Не запостил в программирование, ибо как написать я пока себе вполне представляю. Вопрос (а точноее вопросы, но буду решать по мере поступления) в другом. Это даже не вопросы, а мысли вслух, чтобы избежать ошибок. Заранее спасибо всм, кто прочитает и прокоментирует.
Имеется некий стандартный combined лог веб-сервера. Я без проблем могу выделить уникальные ip, посчитать по ним траф и т.п. Вопрос в другом - помимо записей, где тащится непосредственно страница, в логах куча записей где тащится фавикон, картинки, таблицы стилей, жаба-скрипты и т.п. Собственно считать эти записи отдельным посещением я считаю не есть правильно, так как это все идет в нагрузку к основной html странице. Соответственно если я сделаю некий mime список, который будет содержать все типы, которые не являются html -страницами и буду распарсивать урл на предмет его окончания и сравнения с ним, то в принципе смогу выделить считать этот запрос хитом или нет.
Можно было бы поступить наоборот, т.е. иметь некий список того, что определенно является html - страницей, но не приходит в голову, как это реализовать, так как url самой страницы может быть каким угодно.
Собственно если есть еще какие-то предложения как можно выделить именно посещения страниц - буду рад услышать, если предложенный мной способ оптимален и в голову ничего лучше не пришло - тоже. Спасибо.
Пишу парсер combined логов. Админы веб-серверов, вопрос вам. (Мысли вслух...)
Модераторы: SLEDopit, Модераторы разделов
-
Devon
- Сообщения: 101
- ОС: Debian, Mac, SlackHat :)
-
Denjs
- Сообщения: 1685
- ОС: SuSe 10.2
Re: Пишу парсер combined логов. Админы веб-серверов, вопрос вам.
тоже поразмышляем...
а если с вас тянут только одну картинку без страницы по левой ссылке на форуме дяди пупкина?
это посещение?
как быть с полносьтю динамическими сайтами где запрос на картинку и страницу по форме - суть одно и то-же только ID объекта отличается?
PS: у вас куча мыслей, но задача вашего парсера объяснена вскольз....
вам надо посещения страниц считать?
а если с вас тянут только одну картинку без страницы по левой ссылке на форуме дяди пупкина?
это посещение?
как быть с полносьтю динамическими сайтами где запрос на картинку и страницу по форме - суть одно и то-же только ID объекта отличается?
PS: у вас куча мыслей, но задача вашего парсера объяснена вскольз....
вам надо посещения страниц считать?
-
Devon
- Сообщения: 101
- ОС: Debian, Mac, SlackHat :)
Re: Пишу парсер combined логов. Админы веб-серверов, вопрос вам.
Denjs
По поводу форума дяди пупкина - думал над этим. Думаю нет, человек же не смотрел страницу на моем сайте. Однако в список IP и общего трафа такую запись включать, конечно, нужно, как и всяких роботов.
Как быть с полной динамикой, где картинки отдаются по id без каких-либ иных призаков - и правда не задумывался. Пока решения не вижу.
Идеальным решением было бы пихать однопиксельный прозрачный гифик на каждую страницу, тогда по нему можно было бы безошибочно идентифицировать количество просмотренных страниц, вариант элегантный и простой, но нужно обязательно реализовать и без него, чтобы можно было использовать парсер в любом случае с любым логом.
Задачи парсера широчайшие, хочу написать консольную утилитку, умеющую выдавать на стдаут ту или иную информацию в зависимости от запроса. Например полную инфу по активности какого-то ip, относительную и абсолютную статистику посещения страниц и т.п. В общем на самом деле все не сложно, но вот вопрос с решением проблемы относительно вычленения из списка html страниц самый проблематичный.
По поводу форума дяди пупкина - думал над этим. Думаю нет, человек же не смотрел страницу на моем сайте. Однако в список IP и общего трафа такую запись включать, конечно, нужно, как и всяких роботов.
Как быть с полной динамикой, где картинки отдаются по id без каких-либ иных призаков - и правда не задумывался. Пока решения не вижу.
Идеальным решением было бы пихать однопиксельный прозрачный гифик на каждую страницу, тогда по нему можно было бы безошибочно идентифицировать количество просмотренных страниц, вариант элегантный и простой, но нужно обязательно реализовать и без него, чтобы можно было использовать парсер в любом случае с любым логом.
Задачи парсера широчайшие, хочу написать консольную утилитку, умеющую выдавать на стдаут ту или иную информацию в зависимости от запроса. Например полную инфу по активности какого-то ip, относительную и абсолютную статистику посещения страниц и т.п. В общем на самом деле все не сложно, но вот вопрос с решением проблемы относительно вычленения из списка html страниц самый проблематичный.