Вытакскивание ссылок из html страниц

Обсуждение настройки и работы сервисов, резервирования, сетевых настроек и вопросов безопасности ОС.

Модераторы: SLEDopit, Модераторы разделов

Аватара пользователя
Sekta-N
Сообщения: 854
ОС: Зоопарк

Вытакскивание ссылок из html страниц

Сообщение Sekta-N »

В школу прислали список белых сайтов. Мне их надо перенести в текстовой документ. Список находится в html формате.
пробывал grep http://www. имя_файла, но он мне выдал такое:

/div><div class='link'><a href='http://www.zorich.ru/'><img class='img_icon' src ='ico_web.gif'> ��������� ����� � ���������� ��������</a></div><div class='link' ><a href='http://lleo.aha.ru/'><img class='img_icon' src='ico_web.gif'> �������� � ���� ������� ��������</a></div>
<a href="http://www.informika.ru/"><img class='img_banner' src='logo_informika.g if' title='��� ���� ��� "���������"'></a>
admin@linux:/home/diski/catalog>


Как из этого вырвать только www.<site>.xz
Нет тут подписи и не будет.
Спасибо сказали:
Аватара пользователя
diesel
Бывший модератор
Сообщения: 5989
ОС: OS X, openSuSE, ROSA, Debian

Re: Вытакскивание ссылок из html страниц

Сообщение diesel »

grep -oE 'http://[0-9a-zA-Z\-_\.]*'
где-то так
Спасибо сказали:
Аватара пользователя
Sekta-N
Сообщения: 854
ОС: Зоопарк

Re: Вытакскивание ссылок из html страниц

Сообщение Sekta-N »

Спасибо!
Кому надо держите white лист сайтов для образовательных учреждений.
Представляю сколько бы я виндоусе это бы переносил в фильтр.

Запустил еще uniq | sort
У вас нет необходимых прав для просмотра вложений в этом сообщении.
Нет тут подписи и не будет.
Спасибо сказали:
Аватара пользователя
keir
Сообщения: 317
ОС: linux

Re: Вытакскивание ссылок из html страниц

Сообщение keir »

помимо grep-а еще uniq на этот лист наложить надо :)
Trust №1
Спасибо сказали: