Профессиональный поиск в Интернете
Шрифт:
Интересная находка Falcons – боковая панель с иерархическим деревом классов, к которым относятся найденные объекты. Она позволяет быстро уточнить запрос и упрощает навигацию в больших списках результатов. Данный инструмент напоминает панели кластерных интернет-поисковиков, однако шума здесь гораздо меньше, а структурирование информации выглядит весьма качественно. Достигается это за счет анализа семантической разметки документов.
Semantic Web Search
Коммерческих предложений в области поиска в семантическом вебе пока немного. Упоминания заслуживает проект Semantic Web Search. Основной бизнес фирмы-разработчика Semantic Web Search – внедрение собственного коммерческого программного обеспечения для хранения и обработки данных в формате RDF. Свободно доступный сервис Semantic Web Search носит демонстрационно-рекламный
Сведений о размере индексной базы проекта на сайте Semantic Web Search не приводится, однако если судить по результатам тестовых запросов, она заметно уступает индексам некоммерческих академических поисковиков, о которых шла речь ранее.
В отличие от обычных поисковиков, на данном ресурсе можно составлять запросы, позволяющие, к примеру, найти все статьи человека с определенным именем и фамилией. Для создания сложных запросов применяется собственный язык запросов, использующий FOAF-разметку ресурсов.
Данный проект интересен в первую очередь своими дополнительными инструментами. Начнем с того, что на сайте есть аналог «расширенного поиска» – приложение Search Agent, которое помогает в составлении сложных запросов. Более того, на сайте предлагается простой онлайновый редактор Agent Developer, с помощью которого можно создать собственную программу-агента. Для этого понадобятся только самые общие представления о составлении поисковых запросов, остальные операции выполняются простым выбором тех или иных пунктов в предлагаемом списке. Правда, данный любопытный инструмент, как сообщают разработчики Semantic Web Search, в скором времени будет убран, а на смену ему придет машинный интерфейс, поддерживающий SPARQL-запросы, что даст возможность пользователям подключать к нему собственные программы-агенты.
К сожалению, данному проекту присущ ряд недостатков, обусловленных его демонстрационным характером. Сайт поисковика частенько перегружен, что приводит к ошибкам при обработке запросов. Скорость его работы также оставляет желать лучшего.
Sindice/Sig.ma
Довольно интересной и полезной для широкого круга пользователей попыткой объединить технологии поиска в семантическом вебе со средствами создания мэшапов предпринята системами Sindice и Sig.ma. Эти проекты предлагают весьма удобные комбинированные средства поиска и просмотра семантических данных. Разработчиком обеих систем является уже известный нам ирландский институт DERI. Поисковик Sindice обладает действительно дружественным интерфейсом и предлагает ряд полезных инструментов для непосредственного просмотра результатов поиска человеком. Достигается это во многом за счет совместной работы поисковика с еще одним проектом тех же разработчиков – мэшап-системой Sig.ma.
Как утверждают разработчики, собственная индексная база проекта является крупнейшим индексом документов в семантических форматах в современном интернете. Поскольку конкретных цифр не приводится, оставим это утверждение на совести авторов. Как бы то ни было, заметим, что результаты поиска здесь действительно достойные. Поисковик умеет взаимодействовать с программами-агентами. Выдача данных осуществляется в форматах JSON и RDF.
Sindice предлагает три режима работы. Собственно поиск является только одним из них. Кроме него доступны инструменты ручного добавления собственных семантических ресурсов в базу проекта, а также инструмент поиска семантических данных на указанной пользователем веб-странице.
Предлагается только режим простого поиска. Страница выдачи представляет собой простой список найденных ресурсов. Из дополнительной информации приводятся сведения о формате найденного документа и его размере. Однако это нельзя назвать серьезным недостатком, поскольку результаты Sindice рекомендуется просматривать с помощью сервиса Sig.ma. Для этого предусмотрена кнопка Go to Full Search Version.
Аббревиатура Sig.ma расшифровывается как «Semantic Integrated Mashup». Разработчики также называют этот сервис «браузером для семантического веба». Интерфейс ресурса состоит из двух панелей (рис. 10.3). На левой панели выводится обзорная сводка о предмете поиска, автоматически
Рис. 10.3. Система Sig.ma объединяет технологии поиска и мэшапов
На правой панели выводится список всех задействованных в поиске ресурсов. При наведении указателя мыши на отдельные фрагменты сводки на панели ресурсов подсвечиваются ссылки на источники, из которых были взяты данные сведения. Список ссылок можно сортировать по различным признакам. Кроме того, действует система фильтров, с помощью которой можно удалять из списка ссылок ненужные документы. После этой операции и списки ресурсов, и сводка автоматически перестраиваются. Результаты поиска Sig.ma можно не только просмотреть на сайте проекта, но и экспортировать на собственную веб-страницу в виде виджета.
Выводы и рекомендации
Семантический веб действительно имеет право называться «поколением Web 3.0», поскольку предлагаемые изменения носят принципиальный характер. В первую очередь это относится к ориентации ресурсов на поисковые агенты – программы, которые исполняют роль посредников между опубликованными в интернете разрозненными данными и пользователями. Однако период массового внедрения семантических технологий, скорее всего, будет еще достаточно продолжительным по времени. В таких условиях заслуживают внимания ресурсы, предлагающие удобные с точки зрения людей интерфейсы для работы с данными в семантических форматах. Большинство общедоступных поисковиков, способных стать «окнами» в Web 3.0, – это экспериментальные проекты. Многие проекты поддерживают подключение программ-агентов пользователей, и именно такой режим работы с ними является предпочтительным. Если же ориентироваться на самостоятельную работу пользователя, то практически вне конкуренции в настоящее время оказывается связка проектов Sindice/Sig.ma. Благодаря одним из самых удобных на сегодня интерфейсов просмотра семантических данных эти проекты можно рекомендовать широкому кругу пользователей, заинтересованных в работе с данными в форматах Web 3.0. Другие «герои» этой главы хоть и не могут похвастаться сопоставимыми интерфейсами, за счет охвата широкого спектра источников данных способны стать ценными средствами поиска.
Глава 11
Программы-помощники
Интернет-поиск – это одно из средств получения информации, необходимой для выполнения той или иной деятельности. Именно это является его главной целью. Поэтому в данный процесс входит не только обращение к поисковым интернет-машинам. Найдя с помощью таких поисковиков нужные ресурсы, приходится заниматься их анализом, сохранением и управлением созданным архивом. Эти задачи глобальны, и при активной работе с интернетом решать их приходится практически ежедневно. Поэтому вполне логичным стало появление специализированных приложений, облегчающих эту работу. Даная глава посвящена именно таким программам.
Среди всего многообразия программ-помощников в деле поиска и последующей обработки найденной информации можно выделить две основные группы: инструменты, помогающие непосредственно в поиске информации в Сети, и группа приложений, предназначенных для сохранения и обработки найденных данных.
Идея задействовать «настольное» приложение в качестве посредника между пользователем и интернет-поисковиками далеко не нова. Преимущества такого решения по сравнению со стандартным веб-поиском сводятся к двум аспектам. Первый – это возможность одновременного обращения к большому количеству интернет-поисковиков из единой формы запроса локальной программы. Второй – наличие дополнительных инструментов обработки и анализа найденных ссылок, а также сохранения результатов поиска в удобном формате.