Показать сообщение отдельно

  #3  
Старый 10.06.2015, 02:00
Egor_drug
Новичок
Регистрация: 31.01.2012
Сообщений: 1
С нами: 7516406

Репутация: -10
По умолчанию

ЗАТЕРЯННЫЙ

web

Очередной феномен Интернет

Оказывается в Глобальной паутине информации куда больше, чем это можно себе представить. Чаще всего пользователь находит на необходимые ему новые источники в Сети через информационно-поисковые системы, такие как Google, Yahoo! или "Яндекс", которые для многих стали "де-факто" стандартными. Однако кроме видимой для поисковых систем части вэб-пространства существует огромное количество страниц, которые ими не охватываются. При этом доступ пользователя к таким ресурсам в принципе возможен (хотя иногда "слегка прикрыт" паролями). Как правило, эти вэб- страницы доступны в Интернет, однако выйти на них трудно, а порой невозможно, если не знать точного адреса. Эти ресурсы уже десять лет как имеют собственное название - "скрытый" (deep) вэб, которое ввел Джилл Иллсворт (Jill Ellsworth) в 1994 году, обозначив им источники, недоступные для обычных поисковых систем. Сегодня такие ресурсы называют также невидимым (invisible) вэб. Они чаще всего охватывают динамически формируемые вэб-страницы, содержание которых хранится в базах данных и доступно лишь по запросам пользователей.

В 2000 году американская компания BrightPlanet (www.brightplanet.com) опубликовала сенсационный доклад, в котором утверждается, что в вэб-пространстве в сотни раз больше страниц, чем их удалось проиндексировать самыми популярными поисковыми системами. Эта же компания разработала программу LexiBot, которая позволяет сканировать некоторые динамические вэб-станицы, формируемые из баз данных, и запустив ее получила неожиданные данные. Выяснилось, что для традиционных поисковых систем огромная часть Сети попросту невидима. Топология паутины - "галстук-бабочка"

В отличие от данных из обычного хранилища информации, документы из вэб- пространства характеризуется большим количеством неявно включенных в них экспертных оценок, реализованных в виде взаимных гипертекстовых ссылок. Именно гиперссылки оказались в свое время основой для построения модели вэб-пространства (или, попросту, вэба). И именно их остутствие порождает скрытые области в этом пространстве.

В ноябре 1999, Андрей Бредер (Andrei Broder) и его соавторы из компаний AltaVista, IBM и Compaq совершили прорыв, математически описав "карту" реасурсов и гиперсвязей вэба. Исследования опровергли расхожее мнение, будто Интернет - это единое густое пространство. Проследив с помощью поискового механизма AltaVista свыше 200 млн. вэб-страниц и несколько млрд. ссылок, размещенных на этих страницах, ученые пришли к следующим выводам о структуре вэб-пространства, котороая соответствует, по их мнению, ориентированному графу с топологией "галстука-бабочки" (Bow Tie), в котором вершины соответствуют страницам, а ребра - соединяющим страницы гиперссылкам. В рамках этой модели задача анализа структуры связей между отдельными вэб-страницами было обнаружено наличие:

- центральное ядро (28% вэб-страниц) - компоненты сильной связности (SCC) или узел галстука, составляют вэб-страницы, взаимосвязанные так тесно, что,следуя гиперссылкам, из любой из них в конечном счете можно попасть на любую другую.

- 22% вэб-страниц - это "отправные вэб-страницы" (IN). Они содержат гиперссылки, которые в конечном счете ведут к ядру, но из ядра к ним попасть нельзя.

- столько же - 22% - "оконечных вэб-страниц" (OUT), к которым можно прийти по ссылкам из ядра, но нельзя вернуться назад.

- 22% вэб-страниц - отростки - полностью изолированы от центрального ядра: это либо "мысы", связанные гиперссылками со страницами любой другой категории, либо "перешейки", соединяющие две вэб-страницы, не входящие в ядро.

Четыре основных множества - более 90% исследуемых вэб-страниц, топологически относящихся к одной компоненте связности - обусловили название модели - "галстук- бабочка" (Bow tie).

Существующие "острова" вообще не пересекаются с остальными ресурсами Сети. Единственный способ обнаружить ресурсы этой группы - знать их адрес. Поисковые машины в принципе не находят этих островов, если они в прошлом каким-то образом не соединяли.

Типы скрытых ресурсов

Для того, чтобы определить, какие из ресурсов невидимы для поисковых систем, следует рассмотреть принцип работы типового индексатора - робота таких систем. Эти программы, как правило, посещают вэб-страницы по известным заранее адресам, анализируют их содержание и выделяют гиперссылки, идущие от них. Обычно, обработав текущую страницу, выделив ключевые слова и некоторые поля, робот переходит по адресам, найденным на ней, сканирует последующие страницы, выделяет новые адреса и. т.д. Обычно, как только робот определяет, что он обращается к динамической странице, он останавливает свою работу, так как чаще всего для получения осмысленного ответа из баз данных требуется осмысленный запрос, а большинству из роботов чужды элементы интеллекта, даже искусственного. Т.е. "скрытый" вэб охватывает в первую очередь содержимое онлайновых баз данных. Динамической является и быстро обновляемая информация - новости, конференции, онлайновые журналы.

Конечно, есть и явные "острова" по Брёдеру, на которые не ведут никакие гиперссылки, и от которого гиперссылки не исходят. Защищенные паролями коммерческие вэб-сайты также попадают в категорию "скрытого" вэба - о материалах этих сайтов большинство пользователей никогда не узнают с помощью поисковых систем. Однако относительное количество таких сайтов невелико. Например, среди крупнейших сайтов "скрытого" вэбв, платными являются только 10% ресурсов, хотя именно они включают важнейшие издательства и базы данных.

Основатель BrightPlanet Майкл Бергмана (Michael K. Bergman) выделил 12 разновидностей "скрытых" вэб-ресурсов (www.leidenuniv.nl/ub/biv/specials.htm), относящихся к классу онлайновых баз данных. В списке оказались как традиционные базы данных (патенты, медицина и финансы), так и публичные ресурсы - объявления о поиске работы, чаты, библиотеки, справочники. Бергман причислил к "скрытым" ресурсам и специализированные поисковые системы, которые обслуживают определенные отрасли или рынки, базы данных которых не включаются в глобальные каталоги традиционных поисковых служб.

К "скрытому" вэб также относятся многочисленные системы интерактивного взаимодействия с пользователями - помощи, консультирования, обучения, требующие участия людей для формирования динамических ответов от серверов. К ним также можно отнести и закрытую (полностью или частично) информацию, доступную, пользователям Сети только с определенных адресов, групп адресов, иногда городов или стран. К "скрытой" части Сети многие причисляют и вэб-страницы, зарегистрированные на бесплатных серверах, которые индексируются, в лучшем случае, лишь частично - поисковые системы во избежание рекламного спама не стремятся обходить их в полном объеме.

Недавно появилась категория так называемых "серых" сайтов, функционирующих на основе динамических систем управления контентом (Dynamic Content Management Systems). В поисковых системах обычно ограничивается глубина индексирования таких сайтов во избежание возможного циклического просмотра одних и тех же страниц.

И конечно же, "скрытыми" оказываются вэб-сайты, создатели которых не оповещают кого-либо о создании этих ресурсов.

Безусловно, основной формат данных, с которым работают традиционные поисковые системы в Интернет - это HTML, причем статическая его часть. С другими форматами у многих поисковых систем имеются различные проблемы. К примеру, различные версии формата PDF (Adobe Portable Document Format), а также особенности хранения инкапсулированных графических изображений, заставляют считать сетевые ресурсы, представленные в этом формате, "скрытыми". Тем не менее, некоторые современные поисковые системы уже вполне сносно индексируют документы в этом формате. К "скрытым" форматам принято относить также и Flash, широко использующийся для обеспечения визуальных эффектов на вэб-сайтах.

Кроме того, например, для нашего пользователя, наверняка "скрытой" можно признать большую часть гигантского китайского сегмента Интернет
 
Ответить с цитированием