Ручная проверка веб-страниц имеет то преимущество, что позволяет давать более нюансированные, если не более точные, интерпретации, чем те, на которые способны автоматизированные системы классификации, но страдает от собственных источников ошибок. Участвующие здесь компании, занимающиеся фильтрующим ПО, имеют ограниченный штат сотрудников — от восьми до нескольких десятков человек, доступных для ручной проверки веб-страниц. Рецензенты, нанимаемые этими компаниями, основывают свои решения о категоризации как на тексте, так и на визуальных изображениях, которые появляются на сайтах или страницах, проверку которых им поручено осуществить. Рецензенты-люди обычно сосредотачиваются на веб-сайтах на английском языке и, как правило, не обязаны знать несколько языков. Учитывая скорость, с которой рецензенты должны работать, чтобы поспевать хотя бы за частью из примерно 1,5 миллиона страниц, добавляемых в общедоступный индексируемый интернет ежедневно, человеческие ошибки неизбежны. Ошибки с большой вероятностью возникают из-за скуки или невнимательности, излишнего рвения или стремления «перестраховаться» путем отсеивания материалов, которые могут показаться оскорбительными для некоторых пользователей, даже если они не подпадают ни под одно из определений категорий компании. Ни одна из компаний, занимающихся фильтрацией, не обучает своих рецензентов юридическим определениям того, что является непристойным, детской порнографией или материалами, вредными для несовершеннолетних, и ни одна не предписывает рецензентам принимать во внимание стандарты сообщества при принятии решений о категоризации.
Возможно, из-за ограничений на количество рецензентов-людей и из-за огромного количества новых страниц, которые добавляются в интернет ежедневно, компании, занимающиеся фильтрацией, также широко практикуют категоризацию целых веб-сайтов по «корневому URL-адресу», а не проведение более детального анализа отдельных страниц внутри веб-сайта. Например, компании, занимающиеся фильтрацией, показания которых были даны по делу, все классифицируют весь веб-сайт Playboy как «Для взрослых», «Откровенно сексуальный» или «Порнография». Они не проводят различий между страницами внутри сайта, содержащими изображения или текст с откровенным сексуальным содержанием, и, например, страницами, не содержащими откровенного сексуального контента, такими как текст интервью с известными людьми или политиками. Если «корневому» URL-адресу или URL-адресу верхнего уровня веб-сайта присваивается тег категории, то доступ ко всему контенту на этом веб-сайте будет заблокирован, если соответствующая категория включена пользователем. В некоторых случаях целые веб-сайты блокируются потому, что компании, занимающиеся фильтрацией, концентрируются только на содержимом домашней страницы, доступ к которой осуществляется путем ввода корневого URL-адреса. Целые веб-сайты, содержащие множество веб-страниц, обычно категоризируются без ручной проверки каждой отдельной страницы на этом сайте. Веб-сайты, которые могут содержать множество веб-страниц и требуют аутентификации или оплаты для доступа, обычно категоризируются исключительно на основе оценки рецензентом-человеком страниц, которые можно просмотреть до перехода к странице аутентификации или оплаты.
Поскольку под корневым URL-адресом могут находиться сотни или тысячи страниц, компании, занимающиеся фильтрацией, делают своей главной задачей категоризацию корневого URL-адреса и категоризацию дочерних страниц по мере возникновения необходимости или при наличии времени. Такая форма избыточной блокировки называется «наследованием» (inheritance), поскольку страницы нижнего уровня наследуют категоризацию корневого URL-адреса без учета их конкретного содержания. В некоторых случаях происходит также «обратное наследование» (reverse inheritance), то есть родительские сайты наследуют классификацию страниц на более низком уровне сайта. Это может происходить, когда страницы с контентом сексуального характера появляются на веб-сайте, посвященном в основном несексуальному контенту. Например, продукт фильтрации Bess от N2H2 классифицирует каждую страницу веб-сайта Salon.com, содержащего широкий спектр новостей и культурных комментариев, как «Секс, нецензурная лексика» на том основании, что сайт включает регулярную колонку, посвященную вопросам секса. Блокировка как по доменному имени, так и по IP-адресу — это еще одна практика, используемая компаниями, занимающимися фильтрацией, которая обусловлена как архитектурой интернета, так и необходимостью справляться с быстро растущим числом веб-страниц. Списки категорий, поддерживаемые компаниями-разработчиками фильтрующего ПО, могут включать URL-адреса либо в их удобочитаемой форме доменного имени, либо в форме числового IP-адреса, либо в обеих формах. С помощью услуг «виртуального хостинга» сотни тысяч веб-сайтов с разными доменными именами могут совместно использовать один числовой IP-адрес. В той степени, в какой компании, занимающиеся фильтрацией, блокируют IP-адреса услуг виртуального хостинга, они неизбежно блокируют значительный объем контента без его проверки и, вероятно, осуществляют избыточную блокировку значительного объема контента.
Еще один метод, используемый компаниями, занимающимися фильтрацией, для борьбы со структурной особенностью интернета — это блокировка корневых URL-адресов так называемых сайтов-«лазеек» (loophole). Это веб-сайты, которые предоставляют доступ к определенной веб-странице, но отображают в браузере пользователя URL-адрес, отличный от того URL-адреса, с которым обычно ассоциируется данная страница. Из-за этой особенности они предоставляют «лазейку», которую можно использовать для обхода программного обеспечения для фильтрации, то есть они отображают URL-адрес, отличный от того, который указан в контрольном списке компании, занимающейся фильтрацией. К сайтам-«лазейкам» относятся кэши веб-сайтов, которые были удалены из своего первоначального местоположения, сайты-«анонимайзеры» и сайты переводов. Кэши — это архивные копии, которые некоторые поисковые системы, такие как Google, сохраняют для индексируемых ими веб-страниц. Сохраненная Google кэшированная копия будет иметь URL-адрес, отличный от исходного URL-адреса. Поскольку веб-сайты часто быстро меняются, кэши являются единственным способом доступа к страницам, которые были удалены, пересмотрены или изменили свои URL-адреса по какой-либо причине. Например, журнал может разместить свои текущие материалы под определенным URL-адресом и заменять их ежемесячно новыми материалами. Если бы пользователь захотел найти статью, опубликованную шесть месяцев назад, он или она не смогли бы получить к ней доступ, если бы не кэшированная версия Google.
Некоторые сайты в интернете служат прокси или посредником между пользователем и другой веб-страницей. При использовании прокси-сервера пользователь обращается к странице не с ее исходного URL-адреса, а с URL-адреса прокси-сервера. Одним из типов прокси-сервиса является «анонимайзер». Пользователи могут заходить на веб-сайты опосредованно через анонимайзер, когда они не хотят, чтобы посещаемый ими веб-сайт мог определить IP-адрес, с которого они заходят на сайт, или оставить «файлы cookie» в их браузере. Некоторые прокси-серверы могут использоваться для попытки перевода содержимого веб-страницы с одного языка на другой. Вместо непосредственного обращения к исходной веб-странице на ее родном языке пользователи могут вместо этого получить косвенный доступ к странице через прокси-сервер, предлагающий функции перевода. Как отмечалось выше, компании, занимающиеся фильтрацией, часто блокируют сайты-«лазейки», такие как кэши, анонимайзеры и сайты переводов. Практика блокировки сайтов-«лазеек» неизбежно приводит к значительному объему избыточной блокировки, поскольку подавляющее большинство закешированных страниц, например, не содержат контента, который соответствовал бы определениям категорий компании, занимающейся фильтрацией. Фильтры, которые не блокируют эти сайты-«лазейки», однако, могут позволить пользователям получать доступ к любому URL-адресу в интернете через сайт-«лазейку», что приводит к существенной недостаточной блокировке. 3. Процесс «повторной проверки» веб-страниц после их первичной категоризации Большинство компаний, занимающихся разработкой фильтрующего ПО, не проводят последующие проверки категоризированных сайтов или страниц по расписанию. Приоритет отдается проверке и категоризации новых сайтов и страниц, а не повторной проверке уже категоризированных сайтов и страниц. Как правило, предыдущая категоризация веб-сайта поставщиком программного обеспечения для фильтрации не перепроверяется на предмет точности при добавлении новых страниц на веб-сайт. В той мере, в какой веб-сайт ранее был категоризирован целиком, новые страницы, добавленные на сайт, обычно разделяют категоризацию, назначенную поставщиком продукта блокировки. Это неизбежно приводит как к избыточной, так и к недостаточной блокировке, поскольку, как отмечалось выше, содержимое веб-страниц и веб-сайтов изменяется относительно быстро.
Помимо того, что контент на веб-сайтах или страницах быстро меняется, сами веб-сайты могут исчезать и заменяться сайтами совершенно с другим контентом. Если IP-адрес, связанный с определенным веб-сайтом, заблокирован в рамках определенной категории, а веб-сайт прекращает свое существование, то IP-адрес, вероятно, будет переназначен другому веб-сайту либо интернет-провайдером, либо регистрационной организацией, такой как Американский реестр интернет-номерация (American Registry for Internet Numbers, см. http://www.arin.net). В этом случае сайт, получивший переназначенный IP-адрес, скорее всего, окажется неправильно категоризированным. Поскольку компании, занимающиеся фильтрацией, не проводят систематическую повторную проверку своих списков категорий, такой сайт, скорее всего, останется неправильно категоризированным, если только кто-нибудь не представит его компании, занимающейся фильтрацией, для повторной проверки, что увеличивает частоту избыточной и недостаточной блокировки. Эта неспособность повторно проверять веб-страницы в первую очередь увеличивает показатель избыточной блокировки компании, занимающейся фильтрацией. Однако если компания, занимающаяся фильтрацией, не перепроверяет веб-страницы после того, как определяет, что они не подпадают ни под одну из ее категорий блокировки, то это приведет к недостаточной блокировке (поскольку, например, на странице может появиться контент с откровенным сексуальным характером). 3. Внутренне присущий компромисс между избыточной и недостаточной блокировкой
Существует внутренне присущий компромисс между показателем избыточной блокировки любого фильтра (который специалисты по информационным наукам также называют «точностью» — precision) и показателем его недостаточной блокировки (который также называется «полнотой» — recall). Показатель избыточной блокировки, или точность, измеряется долей объектов, которые система классификации относит к определенной категории и которые классифицированы правильно. Эксперт истцов, д-р Нанберг (Dr. Nunberg), привел гипотетический пример системы классификации, которой поручено выбрать фотографии собак из базы данных, состоящей из 1000 фотографий животных, из которых 80 на самом деле были собаками. Если бы она выдала 100 результатов, из которых 80 действительно были фотографиями собак, а оставшиеся 20 — фотографиями кошек, лошадей и оленей, мы бы сказали, что система идентифицировала фотографии собак с точностью 80%. Это было бы аналогично фильтру, который осуществляет избыточную блокировку с показателем 20%. Мера полноты включает в себя определение того, какая доля реальных членов категории была успешно идентифицирована системой классификации. Например, если гипотетическая база данных фотографий животных содержала в общей сложности 200 фотографий собак, а система идентифицировала 80 из них и не смогла идентифицировать 120, она сработала с полнотой 40%. Это было бы аналогично фильтру, который допускает недостаточную блокировку 60% материала в категории. В автоматизированных системах классификации всегда существует компромисс между точностью и полнотой. В примере с фотографиями животных полноту можно было бы повысить, используя более широкий набор критериев для идентификации фотографий собак в наборе — например, любое животное с четырьмя ногами, — и все собаки были бы идентифицированы, но кошки и другие животные также были бы включены, что привело бы к потере точности. Такой же компромисс существует между показателями избыточной и недостаточной блокировки в системах фильтрации, использующих автоматизированные системы классификации. Например, автоматизированная система, которая классифицирует любую веб-страницу, содержащую слово «секс», как откровенно сексуальную, будет допускать гораздо меньшую недостаточную блокировку, но гораздо большую избыточную блокировку, чем система, которая классифицирует любую веб-страницу, содержащую фразу «бесплатные фотографии людей, занимающихся сексом», как откровенно сексуальную.
Этот компромисс между избыточной и недостаточной блокировкой применим не только к автоматизированным системам классификации, но и к фильтрам, использующим исключительно ручную проверку. Учитывая примерно два миллиарда существующих в интернете страниц, 1,5 миллиона новых страниц, добавляемых ежедневно, и скорость изменения контента на существующих страницах, если компания, занимающаяся фильтрацией, блокирует только те веб-страницы, которые были проверены людьми, практически невозможно избежать огромных объемов недостаточной блокировки. Методы, используемые рецензентами-людьми, такие как блокировка на уровне IP-адреса, уровня доменного имени или уровня каталога, снижают показатели недостаточной блокировки, но неизбежно увеличивают показатели избыточной блокировки, как обсуждалось выше. Используя простой пример, было бы легко разработать фильтр, предназначенный для блокирования откровенно сексуальной речи, который полностью избегает избыточной блокировки. Такой фильтр имел бы в своем контрольном списке только один веб-сайт с откровенным сексуальным содержанием, который можно было бы ежедневно перепроверять, чтобы гарантировать неизменность его содержимого. Хотя у такого фильтра не было бы проблемы избыточной блокировки, у него была бы серьезная проблема недостаточной блокировки, поскольку он не смог бы заблокировать всю откровенно сексуальную речь в интернете, кроме того единственного сайта из его контрольного списка. Аналогично, было бы легко спроектировать фильтр, предназначенный для блокирования откровенно сексуальной речи, который полностью позволяет избежать недостаточной блокировки. Такой фильтр работал бы, позволяя пользователям просматривать только один веб-сайт, например, веб-сайт Sesame Street. Хотя у такого фильтра не было бы проблемы недостаточной блокировки, у него была бы серьезная проблема избыточной блокировки, поскольку он заблокировал бы доступ к миллионам не содержащих откровенного сексуального характера сайтов в интернете, кроме сайта Sesame Street.
Хотя таким образом весьма просто разработать фильтр, который не допускает избыточной блокировки, и столь же просто разработать фильтр, который не допускает недостаточной блокировки, в настоящее время невозможно — учитывая размер интернета, темпы его роста, скорость изменений и архитектуру, а также учитывая уровень развития автоматизированных систем классификации — разработать фильтр, который не допускает ни недостаточной, ни избыточной блокировки значительного объема речи. Чем эффективнее фильтр блокирует веб-сайты в определенной категории, тем больше он неизбежно осуществляет избыточную блокировку. Любой фильтр, который является достаточно эффективным для предотвращения доступа пользователей к контенту с откровенным сексуальным характером в интернете, неизбежно заблокирует значительные объемы речи, не содержащей откровенного сексуального характера. 4. Попытки количественной оценки показателей избыточной и недостаточной блокировки программ фильтрации
Фундаментальная проблема расчета показателей избыточной и недостаточной блокировки заключается в выборе совокупности веб-сайтов или веб-страниц, которые будут служить набором для тестирования. Исследования, представленные сторонами по этому делу, использовали два разных подхода к этой проблеме. Два исследования — одно, подготовленное экспертом истцов Крисом Хантером (Chris Hunter), аспирантом Университета Пенсильвании, а другое — подготовленное экспертом ответчиков Крисом Леммонсом (Chris Lemmons) из eTesting Laboratories в Эс-Ричард-Трайангл-Парк, Северная Каролина, — подошли к этой проблеме путем составления двух отдельных списков веб-сайтов: один состоял из URL-адресов, которые, по их мнению, должны быть заблокированы в соответствии с критериями фильтров, а другой — из URL-адресов, которые, по их мнению, не должны блокироваться в соответствии с критериями фильтров. Они составили эти списки, выбирая веб-сайты из результатов определенных поисков по ключевым словам. Проблема с этим методом отбора заключается в том, что он не является ни случайным, ни приближенным к совокупности веб-страниц, которые посещают посетители библиотек.
Два других исследования — одно, проведенное Дэвидом Биком (David Biek), главным библиотекарем главного филиала Публичной библиотеки Такомы, а другое — Кори Финнеллом (Cory Finnell) из Certus Consulting Group из Сиэтла, штат Вашингтон, — выбрали в качестве совокупности веб-страниц для анализа реальные журналы веб-страниц, посещенных посетителями библиотек за определенные периоды времени. Этот метод, хотя он, безусловно, не столь точен, как истинно случайная выборка индексированного интернета (если предположить, что такую выборку вообще возможно сделать), имеет достоинство использования реальных веб-сайтов, которые посетители библиотек посещали в течение определенного периода. Поскольку посетители библиотек сами выбирали совокупность веб-сайтов, проанализированных в исследованиях Бика и Финнелла, это исключает возможность предвзятости, возникающей в результате выбора автором исследования совокупности сайтов для проверки. Мы находим, что исследования Леммонса и Хантера имеют небольшую доказательственную ценность из-за методологии, использованной для выбора выборочной совокупности веб-сайтов для тестирования. Поэтому мы сосредоточимся на исследованиях, проведенных Финнеллом и Биком, пытаясь получить оценки показателей избыточной и недостаточной блокировки, которые происходят при использовании фильтров в публичных библиотеках. Правительство наняло эксперта-свидетеля Кори Финнелла для изучения журналов интернета, составленных системами публичных библиотек в Такоме (штат Вашингтон), Вестервилле (штат Огайо) и Гринвилле (штат Южная Каролина). Каждая из этих библиотек использует программное обеспечение для фильтрации, которое ведет журнал информации об отдельных запросах веб-сайтов, сделанных посетителями библиотек. Финнелл, консалтинговая фирма которого специализируется на анализе данных, имеет значительный опыт оценки журналов доступа в интернет, генерируемых в сетевых системах. Он провел более года, разрабатывая инструмент отчетности для N2H2, и в ходе этой работы приобрел знакомство с дизайном и работой продуктов интернет-фильтрации.