Окружной суд США по Восточному округу Пенсильвании

«Решение по делу о Законе о защите детей в Интернете (CIPA)»

Страница 3 из 7 · 56 884 зн. · 65 мин. чтения

Ручная проверка веб-страниц имеет то преимущество, что позволяет давать более нюансированные, если не более точные, интерпретации, чем те, на которые способны автоматизированные системы классификации, но страдает от собственных источников ошибок. Участвующие здесь компании, занимающиеся фильтрующим ПО, имеют ограниченный штат сотрудников — от восьми до нескольких десятков человек, доступных для ручной проверки веб-страниц. Рецензенты, нанимаемые этими компаниями, основывают свои решения о категоризации как на тексте, так и на визуальных изображениях, которые появляются на сайтах или страницах, проверку которых им поручено осуществить. Рецензенты-люди обычно сосредотачиваются на веб-сайтах на английском языке и, как правило, не обязаны знать несколько языков. Учитывая скорость, с которой рецензенты должны работать, чтобы поспевать хотя бы за частью из примерно 1,5 миллиона страниц, добавляемых в общедоступный индексируемый интернет ежедневно, человеческие ошибки неизбежны. Ошибки с большой вероятностью возникают из-за скуки или невнимательности, излишнего рвения или стремления «перестраховаться» путем отсеивания материалов, которые могут показаться оскорбительными для некоторых пользователей, даже если они не подпадают ни под одно из определений категорий компании. Ни одна из компаний, занимающихся фильтрацией, не обучает своих рецензентов юридическим определениям того, что является непристойным, детской порнографией или материалами, вредными для несовершеннолетних, и ни одна не предписывает рецензентам принимать во внимание стандарты сообщества при принятии решений о категоризации.

Возможно, из-за ограничений на количество рецензентов-людей и из-за огромного количества новых страниц, которые добавляются в интернет ежедневно, компании, занимающиеся фильтрацией, также широко практикуют категоризацию целых веб-сайтов по «корневому URL-адресу», а не проведение более детального анализа отдельных страниц внутри веб-сайта. Например, компании, занимающиеся фильтрацией, показания которых были даны по делу, все классифицируют весь веб-сайт Playboy как «Для взрослых», «Откровенно сексуальный» или «Порнография». Они не проводят различий между страницами внутри сайта, содержащими изображения или текст с откровенным сексуальным содержанием, и, например, страницами, не содержащими откровенного сексуального контента, такими как текст интервью с известными людьми или политиками. Если «корневому» URL-адресу или URL-адресу верхнего уровня веб-сайта присваивается тег категории, то доступ ко всему контенту на этом веб-сайте будет заблокирован, если соответствующая категория включена пользователем. В некоторых случаях целые веб-сайты блокируются потому, что компании, занимающиеся фильтрацией, концентрируются только на содержимом домашней страницы, доступ к которой осуществляется путем ввода корневого URL-адреса. Целые веб-сайты, содержащие множество веб-страниц, обычно категоризируются без ручной проверки каждой отдельной страницы на этом сайте. Веб-сайты, которые могут содержать множество веб-страниц и требуют аутентификации или оплаты для доступа, обычно категоризируются исключительно на основе оценки рецензентом-человеком страниц, которые можно просмотреть до перехода к странице аутентификации или оплаты.

Поскольку под корневым URL-адресом могут находиться сотни или тысячи страниц, компании, занимающиеся фильтрацией, делают своей главной задачей категоризацию корневого URL-адреса и категоризацию дочерних страниц по мере возникновения необходимости или при наличии времени. Такая форма избыточной блокировки называется «наследованием» (inheritance), поскольку страницы нижнего уровня наследуют категоризацию корневого URL-адреса без учета их конкретного содержания. В некоторых случаях происходит также «обратное наследование» (reverse inheritance), то есть родительские сайты наследуют классификацию страниц на более низком уровне сайта. Это может происходить, когда страницы с контентом сексуального характера появляются на веб-сайте, посвященном в основном несексуальному контенту. Например, продукт фильтрации Bess от N2H2 классифицирует каждую страницу веб-сайта Salon.com, содержащего широкий спектр новостей и культурных комментариев, как «Секс, нецензурная лексика» на том основании, что сайт включает регулярную колонку, посвященную вопросам секса. Блокировка как по доменному имени, так и по IP-адресу — это еще одна практика, используемая компаниями, занимающимися фильтрацией, которая обусловлена как архитектурой интернета, так и необходимостью справляться с быстро растущим числом веб-страниц. Списки категорий, поддерживаемые компаниями-разработчиками фильтрующего ПО, могут включать URL-адреса либо в их удобочитаемой форме доменного имени, либо в форме числового IP-адреса, либо в обеих формах. С помощью услуг «виртуального хостинга» сотни тысяч веб-сайтов с разными доменными именами могут совместно использовать один числовой IP-адрес. В той степени, в какой компании, занимающиеся фильтрацией, блокируют IP-адреса услуг виртуального хостинга, они неизбежно блокируют значительный объем контента без его проверки и, вероятно, осуществляют избыточную блокировку значительного объема контента.

Еще один метод, используемый компаниями, занимающимися фильтрацией, для борьбы со структурной особенностью интернета — это блокировка корневых URL-адресов так называемых сайтов-«лазеек» (loophole). Это веб-сайты, которые предоставляют доступ к определенной веб-странице, но отображают в браузере пользователя URL-адрес, отличный от того URL-адреса, с которым обычно ассоциируется данная страница. Из-за этой особенности они предоставляют «лазейку», которую можно использовать для обхода программного обеспечения для фильтрации, то есть они отображают URL-адрес, отличный от того, который указан в контрольном списке компании, занимающейся фильтрацией. К сайтам-«лазейкам» относятся кэши веб-сайтов, которые были удалены из своего первоначального местоположения, сайты-«анонимайзеры» и сайты переводов. Кэши — это архивные копии, которые некоторые поисковые системы, такие как Google, сохраняют для индексируемых ими веб-страниц. Сохраненная Google кэшированная копия будет иметь URL-адрес, отличный от исходного URL-адреса. Поскольку веб-сайты часто быстро меняются, кэши являются единственным способом доступа к страницам, которые были удалены, пересмотрены или изменили свои URL-адреса по какой-либо причине. Например, журнал может разместить свои текущие материалы под определенным URL-адресом и заменять их ежемесячно новыми материалами. Если бы пользователь захотел найти статью, опубликованную шесть месяцев назад, он или она не смогли бы получить к ней доступ, если бы не кэшированная версия Google.

Некоторые сайты в интернете служат прокси или посредником между пользователем и другой веб-страницей. При использовании прокси-сервера пользователь обращается к странице не с ее исходного URL-адреса, а с URL-адреса прокси-сервера. Одним из типов прокси-сервиса является «анонимайзер». Пользователи могут заходить на веб-сайты опосредованно через анонимайзер, когда они не хотят, чтобы посещаемый ими веб-сайт мог определить IP-адрес, с которого они заходят на сайт, или оставить «файлы cookie» в их браузере. Некоторые прокси-серверы могут использоваться для попытки перевода содержимого веб-страницы с одного языка на другой. Вместо непосредственного обращения к исходной веб-странице на ее родном языке пользователи могут вместо этого получить косвенный доступ к странице через прокси-сервер, предлагающий функции перевода. Как отмечалось выше, компании, занимающиеся фильтрацией, часто блокируют сайты-«лазейки», такие как кэши, анонимайзеры и сайты переводов. Практика блокировки сайтов-«лазеек» неизбежно приводит к значительному объему избыточной блокировки, поскольку подавляющее большинство закешированных страниц, например, не содержат контента, который соответствовал бы определениям категорий компании, занимающейся фильтрацией. Фильтры, которые не блокируют эти сайты-«лазейки», однако, могут позволить пользователям получать доступ к любому URL-адресу в интернете через сайт-«лазейку», что приводит к существенной недостаточной блокировке. 3. Процесс «повторной проверки» веб-страниц после их первичной категоризации Большинство компаний, занимающихся разработкой фильтрующего ПО, не проводят последующие проверки категоризированных сайтов или страниц по расписанию. Приоритет отдается проверке и категоризации новых сайтов и страниц, а не повторной проверке уже категоризированных сайтов и страниц. Как правило, предыдущая категоризация веб-сайта поставщиком программного обеспечения для фильтрации не перепроверяется на предмет точности при добавлении новых страниц на веб-сайт. В той мере, в какой веб-сайт ранее был категоризирован целиком, новые страницы, добавленные на сайт, обычно разделяют категоризацию, назначенную поставщиком продукта блокировки. Это неизбежно приводит как к избыточной, так и к недостаточной блокировке, поскольку, как отмечалось выше, содержимое веб-страниц и веб-сайтов изменяется относительно быстро.

Помимо того, что контент на веб-сайтах или страницах быстро меняется, сами веб-сайты могут исчезать и заменяться сайтами совершенно с другим контентом. Если IP-адрес, связанный с определенным веб-сайтом, заблокирован в рамках определенной категории, а веб-сайт прекращает свое существование, то IP-адрес, вероятно, будет переназначен другому веб-сайту либо интернет-провайдером, либо регистрационной организацией, такой как Американский реестр интернет-номерация (American Registry for Internet Numbers, см. http://www.arin.net). В этом случае сайт, получивший переназначенный IP-адрес, скорее всего, окажется неправильно категоризированным. Поскольку компании, занимающиеся фильтрацией, не проводят систематическую повторную проверку своих списков категорий, такой сайт, скорее всего, останется неправильно категоризированным, если только кто-нибудь не представит его компании, занимающейся фильтрацией, для повторной проверки, что увеличивает частоту избыточной и недостаточной блокировки. Эта неспособность повторно проверять веб-страницы в первую очередь увеличивает показатель избыточной блокировки компании, занимающейся фильтрацией. Однако если компания, занимающаяся фильтрацией, не перепроверяет веб-страницы после того, как определяет, что они не подпадают ни под одну из ее категорий блокировки, то это приведет к недостаточной блокировке (поскольку, например, на странице может появиться контент с откровенным сексуальным характером). 3. Внутренне присущий компромисс между избыточной и недостаточной блокировкой

Существует внутренне присущий компромисс между показателем избыточной блокировки любого фильтра (который специалисты по информационным наукам также называют «точностью» — precision) и показателем его недостаточной блокировки (который также называется «полнотой» — recall). Показатель избыточной блокировки, или точность, измеряется долей объектов, которые система классификации относит к определенной категории и которые классифицированы правильно. Эксперт истцов, д-р Нанберг (Dr. Nunberg), привел гипотетический пример системы классификации, которой поручено выбрать фотографии собак из базы данных, состоящей из 1000 фотографий животных, из которых 80 на самом деле были собаками. Если бы она выдала 100 результатов, из которых 80 действительно были фотографиями собак, а оставшиеся 20 — фотографиями кошек, лошадей и оленей, мы бы сказали, что система идентифицировала фотографии собак с точностью 80%. Это было бы аналогично фильтру, который осуществляет избыточную блокировку с показателем 20%. Мера полноты включает в себя определение того, какая доля реальных членов категории была успешно идентифицирована системой классификации. Например, если гипотетическая база данных фотографий животных содержала в общей сложности 200 фотографий собак, а система идентифицировала 80 из них и не смогла идентифицировать 120, она сработала с полнотой 40%. Это было бы аналогично фильтру, который допускает недостаточную блокировку 60% материала в категории. В автоматизированных системах классификации всегда существует компромисс между точностью и полнотой. В примере с фотографиями животных полноту можно было бы повысить, используя более широкий набор критериев для идентификации фотографий собак в наборе — например, любое животное с четырьмя ногами, — и все собаки были бы идентифицированы, но кошки и другие животные также были бы включены, что привело бы к потере точности. Такой же компромисс существует между показателями избыточной и недостаточной блокировки в системах фильтрации, использующих автоматизированные системы классификации. Например, автоматизированная система, которая классифицирует любую веб-страницу, содержащую слово «секс», как откровенно сексуальную, будет допускать гораздо меньшую недостаточную блокировку, но гораздо большую избыточную блокировку, чем система, которая классифицирует любую веб-страницу, содержащую фразу «бесплатные фотографии людей, занимающихся сексом», как откровенно сексуальную.

Этот компромисс между избыточной и недостаточной блокировкой применим не только к автоматизированным системам классификации, но и к фильтрам, использующим исключительно ручную проверку. Учитывая примерно два миллиарда существующих в интернете страниц, 1,5 миллиона новых страниц, добавляемых ежедневно, и скорость изменения контента на существующих страницах, если компания, занимающаяся фильтрацией, блокирует только те веб-страницы, которые были проверены людьми, практически невозможно избежать огромных объемов недостаточной блокировки. Методы, используемые рецензентами-людьми, такие как блокировка на уровне IP-адреса, уровня доменного имени или уровня каталога, снижают показатели недостаточной блокировки, но неизбежно увеличивают показатели избыточной блокировки, как обсуждалось выше. Используя простой пример, было бы легко разработать фильтр, предназначенный для блокирования откровенно сексуальной речи, который полностью избегает избыточной блокировки. Такой фильтр имел бы в своем контрольном списке только один веб-сайт с откровенным сексуальным содержанием, который можно было бы ежедневно перепроверять, чтобы гарантировать неизменность его содержимого. Хотя у такого фильтра не было бы проблемы избыточной блокировки, у него была бы серьезная проблема недостаточной блокировки, поскольку он не смог бы заблокировать всю откровенно сексуальную речь в интернете, кроме того единственного сайта из его контрольного списка. Аналогично, было бы легко спроектировать фильтр, предназначенный для блокирования откровенно сексуальной речи, который полностью позволяет избежать недостаточной блокировки. Такой фильтр работал бы, позволяя пользователям просматривать только один веб-сайт, например, веб-сайт Sesame Street. Хотя у такого фильтра не было бы проблемы недостаточной блокировки, у него была бы серьезная проблема избыточной блокировки, поскольку он заблокировал бы доступ к миллионам не содержащих откровенного сексуального характера сайтов в интернете, кроме сайта Sesame Street.

Хотя таким образом весьма просто разработать фильтр, который не допускает избыточной блокировки, и столь же просто разработать фильтр, который не допускает недостаточной блокировки, в настоящее время невозможно — учитывая размер интернета, темпы его роста, скорость изменений и архитектуру, а также учитывая уровень развития автоматизированных систем классификации — разработать фильтр, который не допускает ни недостаточной, ни избыточной блокировки значительного объема речи. Чем эффективнее фильтр блокирует веб-сайты в определенной категории, тем больше он неизбежно осуществляет избыточную блокировку. Любой фильтр, который является достаточно эффективным для предотвращения доступа пользователей к контенту с откровенным сексуальным характером в интернете, неизбежно заблокирует значительные объемы речи, не содержащей откровенного сексуального характера. 4. Попытки количественной оценки показателей избыточной и недостаточной блокировки программ фильтрации

Фундаментальная проблема расчета показателей избыточной и недостаточной блокировки заключается в выборе совокупности веб-сайтов или веб-страниц, которые будут служить набором для тестирования. Исследования, представленные сторонами по этому делу, использовали два разных подхода к этой проблеме. Два исследования — одно, подготовленное экспертом истцов Крисом Хантером (Chris Hunter), аспирантом Университета Пенсильвании, а другое — подготовленное экспертом ответчиков Крисом Леммонсом (Chris Lemmons) из eTesting Laboratories в Эс-Ричард-Трайангл-Парк, Северная Каролина, — подошли к этой проблеме путем составления двух отдельных списков веб-сайтов: один состоял из URL-адресов, которые, по их мнению, должны быть заблокированы в соответствии с критериями фильтров, а другой — из URL-адресов, которые, по их мнению, не должны блокироваться в соответствии с критериями фильтров. Они составили эти списки, выбирая веб-сайты из результатов определенных поисков по ключевым словам. Проблема с этим методом отбора заключается в том, что он не является ни случайным, ни приближенным к совокупности веб-страниц, которые посещают посетители библиотек.

Два других исследования — одно, проведенное Дэвидом Биком (David Biek), главным библиотекарем главного филиала Публичной библиотеки Такомы, а другое — Кори Финнеллом (Cory Finnell) из Certus Consulting Group из Сиэтла, штат Вашингтон, — выбрали в качестве совокупности веб-страниц для анализа реальные журналы веб-страниц, посещенных посетителями библиотек за определенные периоды времени. Этот метод, хотя он, безусловно, не столь точен, как истинно случайная выборка индексированного интернета (если предположить, что такую выборку вообще возможно сделать), имеет достоинство использования реальных веб-сайтов, которые посетители библиотек посещали в течение определенного периода. Поскольку посетители библиотек сами выбирали совокупность веб-сайтов, проанализированных в исследованиях Бика и Финнелла, это исключает возможность предвзятости, возникающей в результате выбора автором исследования совокупности сайтов для проверки. Мы находим, что исследования Леммонса и Хантера имеют небольшую доказательственную ценность из-за методологии, использованной для выбора выборочной совокупности веб-сайтов для тестирования. Поэтому мы сосредоточимся на исследованиях, проведенных Финнеллом и Биком, пытаясь получить оценки показателей избыточной и недостаточной блокировки, которые происходят при использовании фильтров в публичных библиотеках. Правительство наняло эксперта-свидетеля Кори Финнелла для изучения журналов интернета, составленных системами публичных библиотек в Такоме (штат Вашингтон), Вестервилле (штат Огайо) и Гринвилле (штат Южная Каролина). Каждая из этих библиотек использует программное обеспечение для фильтрации, которое ведет журнал информации об отдельных запросах веб-сайтов, сделанных посетителями библиотек. Финнелл, консалтинговая фирма которого специализируется на анализе данных, имеет значительный опыт оценки журналов доступа в интернет, генерируемых в сетевых системах. Он провел более года, разрабатывая инструмент отчетности для N2H2, и в ходе этой работы приобрел знакомство с дизайном и работой продуктов интернет-фильтрации.

Библиотека Такомы использует программное обеспечение для фильтрации Cyber Patrol и регистрирует информацию только о заблокированных сайтах. Финнелл работал со списком всех сайтов, заблокированных в публичной библиотеке Такомы за месяц август 2001 года. Библиотека Вестервилла использует продукт фильтрации Websense и регистрирует информацию как о заблокированных, так и о незаблокированных сайтах. Когда журналы достигают определенного размера, они перезаписываются новыми журналами использования. Из-за этой функции перезаписи журналы были доступны Финнеллу только за относительно короткий период с 1 октября 2001 года по 3 октября 2001 года. Библиотека Гринвилля использует продукт фильтрации N2H2 и ведет учет как заблокированных сайтов, так и сайтов, к которым обращались посетители. Журналы содержат более 500 000 записей в день. Из-за объема записей Финнелл ограничил свой анализ периодом со 2 августа 2001 года по 15 августа 2001 года.

Финнелл рассчитал показатель избыточной блокировки для каждой из трех библиотек, изучив хост-веб-сайт, содержащий каждую из заблокированных страниц. Он не использовал метод выборки, а вместо этого изучил каждый заблокированный веб-сайт. Если содержимое хост-веб-сайта или страниц внутри веб-сайта соответствовало определению категории продукта фильтрации, в рамках которой сайт был заблокирован, Финнелл считал это точной блокировкой. Финнелл и еще три человека, двое из которых были временными сотрудниками, изучили веб-сайты, чтобы определить, соответствуют ли они определениям категорий компаний, занимающихся фильтрацией. Их проверка, разумеется, неизбежно ограничивалась: (1) ясностью определений категорий компаний, занимающихся фильтрацией; (2) интерпретацией определений Финнеллом и его сотрудниками; и (3) человеческой ошибкой. Надежность исследования также подрывается тем фактом, что Финнелл не архивировал заблокированные веб-страницы в том виде, в каком они существовали либо в момент отказа в доступе посетителю в одной из трех библиотек, либо во время проверки страниц Финнеллом и его командой. Поэтому никто не может проверить точность и согласованность работы команды проверяющих Финнелла или узнать, содержал ли тот же контент страницы в момент блокировки, какой был при проверке страниц командой Финнелла. Это ключевой изъян, поскольку результаты исследования зависят от индивидуальных определений избыточной и недостаточной блокировки, в ходе которых Финнелл и его команда должны были сравнивать то, что они видели на проверяемых ими веб-страницах, со стандартными определениями, предоставленными компанией, занимающейся фильтрацией.

Программное обеспечение Cyber Patrol библиотеки Такомы заблокировало 836 уникальных веб-сайтов за август. Финнелл определил, что 783 из этих блокировок были точными, а 53 — неточными. Таким образом, уровень ошибок для Cyber Patrol оценивался в 6,34%, а истинный уровень ошибок с 95-процентной доверительной вероятностью оценивался в диапазоне от 4,69% до 7,99%. Финнелл и его команда изучили 185 уникальных веб-сайтов, которые были заблокированы фильтром Websense библиотеки Вестервилла за зарегистрированный период, и определили, что 158 из них были точными, а 27 — неточными. Соответственно, он оценил показатель избыточной блокировки фильтра Websense в 14,59% с 95-процентным доверительным интервалом от 9,51% до 19,68%. Кроме того, Финнелл изучил 1 674 уникальных веб-сайта, заблокированных фильтром N2H2 библиотеки Гринвилля за соответствующий период, и определил, что 1 520 были точными, а 87 — неточными. Это дает расчетный показатель избыточной блокировки в 5,41% и 95-процентный доверительный интервал от 4,33% до 6,55%. Методология Финнелла имела существенные изъяны, поскольку она занижает показатель избыточной блокировки по следующим причинам. Во-первых, посетители трех библиотек знали, что фильтры работают, и могли воздерживаться от попыток доступа к веб-сайтам, которые они воспринимали как «пограничные» сайты, то есть те, которые могли быть или не быть отфильтрованы должным образом в соответствии с определениями категорий компаний, занимающихся фильтрацией. Во-вторых, во время перекрестного допроса Финнелла истцы представили снимки экранов ряда веб-сайтов, которые, по словам Финнелла, были заблокированы должным образом, но которые, как признал Финнелл, содержали только безобидные материалы. Объяснение Финнелла заключалось в том, что веб-сайты должны были измениться между моментом проведения исследования и моментом судебного разбирательства, но поскольку он не архивировал изображения в том виде, в каком они существовали, когда его команда проверяла их для исследования, проверить это не представляется возможным. В-третьих, из-за того, как Финнелл подсчитывал заблокированные веб-сайты — то есть, если разные посетители пытались получить доступ к одному и тому же веб-сайту или один или несколько посетителей пытались получить доступ к нескольким страницам на одном веб-сайте, Финнелл считал эти попытки как одну блокировку (см. примечание 10 выше), — его результаты неизбежно занижают количество случаев, когда посетителям ошибочно отказывали в доступе к информации.

В любом случае, нет никаких сомнений в том, что расчетные показатели избыточной блокировки Финнелла, основанные на собственных определениях категорий компаний, занимающихся фильтрацией, существенно занижают показатель избыточной блокировки в отношении определений категорий CIPA для фильтрации для взрослых. Фильтры, используемые в библиотеках Такомы, Вестервилла и Гринвилля, были настроены на блокировку, среди прочего, изображений полного обнажения и материалов с откровенным сексуальным содержанием. Однако нет никаких сомнений в том, что эти категории намного шире категорий CIPA, включающих визуальные изображения, которые являются непристойными или детской порнографией, — двух категорий материалов, фильтрацию которых библиотеки, подпадающие под действие CIPA, должны подтверждать при использовании интернета взрослыми. В исследовании Финнелла также рассчитывались показатели недостаточной блокировки в отношении библиотек Вестервилла и Гринвилля (обе из которых регистрировали не только заблокированные сайты, но и все сайты, посещенные их посетителями), путем взятия случайных выборок URL-адресов из списка незаблокированных сайтов. В исследовании использовалась выборка из 159 сайтов, к которым обращались посетители Вестервилла, и было определено, что только один из них должен был быть заблокирован в соответствии с определениями категорий программного обеспечения, что дало показатель недостаточной блокировки в 0,6%. Учитывая размер выборки, 95-процентный доверительный интервал составляет от 0% до 1,86%. В исследовании была изучена выборка из 254 веб-сайтов, к которым обращались посетители в Гринвилле, и было обнаружено, что три из них должны были быть заблокированы в соответствии с определениями категорий фильтрующего программного обеспечения. Это дает расчетный показатель недостаточной блокировки в 1,2% с 95-процентным доверительным интервалом в диапазоне от 0% до 2,51%.

Мы не доверяем оценкам показателей недостаточной блокировки Финнелла в публичных библиотеках Вестервилла и Гринвилля по нескольким причинам. Во-первых, оценки Финнелла, вероятно, занижают фактический показатель недостаточной блокировки, поскольку посетители, знавшие, что в библиотеках Гринвилля и Вестервилла работают программы фильтрации, могли воздерживаться от попыток доступа к сайтам с материалами откровенно сексуального характера или другим контентом, который, как они знали, вероятно, соответствовал бы заблокированным категориям программы фильтрации. Во-вторых, и это самое главное, мы считаем, что формула, которую Финнелл использовал для расчета показателя недостаточной блокировки в этих двух библиотеках, не так показательна, как формула, которую информатики обычно используют для расчета показателя полноты, описанная нами выше в подразделе II.E.3. Как пояснил д-р Нанберг, стандартный метод, используемый информатиками для расчета показателя полноты, заключается в сортировке набора элементов на две группы: те, которые попадают в определенную категорию (например, те, которые должны были быть заблокированы фильтром), и те, которые не попадают. Затем показатель полноты рассчитывается путем деления количества элементов, которые система правильно идентифицировала как принадлежащие к категории, на общее количество элементов в категории.

В примере выше мы обсуждали базу данных, содержащую 1000 фотографий. Предположим, что 200 из этих фотографий были изображениями собак. Если бы, например, система классификации, предназначенная для идентификации фотографий собак, идентифицировала 80 фотографий собак и не смогла идентифицировать 120, она сработала бы с показателем полноты 40%. Это было бы аналогично фильтру, который допускает недостаточную блокировку на уровне 60%. Чтобы рассчитать показатель полноты фильтров в публичных библиотеках Вестервилла и Гринвилля в соответствии со стандартным методом, описанным выше, Финнелл должен был взять выборку сайтов из журналов использования интернета библиотек (включая как сайты, которые были заблокированы, так и сайты, которые не были заблокированы) и разделить количество сайтов в выборке, которые фильтр ошибочно не заблокировал, на общее количество сайтов в выборке, которые должны были быть заблокированы. Вместо этого Финнелл взял выборку сайтов, которые не были заблокированы, и разделил общее количество сайтов в этой выборке на количество сайтов в выборке, которые должны были быть заблокированы. Это сделало знаменатель, использованный Финнеллом, намного больше, чем он был бы, если бы он использовал стандартный метод расчета полноты, в результате чего рассчитанный им показатель недостаточной блокировки оказался намного ниже, чем он был бы при использовании стандартного метода.

Более того, несмотря на относительно низкие показатели недостаточной блокировки, обнаруженные в исследовании Финнелла, библиотекари из нескольких библиотек, представленных ответчиками, которые используют продукты блокировки, включая Гринвилль, Такому и Вестервиль, свидетельствовали о том, что в их библиотеках имеют место случаи недостаточной блокировки. Никаких количественных доказательств, сравнивающих эффективность фильтров и других альтернативных методов, используемых библиотеками для предотвращения доступа посетителей к визуальным изображениям, которые являются непристойными, детской порнографией или, в случае несовершеннолетних, вредными для несовершеннолетних, представлено не было. Бик предпринял аналогичное исследование показателей избыточной блокировки, которые являются результатом использования библиотекой Такомы программного обеспечения Cyber Patrol. Он начал с 3 733 отдельных блокировок, произошедших в библиотеке Такомы в октябре 2000 года, и отобрал из этого набора данных случайную выборку из 786 URL-адресов. Он рассчитал два показателя избыточной блокировки: один — в отношении политики библиотеки Такомы в отношении использования интернета (согласно которой визуальное содержание сайта не должно включать «наглядные материалы с изображением полного обнажения и половых актов, которые изображаются очевидно и исключительно в сенсационных или порнографических целях»), а второй — в отношении собственных определений категорий Cyber Patrol. Он подсчитал, что Cyber Patrol осуществила избыточную блокировку 4% всех веб-страниц в октябре 2000 года в отношении определений интернет-политики библиотеки Такомы и 2% всех страниц в отношении собственных определений категорий Cyber Patrol.

Сложно определить, насколько надежны выводы Бика, поскольку он не вел учет исходных данных, которые он использовал в своем исследовании, и не архивировал изображения веб-страниц в том виде, в каком они выглядели, когда он принимал решение о том, правильно ли они классифицированы программой Cyber Patrol. Без этой информации невозможно проверить его выводы (или подорвать их). И исследование Бика, безусловно, занижает показатель избыточной блокировки Cyber Patrol по некоторым из тех же причин, по которым исследование Финнелла, вероятно, занижает истинные показатели избыточной блокировки, используемые в изученных им библиотеках. Мы также отмечаем, что исследование Финнелла, в котором анализировался набор журналов интернета из библиотеки Такомы за период, когда работала та же программа фильтрации с тем же набором включенных категорий блокировки, выявило значительно более высокий показатель избыточной блокировки, чем исследование Бика. Бик обнаружил показатель избыточной блокировки примерно в 2%, в то время как исследование Финнелла оценило показатель избыточной блокировки в 6,34%. В любом случае, определения категорий, используемые CIPA, по крайней мере в отношении использования взрослыми (визуальные изображения, которые являются непристойными или детской порнографией), более узкие, чем материалы, запрещенные политикой библиотеки Такомы, и поэтому исследование Бика занижает показатель избыточной блокировки в отношении определений CIPA для взрослых. Подводя итог, мы считаем, что исследование Финнелла, хотя мы и не доверяем его оценкам недостаточной блокировки, полезно тем, что оно указывает нижние пределы показателей избыточной блокировки, которые имели место при работе фильтров Cyber Patrol, Websense и N2H2 в публичных библиотеках. Хотя эти показатели существенны — от почти 6% до 15%, — мы считаем, по причинам, изложенным выше, что они сильно занижают фактические показатели происходящей избыточной блокировки и поэтому не могут рассматриваться ничем иным, как минимальными оценками показателей избыточной блокировки, происходящей во всех программах фильтрации. 5. Методы получения примеров ошибочно заблокированных веб-сайтов

Истцы составили список из нескольких тысяч веб-сайтов, которые, по их утверждению, на момент проведения исследования с высокой вероятностью были ошибочно заблокированы одной или несколькими из четырех основных коммерческих программ фильтрации: SurfControl Cyber Patrol 6.0.1.47, N2H2 Internet Filtering 2.0, Secure Computing SmartFilter 3.0.0.01 и Websense Enterprise 4.3.0. Они составили этот список с помощью двухэтапного процесса. Во-первых, Бенджамин Эдельман (Benjamin Edelman), свидетель-эксперт, выступавший перед нами, составил список из более чем 500 000 URL-адресов и разработал программу для пропуска их через все четыре программы фильтрации, чтобы составить список URL-адресов, которые могли быть ошибочно заблокированы одной или несколькими программами. Во-вторых, Эдельман переслал подмножества составленного им списка библиотекарям и профессорам библиотечного дела, которых истцы наняли для проверки заблокированных сайтов на предмет их пригодности в контексте публичной библиотеки. Эдельман сформировал список URL-адресов, собрав веб-страницы, которые были заблокированы по следующим категориям в четырех программах: Cyber Patrol: «Для взрослых / Откровенно сексуальный»; N2H2: «Только для взрослых», «Обнажение», «Порнография» и «Секс» с «исключениями», задействованными в категориях «Образование», «Для детей», «История», «Медицина», «С модерацией» и «Только текст/разговорные»; SmartFilter: «Секс», «Обнажение», «Зрелые» и «Экстремальные»; Websense: «Контент для взрослых», «Обнажение» и «Секс».

Затем Эдельман сформировал базу данных веб-сайтов для возможного тестирования. Он получил этот список путем автоматического сбора URL-адресов из указателя веб-сайтов Yahoo, выбирая их из категорий указателя Yahoo, которые существенно отличались от классификаций, включенных им в каждую из программ блокировки (например, беря веб-сайты из категории Yahoo «Правительство»). Затем он расширил этот список, вводя URL-адреса, взятые из указателя Yahoo, в функцию «связанного» поиска поисковой системы Google, которая предоставляет пользователю список похожих сайтов. Эдельман также включал и исключал определенные веб-сайты по просьбе адвокатов истцов.

Взяв список из более чем 500 000 URL-адресов, который он составил, Эдельман использовал разработанную им автоматизированную систему для проверки того, блокируются ли конкретные URL-адреса каждой из четырех программ фильтрации. Это тестирование происходило в период с февраля по октябрь 2001 года. Он записал конкретные даты, когда определенные сайты блокировались определенными программами, и с помощью коммерческого программного обеспечения для архивирования архивировал содержимое домашней страницы заблокированных веб-сайтов (а в некоторых случаях и страниц, на которые ссылалась домашняя страница) в том виде, в каком оно существовало в момент блокировки. Посредством этого процесса Эдельман, чьим показаниям мы доверяем, составил список из 6 777 URL-адресов, заблокированных одной или несколькими из четырех программ. Поскольку эти сайты были выбраны из категорий каталога Yahoo, не связанных с категориями фильтрации, которые были включены во время теста (то есть «Правительство» против «Обнажения»), он рассудил, что они, вероятно, были заблокированы ошибочно. Как поясняется на полях, Эдельман повторил свое тестирование и обнаружил, что Cyber Patrol разблокировала большинство страниц из списка 6 777 после того, как он опубликовал список на своем веб-сайте. Его записи показывают, что сотрудник SurfControl (компании, выпускающей программное обеспечение Cyber Patrol) зашел на его сайт и, предположительно, проверил URL-адреса из списка, подтвердив тем самым суждение Эдельмана о том, что большинство URL-адресов в списке были заблокированы ошибочно. Эдельман переслал список заблокированных сайтов д-ру Джозефу Джейнесу (Dr. Joseph Janes), доценту Информационной школы Вашингтонского университета, который также выступал на судебном процессе в качестве свидетеля-эксперта. Джейнес изучил сайты, собранные Эдельманом, чтобы определить, соответствуют ли они комплектованию фондов библиотеки, то есть являются ли они сайтами, на которые библиотекарь-библиограф направил бы читателя в качестве источника информации в соответствии с профессиональными стандартами.

Эдельман переслал Джейнесу список из 6 775 веб-сайтов — практически весь список заблокированных сайтов, которые он собрал, — из которого Джейнес взял случайную выборку из 859 с использованием статистического пакета программ SPSS. Джейнес указал, что выбрал объем выборки 859, потому что это даст 95-процентный доверительный интервал плюс-минус 2,5%. Джейнес набрал группу из 16 рецензентов, большинство из которых были нынешними или бывшими студентами Информационной школы Вашингтонского университета, чтобы помочь ему определить, какие сайты подходят для использования в библиотеке. Процесс, который он использовал, мы описываем на полях. Из-за неспособности одного из членов команды рецензентов Джейнеса завершить процесс рецензирования, Джейнесу пришлось исключить из выборки 157 веб-сайтов, но поскольку веб-сайты распределялись между рецензентами случайно, маловероятно, что эти сайты существенно отличались от остальной части выборки. Таким образом, объем выборки составил 699, что расширило 95-процентный доверительный интервал до плюс-минус 2,8%.

Из общего числа 699 проверенных сайтов команда Джейнеса пришла к выводу, что 165 из них, или 23,6% процента выборки, не представляли никакой ценности в контексте библиотеки (то есть ни один библиотекарь в соответствии с профессиональными стандартами не стал бы направлять читателя на эти сайты как на источник информации). Они не смогли найти 60 веб-сайтов, или 8,6% выборки. Поэтому они пришли к выводу, что оставшиеся 474 веб-сайта, или 67,8% выборки, являются примерами избыточной блокировки в отношении материалов, которые являются подходящими источниками информации в публичных библиотеках. Применяя 95-процентный доверительный интервал плюс-минус 2,8%, исследование пришло к выводу, что мы можем быть на 95% уверены в том, что фактический процент сайтов в списке из 6 775 сайтов, подходящих для использования в публичных библиотеках, находится где-то между 65,0% и 70,6%. Другими словами, мы можем быть на 95% уверены, что фактическое количество сайтов из 6 775, которые Эдельман переслал Джейнесу и которые подходят для использования в публичных библиотеках (согласно стандарту Джейнеса), составляет от 4 403 до 4 783.

Правительство выдвинуло несколько обоснованных критических замечаний в адрес методологии Джейнеса, раскритиковав, в частности, тот факт, что, в то время как сайты, получившие два голоса «за» в первом раунде голосования, были признаны представляющими достаточный интерес в контексте библиотеки для исключения из дальнейшего анализа, сайты, получившие один или два голоса «против», были направлены на следующий раунд. Правительство также справедливо указывает на то, что результаты исследования Джейнеса могут быть обобщены только на совокупность из 6 775 сайтов, пересланных Эдельманом Джейнесу. Даже принимая во внимание эти критические замечания и соответствующим образом делая скидку на цифры Джейнеса, мы расцениваем исследование Джейнеса как подтверждение того, что набор из 6 775 веб-сайтов Эдельмана содержит по меньшей мере несколько тысяч URL-адресов, которые были ошибочно заблокированы одной или несколькими из четырех использованных им программ фильтрации, независимо от того, оцениваются ли они по определениям CIPA, собственным критериям категорий фильтров или по стандарту, использованному в исследовании Джейнеса. Эдельман протестировал только 500 000 уникальных URL-адресов из 4000 раз большего числа — или двух миллиардов, — которые, по оценкам, существуют в индексируемом интернете. Даже предполагая, что Эдельман выбрал те URL-адреса, которые с наибольшей вероятностью могли быть ошибочно заблокированы коммерческими программами фильтрации, мы заключаем, что количество страниц, ошибочно заблокированных одной или несколькими тестируемыми им программами фильтрации, во много раз превышает количество страниц, выявленных Эдельманом. Исследования Эдельмана и Джейнеса предоставляют многочисленные конкретные примеры веб-страниц, которые были ошибочно заблокированы одной или несколькими программами фильтрации. Веб-страницы, ошибочно заблокированные одной или несколькими программами фильтрации, не укладываются в какие-либо четкие схемы; они широко варьируются по тематике, и трудно сказать, почему они могли подвергнуться избыточной блокировке. Список, составленный Эдельманом, например, содержит веб-страницы, касающиеся религии, политики и государственного управления, здравоохранения, карьеры, образования, путешествий, спорта и многих других тем. В следующем разделе мы приводим примеры из каждой из этих категорий. 6. Примеры ошибочно заблокированных веб-сайтов

Несколько ошибочно заблокированных веб-сайтов содержали контент, относящийся к церквям, религиозным орденам, религиозным благотворительным организациям и религиозным объединениям. К ним относились следующие веб-сайты: совет Рыцарей Колумба № 4828, католическая мужская группа, связанная с церковью Св. Патрика в Фэллоне, штат Невада, http://msnhomepages.talkcity.com/SpiritSt/kofc4828, заблокированная Cyber Patrol в категории «Для взрослых / Откровенно сексуальный»; церковь Агапе в Серси, штат Арканзас, http://www.agapechurch.com, заблокированная Websense как «Контент для взрослых»; домашняя страница хавуры лесбиянок и геев Еврейского общинного центра Лонг-Бич, штат Калифорния, http://www.compupix.com/gay/havurah.htm, заблокированная N2H2 как «Только для взрослых, Порнография», Smartfilter как «Секс» и Websense как «Секс»; приют «Орфанаж Эммануэль» (Orphanage Emmanuel), христианский приют в Гондурасе, в котором проживают 225 детей, http://home8.inet.tele.dk/rfb_viva, заблокированный Cyber Patrol в категории «Для взрослых / Откровенно сексуальный»; Vision Art Online, продающая деревянные настенные панно для дома с молитвами, отрывками из Библии и изображениями Звезды Давида, http://www.visionartonline.com, заблокированная в категории Websense «Секс»; а также домашняя страница Тензин Палмо (Tenzin Palmo), буддийской монахини, содержащая описание ее проекта по строительству буддийского женского монастыря и международного ретритного центра для женщин, http://www.tenzinpalmo.com, классифицированная N2H2 как «Обнажение».

Несколько заблокированных сайтов также содержали информацию о государственных структурах или конкретных политических кандидатах либо содержали политические комментарии. К ним относились: веб-сайт Келли Росс (Kelley Ross), кандидата от Либертарианской партии в Ассамблею штата Калифорния, http://www.friesian.com/ross/ca40, который N2H2 заблокировал как «Обнажение»; веб-сайт Боба Кофлина (Bob Coughlin), члена муниципального совета в Дедхэме, штат Массачусетс, http://www.bobcoughlin.org, заблокированный в категории N2H2 «Обнажение»; список веб-сайтов, содержащих информацию о правительстве и политике в округе Адамс, штат Пенсильвания, http://www.geocities.com/adamscopa, заблокированный Websense как «Секс»; веб-сайт организации Wisconsin Right to Life, http://www.wrtl.org, который N2H2 заблокировал как «Обнажение»; веб-сайт, пропагандирующий федерализм в Уганде, http://federo.com, заблокированный N2H2 как «Только для взрослых, Порнография»; «Боритесь со смертной казнью в США» (Fight the Death Penalty in the USA), датский веб-сайт, посвященный критике американской системы смертной казни, http://www.fdp.dk, заблокированный N2H2 как «Порнография»; и «Глупые законы» (Dumb Laws), юмористический веб-сайт, высмеивающий устаревшие законы, http://www.dumblaws.com, заблокированный N2H2 в категории «Секс». Ошибочно заблокированные веб-сайты, касающиеся вопросов здравоохранения, включали следующие: путеводитель по аллергии, http://www.x-sitez.com/allergy, классифицированный N2H2 как «Только для взрослых, Порнография»; сайт вопросов и ответов о здоровье, спонсируемый Колумбийским университетом, http://www.goaskalice.com.columbia.edu, заблокированный N2H2 как «Секс», а Smartfilter — как «Зрелые»; домашняя страница Западного альянса поддержки ампутированных (Western Amputee Support Alliance Home Page), http://www.usinter.net/wasa, заблокированная N2H2 как «Порнография»; веб-сайт онкологического центра Уиллиса-Кнайтона (Willis-Knighton Cancer Center), учреждения по лечению рака в Шривпорте, штат Луизиана, http://cancerftr.wkmc.com, заблокированный Websense в категории «Секс»; а также сайт, посвященный галитозу, http://www.dreamcastle.com/tungs, заблокированный N2H2 как «Для взрослых, Порнография», Smartfilter — как «Секс», Cyber Patrol — как «Для взрослых / Откровенно сексуальный», и Websense — как «Контент для взрослых».

Программы фильтрации также ошибочно блокировали несколько веб-сайтов, имеющих отношение к образованию и карьере. Программы фильтрации заблокировали два сайта, предоставляющих информацию о домашнем обучении. Сайт «HomEduStation — the Internet Source for Home Education», http://www.perigee.net/~mcmullen/homedustation/, был отнесен Cyber Patrol к категории «Для взрослых / Содержимое сексуального характера». Smartfilter заблокировал сайт «Apricot: A Web site made by and for home schoolers», http://apricotpie.com, в категории «Секс». Программы также неверно классифицировали несколько сайтов, связанных с карьерой. «Social Work Search», http://www.socialworksearch.com/, представляет собой каталог для социальных работников, который Cyber Patrol поместила в категорию «Для взрослых / Содержимое сексуального характера». «Торговая палата лесбиянок и геев южной Невады» (Gay and Lesbian Chamber of Southern Nevada), http://www.lambdalv.com, являющаяся «форумом для делового сообщества с целью развития связей в сообществе лесбиянок, геев, транссексуалов и бисексуалов Лас-Вегаса», была заблокирована N2H2 в категории «Только для взрослых, порнография». Сайт для будущих стоматологов, http://www.vvm.com/~bond/home.htm, был заблокирован Cyber Patrol в категории «Для взрослых / Содержимое сексуального характера». Программы фильтрации ошибочно заблокировали множество туристических веб-сайтов, в том числе: веб-сайт пансиона с завтраком Allen Farmhouse Bed & Breakfast в округе Аллегейни, штат Северная Каролина, http://planet-nc.com/Beth/index.html, который Websense заблокировала как «Контент для взрослых»; Odysseus Gay Travel, туристическую компанию, обслуживающую геев, http://www.odyusa.com, которую N2H2 отнесла к категории «Только для взрослых, порнография»; компанию Southern Alberta Fly Fishing Outfitters, http://albertaflyfish.com, которую N2H2 заблокировала как «Порнография»; и туроператора в Намибии «Nature and Culture Conscious Travel», http://www.trans-namibia-tours.com, который был отнесен N2H2 к категории «Порнография».

Программы фильтрации также неверно классифицировали большое количество спортивных веб-сайтов. Среди них были: сайт, посвященный Уилли О'Ри, первому игроку афроамериканского происхождения в Национальной хоккейной лиге, http://www.missioncreep.com/mw/oree.html, который Websense заблокировала в категории «Обнажение»; домашняя страница Австралийского футбольного клуба Сиднейского университета, http://www.tek.com.au/suafc, которую N2H2 заблокировала как «Только для взрослых, порнография», Smartfilter заблокировал как «Секс», Cyber Patrol заблокировал как «Для взрослых / Содержимое сексуального характера», а Websense заблокировал как «Секс»; и фанатская страница, посвященная хоккейной команде «Торонто Мейпл Лифс», http://www.torontomapleleafs.atmypage.com, которую N2H2 заблокировала в категории «Порнография». 7. Заключение: Эффективность программ фильтрации. Публичные библиотеки приняли различные меры для решения проблем, порождаемых предоставлением доступа в Интернет. Большой объем свободно доступных в Интернете материалов сексуального характера в разной степени привел к жалобам читателей на такие вопросы, как нежелательное столкновение с оскорбительными материалами, случаи домогательств со стороны лиц, просматривающих контент сексуального характера в Интернете, в отношении сотрудников и других читателей, а также использование библиотечных компьютеров для доступа к незаконным материалам, таким как детская порнография. В некоторых библиотеках юные посетители упорно пытались использовать Интернет для доступа к жесткой порнографии.

Те публичные библиотеки, которые отреагировали на эти проблемы с помощью программных фильтров, обнаружили, что такие фильтры представляют собой относительно эффективное средство предотвращения доступа читателей к материалам сексуального характера в Интернете. Тем не менее из всего массива информации в Интернете, подпадающего под определения категорий продуктов фильтрации, фильтры ошибочно не блокируют значительный объем информации. Таким образом, программные фильтры не смогли полностью устранить проблемы, которые публичные библиотеки стремились решить с их помощью, о чем свидетельствуют частые случаи недостаточной блокировки. Нет также никаких количественных данных об относительной эффективности фильтров и альтернативных им средств, которые также призваны предотвращать доступ читателей к незаконному контенту в Интернете. Еще более важно (для настоящего дела) то, что, хотя программные фильтры предоставляют относительно дешевое и эффективное, хотя и несовершенное средство для публичных библиотек, позволяющее предотвратить доступ читателей к речи, подпадающей под определения категорий фильтров, мы приходим к выводу, что коммерчески доступные программы фильтрации ошибочно блокируют огромный объем защищенной Первой поправкой речи. Любой имеющийся в настоящее время продукт фильтрации, который является достаточно эффективным в предотвращении доступа пользователей к контенту в рамках определений категорий фильтра, неизбежно заблокирует бесчисленные тысячи веб-страниц, контент которых не соответствует определениям категорий компании-разработчика фильтра, не говоря уже о юридических определениях непристойности, детской порнографии или материалов, вредных для несовершеннолетних. Даже Финнелл, эксперт-свидетель со стороны ответчиков, установил, что от 6% до 15% заблокированных веб-сайтов в проанализированных им публичных библиотеках не содержали контента, который соответствовал бы даже собственным определениям продуктов фильтрации в отношении контента сексуального характера, не говоря уже об определениях CIPA.

Это явление обусловлено рядом причин, подробно изложенных в вышеприведенных фактологических выводах. К ним относятся ограничения возможностей компаний-разработчиков фильтров: (1) собирать веб-страницы для проверки; (2) проверять и классифицировать собранные веб-страницы; и (3) регулярно перепроверять ранее изученные веб-страницы. Основное ограничение возможностей компаний-разработчиков фильтров по сбору веб-страниц для проверки заключается в том, что значительное большинство страниц в Интернете не поддается индексации с помощью технологии пауков, используемой поисковыми системами в Интернете, и что в совокупности поисковые системы проиндексировали лишь около половины веб-страниц, теоретически подлежащих индексации. Высокие темпы роста числа веб-страниц также ограничивают возможности компаний-разработчиков фильтров по сбору страниц для проверки. Эти недостатки неизбежно приводят к значительной недостаточной блокировке. Ряд ограничений возможностей компаний-разработчиков фильтров по проверке и классификации собранных ими веб-страниц также способствует избыточной и недостаточной блокировке. Во-первых, процессы автоматической проверки, даже те из них, которые основаны на «искусственном интеллекте», не способны стабильно и точно отличать материал, подпадающий под определение категории, от материала, который под него не подпадает. Более того, проверка URL-адресов человеком затруднена ограниченным штатом сотрудников компаний-разработчиков фильтров, а также человеческими ошибками или неверными оценками. Чтобы справляться с огромными размерами Интернета и его быстрыми темпами роста и изменений, компании-разработчики фильтров используют несколько практических приемов, необходимых для сокращения недостаточной блокировки, но неизбежно ведущих к избыточной блокировке. К ним относятся: (1) блокировка целых веб-сайтов даже тогда, когда лишь небольшая часть их страниц содержит материал, который мог бы подпасть под одну из категорий компании-разработчика фильтра (например, блокировка сайта Salon.com из-за наличия на нем колонки о сексе); (2) блокировка по IP-адресу (поскольку один IP-адрес может содержать множество различных веб-сайтов и многие тысячи страниц с разнородным контентом); и (3) блокировка сайтов-лазеек, таких как сайты-переводчики и сайты кэширования, на которых архивируются веб-страницы, удаленные из Интернета их первоначальными издателями.

Наконец, неспособность компаний-разработчиков фильтров регулярно перепроверять веб-страницы, которые они уже классифицировали (или которые они определили как не подпадающие ни под одну из категорий), приводит к значительному объему избыточной и недостаточной блокировки. Например, издатели веб-сайтов часто меняют содержимое веб-страниц. Эта проблема также возникает, когда веб-сайт прекращает свое существование, а его доменное имя или IP-адрес переназначаются новому издателю веб-сайта. В таком случае предыдущая классификация IP-адреса или доменного имени, сделанная компанией-разработчиком фильтра, скорее всего, окажется неверной, что потенциально приведет к избыточной или недостаточной блокировке многих тысяч страниц. Неточности, возникающие из-за этих ограничений технологии фильтрации, весьма существенны. По меньшей мере десятки тысяч страниц индексируемого Интернета подвергаются избыточной блокировке каждой из программ фильтрации, оцененных экспертами по данному делу, даже при сопоставлении с собственными определениями категорий компаний-разработчиков фильтров. Многие ошибочно заблокированные страницы содержат контент, который является абсолютно безвредным как для взрослых, так и для несовершеннолетних, и относительно которого ни один здравомыслящий человек не мог бы сделать вывод, что он соответствует определениям категорий компаний-разработчиков фильтров, таким как «порнография» или «секс».

Количество сайтов, подвергшихся избыточной блокировке, разумеется, намного выше в отношении определений непристойности и детской порнографии, которые CIPA использует в отношении взрослых, поскольку определения категорий продуктов фильтрации, такие как «секс» и «обнажение», охватывают огромное количество веб-страниц, которые не являются ни детской порнографией, ни непристойными материалами. Таким образом, количество страниц конституционно защищенной речи, заблокированных продуктами фильтрации, значительно превышает многие тысячи страниц, подвергшихся избыточной блокировке по сравнению с определениями категорий продуктов фильтрации.

Никакая технология, которую можно вообразить в настоящее время, не способна принимать решения, необходимые для определения того, подпадает ли визуальное изображение под юридические определения непристойности, детской порнографии или материалов, вредных для несовершеннолетних. Учитывая современный уровень развития технологий фильтрации и распознавания образов, а также быстро меняющийся и расширяющийся характер Интернета, мы приходим к выводу, что недостатки продуктов фильтрации не будут устранены с помощью технического решения в обозримом будущем. Подводя итог, можно сказать, что продукты фильтрации в настоящее время не способны блокировать исключительно те визуальные изображения, которые являются непристойными, представляют собой детскую порнографию или вредны для несовершеннолетних (или исключительно контент, соответствующий определениям категорий продукта фильтрации), одновременно предоставляя доступ ко всей защищенной речи (или ко всему контенту, не соответствующему определениям категорий продукта блокировки). Любой программный фильтр, который является относительно эффективным в блокировании доступа к веб-страницам, подпадающим под определения его категорий, неизбежно ошибочно заблокирует значительное количество веб-страниц, которые не подпадают под определения его категорий. 2. Аналитическая структура решения: центральное значение дела Dole и роль абстрактного иска

Обложка выбранной аудиокниги Выберите главу Плеер готов к воспроизведению
0:00 0:00

Громкость