Исследование: треть нового контента в интернете написана искусственным интеллектом

С момента запуска ChatGPT в конце 2022 года прошло менее четырех лет, однако изменения, происходящие в интернете, уже не ограничиваются новыми привычками поиска информации или ростом популярности чат-ботов. Они затрагивают саму базовую структуру цифрового контента.

Масштабный анализ американского исследовательского центра Pew, основанный на изучении примерно полумиллиона англоязычных веб-страниц из базы Common Crawl, показал, что не менее 10% всех активных сегодня интернет-страниц имеют явные признаки того, что их текст был написан или отредактирован с помощью искусственного интеллекта.

Если же выделить из общей базы только сайты и материалы, опубликованные после начала революции генеративного искусственного интеллекта, доля машинного контента превышает треть.

Эти данные отражают стремительный процесс, в ходе которого тексты, написанные людьми, вытесняются искусственным контентом, который можно создавать буквально одним нажатием кнопки. Масштабы этого процесса уже меняют экосистему поисковых систем, социальных сетей и новостных сайтов.

Распределение синтетического текста в интернете демонстрирует существенные различия между различными категориями сайтов. Если в 2022 году показатели были практически нулевыми и почти одинаковыми для всех категорий, то сегодня около 10% сайтов с коммерческими доменными зонами, например com, демонстрируют признаки использования искусственно созданных текстов. Среди некоммерческих организаций этот показатель составляет лишь около 5%.

Академические и государственные сайты пока остаются в стороне от основного потока - доля AI-контента на них составляет всего около 1%.

Этот разрыв свидетельствует о наличии прямого экономического стимула. Коммерческие сайты, маркетинговые блоги и так называемые фермы контента все активнее используют AI-модели для быстрого создания больших объемов материалов, позволяющих привлекать больше посетителей - и ботов - без затрат на дополнительный персонал.

Официальные учреждения, напротив, подчиняются более строгому регулированию и более жестким требованиям к контролю качества.

Эта тенденция не ограничивается Соединенными Штатами. Аналогичные исследования, проведенные в Европе на фоне вступления в силу европейского закона об искусственном интеллекте, выявили схожую картину.

Одновременно регулирующие органы Великобритании и Франции выражают серьезную обеспокоенность возможностью "коллапса моделей" - сценария, при котором будущие системы искусственного интеллекта обучаются на некачественных искусственно созданных текстах, что в итоге снижает достоверность информации, которую они производят.

В Китае центральное правительство осуществляет жесткий контроль и требует снабжать цифровыми водяными знаками любой контент, созданный алгоритмами. В результате там формируется значительно более закрытая и контролируемая система по сравнению с западными странами.

В Израиле многие информационные и коммерческие сайты также внедрили подобные инструменты для поискового продвижения. Это приводит к снижению качества доступных в интернете текстов на иврите и формированию однотипных языковых шаблонов.

Исследование также выявило характерный языковой "почерк" машин.

Инструменты обнаружения AI-контента, такие как Open Pangram, основываются не только на простом сравнении используемой лексики, но и выявляют специфические статистические закономерности.

В текстах, созданных искусственным интеллектом, зафиксирован резкий рост использования длинного тире, серийной запятой и повторяющегося словарного запаса, включающего такие слова и выражения, как "переплетение", "составляющая", "акцентирование" и "глубокое погружение".

Структура предложений также становится более шаблонной. В частности, резко увеличилось использование параллельных противопоставлений, при которых различные идеи сравниваются друг с другом чрезмерно структурированным образом.

Помимо Open Pangram, на рынке существуют и другие коммерческие сервисы обнаружения AI-контента, в частности GPTZero, Copyleaks и инструмент проверки Turnitin.

Несмотря на то что эти системы постоянно совершенствуются, их разработчики признают, что фактически речь идет о непрерывной гонке вооружений.

По мере того как языковые модели, такие как Claude, Gemini и другие передовые системы, учатся избегать характерных языковых ловушек и все убедительнее имитировать разнообразные стили человеческого письма, отличить оригинальную статью, написанную человеком, от искусственно сконструированного текста становится все сложнее.

Последствия этого массового распространения искусственного контента выходят далеко за рамки вопросов авторского права или фактической точности.

По мере того как все более значительная часть публичного информационного пространства создается одними и теми же алгоритмами, усиливаются опасения по поводу утраты оригинальности, воспроизводства культурных предубеждений и постепенного снижения доверия общества к письменной информации в интернете.

Интернет стремительно превращается в среду, в которой машины уже не просто служат вспомогательным инструментом для исследований или перевода, а становятся основными производителями цифрового дискурса.

0
9 сентября в 09:52
Блог Пинхоса Фридберга
Автор блога:
Пинхос Фридберг
Всего постов:
139
Последний пост:
9 сентября 2026 г.