
Pew Research Center проанализировал почти полмиллиона англоязычных веб-страниц на признаки текста, созданного искусственным интеллектом. Согласно опубликованному The Decoder пересказу исследования, более трети страниц, размещённых после запуска ChatGPT, содержат такие признаки.
Коммерческие сайты в доменной зоне.com, по этим данным, в десять раз чаще содержат ИИ-текст, чем сайты в зонах.edu или.gov. Это указывает на различие между типами веб-площадок, но не объясняет причины такого разрыва.
Практическое значение вывода — растущая роль автоматизированного текста в публичной веб-среде. При этом доступный пакет основан на метаданных и синопсисе The Decoder, а не на полном тексте исследования или независимой проверке его результатов.
комментарий редакции
Что это значит
Если выводы подтвердятся, редакциям и исследователям придётся чаще проверять происхождение веб-текстов и различать автоматизированную подготовку материалов. Следующим наблюдаемым сигналом станет появление сопоставимых исследований с открытой методикой и независимой проверкой. Существенная неопределённость связана с тем, что в доступном пакете нет полного текста исследования и описания метода обнаружения.
Дополнительные оценки
Ollama Cloud
GLM 5.2
Распространение ИИ-текста в коммерческой зоне .com в десять раз чаще, чем в .edu или .gov, указывает на системное изменение веб-среды, где экономические стимулы ускоряют автоматизацию контента. Следующим наблюдаемым сигналом станет появление сопоставимых исследований с открытой методологией и независимой верификацией. Существенная неопределённость связана с отсутствием полного текста исследования и описания методов обнаружения ИИ-текста, что не позволяет оценить точность выводов.
В чём оценки сходятся- Растущая доля машинно написанного текста меняет практику проверки и доверия к онлайн-источникам.
- Разрыв между .com и .edu/.gov указывает на различие мотивации площадок, но не объясняет его причины.
- Без полного текста исследования и описания методики выводы нельзя считать окончательно подтверждёнными.
- Формулировка «признаки машинно написанного текста» может переоценивать долю ИИ-контента, если детектор ошибается на отредактированных текстах.
- Выборка только англоязычных страниц не позволяет экстраполировать выводы на весь веб.
- Корреляция с запуском ChatGPT не доказывает причинно-следственную связь без анализа динамики до и после.
Ollama Cloud
Kimi K2.6
Рост ИИ-текста в веб-среде создаёт структурный риск для доверия к онлайн-информации: если треть контента после 2022 года имеет машинное происхождение, системы верификации и алгоритмы поиска потребуют переоснащения. Следующим сигналом станет появление исследований с открытой методологией детекции и международными выборками. Ключевая неопределённость — надёжность самих детекторов: ложноположительные срабатывания могут искажать картину так же сильно, как и реальное распространение ИИ-контента.
В чём оценки сходятся- Рост ИИ-текста после запуска ChatGPT выглядит логичным и подтверждается косвенными данными из других секторов.
- Разрыв между .com и .edu/.gov отражает различные стимулы: коммерческие площадки оптимизируют затраты на контент, а академические и государственные — пока сохраняют барьеры.
- Отсутствие полного текста исследования ограничивает возможность оценить его валидность.
- Пересказ The Decoder может упрощать методологию Pew: «признаки машинного текста» не равны «тексту, написанному ИИ» — это могут быть шаблоны, SEO-оптимизация или переводы.
- Десятикратный разрыв .com против .edu/.gov может объясняться объёмом контента, а не долей ИИ: коммерческих страниц на порядки больше, и абсолютные цифры важнее относительных.
- Отсутствие корреляции с другими исследованиями (corroborated: false) делает вывод преждевременным для стратегических решений.