ИИ создал треть нового англоязычного контента в интернете
Более трети англоязычных веб-страниц, опубликованных после выхода ChatGPT, могут содержать тексты, созданные или существенно отредактированные искусственным интеллектом. Такой вывод сделал Pew Research Center, проанализировав около 490 тысяч англоязычных страниц из веб-архива Common Crawl за последние пять лет. Об этом сообщает «IXBT News».
«Тексты проверяли с помощью детектора Open Pangram, который с помощью машинного обучения выявляет статистические признаки, характерные для ИИ-контента», — сообщает «IXBT News».
В случайной выборке из 10 тысяч страниц, доступных в Common Crawl в июле 2026 года, примерно 10% продемонстрировали существенные признаки ИИ-авторства или редактирования. Однако в эту цифру попало немало старых материалов, созданных ещё до появления современных генеративных чат-ботов. Если учитывать только страницы, опубликованные после запуска ChatGPT, доля резко возрастает. В июле 2026 года признаки использования ИИ обнаруживались примерно в 35% таких материалов. Причём чем новее страницы, тем выше этот показатель.
Распространение ИИ-контента по интернету также оказалось неравномерным. На коммерческих доменах .com в 2026 году признаки генерации или редактирования ИИ обнаруживались примерно на каждой десятой странице. Для .org показатель составлял около 4,6%, а для .edu и .gov — около 1%. Коммерческий сегмент интернета быстрее остальных заполняется материалами с признаками машинного происхождения.
Генеративный ИИ влияет уже не только на количество текстов в интернете, но и на сам язык. Сравнив современные материалы с текстами 2023 года, исследователи обнаружили рост ряда конструкций и знаков препинания, которые особенно часто используются чат-ботами. Например, длинное тире стало встречаться примерно вдвое чаще, а использование оксфордской запятой выросло на 63%.
Исследователи отмечают, что отдельное слово, длинное тире или оксфордская запятая не могут служить доказательством того, что конкретный текст написал ИИ. Все эти особенности существовали в человеческой речи задолго до появления ChatGPT. Показательными они становятся только при статистическом анализе огромных массивов текстов. Кроме того, у исследования есть ограничения: детекторы ИИ могут ошибаться и принимать написанный человеком текст за машинный или, наоборот, не распознавать сгенерированный материал. Поэтому показатели в 10% и 35% следует воспринимать как оценки, а не точный подсчёт страниц, созданных нейросетями. Тем не менее тенденция выглядит показательной.
Подписывайтесь на наш Telegram-канал, чтобы быть в курсе всех новостей и событий Рунета.