После запуска ChatGPT англоязычный интернет начал писать заметно по-другому. Исследователи проанализировали 490 тысяч страниц с января 2021 по июль 2026 года и обнаружили быстрый рост слов, конструкций и знаков препинания, характерных для генеративного ИИ. К июлю 2026 года признаки машинного авторства или редактирования появились примерно на каждой десятой странице, а среди материалов, выпущенных после запуска ChatGPT, уже на более чем трети.

Длинное тире оставило самый заметный след. В начале 2023 года его встречалось в среднем 5,79 раза на 10 тысяч слов, к началу 2026 года — 11,19 раз. Оксфордская запятая выросла на 63%. Синтаксические конструкции типа отрицание-утверждение стали встречаться почти втрое чаще.

Словарь изменился аналогично. Слова, которые языковые модели используют чаще людей, выросли с 11,94 до 26,02 употреблений на 10 тысяч слов. Среди них — термины, которые регулярно выбирают модели, но редко пишут люди. Одно такое слово ничего не значит, но на сотнях тысяч документов этот сдвиг становится очевидным.

Для оценки авторства использовалась открытая модель Pangram, которая ищет статистические особенности в выборе слов и построении предложений. Каждая страница получала оценку от полностью человеческого до полностью машинного текста. Авторы исследования подчеркивают: такой подход нельзя считать безошибочным тестом. ИИ-детекторы дают ложные срабатывания и пропускают отредактированный машинный текст. Результаты отражают крупный тренд, а не происхождение конкретной статьи.

Выборка охватывала не весь интернет. Команда взяла по 10 тысяч англоязычных страниц из 49 снимков Common Crawl. В архив попадают публично доступные сайты, поэтому ресурсы с авторизацией и платным доступом представлены хуже. Даже с этим ограничением разница между сегментами была значительной. В 2026 году признаки ИИ встречались на 9,4% страниц в зоне .com, на 4,6% в .org и примерно на 1% в .edu и .gov.

Социальные сети показали ещё более резкую картину. Pangram проанализировала свыше миллиона публикаций, которые пользователи браузерного расширения проверили с апреля 2026 года. Среди текстов длиннее 250 слов полностью машинными оказались около 41% длинных постов LinkedIn, 31% материалов Medium, 29% публикаций X, 13% постов Reddit и 10% статей Substack. На X ещё 23% длинных текстов получили оценку смешанного авторства. Такая выборка не случайна и не позволяет обобщать на все публикации, но показывает масштаб машинного текста среди проверяемого контента.

Самый интересный вопрос возникает дальше. Рост характерных оборотов может происходить не только потому, что интернет заполняется текстами от ChatGPT, Claude и Gemini. Люди сами перенимают язык моделей. Исследователи изучили более 740 тысяч часов речи из 360 тысяч академических видео YouTube и 771 тысячи выпусков подкастов. После появления ChatGPT частота слов, предпочитаемых моделями, выросла даже в устной речи.

Авторы видят возможный механизм: замкнутую культурную петлю. Языковые модели обучаются на человеческих текстах, формируют свои статистические привычки, затем миллионы людей читают машинный текст и постепенно перенимают эти привычки. Следующее поколение моделей обучается на интернете, где человеческий и машинный язык всё сильнее переплетаются.

Поэтому длинное тире или особый выбор слов сами по себе не делают текст ChatGPT-овским. Исследование выявляет более крупный сдвиг. Машинный стиль перестал быть только результатом работы чат-ботов и превращается в часть общего языкового фона, на котором пишут и люди.