Восемьсот восемьдесят тысяч текстов: почему статьи становятся всё более похожими

Ещё в конце восемнадцатого века двенадцать анонимных политических статей стали предметом спора о том, кто их написал. Разгадку нашли через сто с лишним лет, причём не через…

Восемьсот восемьдесят тысяч текстов: почему статьи становятся всё более похожими

Ещё в конце восемнадцатого века двенадцать анонимных политических статей стали предметом спора о том, кто их написал. Разгадку нашли через сто с лишним лет, причём не через взгляды или аргументы, а через частотность мелких служебных слов вроде предлогов и союзов.

Позже психолингвисты показали, что употребление таких слов статистически связано с чертами личности. След в тексте остаётся, даже если сам автор его не осознаёт. Но что произойдёт, если всё больше людей начнут пропускать свои тексты через языковые модели перед публикацией?

Команда исследователей из Южной Калифорнии проанализировала более восьмисот восьмидесяти тысяч текстов. Сначала они проследили, как за семь лет менялась вариативность письма на трёх платформах: научные препринты, местные новости и раздел Reddit с литературными историями.

Разброс, то есть насколько тексты отличаются друг от друга по сложности и разнообразию языка, после появления ChatGPT в ноябре 2022 года начал устойчиво снижаться на всех трёх.

На новостном сайте падение случилось сразу, на двух других шло постепенно. Авторы осторожны в выводах: корреляция не доказывает причину, и на результаты могли повлиять изменения правил платформ или состава авторов.

Чтобы проверить гипотезу напрямую, исследователи взяли по тысяче написанных человеком текстов с Reddit и из arXiv, все опубликованные до появления ChatGPT, и переписали их тремя моделями с двенадцатью разными подсказками.

Смысл в большинстве случаев сохранился, но стилистическое разнообразие сократилось примерно на пятую часть, а иногда и наполовину. Сильнее всего тексты унифицировались при просьбе «переформулировать иначе».

Дальше выяснилось, что вместе с разнообразием слабеют и сигналы, по которым можно угадать автора. Классификаторы, обученные определять возраст, пол, политические взгляды, черты характера и уровень эмпатии по тексту, после переписывания работали заметно хуже.

Сильнее всего просело определение возраста, затем пола и политической принадлежности. При этом смещение оказалось не хаотичным: переписанные тексты чаще приписывались людям старше, мужчинам, более озабоченным моралью, менее эмпатичным и менее общительным. Республиканские тексты после обработки нередко принимались за демократические.

Исследователи отмечают, что ослабление сигналов — не только плохая новость. Там, где по тексту пытаются угадывать личные свойства без согласия человека, ненадёжность таких догадок снижает риск слежки и дискриминации.

Но есть и обратная сторона: психиатрические скрининги, исследования эмпатии, анализ эмоций в клиентском сервисе — всё это опирается на предположение, что по словам можно читать человека.

Если это предположение слабеет, слабеет и основание таких практик. В отдельной теоретической статье те же авторы ставят вопрос шире: не сглаживается ли вместе со стилем и сам способ думать, ведь модели естественно тяготеют к частым и универсальным формулировкам, а редкие и нестандартные тонут. Это пока лишь гипотеза, не подкреплённая новыми данными.

Возвращаясь к тем двенадцати статьям, стоит помнить: самое узнаваемое в тексте часто прячется в привычках, которых сам автор не замечает. Когда мы нажимаем «отполировать», модель меняет не только ошибки, но и часть этих привычек.

Исследование не доказало, что гладкость обязательно достигается ценой индивидуальности. Оно лишь напоминает: прежде чем доверить текст единому стандарту, стоит решить, какие привычки вы готовы отдать, а какие хотите сохранить за собой.

Автор материалов и основатель сервиса SMSLab Строева Марина — аналитик, эксперт по искусственному интеллекту, автор книг о данных, рынках, экономической истории и AI.

Смотреть все новости