Участники исследования в Великобритании чаще считали ответы, сгенерированные искусственным интеллектом для политических дебатов, более аутентичными, связными и уместными, чем реальные высказывания публичных фигур. Результаты показывают, что современные генеративные модели способны убедительно имитировать политиков и могут использоваться для распространения дезинформации, которой избиратели готовы верить.
Исследование было опубликовано в журнале PLOS One. Его цель состояла в том, чтобы проверить, могут ли обычные граждане отличить настоящее политическое высказывание от текста, созданного машиной, а также как они оценивают качество таких ответов по сравнению с человеческой речью.
Для анализа исследователи использовали программу BBC Question Time, в которой политики, бизнесмены и журналисты отвечают на актуальные вопросы аудитории. Они собрали 520 реальных вопросов зрителей и ответы на них от 112 публичных фигур из выпусков, вышедших с июня 2020 года по ноябрь 2021 года.
Затем модель GPT-4 Turbo сгенерировала альтернативные ответы на те же вопросы. Ей поручили выступать от имени конкретного человека, который отвечал в оригинале. Чтобы имитация была точнее, модели предоставляли краткую биографию, составленную по первому абзацу статьи о фигуре в Википедии, и просили отвечать прямо, в разговорном тоне и примерно в 200 словах.
После этого исследователи привлекли 948 совершеннолетних жителей Великобритании, представлявших репрезентативную выборку. Участникам сообщили, что они читают стенограммы телевизионных дебатов, но не сказали, что половина текстов была создана компьютером.
Как проходила проверка
Участников разделили на три группы. В первой группе люди читали вопрос, имя выступающего и один ответ — либо реальный, либо сгенерированный, — после чего оценивали его аутентичность, то есть вероятность того, что именно этот человек мог так сказать. Кроме того, они оценивали связность текста и его уместность по отношению к исходному вопросу.
Во второй группе участникам показывали рядом оба варианта ответа — настоящий и искусственно созданный. Им предлагали сравнить тексты по тем же критериям, а также определить, выражают ли они одну и ту же основную мысль или разные позиции.
Третья группа видела вопрос, имя публичной фигуры, ее краткую биографию и один ответ — реальный или сгенерированный. Это позволило проверить, влияет ли знание биографии на восприятие аутентичности. В качестве контрольного теста некоторым участникам показывали настоящий ответ, но приписанный случайному, не соответствующему ему человеку.
Что показали результаты
Во всех трех группах участники последовательно отдавали предпочтение текстам, созданным ИИ. В среднем такие ответы получали более высокие оценки по аутентичности, связности и релевантности, чем реальные ответы политиков и других публичных фигур. Даже когда оба текста показывали рядом, участники чаще считали более подлинным именно искусственно сгенерированный вариант.
Исследователи отметили, что ИИ особенно хорошо удерживал фокус на вопросе. В живых дебатах реальные политики нередко уходят от неудобных тем, из-за чего их ответы кажутся аудитории менее релевантными. Модель же, получив прямую инструкцию отвечать по существу, чаще давала ответы по теме. Кроме того, в ее текстах было значительно больше совпадающих слов с формулировкой исходного вопроса.
При этом примерно в половине случаев участники считали, что реальные и сгенерированные ответы передают разные смыслы. Детальный анализ части таких несовпадений показал, что примерно в 26% этих случаев компьютер формулировал позицию, полностью отличавшуюся от реальных взглядов политика. Это указывает на возможность создавать правдоподобные высказывания, искажающие политическую позицию публичной фигуры.
Чем стиль ИИ отличался от человеческой речи
Лингвистический анализ показал, что реальные выступающие чаще использовали маркеры субъективности вроде «я думаю» или «по моему мнению», а также связующие элементы наподобие «потому что» или «во-первых», характерные для живой спонтанной речи. Тексты ИИ, напротив, отличались более разнообразной лексикой и чаще использовали номинализации, которые делают высказывание более абстрактным и формальным.
Несмотря на эти различия, читатели, судя по результатам, не воспринимали стиль ИИ как менее подлинный. Стилистические особенности машинных ответов не снижали их оценки по аутентичности.
Реакция участников и ограничения
После завершения эксперимента участников спросили об их отношении к использованию технологий в политике. Сначала вопросы задавали без раскрытия того, что в исследовании применялся ИИ. Большинство заявили, что знакомы с такими технологиями и в целом поддерживают их использование в публичных дебатах при условии высокой прозрачности.
Когда участникам сообщили, что часть прочитанных ими текстов была создана искусственным интеллектом, более 90% не изменили своего мнения. Те, кто пересмотрел позицию, чаще приходили к выводу, что на самом деле хуже понимают возможности ИИ, чем считали раньше. Многие в комментариях выражали удивление качеством сгенерированных ответов.
Авторы отмечают и ограничения работы. Исследование было сосредоточено на одной телевизионной программе в одной стране и использовало только одну модель искусственного интеллекта. Кроме того, реальные участники дебатов отвечали в прямом эфире, в условиях давления и нередко в напряженной обстановке, поэтому их речь естественным образом была менее отшлифованной, чем тексты, подготовленные моделью.
По мнению исследователей, дальнейшие работы должны проверить, как подобные тексты воспринимаются в других форматах, включая публикации в соцсетях и подготовленные политические выступления, а также насколько охотно аудитория верит в сгенерированные заявления, если модели специально поручить создавать крайние или поляризующие политические позиции.



