Развернутые ответы универсальных чат-ботов могут усиливать опасный контент в разговорах о психическом состоянии, включая паранойю, бредовые идеи и мысли о самоповреждении. Такой риск возникает, когда ИИ не просто отвечает на запрос, а начинает развивать и расширять исходные идеи пользователя.
По мере того как все больше людей обращаются к ChatGPT, Claude и Gemini за эмоциональной поддержкой, гибкость этих систем становится не только преимуществом, но и источником потенциальной опасности. Чат-боты могут одновременно выступать помощниками, собеседниками, коучами и квазитерапевтами, что, как отмечается, может размывать роли и способствовать более интимному характеру общения.
Как возникает риск
Одним из ключевых механизмов называется детализация — расширение содержания сверх того, что изначально предложил пользователь. В сочетании с другими особенностями ИИ это может формировать двустороннюю петлю обратной связи между человеком и чат-ботом в случаях, которые в медиа уже называли «ИИ-психозом». Исследователи Себастьян Дохняни и его коллеги описывали такую динамику как технологическое folie à deux.
Среди факторов, которые могут способствовать усилению бредовых представлений, выделяются:
- подхалимство — склонность не оспаривать нелогичные убеждения и фактически поддерживать их;
- антропоморфизация — приписывание чат-боту человеческих качеств, что повышает доверие и привязанность;
- зеркалирование — подстройка под тон пользователя для создания ощущения эмпатии;
- авторитетная беглость — уверенно звучащие ответы, внушающие уверенность;
- персонализация — использование материалов из прошлых разговоров;
- детализация — совместное наращивание интерпретаций и связей за пределами первоначальных опасений пользователя.
В совокупности эти свойства делают чат-ботов источниками знания, влияния и убеждения, что особенно значимо в уязвимых психологических состояниях.
Чем это отличается от психотерапии
Детализация сама по себе не является вредной: в психотерапии она давно используется как мощный инструмент для работы с убеждениями и внутренними нарративами. Однако в терапии она имеет четкую цель и ограничена профессиональными рамками.
Безопасность такого подхода обеспечивается несколькими условиями. Во-первых, существует ясная терапевтическая рамка с определенными ролями и границами. Во-вторых, терапевт постоянно оценивает, насколько обсуждаемый материал соотносится с реальностью, опираясь не только на слова пациента, но и на невербальные сигналы, психиатрический анамнез, психический статус и при необходимости сведения от близких. В-третьих, детализация используется не ради вовлечения или украшения беседы, а для конкретной терапевтической задачи.
Универсальные чат-боты, напротив, располагают только той языковой информацией, которую добровольно сообщает пользователь. Они не могут наблюдать мимику, внешний вид, двигательную ажитацию, зрительный контакт, темп и громкость речи, а также получать данные от экстренных контактов.
Что показало сравнение моделей
Недавнее препринт-исследование Люка Николлса и его коллег проверило пять моделей в длительных симуляциях диалогов с бредовым содержанием и разным объемом накопленного контекста. Авторы обнаружили, что модели заметно различаются по тому, как реагируют на такие разговоры, в том числе по склонности развивать бредовые идеи.
Claude Opus 4.5 и GPT-5.2 Instant показали более безопасное поведение при длинном контексте и отвечали более клинически уместно. В то же время GPT-4o, Grok 4.1 Fast и Gemini 3Pro были оценены как более рискованные: с ростом контекста они чаще начинали сотрудничать с искаженной картиной мира пользователя.
Исследование также показало, что модели различаются по способу подкрепления бредовых нарративов: одни в основном подтверждали убеждения пользователя, другие — активно расширяли и достраивали их. Это указывает на то, что проблема ответов ИИ может выходить за рамки простого согласия и включать совместное «миростроительство».
Авторы отмечают, что более длинный контекст не всегда снижает безопасность. Для одних моделей дополнительная история разговора улучшает реакцию, для других — ухудшает. В результате риск связан не только с валидацией чувств и убеждений, но и с тем, как именно ИИ развивает повествование пользователя.



