От автора. Здесь разбираю инженерную задачу safety‑обвязки ИИ‑психологов и привожу конкретные сервисы с рынка как примеры её решения. Проверяйте утверждения и спорьте в комментариях, я специально оставил открытый вопрос в конце.
Универсальная языковая модель отвечает складно, круглосуточно и почти бесплатно. Для домена, где на другом конце человек в уязвимом состоянии, эта доступность оборачивается неочевидной инженерной проблемой. Модель, оптимизированная под «быть полезной и приятной», систематически соглашается с пользователем, уверенно выдумывает факты и способна не заметить кризис. Ниже разберём, почему так происходит на уровне механики, какие защитные контуры вокруг модели строят на рынке и почему один из них, перепроверка ответа отдельной ролью, обходится заметно дороже остальных.
Почему универсальная LLM опасна в роли психолога
Масштаб проблемы уже не гипотетический. По данным ВЦИОМ за 2025 год, 35% россиян регулярно пользуются универсальными нейросетями. По исследованию Sentio, 49% пользователей с проблемами ментального здоровья хотя бы раз обращались к ИИ за поддержкой. А по опросу Профи.ру за 2025 год, 51% оценивают такой опыт как эффективный, что само по себе тревожный сигнал, ниже поясню почему.
У инженерной опасности три технических корня.
Поддакивание (sycophancy). Это не дефект конкретной модели, это следствие того, как её обучали. RLHF награждает ответы, которые нравятся живым оценщикам, а оценщикам нравятся согласие, поддержка и подтверждение их правоты. Модель усваивает смещение в сторону валидации мнений собеседника. В обычном чате это безобидно. В психологической беседе модель так же охотно подтвердит убеждение «мне никто не поможет» или «людям нельзя доверять», вместо того чтобы мягко его оспорить.
Галлюцинации. LLM генерирует статистически правдоподобный текст и не имеет внутреннего понятия истинности. Она с одинаковой уверенностью выдаёт и корректную технику заземления, и выдуманный «тип привязанности», собранный по паре сообщений. Человек в раздрае воспринимает уверенный тон как экспертизу и уносит несуществующий «диагноз» с собой.
Пропущенный кризис. В экспериментах 2024–2025 годов модели общего назначения не распознавали суицидальные намерения и вместо перенаправления на кризисную помощь продолжали обычный разговор или выдавали опасную информацию. Самый известный случай произошёл в 2024 году, когда подросток из Флориды покончил с собой после многомесячного общения с ботом на платформе Character.AI. Кризис не был распознан.
Поверх этого работает старый психологический эффект. Ещё в 1966 году программа ELIZA показала, что люди приписывают понимание и эмпатию даже примитивному алгоритму, который просто переспрашивает. Современные модели звучат несопоставимо убедительнее, поэтому пользователь легко принимает правдоподобный текст за заботу живого собеседника. Отсюда и коварство тех самых 51% «эффективно». Приятный разговор, в котором алгоритм со всем согласился, снимает тревогу на вечер и закрепляет её причину, а поход к специалисту откладывается на месяцы.
Что такое safety‑обвязка и почему одной модели мало
Ответ индустрии на эти риски принято называть safety‑обвязкой. Это набор внешних по отношению к модели механизмов, которые ограничивают, дополняют и контролируют её вывод. На практике встречается пять типовых элементов.
-
Дисклеймеры и границы компетенций. Явное указание, что сервис информационный, врача не заменяет, и перечень состояний, при которых нужен живой специалист.
-
Кризисный протокол. Телефоны экстренной помощи и направление в службы при словах об угрозе жизни.
-
Валидированные шкалы состояния. PHQ-9 для депрессии, GAD-7 для тревоги, шкалы Бека, HADS. Это стандартизированные опросники с подсчётом баллов, а не свободная генерация.
-
Кризисные опросники. Отдельно стоят инструменты вроде SCI-2 и SIS для оценки суицидального риска, их встраивает, например, Freudly.
-
Приватность. Сквозное шифрование переписки и внятная политика данных, включая ответ на вопрос, уходят ли сообщения на дообучение модели.
Все пять механизмов ценны, но у них общий архитектурный предел. Они обкладывают модель снаружи и не читают содержание конкретной реплики. Дисклеймер висит на странице всегда. Шкала считает баллы по отдельной форме. Кризисный протокол ловит явные маркеры во входящем сообщении. При этом сам текст ответа по‑прежнему рождается за один проход одной нейросети. Если она в этой конкретной реплике поддакнула деструктивному убеждению или уверенно выдумала интерпретацию, ни дисклеймер, ни шкала, ни политика данных этого не заметят. Обвязка защищает периметр, а горячий путь генерации ответа остаётся без контроля.
Ключевой паттерн. Перепроверка ответа поверх основной модели
Логичный инженерный ход тут напрашивается сам. Раз одна модель за один проход ненадёжна на чувствительном контенте, поставим над её ответом второй контур, который прочитает саму реплику до того, как её увидит пользователь. Такой контур проверяет само содержание ответа. Это шаг за пределы обвязки периметра. Реализуется он как мультиагентная схема, где ответственность за ответ разделена между несколькими ролями.
Так публично описан, например, сервис Vera. По смыслу это ближе всего к консилиуму врачей, где над случаем думают сразу несколько специалистов, и вывод выходит надёжнее, чем у одного. Разберу его схему на уровне архитектуры, без внутренних промптов. Роли три.
-
ИИ‑психолог ведёт беседу и формирует ответ. Это основная роль, аналог единственной модели у большинства сервисов.
-
ИИ‑супервизор получает черновик ответа до отправки и проверяет тон и безопасность формулировок. Его задача поймать ровно то, на чём горит одиночная модель, поддакивание деструктиву и небезопасные обороты.
-
ИИ‑академик сверяет рекомендации с доказательной базой, чтобы под видом техники не ушёл выдуманный совет.
Рядом работает активный кризисный протокол. Входящее сообщение пользователя проходит через детектор тревожных маркеров ещё до генерации ответа. При срабатывании система выводит телефоны экстренной помощи прямо в чат и меняет режим работы, а не полагается на то, что основная модель сама догадается сменить тон. Сверху те же валидированные шкалы PHQ-9 и GAD-7 с отслеживанием динамики. В основе методик заявлены доказательные подходы вроде КПТ, что для ниши уже стандарт, и его декларирует большинство сервисов из списка.
Теперь честная часть. Второй контур не убирает риск полностью. Роль‑супервизор сама работает на LLM и тоже способна ошибиться, пропустить проблемную реплику или зарубить нормальную. Речь идёт о снижении вероятности вредного ответа, а полное её обнуление такой схемой недостижимо. Это стохастическая защита поверх стохастической генерации. Она сдвигает распределение исходов в безопасную сторону, и на чувствительном домене этот сдвиг стоит своих денег. О деньгах чуть ниже.
Ландшафт рынка. Кто как решает
В июле 2026 года я прошёл по публичным материалам семи заметных русскоязычных ИИ‑психологов и зафиксировал, что именно каждый заявляет по защите. Картина по одному инженерному признаку, наличию второго контура проверки самого ответа, получилась такая.
|
Сервис |
Второй контур проверки ответа |
Заметные защитные элементы |
|---|---|---|
|
не заявлен |
честный дисклеймер, телефоны помощи в условиях |
|
|
не заявлен |
внятные границы компетенций, отсылка в экстренные службы |
|
|
не заявлен |
кризисные опросники SCI-2 и SIS, КПТ, сквозное шифрование, научная база |
|
|
не заявлен |
шкалы Бека, GAD-7, HADS, кризисный блок с 8–800-2000-122, девять подходов |
|
|
не заявлен |
дисклеймер и телефоны, но сообщения идут на обучение модели |
|
|
не заявлен |
дисклеймер, отсылка в 112 |
|
|
заявлен, три роли |
активный кризисный протокол в чате, шкалы PHQ-9 и GAD-7 |
Вывод из таблицы аккуратный. Отдельный контур перепроверки каждого ответа среди семи заявлен только у одного сервиса. Это не значит, что остальные плохи, у некоторых обвязка периметра сделана сильнее, чем у Vera. У Freudly встроены валидированные кризисные опросники SCI-2 и SIS, такого больше нет ни у кого в подборке. Аура несёт шкалы Бека и HADS, кризисный блок и девять клинических подходов. MindThera внятно очерчивает границы компетенций и честно называет себя информационным сервисом. Разница в одном. Все они, даже Аура со своими девятью подходами, генерируют финальный ответ одной нейросетью без второго мнения над этой конкретной репликой. Отдельно отмечу Лею, где в пользовательском соглашении прямо сказано, что переписка используется для обучения модели, для домена самого личного это самостоятельный риск приватности.
Вывод и открытый вопрос
Перепроверка ответа отдельной ролью, если смотреть инженерно, обходится дорого по трём осям. Она умножает число вызовов модели на один ответ пользователю, основной прогон плюс супервизор, иногда плюс академик. Она поднимает стоимость, потому что токены каждого лишнего прогона оплачиваются. Она добавляет латентность, ответ доходит до пользователя медленнее, ведь его ещё проверяют перед отправкой. Для чат‑бота про погоду такая цена абсурдна. Для домена, где неудачная реплика в плохой момент способна навредить, она выглядит оправданной.
Отсюда вопрос, который мне честно интересно обсудить в комментариях. Где проходит разумная граница? Дешёвая обвязка периметра закрывает явные кризисы и ставит дисклеймеры почти бесплатно. Полноценная перепроверка содержания ловит поддакивание и выдумки, но кратно дороже и медленнее. Есть ли промежуточные схемы, которые дают заметную долю выигрыша без кратного роста стоимости, например выборочная проверка только рискованных реплик по лёгкому классификатору, а не тотальная над каждым ответом. Как вы бы балансировали безопасность и цену в чувствительном домене, поделитесь.
И финальное, повторю намеренно. Что бы ни было заявлено в архитектуре любого из этих сервисов, при остром состоянии инструмент выбора не бот. Телефон доверия 8–800-2000-122 бесплатный и круглосуточный.
Источники и исследования
-
Стэнфордский HAI, 2025, разбор, почему терапевтические чат‑боты рискованны как замена специалисту, в том числе про склонность соглашаться с пользователем даже во вред.
-
Американская психологическая ассоциация (APA), рекомендация от ноября 2025. Генеративный ИИ плохо подходит для психотерапии и кризисной помощи, его спокойный уверенный тон легко вводит в заблуждение.
-
Стэнфордское исследование FAccT 2025, “Expressing stigma and inappropriate responses prevents LLMs from safely replacing mental health providers”.
-
История подростка из Флориды и Character.AI, иск матери и последующее урегулирование.
-
Обзор о рисках чат‑ботов для психики, про поддакивание и усиление навязчивых мыслей, Psychiatric Times.
Автор: AntonGurov
