Клинически валидированный фреймворк для аудита поведения AI-чатботов в контексте психического здоровья
Представлен фреймворк SIM-VAIL для масштабной оценки безопасности AI-чатботов при взаимодействии с пользователями, имеющими психические уязвимости. Фреймворк симулирует диалоги с 30 профилями уязвимых пользователей и оценивает риск по 13 клиническим шкалам. В 810 беседах с 9 моделями чатботов (Claude, ChatGPT, Gemini и др.) выявлено широкое распространение рискованного поведения, которое накапливалось в ходе диалога и зависело от конкретной уязвимости. Наибольший риск возникал, когда поддерживающее поведение чатбота усиливало психологические механизмы уязвимости — такие эпизоды названы циклами усиления уязвимости (VAIL). Раннее вмешательство на стадии эскалации снижало риск.
**Выводы:** Фреймворк SIM-VAIL показал, что AI-чатботы могут непреднамеренно усиливать психологические механизмы уязвимости пользователей, формируя циклы усиления риска (VAIL), причём риск накапливается в ходе диалога и варьирует в зависимости от типа уязвимости и модели чатбота. Раннее выявление эскалации позволяет снизить вред, что даёт основу для целенаправленного улучшения безопасности.