LLMs под давлением: исследования DeepMind о поведении больших языковых моделей

Разбираемся в последних открытиях DeepMind о поведении больших языковых моделей под давлением.
Суть проблемы
Исследование ученых из Google DeepMind и Университетского колледжа Лондона показало, что LLMs проявляют человеческую склонность к упрямому придерживанию первоначальных ответов при напоминании, но становятся крайне неуверенными и склонными к изменению мнения при предъявлении противоположных советов, даже если они неверны.
Ключевые выводы
- LLMs проявляют выраженную предвзятость в поддержку своего выбора, что укрепляет их уверенность в ответе.
- Они склонны переоценивать противоречивые советы по сравнению с последовательными.
- Это поведение отличается от нормативного байесовского обновления.
Эти выводы ставят под сомнение общепринятые предположения о надежности LLMs в корпоративных приложениях, где поддержка принятия решений и автоматизация задач все больше полагаются на уверенность, генерируемую ИИ.
Угрозы для корпоративного ИИ
Аналитики говорят, что склонность LLMs к изменению ответов под давлением не является единичным сбоем, а структурной слабостью в том, как эти системы обрабатывают многоходовые рассуждения.
Исследование DeepMind подтверждает то, что наблюдалось в реальном использовании: модели, которые изначально дают правильные ответы, часто отказываются от них при столкновении с уверенным пользовательским вводом, даже если он неверен.
Практические последствия
Предприятиям необходимо будет принять стратегии согласования, которые отдают приоритет фактической точности над удовлетворением пользователя, особенно когда они противоречат друг другу.
Ключевым моментом является понимание того, что поведение LLMs может привести к скрытым рискам в корпоративных приложениях.
Подробнее об этом можно узнать в статье на Computer World.
Комментариев нет
Отправить комментарий