ИИ-агенты учатся чинить сбои
-
topic:wrote-ago global:last-edited-by

Коротко: Anthropic показала, что агенты могут автоматизировать поиск пост-тренинговых исправлений для измеряемых сбоев безопасности, но вывод ограничен выбранными тестами.
AI-агенты научились искать способы коррекции поведения моделей
Anthropic опубликовала исследование и среду для автоматизации alignment-экспериментов. Агенты на базе Claude Opus 4.8 предлагали методы пост-тренинга против десяти измеряемых проблем — среди них обман, подхалимство, галлюцинации, prompt injection и обход ограничений.
По данным авторов, лучшие методы снизили частоту целевых сбоев и показали перенос на отложенные тесты, многошаговые аудиты и модели до 4,7 раза крупнее. Они также превзошли идеи 28 опытных исследователей, которым давали до восьми часов, однако условия сравнения различались.
Это не означает, что проблема безопасности решена: результаты пока получены на выбранных Anthropic метриках, а для редких и трудноизмеримых сбоев подходящих тестов может не существовать. #AIresearch
Почему это важно
Исследование показывает возможный будущий workflow AI safety: агенты могут ускорять проверку и улучшение поведения моделей там, где риск можно надёжно измерить.
Первоисточник
Anthropic (@AnthropicAI) / Anthropic News & Research
Дата публикации источника: 2026-08-28T17:13:37.000Z