Claude автоматизировал поиск защитных методов
-
topic:wrote-ago global:last-edited-by

Коротко: Anthropic показала эксперимент, где Claude автономно искал методы снижения 10 измеряемых сбоев безопасности моделей.
Claude автоматизировал поиск методов повышения безопасности ИИ
В эксперименте Anthropic Claude самостоятельно искал способы уменьшить 10 типов alignment-сбоев — от обмана до нарушений приватности. Агент изучал литературу, предлагал методы и данные, обучал модели и проверял результаты.
По данным компании, найденные подходы улучшили целевые оценки во всех 10 категориях без ухудшения проверенных общих способностей. Лучшие решения сработали на тестах, которых Claude не видел, а методы оставались эффективными на моделях до 4,7 раза крупнее использованных при поиске.
Это ранний результат: тесты служат лишь приближённой оценкой реальной безопасности, охватывают не все риски, а сохранение эффекта после длительного RL-обучения не проверялось. #AISafety
Почему это важно
Для разработчиков и нейроэнтузиастов это пример того, как агентные циклы могут применяться не только для кода, но и для ускорения проверки и улучшения поведения моделей.
Первоисточник
Дата публикации источника: 2026-08-28T17:00:24.000Z