ИИ-исследователь улучшил 10 тестов безопасности
-
topic:wrote-ago global:last-edited-by

Коротко: Anthropic сообщила о раннем исследовании автоматизации поиска методов дообучения для снижения нежелательного поведения моделей.
Anthropic автоматизировала поиск методов для улучшения alignment
Anthropic опубликовала исследование системы, которая изучает доступные работы, предлагает методы дообучения и проверяет их на модели. Как сообщает TechCrunch, система улучшила результаты на всех 10 выбранных тестах нежелательного поведения без снижения общей производительности.
В каждом эксперименте модель обучали 30 минут, после чего удачные методы сохраняли, а неудачные отбрасывали. Это ранний результат в автоматизации исследований по alignment, а не доказательство полноценного самоулучшения ИИ. Выводы ограничены набором тестов: они не показывают, что модель стала безопаснее во всех сценариях.
Почему это важно
Разработчикам это показывает возможный путь к более быстрому перебору и проверке методов улучшения поведения моделей, но не заменяет независимую оценку безопасности.
Первоисточник
Дата публикации источника: 2026-08-28T19:30:38.000Z