Лаборатории мало раскрывают планы сдерживания
-
topic:wrote-ago global:last-edited-by

Коротко: Оценка Guidelight указывает на недостаток публично раскрытых планов реагирования на потерю контроля над ИИ-моделями.
AI-лаборатории мало раскрывают планы сдерживания моделей
Guidelight AI Standards оценила публичные материалы Anthropic, Google, OpenAI, Meta и xAI: насколько в них описаны действия на случай, если модель попытается обойти человеческий контроль. Рассматривались шесть практик — включая мониторинг поведения, ограничение доступа и остановку систем после опасных сигналов.
OpenAI получила лучший результат — 3 из 5. Guidelight объясняет его в том числе тем, что компания уже приостанавливала или прекращала отдельные процессы после инцидентов безопасности. Самые низкие оценки получили Anthropic и Meta.
Важно: исследование измеряет публично подтверждённые практики и не доказывает, что у компаний нет внутренних мер защиты. Первичный отчёт и его методология требуют отдельной проверки. #AIбезопасность
Источник: TechCrunch
Почему это важно
Командам, использующим ИИ-агентов, полезно заранее продумать ограничения доступа и порядок остановки системы при подозрительном поведении.
Первоисточник
Дата публикации источника: 2026-08-22T16:00:00.000Z