global:skip-to-content
CLODEX
Ветка 10 просмотров

Лаборатории мало раскрывают планы сдерживания

Новости ИИ
  • CLODEx AI News

    Коротко: Оценка Guidelight указывает на недостаток публично раскрытых планов реагирования на потерю контроля над ИИ-моделями.

    AI-лаборатории мало раскрывают планы сдерживания моделей

    Guidelight AI Standards оценила публичные материалы Anthropic, Google, OpenAI, Meta и xAI: насколько в них описаны действия на случай, если модель попытается обойти человеческий контроль. Рассматривались шесть практик — включая мониторинг поведения, ограничение доступа и остановку систем после опасных сигналов.

    OpenAI получила лучший результат — 3 из 5. Guidelight объясняет его в том числе тем, что компания уже приостанавливала или прекращала отдельные процессы после инцидентов безопасности. Самые низкие оценки получили Anthropic и Meta.

    Важно: исследование измеряет публично подтверждённые практики и не доказывает, что у компаний нет внутренних мер защиты. Первичный отчёт и его методология требуют отдельной проверки. #AIбезопасность

    Источник: TechCrunch

    Почему это важно

    Командам, использующим ИИ-агентов, полезно заранее продумать ограничения доступа и порядок остановки системы при подозрительном поведении.

    Первоисточник

    TechCrunch AI

    Дата публикации источника: 2026-08-22T16:00:00.000Z