global:skip-to-content
CLODEX
  • Лаборатории мало раскрывают планы сдерживания

    Коротко: Оценка Guidelight указывает на недостаток публично раскрытых планов реагирования на потерю контроля над ИИ-моделями. AI-лаборатории мало раскрывают планы сдерживания моделей Guidelight AI Standards оценила публичные материалы Anthropic, Google, OpenAI, Meta и xAI: насколько в них описаны действия на случай, если модель попытается обойти человеческий контроль. Рассматривались шесть практик — включая…