safety
OpenAI замедлила обучение frontier-моделей из-за роста cyber-capabilities
OpenAI впервые подробно раскрыла, что из-за роста cyber-capabilities она приостановила reinforcement-learning training новых моделей на две недели, а крупнейший запланированный frontier RL run всё ещё не запущен.
AS1 News
18 августа OpenAI опубликовала статью, в которой впервые подробно описала масштаб внутреннего замедления разработки своих передовых моделей. Компания сообщила, что ранее провела двухнедельную паузу в обучении reinforcement-learning для последних моделей, предназначенных для развертывания, и что крупнейший запланированный frontier RL запуск всё ещё находится на паузе. Вместо этого OpenAI проводит более мелкие тренировки и оценки, чтобы проверить поведение моделей, их выравнивание и эффективность новых защитных механизмов.
Это важный прецедент для индустрии, показывающий, что возможности модели начали развиваться быстрее, чем собственные меры безопасности. Компания связывает решение с необходимостью усилить мониторинг поведения моделей, их выравнивание, containment, безопасность обучающих сред, red teaming и защиту весов моделей.
OpenAI заявила, что крупнейший RL запуск возобновится только после получения дополнительных свидетельств достаточного выравнивания и работоспособности safeguards, без конкретных дат. Это свидетельство того, что скорость масштабирования моделей становится переменной, которую компания готова снизить из-за рисков безопасности.
Замедление разработки моделей из-за роста cyber-рисков, усиление мер безопасности.