safety
Подробности о мерах кибербезопасности и рамочной модели jailbreak для Fable 5
Anthropic представила детали системы защиты Fable 5, включая классификаторы безопасности и предварительную версию рамочной модели для оценки серьезности jailbreak-атак.
AS1 NewsИсточник: anthropic.com
Claude Fable 5 был повторно развернут и теперь доступен глобально для всех пользователей. Компания Anthropic подробно описала меры кибербезопасности, внедренные в модель, включая системы классификации, которые помогают обнаруживать и блокировать опасные или потенциально опасные сценарии использования ИИ в кибербезопасности.
Классификаторы предназначены для различения четырех категорий кибербезопасных запросов, от низкорискованных до высокорискованных, что позволяет более точно управлять доступом и предотвращать злоупотребления. В рамках усилий по обеспечению безопасности, компания также запустила программу HackerOne для привлечения исследователей безопасности, чтобы выявлять потенциальные уязвимости.
Особое внимание уделяется так называемым jailbreak-атакам — способам обхода защитных механизмов ИИ. Anthropic разработала предварительный проект рамочной модели для оценки степени опасности таких атак, что поможет разработчикам и регуляторам лучше понимать и управлять рисками.
Эти меры подчеркивают важность балансировки между возможностями ИИ в области кибербезопасности и рисками злоупотреблений. Внедрение таких систем безопасности важно для повышения доверия к использованию ИИ в критических сферах, таких как защита информации и инфраструктуры.
В целом, эти инициативы могут способствовать более безопасному развитию и использованию ИИ-технологий, а также помочь в формировании стандартов и регуляций в области кибербезопасности и этики ИИ.
Меры безопасности и рамочная модель могут повысить уровень доверия и безопасность использования AI в кибербезопасности.