models
Автоматическая оценка агентов с помощью Amazon Bedrock AgentCore и GitHub Actions
Статья описывает интеграцию Amazon Bedrock AgentCore Evaluations в пайплайн GitHub Actions для автоматической оценки поведения AI-агента и блокировки пулл-запросов при ухудшении качества.
AS1 NewsИсточник: aws.amazon.com
В статье рассматривается создание системы автоматической оценки качества AI-агента, развернутого на платформе Amazon Bedrock AgentCore. Используя API оценки AgentCore Evaluate, разработчики могут автоматически тестировать агента с помощью тестовых подсказок, получать оценки его ответов и при снижении качества блокировать слияние изменений в код. В качестве примера приводится пайплайн на GitHub Actions, который развертывает агент и MCP сервер, вызывает агента с тестовыми запросами, собирает трассировки и оценивает их, автоматически отклоняя пулл-запросы при регрессии.
Реализация включает использование Amazon Cognito для аутентификации, поддержку OAuth с ролями для защиты MCP сервера, а также механизм оценки в реальном времени и пакетную обработку данных. В статье подробно описываются архитектура системы, подходы к аутентификации без пользовательского контекста, а также три варианта оценки — на основе сохраненных трассировок, с использованием M2M токенов и роль-гейтом.
Особое внимание уделяется интеграции с инфраструктурой AWS через CDK, автоматизации развертывания и очистки ресурсов, а также использованию единого скрипта оценки, который управляет получением токенов, вызовами агента и анализом трассировок. В статье представлены рекомендации по выбору подхода в зависимости от требований к тестированию ролей и необходимости живого вызова агента.
Доступен полный исходный код, включающий инфраструктурные шаблоны, скрипты оценки и рабочий процесс GitHub Actions, что позволяет разработчикам быстро внедрить автоматическую систему оценки качества AI-агентов в своих проектах.
Обеспечивает автоматическую проверку качества AI-агентов в процессе разработки, повышая надежность и безопасность внедрения новых моделей.