← Назад

models

Автоматическая оценка агентов с помощью Amazon Bedrock AgentCore и GitHub Actions

Статья описывает интеграцию Amazon Bedrock AgentCore Evaluations в пайплайн GitHub Actions для автоматической оценки поведения AI-агента и блокировки пулл-запросов при ухудшении качества.

AS1 NewsИсточник: aws.amazon.com

evaluationamazon-bedrockgithub-actionsci-cdmcpoauthrole-based-access
AMZN$256.78-0.82%GT$9.20-0.38%

В статье рассматривается создание системы автоматической оценки качества AI-агента, развернутого на платформе Amazon Bedrock AgentCore. Используя API оценки AgentCore Evaluate, разработчики могут автоматически тестировать агента с помощью тестовых подсказок, получать оценки его ответов и при снижении качества блокировать слияние изменений в код. В качестве примера приводится пайплайн на GitHub Actions, который развертывает агент и MCP сервер, вызывает агента с тестовыми запросами, собирает трассировки и оценивает их, автоматически отклоняя пулл-запросы при регрессии.

Реализация включает использование Amazon Cognito для аутентификации, поддержку OAuth с ролями для защиты MCP сервера, а также механизм оценки в реальном времени и пакетную обработку данных. В статье подробно описываются архитектура системы, подходы к аутентификации без пользовательского контекста, а также три варианта оценки — на основе сохраненных трассировок, с использованием M2M токенов и роль-гейтом.

Особое внимание уделяется интеграции с инфраструктурой AWS через CDK, автоматизации развертывания и очистки ресурсов, а также использованию единого скрипта оценки, который управляет получением токенов, вызовами агента и анализом трассировок. В статье представлены рекомендации по выбору подхода в зависимости от требований к тестированию ролей и необходимости живого вызова агента.

Доступен полный исходный код, включающий инфраструктурные шаблоны, скрипты оценки и рабочий процесс GitHub Actions, что позволяет разработчикам быстро внедрить автоматическую систему оценки качества AI-агентов в своих проектах.

нейтрально

Обеспечивает автоматическую проверку качества AI-агентов в процессе разработки, повышая надежность и безопасность внедрения новых моделей.