models
Оценка агентов с помощью Amazon Bedrock AgentCore Evaluations
Amazon Bedrock AgentCore Evaluations обеспечивает независимую от фреймворка оценку AI-агентов, использующих OpenTelemetry для телеметрии. Это позволяет унифицировать оценку независимо от используемой платформы или SDK.
AS1 NewsИсточник: aws.amazon.com
Команды, создающие производственных агентов на базе искусственного интеллекта, сталкиваются с проблемой фрагментации инструментов оценки. Многие системы предполагают использование конкретных SDK или паттернов трассировки, что усложняет оценку агентов, построенных на различных платформах.
Amazon Bedrock AgentCore Evaluations решает эту проблему, отделяя процесс оценки от выбранного фреймворка. Поддерживая стандарт OpenTelemetry, сервис может собирать телеметрию и оценивать агента вне зависимости от используемой платформы или SDK, будь то LangGraph, LlamaIndex, OpenAI Agents SDK, Google ADK, Claude Agent SDK или Strands Agents.
OpenTelemetry — это нейтральная к поставщикам инфраструктура, которая стандартизирует сбор трассировок, метрик и логов. Агентская телеметрия, независимо от платформы, экспортируется через OTLP и собирается в AWS Distro for OpenTelemetry, которая маршрутизирует данные в Amazon CloudWatch.
Для оценки важны три типа спанов: invoke agent (запрос и ответ агента), inference (вызовы модели) и execute tool (использование инструментов). Сервис классифицирует эти спаны, извлекает нужные атрибуты и формирует единое представление сессии, что позволяет применять одинаковые метрики и оценки к агентам на разных платформах.
Поддержка различных фреймворков достигается за счет использования стандартных схем атрибутов и имен спанов, что обеспечивает совместимость и расширяемость. Для новых платформ достаточно обеспечить соответствие этим схемам и использовать правильные префиксы scope name при инструментализации.
Интеграция с Amazon Bedrock AgentCore Evaluations происходит без необходимости внесения изменений в код агента: достаточно установить соответствующий пакет инструментализации, и все спаны автоматически собираются и классифицируются. Оценка может проводиться как в режиме on-demand, так и в онлайн-режиме, что обеспечивает гибкость в управлении качеством AI-агентов.
Таким образом, новая система позволяет унифицировать и упростить процессы оценки, делая их более надежными и масштабируемыми, независимо от выбранных технологий и платформ.
Обеспечивает унифицированную оценку AI-агентов на различных платформах, повышая стандартизацию и качество разработки.