models
Настройка лимитов скорости для AI-трафика на шлюзе AgentCore Amazon Bedrock
Amazon Bedrock AgentCore теперь поддерживает настройку лимитов скорости, позволяя контролировать трафик пользователей и защищать downstream-модели и инструменты от перегрузок.
AS1 NewsИсточник: aws.amazon.com
Шлюз Amazon Bedrock AgentCore — полностью управляемый безсерверный AI-шлюз, обеспечивающий единый безопасный вход для AI-трафика. Сегодня объявлено о поддержке настройки лимитов скорости, что дает возможность тонко регулировать объем трафика, потребляемого отдельными пользователями. Эта функция позволяет задавать правила на основе OAuth или IAM для запросов в минуту, одновременных соединений и пропускной способности токенов, что помогает сохранять доступность сервисов при пиковых нагрузках.
AgentCore поддерживает три типа целей: MCP, inference и HTTP passthrough. Для каждого типа доступны метрики лимитирования: лимиты запросов (RPS и RPM), лимиты токенов (TPM) и лимиты соединений (CPS). Например, лимиты запросов позволяют ограничивать количество запросов в секунду или минуту, а лимиты токенов — объем входных и выходных токенов, используемых при inference-запросах.
Настройка лимитов осуществляется через AWS CLI, где можно определить правила для различных групп пользователей, моделей и целей. Например, можно задать разные лимиты для групп Basic, Advanced и Beta, а также установить индивидуальные лимиты для каждого пользователя по JWT-подписке, что обеспечивает справедливое распределение ресурсов.
Конфигурация лимитов включает определение ключей измерения (например, targetName, toolName, claim из JWT) и правил, которые задают максимально допустимый трафик. Можно комбинировать несколько ключей для более точного контроля, например, ограничивать трафик по модели и роли пользователя одновременно.
Дополнительно, поддерживаются лимиты на уровне конкретных целей, моделей или инструментов, что позволяет защищать backend-ресурсы и равномерно распределять нагрузку. В случае необходимости можно задать лимиты на уровне пользователя внутри группы, что предотвращает монополизацию ресурсов одним пользователем.
Все настройки лимитов логируются с помощью OpenTelemetry, что позволяет мониторить и отлаживать работу системы. В статье приведены примеры конфигураций и рекомендации по их использованию для обеспечения стабильной работы AI-инфраструктуры.
Поддержка настройки лимитов — важный шаг к управлению AI-трафиком, обеспечивающему справедливое использование ресурсов и защиту сервисов. В будущем планируется расширение возможностей и улучшение инструментов мониторинга и управления.
Объявление расширяет возможности контроля трафика в AI-инфраструктуре, повышая стабильность и безопасность сервисов.