← Назад

models

Настройка лимитов скорости для AI-трафика на шлюзе AgentCore Amazon Bedrock

Amazon Bedrock AgentCore теперь поддерживает настройку лимитов скорости, позволяя контролировать трафик пользователей и защищать downstream-модели и инструменты от перегрузок.

AS1 NewsИсточник: aws.amazon.com

infrastructurerate-limitingagentcoreamazon-bedrocksecurity
AMZN$256.78-0.82%Scale AI

Шлюз Amazon Bedrock AgentCore — полностью управляемый безсерверный AI-шлюз, обеспечивающий единый безопасный вход для AI-трафика. Сегодня объявлено о поддержке настройки лимитов скорости, что дает возможность тонко регулировать объем трафика, потребляемого отдельными пользователями. Эта функция позволяет задавать правила на основе OAuth или IAM для запросов в минуту, одновременных соединений и пропускной способности токенов, что помогает сохранять доступность сервисов при пиковых нагрузках.

AgentCore поддерживает три типа целей: MCP, inference и HTTP passthrough. Для каждого типа доступны метрики лимитирования: лимиты запросов (RPS и RPM), лимиты токенов (TPM) и лимиты соединений (CPS). Например, лимиты запросов позволяют ограничивать количество запросов в секунду или минуту, а лимиты токенов — объем входных и выходных токенов, используемых при inference-запросах.

Настройка лимитов осуществляется через AWS CLI, где можно определить правила для различных групп пользователей, моделей и целей. Например, можно задать разные лимиты для групп Basic, Advanced и Beta, а также установить индивидуальные лимиты для каждого пользователя по JWT-подписке, что обеспечивает справедливое распределение ресурсов.

Конфигурация лимитов включает определение ключей измерения (например, targetName, toolName, claim из JWT) и правил, которые задают максимально допустимый трафик. Можно комбинировать несколько ключей для более точного контроля, например, ограничивать трафик по модели и роли пользователя одновременно.

Дополнительно, поддерживаются лимиты на уровне конкретных целей, моделей или инструментов, что позволяет защищать backend-ресурсы и равномерно распределять нагрузку. В случае необходимости можно задать лимиты на уровне пользователя внутри группы, что предотвращает монополизацию ресурсов одним пользователем.

Все настройки лимитов логируются с помощью OpenTelemetry, что позволяет мониторить и отлаживать работу системы. В статье приведены примеры конфигураций и рекомендации по их использованию для обеспечения стабильной работы AI-инфраструктуры.

Поддержка настройки лимитов — важный шаг к управлению AI-трафиком, обеспечивающему справедливое использование ресурсов и защиту сервисов. В будущем планируется расширение возможностей и улучшение инструментов мониторинга и управления.

позитивно

Объявление расширяет возможности контроля трафика в AI-инфраструктуре, повышая стабильность и безопасность сервисов.