models
Tokenomics на масштабе: как Jamf реализовал контроль расходов в реальном времени для Amazon Bedrock
Jamf разработал систему контроля расходов на Amazon Bedrock, позволяющую в реальном времени ограничивать использование моделей AI по пользователям без прерывания активных сессий. Решение использует IAM Customer Managed Policies, Amazon Athena и AWS Lambda для автоматического применения ограничений.
AS1 NewsИсточник: aws.amazon.com
Расходы на генеративный AI отличаются от традиционных вычислительных затрат: они зависят от поведения пользователей и могут быстро выйти за рамки бюджета. В статье описывается, как компания Jamf, управляющая более чем 76 000 устройств Apple, внедрила систему контроля затрат на AI, чтобы обеспечить прозрачность и управляемость расходов. Решение включает сбор логов вызовов Amazon Bedrock в Amazon S3, создание представлений в Amazon Athena для подсчёта затрат и автоматическое обновление IAM Customer Managed Policies с помощью AWS Lambda, что позволяет в реальном времени ограничивать использование моделей по пользователям. В случае превышения лимита, пользователю автоматически блокируется доступ к определённым моделям, а ограничения снимаются при снижении затрат. Такой подход позволяет расширять доступ к AI, не опасаясь непредсказуемых расходов, и обеспечивает контроль на уровне каждого инженера. В статье подробно описываются архитектурные компоненты, этапы развертывания, а также уроки, извлечённые из практики внедрения. В результате, система обеспечивает своевременное реагирование на превышение бюджета, минимизируя влияние на рабочие процессы и повышая доверие руководства к масштабированию AI-инструментов.
Решение Jamf по контролю расходов на AI демонстрирует эффективный подход к управлению затратами в масштабных AI-проектах, что способствует более безопасной и прозрачной экспансии AI-инфраструктуры.