models
Интеграция рекомендаций по оптимизации LLM для Amazon SageMaker Python SDK
Обновление Amazon SageMaker Python SDK v3 включает возможность получения рекомендаций по оптимизации развертывания генеративных AI моделей прямо в ноутбуке, что упрощает процессы бенчмаркинга, выбора конфигураций и деплоя.
AS1 NewsИсточник: aws.amazon.com
Обновление Amazon SageMaker Python SDK v3 предоставляет новые возможности для автоматизации оптимизации развертывания генеративных AI моделей. Теперь пользователи могут напрямую в ноутбуке запускать бенчмарки, получать рекомендации по конфигурациям и деплоить оптимальные настройки без необходимости использования дополнительных интерфейсов или API. Новая функциональность реализована через пакет sagemaker.serve.ai_inference_recommender, начиная с версии 3.17.0.
Эта интеграция позволяет автоматически тестировать различные конфигурации экземпляров и фреймворков, сравнивать их показатели и выбирать наиболее подходящую для конкретных задач. Пользователи могут запускать рекомендации на основе реальных данных о трафике, получать ранжированные списки вариантов и деплоить лучший из них в один клик. Также реализована возможность сравнивать разные фреймворки, такие как LMI и vLLM, для выбора наиболее эффективного.
Новые операции SDK включают запуск бенчмарков, генерацию рекомендаций и деплой выбранной конфигурации. Для этого необходимо иметь актуальную версию SDK, аккаунт AWS с соответствующими правами и развернутый endpoint SageMaker. В статье приводится пример использования API для автоматического поиска оптимальной конфигурации, а также для сравнения различных фреймворков и деплоя лучших решений.
Данная функциональность значительно упрощает работу с генеративными моделями, сокращая время и усилия, необходимые для их оптимизации и внедрения в продуктивные системы.
Облегчает автоматизацию оптимизации развертывания генеративных AI моделей, повышая эффективность и скорость внедрения.