← Назад

models

Уменьшение времени холодных запусков в Amazon SageMaker HyperPod с помощью кэширования моделей

Amazon SageMaker HyperPod теперь поддерживает кэширование моделей, что позволяет предварительно загружать веса моделей и образы контейнеров на узлы кластера, сокращая время холодных запусков с минут до секунд.

AS1 NewsИсточник: aws.amazon.com

machine-learninginferencecloud-computingmodel-cachingamazon-sagemaker
AMZN$256.78-0.82%Scale AI

Amazon SageMaker HyperPod внедряет новую функцию кэширования моделей, которая устраняет задержки, связанные с загрузкой весов моделей и образов контейнеров при масштабировании. Эта технология позволяет предварительно загружать данные на узлы кластера, что обеспечивает быстрый запуск новых экземпляров и сокращает время ожидания с десятков минут до нескольких секунд.

Процесс запуска inference-пода без кэширования включает в себя последовательное скачивание образа контейнера из Amazon ECR и загрузку весов модели из источника данных, такого как Amazon S3 или HuggingFace Hub. Для больших моделей, таких как DeepSeek-R1 объемом более 600 ГБ, это может занимать более 30 минут.

Кэширование моделей работает за счет предварительной загрузки весов и образов на локальные NVMe-накопители узлов. При включении этой функции, соответствующие ресурсы автоматически создаются и управляются оператором, который обеспечивает загрузку данных и их доступность для подов. В результате, при запуске пода, он читает данные из локального хранилища со скоростью около 7 ГБ/с, что значительно ускоряет запуск.

Функции кэширования могут быть активированы независимо или вместе, что позволяет гибко управлять процессом. В случае обновления модели, оператор автоматически обновляет кэш и обеспечивает безотказный переход на новые данные.

Демонстрационные тесты показывают, что использование кэширования ускоряет масштабирование примерно на 60% для моделей размером от 57 до 145 ГБ, а для моделей более 600 ГБ сокращает время загрузки с более чем 30 минут до нескольких минут.

Поддержка кэширования распространяется на все источники моделей, совместимые с HyperPod, включая Amazon S3, Amazon FSx for Lustre, HuggingFace Hub и JumpStart. Требования к типу инстанса включают достаточный объем NVMe для хранения модели.

Для активации функции необходимо добавить раздел modelCacheConfig в конфигурацию InferenceEndpoint или JumpStartModel. После этого оператор автоматически управляет процессом загрузки и обновления кэша, обеспечивая минимальные простои и актуальность данных.

нейтрально

Функция кэширования моделей значительно сокращает время запуска inference-подов, повышая эффективность масштабирования и снижая задержки при работе с крупными моделями.