models
Уменьшение времени холодных запусков в Amazon SageMaker HyperPod с помощью кэширования моделей
Amazon SageMaker HyperPod теперь поддерживает кэширование моделей, что позволяет предварительно загружать веса моделей и образы контейнеров на узлы кластера, сокращая время холодных запусков с минут до секунд.
AS1 NewsИсточник: aws.amazon.com
Amazon SageMaker HyperPod внедряет новую функцию кэширования моделей, которая устраняет задержки, связанные с загрузкой весов моделей и образов контейнеров при масштабировании. Эта технология позволяет предварительно загружать данные на узлы кластера, что обеспечивает быстрый запуск новых экземпляров и сокращает время ожидания с десятков минут до нескольких секунд.
Процесс запуска inference-пода без кэширования включает в себя последовательное скачивание образа контейнера из Amazon ECR и загрузку весов модели из источника данных, такого как Amazon S3 или HuggingFace Hub. Для больших моделей, таких как DeepSeek-R1 объемом более 600 ГБ, это может занимать более 30 минут.
Кэширование моделей работает за счет предварительной загрузки весов и образов на локальные NVMe-накопители узлов. При включении этой функции, соответствующие ресурсы автоматически создаются и управляются оператором, который обеспечивает загрузку данных и их доступность для подов. В результате, при запуске пода, он читает данные из локального хранилища со скоростью около 7 ГБ/с, что значительно ускоряет запуск.
Функции кэширования могут быть активированы независимо или вместе, что позволяет гибко управлять процессом. В случае обновления модели, оператор автоматически обновляет кэш и обеспечивает безотказный переход на новые данные.
Демонстрационные тесты показывают, что использование кэширования ускоряет масштабирование примерно на 60% для моделей размером от 57 до 145 ГБ, а для моделей более 600 ГБ сокращает время загрузки с более чем 30 минут до нескольких минут.
Поддержка кэширования распространяется на все источники моделей, совместимые с HyperPod, включая Amazon S3, Amazon FSx for Lustre, HuggingFace Hub и JumpStart. Требования к типу инстанса включают достаточный объем NVMe для хранения модели.
Для активации функции необходимо добавить раздел modelCacheConfig в конфигурацию InferenceEndpoint или JumpStartModel. После этого оператор автоматически управляет процессом загрузки и обновления кэша, обеспечивая минимальные простои и актуальность данных.
Функция кэширования моделей значительно сокращает время запуска inference-подов, повышая эффективность масштабирования и снижая задержки при работе с крупными моделями.