← Назад

models

Упрощение и поддержка нагрузок TorchServe с помощью Ray Serve Deep Learning Containers

AWS представила Ray Serve Deep Learning Container, поддерживаемый, предварительно протестированный контейнер для развертывания моделей AI, который упрощает работу с inference на GPU, заменяя устаревший TorchServe.

AS1 NewsИсточник: aws.amazon.com

deep-learninginferencecontainersawsgpu
RAY$1.40-6.26%AMZN$256.78-0.82%VSN$0.0412+0.05%

TorchServe больше не поддерживается, что оставляет командам необходимость самостоятельно управлять всей инфраструктурой GPU inference. AWS предложила решение в виде Ray Serve Deep Learning Container (DLC), который включает в себя фреймворк, драйверы GPU и слой обслуживания, уже собранные и протестированные. Этот контейнер предназначен для развертывания моделей через HTTP, что упрощает работу разработчиков и инженеров.

Ray Serve DLC основан на образах Amazon Linux 2023 и NVIDIA Amazon Linux 2023, включающих PyTorch, Ray Serve, FastAPI, Uvicorn и утилиты для мультимодальных задач. Он предназначен для использования в Amazon EKS, EC2 и SageMaker, обеспечивая совместимость и безопасность.

В статье подробно описывается процесс развертывания модели Qwen3-VL-2B, которая является моделью для обработки изображений и текста, на кластере Amazon EKS с одним GPU-узлом. Процесс включает подготовку контейнера, создание конфигурационных файлов, развертывание на Kubernetes и тестирование модели через HTTP-запросы.

Преимущества использования Ray Serve DLC включают устранение проблем с версионной несовместимостью, автоматизацию обновлений и безопасность, управляемую AWS. Для масштабирования на несколько узлов возможна интеграция с KubeRay.

Пользователи могут начать работу с примером кода, доступным в репозитории, и ознакомиться с полным списком образов на странице AWS Deep Learning Containers. В статье также приведены инструкции по очистке ресурсов после тестирования.

нейтрально

Обеспечивает более простое и безопасное развертывание моделей AI на GPU, снижая технические барьеры и повышая эффективность разработки.