← Назад

models

Развертывание Qwen3.8-2.4T-A95B на Amazon SageMaker HyperPod с vLLM

Статья описывает процесс развертывания модели Qwen3.8-2.4T-A95B, обладающей 2.4 трлн параметров, на платформе Amazon SageMaker HyperPod с использованием vLLM. Рассматриваются этапы настройки кластера, квантования NVFP4 и создание совместимого с OpenAI API эндпоинта с расширенными возможностями reasoning и tool calling.

AS1 NewsИсточник: aws.amazon.com

modelsawssagemakervllmlarge-modelsinfrastructure
AMZN$256.78-0.82%OpenAI$1,487.99-1.17%NVDA$218.29-4.45%

В статье подробно описан процесс развертывания крупной модели Qwen3.8-2.4T-A95B, которая является одной из самых мощных моделей в семействе Qwen. Модель обладает 2.4 трлн параметров и предназначена для выполнения сложных задач, таких как многоступенчатое программирование, долгосрочное планирование и автономное использование инструментов.

Разработчики AWS демонстрируют, как развернуть модель на платформе Amazon SageMaker HyperPod, используя vLLM на инстансе ml.p6-b300 с 8 GPU NVIDIA B300 Blackwell Ultra. В статье рассматриваются этапы от создания кластера до настройки OpenAI-совместимого API эндпоинта, включая конфигурацию vLLM для квантования NVFP4, встроенного reasoning, вызова инструментов и нативного предсказания с помощью Multi-Token Prediction.

Особое внимание уделяется архитектуре модели, которая включает гибридное внимание и распределение экспертов MoE, что обеспечивает эффективность при работе с длинными контекстами и сложными задачами. Также описаны возможности модели по управлению reasoning, включая параметры для балансировки вычислений и глубины reasoning.

Для развертывания используется автоматизированный процесс с помощью Kubernetes манифестов и инструментов AWS, что позволяет автоматизировать загрузку весов, управление контейнерами и мониторинг состояния. В статье приводятся рекомендации по настройке параметров сервиса, оптимизации пропускной способности и обеспечению отказоустойчивости.

В завершение, авторы подчеркивают, что развертывание такой модели требует специализированной GPU-инфраструктуры и оптимизированных решений для обслуживания, а также предоставляют ссылки на дополнительные ресурсы и инструменты для дальнейшей работы с моделью.

позитивно

Статья демонстрирует возможности развертывания крупномасштабных моделей AI на облачной инфраструктуре AWS, что важно для развития инфраструктурных решений и enterprise-области в области AI.