← Назад

models

Тестирование inference малых LLM на SageMaker AI: G7 против G5 и G6

В статье представлен сравнительный анализ двух моделей с 30 миллиардами параметров — Qwen3-Coder-30B и NVIDIA Nemotron-3-Nano-30B — на различных GPU-инстансах G5, G6, G6e и G7 на платформе Amazon SageMaker AI. Исследование показывает, как новые G7 с GPU NVIDIA Blackwell обеспечивают улучшение пропускной способности, снижают задержки и уменьшают стоимость за токен при inference.

AS1 NewsИсточник: aws.amazon.com

mlgpuinferencenvidia-blackwellamazon-sagemaker
COST$904.77-2.23%AMZN$256.78-0.82%NVDA$218.29-4.45%

Выбор подходящего GPU-инстанса для inference крупных языковых моделей (LLM) является ключевым фактором при масштабной реализации генеративного ИИ. В этом исследовании сравниваются производительность и стоимость двух 30-миллиардных моделей с использованием различных GPU-инстансов на платформе Amazon SageMaker AI.

Для оценки эффективности использовались модели Qwen3-Coder-30B и NVIDIA Nemotron-3-Nano-30B, развернутые на инстансах G5, G6, G6e и G7. В рамках тестирования измерялись показатели пропускной способности, задержки и стоимость за токен. Особое внимание уделялось новым G7 с GPU NVIDIA Blackwell, которые поддерживают нативный формат FP4, что дает значительные преимущества в сжатии модели и скорости inference.

Результаты показали, что G7 обеспечивает наилучшую производительность среди протестированных конфигураций. Например, при тестировании Qwen3-Coder-30B на G7 достигнута пропускная способность 391.3 токенов в секунду, что на 60.8% выше, чем на G6, и на 13% выше, чем на G5. Также G7 демонстрирует меньшую среднюю задержку и значительно сокращает пиковую задержку (P99).

Для интерактивных приложений проведен тест с потоковой передачей данных, где G7 показал среднее время до первого токена около 119 мс и стабильную доставку токенов с задержкой менее 9 мс.

Дополнительно использовались автоматические рекомендации по конфигурации развертывания моделей с помощью Amazon SageMaker AI Generative AI Inference Recommendations. В рамках этого подхода G7 показал лучшие показатели пропускной способности и стоимости при различных нагрузках и сценариях использования.

Общий вывод: G7 с GPU NVIDIA Blackwell превосходит предыдущие поколения G5 и G6 по ключевым метрикам эффективности и стоимости, что делает его предпочтительным выбором для масштабных задач inference крупных языковых моделей при использовании Amazon SageMaker AI.

нейтрально

Обновление GPU-инстансов G7 с NVIDIA Blackwell обеспечивает значительные улучшения в inference крупных языковых моделей, что влияет на разработчиков и компании, использующие Amazon SageMaker AI для генеративных задач.