models
Снижение затрат на ASR-инференцию на 75% с помощью NVIDIA MPS на Amazon EC2
Использование NVIDIA CUDA Multi-Process Service (MPS) с NVIDIA Triton Inference Server на GPU-инстансах Amazon EC2 позволяет снизить требования к GPU-инфраструктуре для ASR-моделей на 75%, сохраняя при этом низкую задержку обработки.
AS1 NewsИсточник: aws.amazon.com
Совместная работа AWS, NVIDIA и Heidi демонстрирует, как оптимизация использования GPU при автоматическом распознавании речи (ASR) может значительно снизить затраты. В частности, при использовании NVIDIA CUDA Multi-Process Service (MPS) в сочетании с NVIDIA Triton Inference Server на GPU-инстансах Amazon EC2 удалось уменьшить необходимое количество GPU-инстансов с 16 до 4, что составляет сокращение на 75%. Это достигается за счет эффективного распределения ресурсов GPU, позволяющего нескольким процессам одновременно использовать вычислительные мощности без потери скорости и качества.
В рамках решения применяется несколько технологий: MPS обеспечивает одновременное выполнение нескольких kernels на GPU, устраняя излишние переключения контекста, а модельные оптимизации с ONNX Runtime и TensorRT позволяют ускорить обработку за счет использования аппаратных возможностей. В дополнение, Triton Inference Server управляет очередями запросов и их батчингом, что обеспечивает баланс между задержкой и пропускной способностью.
Демонстрационные тесты показали, что при использовании данной архитектуры достигается обработка до 92.1 запросов в секунду на GPU при средней задержке менее 650 мс, что соответствует SLA. Варианты конфигураций позволяют дополнительно повысить throughput, достигая более 111 RPS на GPU, что существенно сокращает инфраструктурные расходы.
Данный подход универсален и подходит для различных моделей ASR, а также может быть применен к другим задачам, использующим небольшую долю GPU-ресурсов на запрос. В репозитории проекта доступны все необходимые инструменты для развертывания и настройки системы, что делает его пригодным для внедрения в производственные среды.
Значительное снижение затрат на инфраструктуру при сохранении высокого уровня производительности и низкой задержки для ASR-сервисов.