← Назад

models

Уменьшение задержки LLM с помощью маршрутизации с учетом префикса на Amazon SageMaker Inference

Amazon SageMaker Inference внедряет стратегию маршрутизации с учетом префикса, которая повышает производительность и снижает задержки при работе с крупными языковыми моделями за счет постоянной маршрутизации запросов с одинаковым префиксом к одному и тому же экземпляру.

AS1 NewsИсточник: aws.amazon.com

mlinferencesagemakerroutingoptimization
AMZN$256.78-0.82%

Amazon SageMaker Inference представил новую стратегию маршрутизации — с учетом префикса, которая позволяет значительно снизить задержки при обработке запросов к крупным языковым моделям (LLM). Эта стратегия анализирует начало каждого запроса и последовательно направляет запросы с одинаковым префиксом на один и тот же экземпляр, что способствует сохранению и повторному использованию кеша ключ-значение (KV).

В тестах на модели Llama 3.1 70B, использование этой стратегии привело к сокращению времени до первого токена (TTFT) на 77% по показателю P50 и увеличению скорости обработки запросов на 16%. Также повысился уровень попаданий в кеш KV с примерно 25% до более 80%, что значительно ускоряет работу модели.

Стратегия маршрутизации анализирует содержимое каждого входящего запроса и, при совпадении префикса, направляет его на один и тот же экземпляр. Это обеспечивает более эффективное использование кеша и уменьшает нагрузку на систему. В случае высокой популярности определенного префикса, система автоматически перераспределяет запросы, чтобы избежать перегрузки отдельных экземпляров.

Тестирование показало, что при работе с длинными контекстами, где префикс занимает значительную часть запроса, преимущества стратегии особенно заметны. В сценариях с короткими запросами эффект менее выражен, однако все равно наблюдается рост производительности.

Новая стратегия маршрутизации доступна в рамках конфигурации конечных точек Amazon SageMaker и не требует изменений в моделях или инфраструктуре. Пользователи могут легко переключаться между стратегиями, обновляя конфигурацию конечной точки.

Эта функция особенно полезна для приложений, использующих повторяющиеся шаблоны запросов, таких как системы диалоговых ботов, генерация с дополнением, а также при работе с большими объемами данных, где одинаковые префиксы встречаются часто.

нейтрально

Повышение эффективности обработки запросов к крупным языковым моделям за счет оптимизации маршрутизации и кеширования.