Перейти к основному содержимому

Параметры модели inference-сервиса

Вы можете указать параметры модели при создании inference-сервиса. Они определяют, как inference-сервис будет обрабатывать запросы и расходовать вычислительные ресурсы.

Тип данных для KV-кэша (Key-Value Cache)

Формат хранения промежуточных вычислений модели при генерации токенов. Key-Value Cache — механизм ускорения генерации токенов в LLM на базе архитектуры трансформеров. Более компактные форматы снижают потребление памяти и позволяют обрабатывать более длинные контексты

Максимальная длина контекста

Максимальное количество токенов, которое модель может обработать в рамках одного запроса