Перейти к основному содержимому

FAQ по Dedicated Inference

Про Dedicated Inference

Что такое Dedicated Inference?

Dedicated Inference — это сервис для развертывания преднастроенных ML-моделей с готовым API в инфраструктуре Selectel. Доступные модели развертываются в виде изолированных inference-сервисов с выделенными ресурсами (GPU, vCPU, RAM, диск).

Работать с моделью можно через выделенный масштабируемый эндпоинт. Эндпоинт совместим с OpenAI API.

Про inference-сервисы

Что такое inference-сервис?

Inference-сервис — базовая единица развертывания в Dedicated Inference. Это изолированный сервис с выделенными ресурсами (GPU, vCPU, RAM, диск), который предоставляет API для взаимодействия с предварительно обученной моделью.

Конфигурации inference-сервисов подбираются автоматически в зависимости от выбранной модели и ее параметров. При выборе конфигурации вы можете посмотреть ожидаемые показатели производительности модели.

Что такое inference-инстанс?

Inference-инстанс — это развернутый экземпляр модели в inference-сервисе. Вы можете изменять количество inference-инстансов, чтобы оптимально использовать ресурсы inference-сервиса. Подробнее в инструкции Масштабировать inference-сервис.

Что такое inference-сервер?

Inference-сервер — это программный компонент, который организует работу модели. Он принимает запросы от клиентов, подготавливает данные, запускает модель для выполнения вычислений и возвращает результат.

В Dedicated Inference используются разные типы inference-серверов. Тип сервера зависит от выбранной модели. Например, для больших языковых моделей (LLM) используется inference-сервер vLLM.

Про ограничения

Какие ограничения есть при работе с Dedicated Inference?

На стадии публичного тестирования (public preview) работать с моделями на стороне сервера можно только в синхронном режиме.

Можно ли развернуть свою модель?

В Dedicated Inference не предусмотрена возможность загрузки своих моделей.

Можно ли развернуть модель в частной инсталляции?

Нет, сделать это оn-premise, в А-ЦОД, на выделенных серверах и в аттестованном облаке Selectel сейчас нельзя. Развертывать модели из Dedicated Inference можно только в публичном облаке Selectel. Доступ к моделям можно получить из интернета или по приватной сети.

Про стоимость

Как рассчитывается стоимость продукта Dedicated Inference?

Стоимость зависит только от типа и количества GPU в конфигурации inference-сервиса. Количество токенов на стоимость не влияет. Подробнее в инструкции Модель оплаты и цены Dedicated Inference.

Перед созданием inference-сервиса пополните баланс.