Справочник метрик
В этой инструкции описаны метрики по продуктам, которые собираются сервисом.
Список продуктов, которые поддерживают метрики, будет пополняться.
Выделенные серверы
Пространство имен (namespace) выделенных серверов – dedicated.
Мониторинг поддерживают серверы с KVM-консолью, которая доступна для каждого выделенного сервера, кроме серверов линейки Chipcore и серверов в выделенной стойке — подробнее на странице Серверы в выделенной стойке на selectel.ru.
Набор IPMI метрик может отличаться в зависимости от модели сервера.
В каждой метрике передается timestamp — время сбора метрики.
Конвертировать значение можно с помощью онлайн-сервисов, например на сайте unixtimestamp.com.
| Имя метрики Тип, единица измерения | Описание | Лейблы |
|---|---|---|
| ipmi_bmc_info Gauge, UNIT | Метаданные BMC (Baseboard Management Controller) — прошивка, производитель и другое. Значение метрики всегда равно 1 |
|
| up Gauge, bool | Проверка доступности источника метрик:
|
|
| ipmi_up Gauge, bool | Проверка доступности IPMI:
|
|
| ipmi_scrape_duration_seconds Gauge, секунды | Время сбора метрик IPMI exporter |
|
| ipmi_sel_events_count_by_state Gauge, количество | Количество событий из журнала SEL (System Event Log), сгруппированных по уровню критичности события |
|
| ipmi_chassis_cooling_fault_state Gauge, bool | Состояние системы охлаждения сервера:
|
|
| ipmi_chassis_drive_fault_state Gauge, bool | Состояние дисков:
|
|
| ipmi_chassis_power_state Gauge, bool | Состояние питания сервера:
|
|
| ipmi_fan_speed_state Gauge, enum | Состояние вентиляторов:
|
|
| ipmi_power_state Gauge, enum | Состояние питания компонентов сервера:
|
|
| ipmi_temperature_state Gauge, enum | Состояние температуры компонентов сервера:
|
|
| ipmi_voltage_state Gauge, enum | Состояние напряжения:
|
|
| ipmi_sensor_state Gauge, enum | Состояние компонентов сервера:
|
|
| ipmi_fan_speed_rpm Gauge, RPM | Скорость вращения вентилятора |
|
| ipmi_power_watts Gauge, ватты | Потребляемая мощность |
|
| ipmi_temperature_celsius Gauge, градусы °C | Температура компонентов сервера |
|
| ipmi_voltage_volts Gauge, вольты | Напряжение |
|
| ipmi_sensor_value Gauge | Данные с IPMI датчика. Единица измерения зависит от типа датчика |
|
Облачные серверы
Пространство имен (namespace) облачных серверов — compute.
Метрики собираются на уровне гипервизора. Метрики со стороны гипервизора и метрики внутри ОС облачного сервера могут расходиться в значениях:
- метрики гипервизора отражают физическое состояние облачных серверов и их ресурсов — CPU, памяти, дисков и сети, включая работу по обслуживанию дисковых и сетевых операций и служебные операции по виртуализации;
- метрики внутри ОС отражают только вычисления, которые видит ядро ОС, и не учитывают фоновую работу.
При высокой нагрузке на диск или сеть значения метрик могут отличаться – это ожидаемое поведение виртуализированной среды, а не ошибка сбора метрик.
Сбор метрик не зависит от состояния ОС. Метрики собираются даже если облачный сервер загружается, находится под высокой нагрузкой или не отвечает по сети. Метрики не собираются только когда облачный сервер выключен.
| Имя метрики Тип, единица измерения | Описание | Лейблы |
|---|---|---|
| server_meta_info Gauge, UNIT | Метаданные облачного сервера |
|
| server_state_info Gauge, UNIT | Текущий статус облачного сервера:
|
|
| cpu_count Gauge, количество | Количество vCPU облачного сервера |
|
| vcpu_usage_ratio Gauge, % | Утилизация каждого из vCPU облачного сервера в % |
|
| cpu_usage_ratio Gauge, % | Утилизация CPU облачного сервера в % |
|
| memory_total_bytes Gauge, байты | Размер памяти на облачном сервере |
|
| memory_usage_bytes Gauge, байты | Используемый размер памяти облачным сервером |
|
| memory_usage_ratio Gauge, % | Процент оперативной памяти, которая используется облачным сервером |
|
| memory_major_faults_total Counter, штуки | Количество крупных страничных сбоев (major page faults), которые возникли на облачном сервере с момента его последнего запуска |
|
| disk_meta_info Gauge, UNIT | Метаданные диска облачного сервера |
|
| disk_write_requests_rate Gauge, операции/с | Количество операций записи в секунду на диск облачного сервера |
|
| disk_read_requests_rate Gauge, операции/с | Количество операций чтения в секунду с диска облачного сервера |
|
| disk_read_requests_limit Gauge, операции/с | Максимальное количество операций чтения диска облачного сервера |
|
| disk_write_requests_limit Gauge, операции/с | Максимальное количество операций записи диска облачного сервера |
|
| disk_flush_requests_rate Gauge, операции/с | Количество операций на очистку кэша диска облачного сервера |
|
| disk_read_bytes_rate Gauge, байты/с | Количество байт в секунду, прочитанных с диска облачного сервера |
|
| disk_write_bytes_rate Gauge, байты/с | Количество байт в секунду, записанных на диск облачного сервера |
|
| network_meta_info Gauge, UNIT | Метаданные сетевых интерфейсов облачного сервера |
|
| network_receive_packets_rate Gauge, пакеты/с | Количество пакетов в секунду, полученных на сетевом интерфейсе облачного сервера |
|
| network_transmit_packets_rate Gauge, пакеты/с | Количество пакетов в секунду, переданных через сетевой интерфейс облачного сервера |
|
| network_receive_bits_rate Gauge, биты/с | Количество бит в секунду, полученных на сетевом интерфейсе облачного сервера |
|
| network_transmit_bits_rate Gauge, биты/с | Количество бит в секунду, отправленных через сетевой интерфейс облачного сервера |
|
Dedicated Inference
Пространство имен (namespace) Dedicated Inference – inference.
| Имя метрики Тип, единица измерения | Описание | Лейблы |
|---|---|---|
| info Gauge, UNIT | Метаданные inference-сервиса. Значение метрики всегда равно 1 |
|
| config_info Gauge, UNIT | Конфигурация inference-сервиса. Значение метрики всегда равно 1 |
|
| autoscaling_config_info Gauge, UNIT | Настройки автомасштабирования inference-сервиса. Значение метрики всегда равно 1 |
|
| model_config_info Gauge, UNIT | Конфигурация модели inference-сервиса. Значение метрики всегда равно 1 |
|
| vllm_cache_config_info Gauge, UNIT | Настройки KV-кэша движка vLLM. Значение метрики всегда равно 1 |
|
| vllm_kv_cache_usage_perc Gauge, доля | Доля занятых блоков KV-кэша (от 0 до 1) |
|
| vllm_prefix_cache_hits_total Gauge, штуки | Количество совпадений в кэше префиксов |
|
| vllm_prefix_cache_queries_total Gauge, штуки | Количество обращений к кэшу префиксов |
|
| vllm_prompt_tokens_total Gauge, токены | Общее количество входных токенов, которые обработаны моделью |
|
| vllm_generation_tokens_total Gauge, токены | Общее количество сгенерированных токенов |
|
| vllm_num_requests_running Gauge, штуки | Количество запросов, которые находятся в обработке моделью |
|
| vllm_num_requests_waiting Gauge, штуки | Количество запросов, которые ожидают в очереди |
|
| vllm_request_success_total Gauge, штуки | Количество успешно обработанных запросов |
|
| vllm_engine_sleep_state Gauge, bool | Состояние загрузки inference-инстанса.
Метрика экспортирует три строки одновременно — по одной строке на каждое значение лейбла
|
|
| vllm_e2e_request_latency_seconds Histogram, секунды | Задержка обработки запроса от получения промта до полного завершения ответа (end-to-end) |
|
| vllm_request_queue_time_seconds Histogram, секунды | Время ожидания запроса в очереди |
|
| vllm_request_prefill_time_seconds Histogram, секунды | Время обработки входного промта |
|
| vllm_request_decode_time_seconds Histogram, секунды | Время генерации ответа на запрос |
|
| vllm_request_inference_time_seconds Histogram, секунды | Общее время обработки промта и генерации ответа |
|
| vllm_request_time_per_output_token_seconds Histogram, секунды | Среднее время на генерацию каждого токена |
|
| vllm_time_to_first_token_seconds Histogram, секунды | Время от получения запроса до генерации первого токена |
|
| vllm_inter_token_latency_seconds Histogram, секунды | Задержка между токенами |
|
| vllm_request_prompt_tokens Histogram, токены | Количество входных токенов на запрос |
|
| vllm_request_generation_tokens Histogram, токены | Количество сгенерированных токенов на запрос |
|
| vllm_iteration_tokens_total Histogram, токены | Количество токенов, которое обработала модель за одну итерацию по всем активным запросам |
|
| cpu_usage_cores Gauge, ядра | Текущее потребление CPU inference-инстансом |
|
| cpu_limit_cores Gauge, ядра | Заданный лимит CPU на inference-инстанс |
|
| memory_usage_bytes Gauge, байты | Текущее потребление памяти inference-инстансом |
|
| memory_limit_bytes Gauge, байты | Заданный лимит памяти на inference-инстанс |
|
| http_requests_total Gauge, штуки | Общее количество HTTP-запросов на inference-сервис |
|
| http_requests_bytes_total Gauge, байты | Общий размер HTTP-запросов |
|
| http_responses_bytes_total Gauge, байты | Общий размер HTTP-ответов |
|
| network_receive_bytes_total Gauge, байты/с | Количество байт в секунду, полученных inference-инстансом |
|
| network_receive_packets_total Gauge, пакеты/с | Количество пакетов в секунду, полученных inference-инстансом |
|
| network_receive_packets_dropped_total Gauge, пакеты/с | Количество пакетов в секунду, потерянных при приеме inference-инстансом |
|
| network_transmit_bytes_total Gauge, байты/с | Количество байт в секунду, отправленных inference-инстансом |
|
| network_transmit_packets_total Gauge, пакеты/с | Количество пакетов в секунду, отправленных inference-инстансом |
|
| network_transmit_packets_dropped_total Gauge, пакеты/с | Количество пакетов в секунду, потерянных при передаче inference-инстансом |
|