Add engine_type label to tokenizer manager metrics (#23978)

This commit is contained in:
Lianmin Zheng
2026-04-28 19:52:58 -07:00
committed by GitHub
parent d66eb3a91b
commit 2a771a40ac
3 changed files with 16 additions and 9 deletions
@@ -35,6 +35,14 @@ class DisaggregationMode(Enum):
PREFILL = "prefill"
DECODE = "decode"
@staticmethod
def to_engine_type(mode: str) -> str:
if mode == DisaggregationMode.PREFILL.value:
return "prefill"
elif mode == DisaggregationMode.DECODE.value:
return "decode"
return "unified"
#########################
# Synchronization
@@ -454,9 +454,13 @@ class TokenizerManager(TokenizerControlMixin, TokenizerManagerScoreMixin):
def init_metric_collector_watchdog(self):
# Metrics
if self.enable_metrics:
engine_type = DisaggregationMode.to_engine_type(
self.server_args.disaggregation_mode
)
labels = {
"model_name": self.server_args.served_model_name,
# TODO: Add lora name/path in the future,
"engine_type": engine_type,
}
if self.enable_priority_scheduling:
labels["priority"] = ""
@@ -121,14 +121,9 @@ class SchedulerMetricsMixin:
self.attn_tp_rank == 0 or self.server_args.enable_metrics_for_all_schedulers
)
if self.enable_metrics:
if self.server_args.disaggregation_mode == DisaggregationMode.PREFILL.value:
engine_type = "prefill"
elif (
self.server_args.disaggregation_mode == DisaggregationMode.DECODE.value
):
engine_type = "decode"
else:
engine_type = "unified"
engine_type = DisaggregationMode.to_engine_type(
self.server_args.disaggregation_mode
)
labels = {
"model_name": self.server_args.served_model_name,