Add engine_type label to tokenizer manager metrics (#23978)

This commit is contained in:
Lianmin Zheng
2026-04-28 19:52:58 -07:00
committed by GitHub
parent d66eb3a91b
commit 2a771a40ac
3 changed files with 16 additions and 9 deletions
@@ -35,6 +35,14 @@ class DisaggregationMode(Enum):
PREFILL = "prefill" PREFILL = "prefill"
DECODE = "decode" DECODE = "decode"
@staticmethod
def to_engine_type(mode: str) -> str:
if mode == DisaggregationMode.PREFILL.value:
return "prefill"
elif mode == DisaggregationMode.DECODE.value:
return "decode"
return "unified"
######################### #########################
# Synchronization # Synchronization
@@ -454,9 +454,13 @@ class TokenizerManager(TokenizerControlMixin, TokenizerManagerScoreMixin):
def init_metric_collector_watchdog(self): def init_metric_collector_watchdog(self):
# Metrics # Metrics
if self.enable_metrics: if self.enable_metrics:
engine_type = DisaggregationMode.to_engine_type(
self.server_args.disaggregation_mode
)
labels = { labels = {
"model_name": self.server_args.served_model_name, "model_name": self.server_args.served_model_name,
# TODO: Add lora name/path in the future, "engine_type": engine_type,
} }
if self.enable_priority_scheduling: if self.enable_priority_scheduling:
labels["priority"] = "" labels["priority"] = ""
@@ -121,14 +121,9 @@ class SchedulerMetricsMixin:
self.attn_tp_rank == 0 or self.server_args.enable_metrics_for_all_schedulers self.attn_tp_rank == 0 or self.server_args.enable_metrics_for_all_schedulers
) )
if self.enable_metrics: if self.enable_metrics:
if self.server_args.disaggregation_mode == DisaggregationMode.PREFILL.value: engine_type = DisaggregationMode.to_engine_type(
engine_type = "prefill" self.server_args.disaggregation_mode
elif ( )
self.server_args.disaggregation_mode == DisaggregationMode.DECODE.value
):
engine_type = "decode"
else:
engine_type = "unified"
labels = { labels = {
"model_name": self.server_args.served_model_name, "model_name": self.server_args.served_model_name,