From 6b2bf66cd9cd0448b0e9f3af8a54e9e10686fdf2 Mon Sep 17 00:00:00 2001 From: ishandhanani <82981111+ishandhanani@users.noreply.github.com> Date: Mon, 13 Apr 2026 15:10:07 -0500 Subject: [PATCH] fix[glm4.7 flash]: properly detect `gfx95_quant_format` (#22720) --- python/sglang/srt/models/glm4_moe_lite.py | 2 ++ 1 file changed, 2 insertions(+) diff --git a/python/sglang/srt/models/glm4_moe_lite.py b/python/sglang/srt/models/glm4_moe_lite.py index 03ff3d201..5b08f1f45 100644 --- a/python/sglang/srt/models/glm4_moe_lite.py +++ b/python/sglang/srt/models/glm4_moe_lite.py @@ -403,6 +403,8 @@ class Glm4MoeLiteDecoderLayer(DeepseekV2DecoderLayer): config.hidden_size, eps=config.rms_norm_eps ) + self._gfx95_quant_format = self._detect_gfx95_quant_format() + self.layer_communicator = LayerCommunicator( layer_scatter_modes=self.layer_scatter_modes, input_layernorm=self.input_layernorm,