From 934e19a6104b86d563a7f43a65e72be81b1349b7 Mon Sep 17 00:00:00 2001 From: blzheng Date: Mon, 13 Apr 2026 09:59:13 +0800 Subject: [PATCH] =?UTF-8?q?[CPU]=20Fix=20argument=20issues=20in=20qkv=5Fpr?= =?UTF-8?q?oj=5Fwith=5Frope=5Ffused=5Fweight=20and=20bmm=E2=80=A6=20(#2136?= =?UTF-8?q?7)?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Co-authored-by: Ma Mingfei --- python/sglang/srt/model_executor/cpu_graph_runner.py | 1 + .../attention_forward_methods/forward_mla_fused_rope_cpu.py | 4 ++-- 2 files changed, 3 insertions(+), 2 deletions(-) diff --git a/python/sglang/srt/model_executor/cpu_graph_runner.py b/python/sglang/srt/model_executor/cpu_graph_runner.py index 8db80fc66..28b808fd0 100644 --- a/python/sglang/srt/model_executor/cpu_graph_runner.py +++ b/python/sglang/srt/model_executor/cpu_graph_runner.py @@ -222,6 +222,7 @@ def register_fake_ops(): use_fp8_w8a16, qkv_a_proj_scale, q_b_proj_scale, + w_scale, is_vnni, block_size, q_lora_rank, diff --git a/python/sglang/srt/models/deepseek_common/attention_forward_methods/forward_mla_fused_rope_cpu.py b/python/sglang/srt/models/deepseek_common/attention_forward_methods/forward_mla_fused_rope_cpu.py index b6c76df09..fa781b39c 100644 --- a/python/sglang/srt/models/deepseek_common/attention_forward_methods/forward_mla_fused_rope_cpu.py +++ b/python/sglang/srt/models/deepseek_common/attention_forward_methods/forward_mla_fused_rope_cpu.py @@ -100,7 +100,7 @@ class DeepseekMLACpuForwardMixin: else None ) ), - self.w_scale, + self.w_scale if self.qkv_proj_with_rope_is_fp8 else None, True, # is_vnni self.weight_block_size, self.q_lora_rank, @@ -145,7 +145,7 @@ class DeepseekMLACpuForwardMixin: attn_output.transpose(0, 1), self.w_vc, True, # is_vnni - self.w_scale, # scale + self.w_scale if self.qkv_proj_with_rope_is_fp8 else None, # scale ) attn_output = output output, _ = self.o_proj(attn_output)