diff --git a/python/sglang/srt/model_executor/cpu_graph_runner.py b/python/sglang/srt/model_executor/cpu_graph_runner.py index 8db80fc66..28b808fd0 100644 --- a/python/sglang/srt/model_executor/cpu_graph_runner.py +++ b/python/sglang/srt/model_executor/cpu_graph_runner.py @@ -222,6 +222,7 @@ def register_fake_ops(): use_fp8_w8a16, qkv_a_proj_scale, q_b_proj_scale, + w_scale, is_vnni, block_size, q_lora_rank, diff --git a/python/sglang/srt/models/deepseek_common/attention_forward_methods/forward_mla_fused_rope_cpu.py b/python/sglang/srt/models/deepseek_common/attention_forward_methods/forward_mla_fused_rope_cpu.py index b6c76df09..fa781b39c 100644 --- a/python/sglang/srt/models/deepseek_common/attention_forward_methods/forward_mla_fused_rope_cpu.py +++ b/python/sglang/srt/models/deepseek_common/attention_forward_methods/forward_mla_fused_rope_cpu.py @@ -100,7 +100,7 @@ class DeepseekMLACpuForwardMixin: else None ) ), - self.w_scale, + self.w_scale if self.qkv_proj_with_rope_is_fp8 else None, True, # is_vnni self.weight_block_size, self.q_lora_rank, @@ -145,7 +145,7 @@ class DeepseekMLACpuForwardMixin: attn_output.transpose(0, 1), self.w_vc, True, # is_vnni - self.w_scale, # scale + self.w_scale if self.qkv_proj_with_rope_is_fp8 else None, # scale ) attn_output = output output, _ = self.o_proj(attn_output)