From 5e81d462c3626e1f0082eaf5a120257d4ebdfd43 Mon Sep 17 00:00:00 2001 From: Aleksi Vesanto Date: Fri, 4 Sep 2026 04:25:08 +0300 Subject: [PATCH] [diffusion] fix: only use fused qk_norm on nvidia gpu (#33994) --- python/sglang/multimodal_gen/runtime/models/dits/minimax_h3.py | 1 + 1 file changed, 1 insertion(+) diff --git a/python/sglang/multimodal_gen/runtime/models/dits/minimax_h3.py b/python/sglang/multimodal_gen/runtime/models/dits/minimax_h3.py index 2dc5f3b67..fef29927a 100644 --- a/python/sglang/multimodal_gen/runtime/models/dits/minimax_h3.py +++ b/python/sglang/multimodal_gen/runtime/models/dits/minimax_h3.py @@ -440,6 +440,7 @@ def _apply_qk_norm( and q.stride(-2) == k.stride(-2) == head_dim and q_norm.eps == k_norm.eps and not torch.compiler.is_compiling() + and current_platform.is_cuda() ): fused_inplace_qknorm( q,