[Fix] Fall back to triton MOE for GPT-OSS on Blackwell with driver >= 595 (#21780)

Co-authored-by: Claude Opus 4.6 (1M context) <noreply@anthropic.com>
This commit is contained in:
Baizhou Zhang
2026-03-31 15:52:10 -07:00
committed by GitHub
co-authored by Claude Opus 4.6
parent 9191b02eda
commit f60f2ccc10
4 changed files with 61 additions and 32 deletions
+16 -4
View File
@@ -42,6 +42,7 @@ from sglang.srt.utils.common import (
get_device_name,
get_device_sm,
get_int_env_var,
get_nvidia_driver_version,
get_quantization_config,
human_readable_int,
is_blackwell_supported,
@@ -1757,10 +1758,21 @@ class ServerArgs:
and is_triton_kernels_available()
and self.quantization is None
):
self.moe_runner_backend = "triton_kernel"
logger.warning(
"Detected GPT-OSS model, enabling triton_kernels MOE kernel."
)
# The triton_kernels package segfaults on Blackwell (B200)
# with NVIDIA driver >= 595. Fall back to triton backend.
if is_blackwell_supported() and get_nvidia_driver_version() >= (
595,
):
self.moe_runner_backend = "triton"
logger.warning(
"Detected GPT-OSS model on Blackwell with driver >= 595, "
"using triton MOE kernel to avoid triton_kernels SIGSEGV."
)
else:
self.moe_runner_backend = "triton_kernel"
logger.warning(
"Detected GPT-OSS model, enabling triton_kernels MOE kernel."
)
if self.moe_runner_backend == "triton_kernel":
assert (