[Fix] Fall back to triton MOE for GPT-OSS on Blackwell with driver >= 595 (#21780)
Co-authored-by: Claude Opus 4.6 (1M context) <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Opus 4.6
parent
9191b02eda
commit
f60f2ccc10
@@ -42,6 +42,7 @@ from sglang.srt.utils.common import (
|
||||
get_device_name,
|
||||
get_device_sm,
|
||||
get_int_env_var,
|
||||
get_nvidia_driver_version,
|
||||
get_quantization_config,
|
||||
human_readable_int,
|
||||
is_blackwell_supported,
|
||||
@@ -1757,10 +1758,21 @@ class ServerArgs:
|
||||
and is_triton_kernels_available()
|
||||
and self.quantization is None
|
||||
):
|
||||
self.moe_runner_backend = "triton_kernel"
|
||||
logger.warning(
|
||||
"Detected GPT-OSS model, enabling triton_kernels MOE kernel."
|
||||
)
|
||||
# The triton_kernels package segfaults on Blackwell (B200)
|
||||
# with NVIDIA driver >= 595. Fall back to triton backend.
|
||||
if is_blackwell_supported() and get_nvidia_driver_version() >= (
|
||||
595,
|
||||
):
|
||||
self.moe_runner_backend = "triton"
|
||||
logger.warning(
|
||||
"Detected GPT-OSS model on Blackwell with driver >= 595, "
|
||||
"using triton MOE kernel to avoid triton_kernels SIGSEGV."
|
||||
)
|
||||
else:
|
||||
self.moe_runner_backend = "triton_kernel"
|
||||
logger.warning(
|
||||
"Detected GPT-OSS model, enabling triton_kernels MOE kernel."
|
||||
)
|
||||
|
||||
if self.moe_runner_backend == "triton_kernel":
|
||||
assert (
|
||||
|
||||
Reference in New Issue
Block a user