From 486b54714b5a6187f7d2add09171d9e2aebc7d84 Mon Sep 17 00:00:00 2001 From: Kaixi Hou Date: Tue, 12 May 2026 13:35:50 -0700 Subject: [PATCH] [NVIDIA] Deterministic inference backend order on Blackwell (#21450) --- python/sglang/srt/server_args.py | 6 +++--- 1 file changed, 3 insertions(+), 3 deletions(-) diff --git a/python/sglang/srt/server_args.py b/python/sglang/srt/server_args.py index 8a49db505..79d9a7584 100644 --- a/python/sglang/srt/server_args.py +++ b/python/sglang/srt/server_args.py @@ -913,6 +913,9 @@ class ServerArgs: # Set kernel backends. self._handle_sampling_backend() + # Must run before _handle_attention_backend_compatibility so the + # deterministic backend is set before auto-detection fills it in. + self._handle_deterministic_inference() self._handle_attention_backend_compatibility() self._handle_mamba_backend() self._handle_linear_attn_backend() @@ -970,9 +973,6 @@ class ServerArgs: # Validate cache settings. self._handle_cache_compatibility() - # Handle deterministic inference. - self._handle_deterministic_inference() - # Handle diffusion LLM inference. self._handle_dllm_inference()