[NVIDIA] Deterministic inference backend order on Blackwell (#21450)

This commit is contained in:
Kaixi Hou
2026-05-12 13:35:50 -07:00
committed by GitHub
parent 52d4c697bb
commit 486b54714b
+3 -3
View File
@@ -913,6 +913,9 @@ class ServerArgs:
# Set kernel backends.
self._handle_sampling_backend()
# Must run before _handle_attention_backend_compatibility so the
# deterministic backend is set before auto-detection fills it in.
self._handle_deterministic_inference()
self._handle_attention_backend_compatibility()
self._handle_mamba_backend()
self._handle_linear_attn_backend()
@@ -970,9 +973,6 @@ class ServerArgs:
# Validate cache settings.
self._handle_cache_compatibility()
# Handle deterministic inference.
self._handle_deterministic_inference()
# Handle diffusion LLM inference.
self._handle_dllm_inference()