[Fix] Disable FlashInfer allreduce fusion under deterministic inference (#24629)

This commit is contained in:
Jimmy Shong
2026-05-10 20:04:52 -05:00
committed by GitHub
parent aa7a9af12f
commit e9a15b95da
+12
View File
@@ -890,6 +890,12 @@ class ServerArgs:
# Handle memory-related, chunked prefill, and CUDA graph batch size configurations.
self._handle_gpu_memory_settings(gpu_mem)
# enforce_disable_flashinfer_allreduce_fusion must be set before
# _handle_model_specific_adjustments, which auto-enables the fusion
# for several SM90/SM100 MoE arches.
if self.enable_deterministic_inference:
self.enforce_disable_flashinfer_allreduce_fusion = True
# Apply model-specific adjustments.
self._handle_model_specific_adjustments()
@@ -4078,6 +4084,12 @@ class ServerArgs:
)
self.enable_aiter_allreduce_fusion = False
if self.enable_flashinfer_allreduce_fusion:
logger.warning(
"Disable --enable-flashinfer-allreduce-fusion because deterministic inference is enabled."
)
self.enable_flashinfer_allreduce_fusion = False
# Check sampling backend
self.sampling_backend = "pytorch"
logger.warning(