[Fix] Disable FlashInfer allreduce fusion under deterministic inference (#24629)
This commit is contained in:
@@ -890,6 +890,12 @@ class ServerArgs:
|
|||||||
# Handle memory-related, chunked prefill, and CUDA graph batch size configurations.
|
# Handle memory-related, chunked prefill, and CUDA graph batch size configurations.
|
||||||
self._handle_gpu_memory_settings(gpu_mem)
|
self._handle_gpu_memory_settings(gpu_mem)
|
||||||
|
|
||||||
|
# enforce_disable_flashinfer_allreduce_fusion must be set before
|
||||||
|
# _handle_model_specific_adjustments, which auto-enables the fusion
|
||||||
|
# for several SM90/SM100 MoE arches.
|
||||||
|
if self.enable_deterministic_inference:
|
||||||
|
self.enforce_disable_flashinfer_allreduce_fusion = True
|
||||||
|
|
||||||
# Apply model-specific adjustments.
|
# Apply model-specific adjustments.
|
||||||
self._handle_model_specific_adjustments()
|
self._handle_model_specific_adjustments()
|
||||||
|
|
||||||
@@ -4078,6 +4084,12 @@ class ServerArgs:
|
|||||||
)
|
)
|
||||||
self.enable_aiter_allreduce_fusion = False
|
self.enable_aiter_allreduce_fusion = False
|
||||||
|
|
||||||
|
if self.enable_flashinfer_allreduce_fusion:
|
||||||
|
logger.warning(
|
||||||
|
"Disable --enable-flashinfer-allreduce-fusion because deterministic inference is enabled."
|
||||||
|
)
|
||||||
|
self.enable_flashinfer_allreduce_fusion = False
|
||||||
|
|
||||||
# Check sampling backend
|
# Check sampling backend
|
||||||
self.sampling_backend = "pytorch"
|
self.sampling_backend = "pytorch"
|
||||||
logger.warning(
|
logger.warning(
|
||||||
|
|||||||
Reference in New Issue
Block a user