From 7a82178277ee2a6afc894dad59291c973445bd1c Mon Sep 17 00:00:00 2001 From: Liangsheng Yin Date: Sun, 12 Jul 2026 15:39:59 -0500 Subject: [PATCH] [Fix] Disable FlashInfer allreduce fusion in Nemotron-3-Nano lm-eval test (#30945) --- test/registered/models_e2e/test_nvidia_nemotron_3_nano.py | 5 +++++ 1 file changed, 5 insertions(+) diff --git a/test/registered/models_e2e/test_nvidia_nemotron_3_nano.py b/test/registered/models_e2e/test_nvidia_nemotron_3_nano.py index 87e2f708f..0813eaf9f 100644 --- a/test/registered/models_e2e/test_nvidia_nemotron_3_nano.py +++ b/test/registered/models_e2e/test_nvidia_nemotron_3_nano.py @@ -27,6 +27,11 @@ class TestNvidiaNemotron3Nano30BFP8(LMEvalMixin, DefaultServerBase): other_args = [ "--tp-size", "2", + # FlashInfer trtllm allreduce fusion on flashinfer 0.6.14 degrades + # gsm8k for this model (strict-match 0.84 -> 0.78); the ground truth + # was calibrated with fusion disabled. Keep it off until the fusion + # numerics regression is resolved. + "--enforce-disable-flashinfer-allreduce-fusion", ] + NEMOTRON_3_NANO_THINKING_ARGS