diff --git a/python/sglang/test/server_fixtures/dsa_mtp_fixture.py b/python/sglang/test/server_fixtures/dsa_mtp_fixture.py index 127c83ec0..0a958bc71 100644 --- a/python/sglang/test/server_fixtures/dsa_mtp_fixture.py +++ b/python/sglang/test/server_fixtures/dsa_mtp_fixture.py @@ -32,8 +32,9 @@ from sglang.test.test_utils import ( class DsaMtpEvalConfigDefaults: """Eval thresholds & params shared across DSA-MTP regression variants.""" - # GSM8KMixin defaults. - gsm8k_accuracy_thres = 0.935 + # GSM8KMixin defaults. `gsm8k_accuracy_thres` is measured on the FP8 + # variants; lower-scoring quantizations override it per variant. + gsm8k_accuracy_thres = 0.925 gsm8k_accept_length_thres = 3.7 gsm8k_num_questions = 500 gsm8k_num_threads = 500 diff --git a/test/registered/e2e/models/test_dsa_glm52_nvfp4_dp_mtp.py b/test/registered/e2e/models/test_dsa_glm52_nvfp4_dp_mtp.py index d130125bf..db33bda82 100644 --- a/test/registered/e2e/models/test_dsa_glm52_nvfp4_dp_mtp.py +++ b/test/registered/e2e/models/test_dsa_glm52_nvfp4_dp_mtp.py @@ -24,6 +24,7 @@ class TestGLM52NVFP4DPMTP( mem_fraction_static = 0.88 enable_dp_attention = True bs_1_speed_thres = 180 + gsm8k_accuracy_thres = 0.92 extra_server_args = [ "--moe-runner-backend", "flashinfer_trtllm", diff --git a/test/registered/e2e/models/test_dsa_glm52_nvfp4_tp_mtp.py b/test/registered/e2e/models/test_dsa_glm52_nvfp4_tp_mtp.py index 8f1c3d84d..a7d53b328 100644 --- a/test/registered/e2e/models/test_dsa_glm52_nvfp4_tp_mtp.py +++ b/test/registered/e2e/models/test_dsa_glm52_nvfp4_tp_mtp.py @@ -22,6 +22,7 @@ class TestGLM52NVFP4TPMTP( tp_size = 4 mem_fraction_static = 0.8 bs_1_speed_thres = 280 + gsm8k_accuracy_thres = 0.92 extra_server_args = [ "--moe-runner-backend", "flashinfer_trtllm",