[UnifiedTree] Use dense model for HiCache+CP KL tests (#28726)

This commit is contained in:
Vladislav Nosivskoy
2026-06-20 00:18:01 +08:00
committed by GitHub
parent cab62855f5
commit 2ad9a5b576
@@ -13,11 +13,11 @@ from sglang.test.test_utils import (
register_cuda_ci(est_time=950, stage="extra-b", runner_config="4-gpu-h100") register_cuda_ci(est_time=950, stage="extra-b", runner_config="4-gpu-h100")
QWEN3_30B_MODEL = "Qwen/Qwen3-30B-A3B-FP8" QWEN3_32B_MODEL = "Qwen/Qwen3-32B"
class TestUnifiedQwen3HiCacheCP(UnifiedRadixTreeTestMixin, CustomTestCase): class TestUnifiedQwen3HiCacheCP(UnifiedRadixTreeTestMixin, CustomTestCase):
"""Qwen3-30B-A3B-FP8 + HiCache + CP + UnifiedRadixCache.""" """Qwen3-32B + HiCache + CP + UnifiedRadixCache."""
hicache_io_backend = "kernel" hicache_io_backend = "kernel"
hicache_mem_layout = "page_first" hicache_mem_layout = "page_first"
@@ -28,7 +28,7 @@ class TestUnifiedQwen3HiCacheCP(UnifiedRadixTreeTestMixin, CustomTestCase):
@classmethod @classmethod
def setUpClass(cls): def setUpClass(cls):
cls.model = QWEN3_30B_MODEL cls.model = QWEN3_32B_MODEL
cls.base_url = DEFAULT_URL_FOR_TEST cls.base_url = DEFAULT_URL_FOR_TEST
cls.process = popen_launch_server( cls.process = popen_launch_server(
cls.model, cls.model,
@@ -38,10 +38,6 @@ class TestUnifiedQwen3HiCacheCP(UnifiedRadixTreeTestMixin, CustomTestCase):
"--trust-remote-code", "--trust-remote-code",
"--tp-size", "--tp-size",
"4", "4",
"--moe-dp-size",
"1",
"--ep-size",
"4",
"--attn-cp-size", "--attn-cp-size",
"2", "2",
"--enable-prefill-context-parallel", "--enable-prefill-context-parallel",
@@ -51,6 +47,8 @@ class TestUnifiedQwen3HiCacheCP(UnifiedRadixTreeTestMixin, CustomTestCase):
"32", "32",
"--max-running-requests", "--max-running-requests",
str(cls.max_running_requests), str(cls.max_running_requests),
"--max-total-tokens",
"14000", # loadback trigger
"--disable-piecewise-cuda-graph", "--disable-piecewise-cuda-graph",
"--model-loader-extra-config", "--model-loader-extra-config",
'{"enable_multithread_load": true, "num_threads": 64}', '{"enable_multithread_load": true, "num_threads": 64}',