[AMD] Enable Piecewise CUDA Graph for AMD GPUs (#22299)

This commit is contained in:
Hubert Lu
2026-06-07 16:28:20 -07:00
committed by GitHub
parent 02be2e7189
commit 10d33bd77e
10 changed files with 335 additions and 32 deletions
@@ -40,6 +40,11 @@ class TestDeepseekR1MXFP4(CustomTestCase):
"131072",
"--model-loader-extra-config",
'{"enable_multithread_load": true}',
"--enforce-piecewise-cuda-graph",
"--piecewise-cuda-graph-compiler",
"eager",
"--piecewise-cuda-graph-max-tokens",
"8192",
]
cls.process = popen_launch_server(
cls.model,
@@ -73,7 +78,7 @@ class TestDeepseekR1MXFP4(CustomTestCase):
write_github_step_summary(
f"### test_gsm8k (deepseek-r1-mxfp4)\n" f'{metrics["accuracy"]=:.3f}\n'
)
self.assertGreater(metrics["accuracy"], 0.94)
self.assertGreater(metrics["accuracy"], 0.94)
def test_bs_1_speed(self):
args = BenchArgs(port=int(self.base_url.split(":")[-1]), max_new_tokens=2048)
@@ -85,7 +90,7 @@ class TestDeepseekR1MXFP4(CustomTestCase):
write_github_step_summary(
f"### test_bs_1_speed (deepseek-r1-mxfp4)\n" f"{speed=:.2f} token/s\n"
)
self.assertGreater(speed, 75)
self.assertGreater(speed, 75)
class TestDeepseekR1MXFP4MTP(CustomTestCase):
@@ -5,7 +5,7 @@ import torch
from sglang import Engine
from sglang.lang.chat_template import get_chat_template_by_model_path
from sglang.srt.utils import kill_process_tree
from sglang.test.ci.ci_register import register_cuda_ci
from sglang.test.ci.ci_register import register_amd_ci, register_cuda_ci
from sglang.test.run_eval import run_eval
from sglang.test.test_utils import (
DEFAULT_IMAGE_URL,
@@ -18,6 +18,7 @@ from sglang.test.test_utils import (
# CI Registration
register_cuda_ci(est_time=180, stage="base-b", runner_config="1-gpu-large")
register_amd_ci(est_time=180, suite="stage-b-test-1-gpu-large-amd")
class TestPiecewiseCudaGraphQwen25VL(CustomTestCase):