Migrate all callers from /get_server_info to /server_info (#21463)

This commit is contained in:
David Cheung
2026-04-01 21:17:50 -07:00
committed by GitHub
parent 24997fe42c
commit ed427e1299
48 changed files with 74 additions and 70 deletions
@@ -149,7 +149,7 @@ class TestQwen35FP4MTP(CustomTestCase):
print(f"{metrics=}")
self.assertGreaterEqual(metrics["score"], ACC_THRESHOLDS[self.model]["gsm8k"])
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -226,7 +226,7 @@ class TestQwen35FP4MTPV2(CustomTestCase):
print(f"{metrics=}")
self.assertGreaterEqual(metrics["score"], ACC_THRESHOLDS[self.model]["gsm8k"])
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -76,7 +76,7 @@ class TestDeepseekV32DPMTP(CustomTestCase):
metrics = run_eval(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -163,7 +163,7 @@ class TestDeepseekV32DPMTPV2(CustomTestCase):
metrics = run_eval(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -246,7 +246,7 @@ class TestDeepseekV32TPMTP(CustomTestCase):
metrics = run_eval(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -330,7 +330,7 @@ class TestDeepseekV32TPMTPV2(CustomTestCase):
metrics = run_eval(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -72,7 +72,7 @@ class TestDeepseekV3MTP(CustomTestCase):
metrics = run_eval(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -106,7 +106,7 @@ class TestDeepseekV32TPMTP(CustomTestCase):
metrics = run_eval_few_shot_gsm8k(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -108,7 +108,7 @@ class TestDeepseekV32TPMTP(CustomTestCase):
metrics = run_eval_few_shot_gsm8k(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -135,7 +135,7 @@ class TestDeepseekR1MXFP4MTP(CustomTestCase):
metrics = run_eval_few_shot_gsm8k(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
+2 -2
View File
@@ -87,7 +87,7 @@ class TestDeepseekV32DPMTP(CustomTestCase):
metrics = run_eval_few_shot_gsm8k(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -179,7 +179,7 @@ class TestDeepseekV32TPMTP(CustomTestCase):
metrics = run_eval_few_shot_gsm8k(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
+1 -1
View File
@@ -72,7 +72,7 @@ class TestDeepseekV3MTP(CustomTestCase):
metrics = run_eval_few_shot_gsm8k(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -76,7 +76,7 @@ class TestDeepseekV3MTPKvFp8(CustomTestCase):
metrics = run_eval_few_shot_gsm8k(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
+3 -3
View File
@@ -145,7 +145,7 @@ class TestMTP(CustomTestCase):
print(f"{metrics=}")
self.assertGreaterEqual(metrics["accuracy"], 0.92)
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -397,7 +397,7 @@ class TestMTPwithTBONormal(CustomTestCase):
print(f"{metrics=}")
self.assertGreaterEqual(metrics["accuracy"], 0.92)
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -457,7 +457,7 @@ class TestMTPwithTBOLowLatency(CustomTestCase):
print(f"{metrics=}")
self.assertGreaterEqual(metrics["accuracy"], 0.92)
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -146,7 +146,7 @@ class TestQwen3CoderNextMTP(CustomTestCase):
metrics = run_eval_few_shot_gsm8k(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -64,7 +64,7 @@ class TestAscendWarmups(CustomTestCase):
def test_warmups_with_voice_chat(self):
# Call the get_server_info API to verify that the warmups parameter configuration takes effect.
response = requests.get(f"{DEFAULT_URL_FOR_TEST}/get_server_info")
response = requests.get(f"{DEFAULT_URL_FOR_TEST}/server_info")
self.assertEqual(response.status_code, 200)
self.assertEqual("voice_chat", response.json().get("warmups"))
@@ -92,7 +92,7 @@ class TestHybridAttnBackendBase(CustomTestCase):
self.assertGreater(metrics["score"], self.accuracy_threshold)
if self.speculative_decode:
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
+2 -2
View File
@@ -500,7 +500,7 @@ class TestSRTEndpoint(CustomTestCase):
self.assertEqual(send_and_check_cached_tokens(range(0, 11000)), 10000)
def test_get_server_info(self):
response = requests.get(self.base_url + "/get_server_info")
response = requests.get(self.base_url + "/server_info")
response_json = response.json()
max_total_num_tokens = response_json["max_total_num_tokens"]
@@ -630,7 +630,7 @@ class TestSRTEndpoint(CustomTestCase):
tp = ThreadPoolExecutor(max_workers=30)
def s():
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
server_info.json()
futures = []
@@ -57,13 +57,13 @@ class TestDataParallelism(CustomTestCase, GSM8KMixin):
assert response.status_code == 200
def test_get_memory_pool_size(self):
# use `get_server_info` instead since `get_memory_pool_size` is merged into `get_server_info`
response = requests.get(self.base_url + "/get_server_info")
# use `server_info` instead since `get_memory_pool_size` is merged into `server_info`
response = requests.get(self.base_url + "/server_info")
assert response.status_code == 200
time.sleep(1)
response = requests.get(self.base_url + "/get_server_info")
response = requests.get(self.base_url + "/server_info")
assert response.status_code == 200
@@ -167,7 +167,7 @@ class TestDPAttentionDP2TP2DeepseekV3MTP(
self.assertGreater(metrics["score"], 0.60)
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -127,7 +127,7 @@ class TestDPAttentionDP2TP2DeepseekV3MTP(
self.assertGreater(metrics["score"], 0.60)
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
+1 -1
View File
@@ -148,7 +148,7 @@ class TestDeepseekMTP(CustomTestCase):
self.assertGreater(metrics["score"], 0.92)
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
+3 -3
View File
@@ -412,7 +412,7 @@ class TestMTP(CustomTestCase):
self.assertGreater(metrics["score"], 0.60)
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -486,7 +486,7 @@ class TestMTPWithTBO(CustomTestCase):
self.assertGreater(metrics["score"], 0.60)
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -562,7 +562,7 @@ class TestMTPWithTPAttnAndTBO(CustomTestCase):
self.assertGreater(metrics["score"], 0.60)
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
+1 -1
View File
@@ -199,7 +199,7 @@ class TestDeepseekV3MTP(CustomTestCase):
self.assertGreater(metrics["score"], 0.60)
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
+1 -1
View File
@@ -115,7 +115,7 @@ class TestFlashinferMLAMTP(CustomTestCase):
self.assertGreater(metrics["score"], 0.60)
server_info = requests.get(self.base_url + "/get_server_info").json()
server_info = requests.get(self.base_url + "/server_info").json()
avg_spec_accept_length = server_info["internal_states"][0][
"avg_spec_accept_length"
]
@@ -117,7 +117,7 @@ class TestDeepseekV3MTPChannelInt8(CustomTestCase):
self.assertGreater(metrics["score"], 0.60)
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -221,7 +221,7 @@ class TestDeepseekV3MTPBlockInt8(CustomTestCase):
self.assertGreater(metrics["score"], 0.60)
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -84,7 +84,7 @@ class TestDeepseekV32FP4DPSpecV2(CustomTestCase):
metrics = run_eval(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -175,7 +175,7 @@ class TestDeepseekV32FP4TPSpecV2(CustomTestCase):
metrics = run_eval(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -106,7 +106,7 @@ class TestDeepseekV3W4Afp8Mtp(CustomTestCase):
metrics = run_eval(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -87,7 +87,7 @@ class TestEAGLE3EngineDPAttention(CustomTestCase):
metrics = run_eval(args)
print(f"{metrics=}")
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
server_data = server_info.json()
# Try to get avg_spec_accept_length
@@ -33,7 +33,7 @@ def test_gsm8k(base_url: str, model: str):
num_threads=128,
)
metrics = run_eval(args)
server_info = requests.get(base_url + "/get_server_info")
server_info = requests.get(base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -113,7 +113,7 @@ class TestStandaloneSpeculativeDecodingBase(CustomTestCase):
metric_key = "score"
self.assertGreater(metrics[metric_key], self.accuracy_threshold)
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]
@@ -176,7 +176,7 @@ class TestStandaloneV2SpeculativeDecodingBase(CustomTestCase):
metric_key = "score"
self.assertGreater(metrics[metric_key], self.accuracy_threshold)
server_info = requests.get(self.base_url + "/get_server_info")
server_info = requests.get(self.base_url + "/server_info")
avg_spec_accept_length = server_info.json()["internal_states"][0][
"avg_spec_accept_length"
]