[CI] Install sgl-eval from PyPI through the test extra (#37504)

This commit is contained in:
Liangsheng Yin
2026-09-02 01:45:25 -07:00
committed by GitHub
parent fe3d4b9bbb
commit ebfd8c60e5
32 changed files with 52 additions and 80 deletions
@@ -71,26 +71,26 @@ export const config = {
--num-prompts {{NUM_PROMPTS}} --max-concurrency {{MAX_CONCURRENCY}}`,
accuracy: {
gsm8k_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--model {{MODEL_NAME}} \\
--num-threads 128`,
gpqa_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
# GPQA's HF dataset (Idavidrein/gpqa) is gated — accept its terms with your HF account first.
sgl-eval run gpqa \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--model {{MODEL_NAME}} \\
--num-threads 128`,
mmlu_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run mmlu \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--model {{MODEL_NAME}} \\
--num-threads 128`,
aime25_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run aime25 \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--model {{MODEL_NAME}} \\
@@ -61,21 +61,21 @@ export const config = {
--num-prompts {{NUM_PROMPTS}} --max-concurrency {{MAX_CONCURRENCY}}`,
accuracy: {
gsm8k_pct:
`pip install git+https://github.com/sgl-project/sgl-eval
`pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--model {{MODEL_NAME}} \\
--temperature 1.0 --top-p 0.95 \\
--thinking`,
gpqa_pct:
`pip install git+https://github.com/sgl-project/sgl-eval
`pip install sgl-eval
sgl-eval run gpqa \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--model {{MODEL_NAME}} \\
--temperature 1.0 --top-p 0.95 \\
--thinking --n-repeats 4 --max-tokens 40960`,
mmmu_pro_pct:
`pip install git+https://github.com/sgl-project/sgl-eval
`pip install sgl-eval
sgl-eval run mmmu_pro \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--model {{MODEL_NAME}} \\
@@ -98,13 +98,13 @@ export const config = {
--warmup-requests 64 --flush-cache`,
accuracy: {
gsm8k_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--num-threads 32`,
gpqa_pct: {
flash:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run gpqa \\
--model {{MODEL_NAME}} --api-key <api-key> \\
--n-repeats 16 --max-tokens 200000 \\
@@ -112,7 +112,7 @@ sgl-eval run gpqa \\
--out-dir /sgl-workspace/logs \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1`,
"flash-official":
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run gpqa \\
--model {{MODEL_NAME}} --api-key <api-key> \\
--n-repeats 16 --max-tokens 200000 \\
@@ -120,7 +120,7 @@ sgl-eval run gpqa \\
--out-dir /sgl-workspace/logs \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1`,
pro:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run gpqa \\
--model {{MODEL_NAME}} --api-key <api-key> \\
--n-repeats 16 --max-tokens 400000 \\
@@ -130,7 +130,7 @@ sgl-eval run gpqa \\
},
aime25_pct: {
"flash-official":
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run aime25 \\
--model {{MODEL_NAME}} --api-key <api-key> \\
--n-repeats 16 --max-tokens 200000 \\
@@ -138,7 +138,7 @@ sgl-eval run aime25 \\
--out-dir /sgl-workspace/logs \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1`,
flash:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run aime25 \\
--model {{MODEL_NAME}} --api-key <api-key> \\
--n-repeats 16 --max-tokens 200000 \\
@@ -146,7 +146,7 @@ sgl-eval run aime25 \\
--out-dir /sgl-workspace/logs \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1`,
pro:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run aime25 \\
--model {{MODEL_NAME}} --api-key <api-key> \\
--n-repeats 16 --max-tokens 400000 \\
@@ -156,7 +156,7 @@ sgl-eval run aime25 \\
},
mmmu_pro_pct: {
"flash-vision":
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run mmmu_pro \\
--reasoning-effort max \\
--temperature 1.0 --top-p 0.95 \\
@@ -63,7 +63,7 @@ export const config = {
--num-prompts {{NUM_PROMPTS}} --max-concurrency {{MAX_CONCURRENCY}} \\
--flush-cache`,
accuracy: {
gsm8k_pct: `# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
gsm8k_pct: `# To install sgl-eval: pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--num-threads 32`,
@@ -57,7 +57,7 @@ export const config = {
--num-prompts {{NUM_PROMPTS}} --max-concurrency {{MAX_CONCURRENCY}} \\
--flush-cache`,
accuracy: {
gsm8k_pct: `# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
gsm8k_pct: `# To install sgl-eval: pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--num-threads 32 \\
@@ -51,12 +51,12 @@ export const config = {
--warmup-requests 8 --flush-cache`,
accuracy: {
gsm8k_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--num-threads 32`,
gpqa_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run gpqa \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--num-threads 16`,
@@ -57,7 +57,7 @@ export const config = {
--warmup-requests 64 --flush-cache`,
accuracy: {
gsm8k_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--num-threads 32`,
@@ -51,7 +51,7 @@ export const config = {
--flush-cache`,
accuracy: {
gsm8k_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--num-threads 32`,
@@ -82,7 +82,7 @@ export const config = {
// (AIME 25 to be added back once truncation-free numbers are measured.)
accuracy: {
gsm8k_pct:
`# pip install git+https://github.com/sgl-project/sgl-eval
`# pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--num-threads 128`,
@@ -72,7 +72,7 @@ export const config = {
--num-prompts {{NUM_PROMPTS}} --max-concurrency {{MAX_CONCURRENCY}}`,
accuracy: {
gsm8k_pct:
`# pip install git+https://github.com/sgl-project/sgl-eval
`# pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--num-threads 128`,
@@ -80,7 +80,7 @@ sgl-eval run gsm8k \\
// Serve with a copy of the model's chat template whose enable_thinking default
// is flipped to true. For BF16: use --max-tokens 131072 (see Configuration Tips).
aime25_pct:
`# pip install git+https://github.com/sgl-project/sgl-eval
`# pip install sgl-eval
# Serve with an enable_thinking=true chat template (see Configuration Tips: Thinking).
# For BF16: use --max-tokens 131072 (see Configuration Tips: BF16 reasoning length).
sgl-eval run aime25 \\
@@ -112,7 +112,7 @@ export const config = {
// GSM8K is the required accuracy sanity on every verified cell (cookbook_guide §3), via sgl-eval.
accuracy: {
gsm8k_pct:
`# pip install git+https://github.com/sgl-project/sgl-eval
`# pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--num-threads 128`,
@@ -121,7 +121,7 @@ sgl-eval run gsm8k \\
// AIME25 with thinking, serve with a copy of the model's chat template whose
// enable_thinking default is flipped to true, passed via --chat-template.
aime25_pct:
`# pip install git+https://github.com/sgl-project/sgl-eval
`# pip install sgl-eval
# Serve with an enable_thinking=true chat template (see Configuration Tips: Thinking).
sgl-eval run aime25 \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
+2 -2
View File
@@ -62,12 +62,12 @@ export const config = {
--warmup-requests 64`,
accuracy: {
gsm8k_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--num-threads 32`,
aime26_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run aime26 \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--model {{MODEL_NAME}} --api-key <api-key> \\
@@ -72,7 +72,7 @@ export const config = {
// GSM8K harness — keep these exact settings for comparability across runs.
accuracy: {
gsm8k_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--model {{MODEL_NAME}} \\
@@ -63,12 +63,12 @@ export const config = {
--warmup-requests 64 --flush-cache`,
accuracy: {
gsm8k_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--num-threads 32`,
aime25_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run aime25 \\
--model {{MODEL_NAME}} --api-key <api-key> \\
--n-repeats 16 --max-tokens 64000 \\
@@ -158,7 +158,7 @@ python3 -m sglang.bench_serving \\
numPromptsByConc: { 1: 16, 16: 80, 64: 320, 256: 1280, 1024: 5120 },
accuracy: {
gsm8k_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--model {{MODEL_NAME}} \\
@@ -61,12 +61,12 @@ export const config = {
--warmup-requests 64 --flush-cache`,
accuracy: {
gsm8k_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run gsm8k \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
--num-threads 32`,
aime26_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run aime26 \\
--model {{MODEL_NAME}} --api-key <api-key> \\
--n-repeats 16 --max-tokens 64000 \\
@@ -74,7 +74,7 @@ sgl-eval run aime26 \\
--out-dir /sgl-workspace/logs \\
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1`,
aime25_pct:
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
`# To install sgl-eval: pip install sgl-eval
sgl-eval run aime25 \\
--model {{MODEL_NAME}} --api-key <api-key> \\
--n-repeats 16 --max-tokens 64000 \\