[CI] Install sgl-eval from PyPI through the test extra (#37504)
This commit is contained in:
@@ -849,7 +849,7 @@ Results on AIME 2025 (8×B200), evaluated with [sgl-eval](https://github.com/sgl
|
||||
**Reproduction.** Install [sgl-eval](https://github.com/sgl-project/sgl-eval), launch the server with the tool-call and reasoning parsers, then run `sgl-eval run`. The AIME 2025 dataset ships with sgl-eval, and thinking is on by default for it:
|
||||
|
||||
```bash Command
|
||||
pip install git+https://github.com/sgl-project/sgl-eval.git
|
||||
pip install sgl-eval
|
||||
|
||||
sgl-eval run aime25 \
|
||||
--base-url http://localhost:30000/v1 \
|
||||
|
||||
@@ -1455,7 +1455,7 @@ Median ITL (ms): 15.11
|
||||
Reproduce against a running server (`--base-url` points at your endpoint):
|
||||
|
||||
```bash Command
|
||||
pip install git+https://github.com/sgl-project/sgl-eval
|
||||
pip install sgl-eval
|
||||
|
||||
# Sanity-check the endpoint
|
||||
sgl-eval ping --base-url http://localhost:30000/v1
|
||||
|
||||
@@ -497,7 +497,7 @@ This section uses **industry-standard configurations** for comparable benchmark
|
||||
- Prompt: `eval/aai/mcq-4choices` (4-choice multiple choice, matching [Artificial Analysis methodology](https://artificialanalysis.ai/methodology/intelligence-benchmarking)) -- sgl-eval's default for this benchmark
|
||||
- Evaluation command:
|
||||
```bash Command
|
||||
pip install git+https://github.com/sgl-project/sgl-eval.git
|
||||
pip install sgl-eval
|
||||
|
||||
sgl-eval run gpqa \
|
||||
--base-url http://localhost:30000/v1 \
|
||||
|
||||
@@ -628,7 +628,7 @@ python tool_calls_eval.py tool-calls/samples.jsonl \
|
||||
**Evaluation Command:**
|
||||
|
||||
```shell Command
|
||||
pip install git+https://github.com/sgl-project/sgl-eval.git
|
||||
pip install sgl-eval
|
||||
|
||||
# The dataset ships with sgl-eval; --n-repeats runs all 32 samples per problem.
|
||||
sgl-eval run aime25 \
|
||||
|
||||
@@ -71,26 +71,26 @@ export const config = {
|
||||
--num-prompts {{NUM_PROMPTS}} --max-concurrency {{MAX_CONCURRENCY}}`,
|
||||
accuracy: {
|
||||
gsm8k_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--model {{MODEL_NAME}} \\
|
||||
--num-threads 128`,
|
||||
gpqa_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
# GPQA's HF dataset (Idavidrein/gpqa) is gated — accept its terms with your HF account first.
|
||||
sgl-eval run gpqa \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--model {{MODEL_NAME}} \\
|
||||
--num-threads 128`,
|
||||
mmlu_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run mmlu \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--model {{MODEL_NAME}} \\
|
||||
--num-threads 128`,
|
||||
aime25_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run aime25 \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--model {{MODEL_NAME}} \\
|
||||
|
||||
@@ -61,21 +61,21 @@ export const config = {
|
||||
--num-prompts {{NUM_PROMPTS}} --max-concurrency {{MAX_CONCURRENCY}}`,
|
||||
accuracy: {
|
||||
gsm8k_pct:
|
||||
`pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--model {{MODEL_NAME}} \\
|
||||
--temperature 1.0 --top-p 0.95 \\
|
||||
--thinking`,
|
||||
gpqa_pct:
|
||||
`pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`pip install sgl-eval
|
||||
sgl-eval run gpqa \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--model {{MODEL_NAME}} \\
|
||||
--temperature 1.0 --top-p 0.95 \\
|
||||
--thinking --n-repeats 4 --max-tokens 40960`,
|
||||
mmmu_pro_pct:
|
||||
`pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`pip install sgl-eval
|
||||
sgl-eval run mmmu_pro \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--model {{MODEL_NAME}} \\
|
||||
|
||||
@@ -98,13 +98,13 @@ export const config = {
|
||||
--warmup-requests 64 --flush-cache`,
|
||||
accuracy: {
|
||||
gsm8k_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--num-threads 32`,
|
||||
gpqa_pct: {
|
||||
flash:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gpqa \\
|
||||
--model {{MODEL_NAME}} --api-key <api-key> \\
|
||||
--n-repeats 16 --max-tokens 200000 \\
|
||||
@@ -112,7 +112,7 @@ sgl-eval run gpqa \\
|
||||
--out-dir /sgl-workspace/logs \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1`,
|
||||
"flash-official":
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gpqa \\
|
||||
--model {{MODEL_NAME}} --api-key <api-key> \\
|
||||
--n-repeats 16 --max-tokens 200000 \\
|
||||
@@ -120,7 +120,7 @@ sgl-eval run gpqa \\
|
||||
--out-dir /sgl-workspace/logs \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1`,
|
||||
pro:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gpqa \\
|
||||
--model {{MODEL_NAME}} --api-key <api-key> \\
|
||||
--n-repeats 16 --max-tokens 400000 \\
|
||||
@@ -130,7 +130,7 @@ sgl-eval run gpqa \\
|
||||
},
|
||||
aime25_pct: {
|
||||
"flash-official":
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run aime25 \\
|
||||
--model {{MODEL_NAME}} --api-key <api-key> \\
|
||||
--n-repeats 16 --max-tokens 200000 \\
|
||||
@@ -138,7 +138,7 @@ sgl-eval run aime25 \\
|
||||
--out-dir /sgl-workspace/logs \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1`,
|
||||
flash:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run aime25 \\
|
||||
--model {{MODEL_NAME}} --api-key <api-key> \\
|
||||
--n-repeats 16 --max-tokens 200000 \\
|
||||
@@ -146,7 +146,7 @@ sgl-eval run aime25 \\
|
||||
--out-dir /sgl-workspace/logs \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1`,
|
||||
pro:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run aime25 \\
|
||||
--model {{MODEL_NAME}} --api-key <api-key> \\
|
||||
--n-repeats 16 --max-tokens 400000 \\
|
||||
@@ -156,7 +156,7 @@ sgl-eval run aime25 \\
|
||||
},
|
||||
mmmu_pro_pct: {
|
||||
"flash-vision":
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run mmmu_pro \\
|
||||
--reasoning-effort max \\
|
||||
--temperature 1.0 --top-p 0.95 \\
|
||||
|
||||
@@ -63,7 +63,7 @@ export const config = {
|
||||
--num-prompts {{NUM_PROMPTS}} --max-concurrency {{MAX_CONCURRENCY}} \\
|
||||
--flush-cache`,
|
||||
accuracy: {
|
||||
gsm8k_pct: `# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
gsm8k_pct: `# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--num-threads 32`,
|
||||
|
||||
@@ -57,7 +57,7 @@ export const config = {
|
||||
--num-prompts {{NUM_PROMPTS}} --max-concurrency {{MAX_CONCURRENCY}} \\
|
||||
--flush-cache`,
|
||||
accuracy: {
|
||||
gsm8k_pct: `# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
gsm8k_pct: `# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--num-threads 32 \\
|
||||
|
||||
@@ -51,12 +51,12 @@ export const config = {
|
||||
--warmup-requests 8 --flush-cache`,
|
||||
accuracy: {
|
||||
gsm8k_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--num-threads 32`,
|
||||
gpqa_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gpqa \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--num-threads 16`,
|
||||
|
||||
@@ -57,7 +57,7 @@ export const config = {
|
||||
--warmup-requests 64 --flush-cache`,
|
||||
accuracy: {
|
||||
gsm8k_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--num-threads 32`,
|
||||
|
||||
@@ -51,7 +51,7 @@ export const config = {
|
||||
--flush-cache`,
|
||||
accuracy: {
|
||||
gsm8k_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--num-threads 32`,
|
||||
|
||||
@@ -82,7 +82,7 @@ export const config = {
|
||||
// (AIME 25 to be added back once truncation-free numbers are measured.)
|
||||
accuracy: {
|
||||
gsm8k_pct:
|
||||
`# pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--num-threads 128`,
|
||||
|
||||
@@ -72,7 +72,7 @@ export const config = {
|
||||
--num-prompts {{NUM_PROMPTS}} --max-concurrency {{MAX_CONCURRENCY}}`,
|
||||
accuracy: {
|
||||
gsm8k_pct:
|
||||
`# pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--num-threads 128`,
|
||||
@@ -80,7 +80,7 @@ sgl-eval run gsm8k \\
|
||||
// Serve with a copy of the model's chat template whose enable_thinking default
|
||||
// is flipped to true. For BF16: use --max-tokens 131072 (see Configuration Tips).
|
||||
aime25_pct:
|
||||
`# pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# pip install sgl-eval
|
||||
# Serve with an enable_thinking=true chat template (see Configuration Tips: Thinking).
|
||||
# For BF16: use --max-tokens 131072 (see Configuration Tips: BF16 reasoning length).
|
||||
sgl-eval run aime25 \\
|
||||
|
||||
@@ -112,7 +112,7 @@ export const config = {
|
||||
// GSM8K is the required accuracy sanity on every verified cell (cookbook_guide §3), via sgl-eval.
|
||||
accuracy: {
|
||||
gsm8k_pct:
|
||||
`# pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--num-threads 128`,
|
||||
@@ -121,7 +121,7 @@ sgl-eval run gsm8k \\
|
||||
// AIME25 with thinking, serve with a copy of the model's chat template whose
|
||||
// enable_thinking default is flipped to true, passed via --chat-template.
|
||||
aime25_pct:
|
||||
`# pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# pip install sgl-eval
|
||||
# Serve with an enable_thinking=true chat template (see Configuration Tips: Thinking).
|
||||
sgl-eval run aime25 \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
|
||||
@@ -62,12 +62,12 @@ export const config = {
|
||||
--warmup-requests 64`,
|
||||
accuracy: {
|
||||
gsm8k_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--num-threads 32`,
|
||||
aime26_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run aime26 \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--model {{MODEL_NAME}} --api-key <api-key> \\
|
||||
|
||||
@@ -72,7 +72,7 @@ export const config = {
|
||||
// GSM8K harness — keep these exact settings for comparability across runs.
|
||||
accuracy: {
|
||||
gsm8k_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--model {{MODEL_NAME}} \\
|
||||
|
||||
@@ -63,12 +63,12 @@ export const config = {
|
||||
--warmup-requests 64 --flush-cache`,
|
||||
accuracy: {
|
||||
gsm8k_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--num-threads 32`,
|
||||
aime25_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run aime25 \\
|
||||
--model {{MODEL_NAME}} --api-key <api-key> \\
|
||||
--n-repeats 16 --max-tokens 64000 \\
|
||||
|
||||
@@ -158,7 +158,7 @@ python3 -m sglang.bench_serving \\
|
||||
numPromptsByConc: { 1: 16, 16: 80, 64: 320, 256: 1280, 1024: 5120 },
|
||||
accuracy: {
|
||||
gsm8k_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--model {{MODEL_NAME}} \\
|
||||
|
||||
@@ -61,12 +61,12 @@ export const config = {
|
||||
--warmup-requests 64 --flush-cache`,
|
||||
accuracy: {
|
||||
gsm8k_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run gsm8k \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 \\
|
||||
--num-threads 32`,
|
||||
aime26_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run aime26 \\
|
||||
--model {{MODEL_NAME}} --api-key <api-key> \\
|
||||
--n-repeats 16 --max-tokens 64000 \\
|
||||
@@ -74,7 +74,7 @@ sgl-eval run aime26 \\
|
||||
--out-dir /sgl-workspace/logs \\
|
||||
--base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1`,
|
||||
aime25_pct:
|
||||
`# To install sgl-eval: pip install git+https://github.com/sgl-project/sgl-eval
|
||||
`# To install sgl-eval: pip install sgl-eval
|
||||
sgl-eval run aime25 \\
|
||||
--model {{MODEL_NAME}} --api-key <api-key> \\
|
||||
--n-repeats 16 --max-tokens 64000 \\
|
||||
|
||||
Reference in New Issue
Block a user