58 lines
1.8 KiB
YAML
58 lines
1.8 KiB
YAML
# PD2 二分 Round 2 D 侧(2026-09-24):干净 D + 嫌疑项②
|
|
# SGLANG_DISAGGREGATION_QUEUE_SIZE=16 + SGLANG_DISAGGREGATION_THREAD_POOL_SIZE=32
|
|
services:
|
|
sglang:
|
|
image: ymkymx/sglang:dsv41-pd-visioncp-db7d2cb7d-fix
|
|
container_name: ds41-pd2-decode
|
|
shm_size: "32gb"
|
|
ipc: host
|
|
pid: host
|
|
privileged: true
|
|
network_mode: host
|
|
|
|
environment:
|
|
- CUDA_VISIBLE_DEVICES=6,7
|
|
- SGLANG_RAGGED_VERIFY_MODE=static
|
|
- MC_INTRANODE_NVLINK=true
|
|
- MC_INTRA_NVLINK=true
|
|
- SGLANG_MOONCAKE_SEND_AUX_TCP=1
|
|
- SGLANG_ENABLE_DSV41_ENGRAM_HOST_TABLE=1
|
|
- SGLANG_DISAGGREGATION_QUEUE_SIZE=16
|
|
- SGLANG_DISAGGREGATION_THREAD_POOL_SIZE=32
|
|
volumes:
|
|
- /data:/data
|
|
- /data/ymk/cache/sglang:/root/.cache/sglang
|
|
- /data/ymk/sglang/python/sglang/srt/managers/scheduler.py:/sgl-workspace/sglang/python/sglang/srt/managers/scheduler.py
|
|
deploy:
|
|
resources:
|
|
reservations:
|
|
devices:
|
|
- driver: nvidia
|
|
count: all
|
|
capabilities: [gpu]
|
|
command: >-
|
|
sglang serve
|
|
--trust-remote-code
|
|
--model-path /data/models/DeepSeek-V4.1-Flash
|
|
--tp 2
|
|
--ep-size 2
|
|
--dp-size 2
|
|
--enable-dp-attention
|
|
--enable-dp-lm-head
|
|
--mem-fraction-static 0.75
|
|
--attention-backend dsv4
|
|
--moe-runner-backend flashinfer_mxfp4
|
|
--cuda-graph-max-bs-decode 32
|
|
--reasoning-parser auto
|
|
--tool-call-parser auto
|
|
--default-chat-template-kwargs '{"thinking": true, "reasoning_effort": "high"}'
|
|
--tokenizer-worker-num 8
|
|
--host 0.0.0.0
|
|
--port 30030
|
|
--enable-cache-report
|
|
--enable-metrics
|
|
--speculative-algorithm DSPARK
|
|
--speculative-dspark-block-size 5
|
|
--disaggregation-mode decode
|
|
--disaggregation-transfer-backend mooncake
|