diff --git a/docs/platforms/ascend/ascend_npu_support_features.md b/docs/platforms/ascend/ascend_npu_support_features.md index 54bdf7c97..7f0127a76 100644 --- a/docs/platforms/ascend/ascend_npu_support_features.md +++ b/docs/platforms/ascend/ascend_npu_support_features.md @@ -243,29 +243,29 @@ click [Server Arguments](https://docs.sglang.io/advanced_features/server_argumen ## Expert parallelism -| Argument | Defaults | Options | Server supported | -|-------------------------------------------------------|-----------|---------------------------------------------|:----------------:| -| `--expert-parallel-size`
`--ep-size`
`--ep` | `1` | Type: int | A2, A3 | -| `--moe-a2a-backend` | `none` | `none`,
`deepep`,
`ascend_fuseep` | A2, A3 | -| `--moe-runner-backend` | `auto` | `auto`, `triton` | A2, A3 | -| `--flashinfer-mxfp4-`
`moe-precision` | `default` | `default`,
`bf16` | Special for GPU | -| `--enable-flashinfer-`
`allreduce-fusion` | `False` | bool flag
(set to enable) | Special for GPU | -| `--deepep-mode` | `auto` | `normal`,
`low_latency`,
`auto` | A2, A3 | -| `--deepep-config` | `None` | Type: str | Special for GPU | -| `--ep-num-redundant-experts` | `0` | Type: int | A2, A3 | -| `--ep-dispatch-algorithm` | `None` | `static`,
`dynamic`,
`fake` | A2, A3 | -| `--init-expert-location` | `trivial` | Type: str | A2, A3 | -| `--enable-eplb` | `False` | bool flag
(set to enable) | A2, A3 | -| `--eplb-algorithm` | `deepseek`| Type: str | A2, A3 | -| `--eplb-rebalance-num-iterations` | `1000` | Type: int | A2, A3 | -| `--eplb-rebalance-layers-`
`per-chunk` | `None` | Type: int | A2, A3 | -| `--eplb-min-rebalancing-`
`utilization-threshold` | `1.0` | Type: float | A2, A3 | -| `--expert-distribution-`
`recorder-mode` | `None` | `stat`,
`stat_approx`,
`per_pass`,
`per_token` | A2, A3 | -| `--expert-distribution-`
`recorder-buffer-size` | `None` | Type: int | A2, A3 | -| `--enable-expert-distribution-`
`metrics` | `False` | bool flag (set to enable) | A2, A3 | -| `--moe-dense-tp-size` | `None` | `1` | A2, A3 | -| `--elastic-ep-backend` | `None` | `none`, `mooncake` | Special for GPU | -| `--mooncake-ib-device` | `None` | Type: str | Special for GPU | +| Argument | Defaults | Options | Server supported | +|-------------------------------------------------------|-----------|---------------------------------------------------------------------------|:----------------:| +| `--expert-parallel-size`
`--ep-size`
`--ep` | `1` | Type: int | A2, A3 | +| `--moe-a2a-backend` | `none` | `none`,
`deepep`,
`ascend_fuseep`(It is incompatible with eplb) | A2, A3 | +| `--moe-runner-backend` | `auto` | `auto`, `triton` | A2, A3 | +| `--flashinfer-mxfp4-`
`moe-precision` | `default` | `default`,
`bf16` | Special for GPU | +| `--enable-flashinfer-`
`allreduce-fusion` | `False` | bool flag
(set to enable) | Special for GPU | +| `--deepep-mode` | `auto` | `normal`,
`low_latency`,
`auto` | A2, A3 | +| `--deepep-config` | `None` | Type: str | Special for GPU | +| `--ep-num-redundant-experts` | `0` | Type: int | A2, A3 | +| `--ep-dispatch-algorithm` | `None` | `static`,
`dynamic`,
`fake` | A2, A3 | +| `--init-expert-location` | `trivial` | Type: str | A2, A3 | +| `--enable-eplb` | `False` | bool flag
(set to enable) | A2, A3 | +| `--eplb-algorithm` | `deepseek`| Type: str | A2, A3 | +| `--eplb-rebalance-num-iterations` | `1000` | Type: int | A2, A3 | +| `--eplb-rebalance-layers-`
`per-chunk` | `None` | Type: int | A2, A3 | +| `--eplb-min-rebalancing-`
`utilization-threshold` | `1.0` | Type: float | A2, A3 | +| `--expert-distribution-`
`recorder-mode` | `None` | `stat`,
`stat_approx`,
`per_pass`,
`per_token` | A2, A3 | +| `--expert-distribution-`
`recorder-buffer-size` | `None` | Type: int | A2, A3 | +| `--enable-expert-distribution-`
`metrics` | `False` | bool flag (set to enable) | A2, A3 | +| `--moe-dense-tp-size` | `None` | `1` | A2, A3 | +| `--elastic-ep-backend` | `None` | `none`, `mooncake` | Special for GPU | +| `--mooncake-ib-device` | `None` | Type: str | Special for GPU | ## Mamba Cache @@ -436,8 +436,6 @@ click [Server Arguments](https://docs.sglang.io/advanced_features/server_argumen | Argument | Defaults | Options | Server supported | |-----------------------------------------------|----------|--------------------------------|:----------------:| -| `--mm-max-concurrent-calls` | `32` | Type: int | A2, A3 | -| `--mm-per-request-timeout` | `10.0` | Type: float | A2, A3 | | `--enable-broadcast-mm-`
`inputs-process` | `False` | bool flag
(set to enable) | A2, A3 | | `--mm-process-config` | `None` | Type: JSON / Dict | A2, A3 | | `--mm-enable-dp-encoder` | `False` | bool flag
(set to enable) | A2, A3 |