[NPU] ascend fuseep use moe ep group (#32040)
This commit is contained in:
@@ -12,7 +12,7 @@ from typing import TYPE_CHECKING
|
|||||||
|
|
||||||
import torch
|
import torch
|
||||||
|
|
||||||
from sglang.srt.distributed import get_tp_group
|
from sglang.srt.distributed import get_moe_ep_group
|
||||||
from sglang.srt.environ import envs
|
from sglang.srt.environ import envs
|
||||||
from sglang.srt.hardware_backend.npu.utils import npu_format_cast
|
from sglang.srt.hardware_backend.npu.utils import npu_format_cast
|
||||||
from sglang.srt.layers.moe.token_dispatcher.deepep import DeepEPBuffer
|
from sglang.srt.layers.moe.token_dispatcher.deepep import DeepEPBuffer
|
||||||
@@ -30,7 +30,7 @@ _PARAMS_BYTES = 2 # bf16 — Ascend's Dispatch & Combine does not support fp16
|
|||||||
def _get_fuseep_buffer(layer: FusedMoE):
|
def _get_fuseep_buffer(layer: FusedMoE):
|
||||||
DeepEPBuffer.set_dispatch_mode_as_low_latency()
|
DeepEPBuffer.set_dispatch_mode_as_low_latency()
|
||||||
return DeepEPBuffer.get_deepep_buffer(
|
return DeepEPBuffer.get_deepep_buffer(
|
||||||
get_tp_group().device_group,
|
get_moe_ep_group().device_group,
|
||||||
layer.hidden_size,
|
layer.hidden_size,
|
||||||
_PARAMS_BYTES,
|
_PARAMS_BYTES,
|
||||||
DeepEPMode.LOW_LATENCY,
|
DeepEPMode.LOW_LATENCY,
|
||||||
|
|||||||
Reference in New Issue
Block a user