[NPU] Fix xgrammar apply_vocab_mask device dispatch to use torch.ops.npu (#36120)
Co-authored-by: Even Zhou <even.y.zhou@outlook.com> Co-authored-by: sglang-npu-bot <sglangnpu@163.com>
This commit is contained in:
co-authored by
Even Zhou
sglang-npu-bot
parent
877a293d6d
commit
a9f02b0fa4
@@ -261,11 +261,15 @@ class XGrammarGrammarBackend(BaseGrammarBackend):
|
||||
|
||||
@staticmethod
|
||||
def apply_vocab_mask(logits: torch.Tensor, vocab_mask: torch.Tensor) -> None:
|
||||
if logits.device.type in {"cuda", "npu", "xpu", "musa"}:
|
||||
if logits.device.type in {"cuda", "xpu", "musa"}:
|
||||
if _is_hip:
|
||||
apply_token_bitmask_inplace_cuda(logits, vocab_mask)
|
||||
else:
|
||||
apply_token_bitmask_inplace_triton(logits, vocab_mask)
|
||||
elif logits.device.type == "npu":
|
||||
import sgl_kernel_npu # noqa: F401
|
||||
|
||||
torch.ops.npu.apply_token_bitmask(logits, vocab_mask)
|
||||
else:
|
||||
raise RuntimeError(f"Unsupported device: {logits.device.type}")
|
||||
|
||||
|
||||
Reference in New Issue
Block a user