From fdfc46f3a5b6453d42d338f548895ca1ea429a20 Mon Sep 17 00:00:00 2001 From: Polisetty V R K Jyothendra Varma Date: Tue, 5 May 2026 18:17:40 +0530 Subject: [PATCH] [Intel GPU] Enable DeepSeek V3.2 inference on XPU (#24356) Signed-off-by: P V R K Jyothendra Varma --- .../sglang/srt/layers/attention/nsa/nsa_indexer.py | 13 +++++++++++++ python/sglang/srt/server_args.py | 2 +- 2 files changed, 14 insertions(+), 1 deletion(-) diff --git a/python/sglang/srt/layers/attention/nsa/nsa_indexer.py b/python/sglang/srt/layers/attention/nsa/nsa_indexer.py index 6e92533b7..66d83fa86 100644 --- a/python/sglang/srt/layers/attention/nsa/nsa_indexer.py +++ b/python/sglang/srt/layers/attention/nsa/nsa_indexer.py @@ -1062,6 +1062,19 @@ class Indexer(MultiPlatformOp): index_k_scale=k_scale, ) + def forward_xpu( + self, + x: torch.Tensor, + q_lora: torch.Tensor, + positions: torch.Tensor, + forward_batch: ForwardBatch, + layer_id: int, + return_indices: bool = True, + ) -> Optional[torch.Tensor]: + return self.forward_cuda( + x, q_lora, positions, forward_batch, layer_id, return_indices + ) + def forward_cuda( self, x: torch.Tensor, diff --git a/python/sglang/srt/server_args.py b/python/sglang/srt/server_args.py index 67d50dc9b..0a554e40d 100644 --- a/python/sglang/srt/server_args.py +++ b/python/sglang/srt/server_args.py @@ -1707,7 +1707,7 @@ class ServerArgs: self.attention_backend = "nsa" logger.info("Use nsa attention backend for DeepSeek with DSA.") - if not is_npu(): # CUDA or ROCm GPU + if not is_npu() and not is_xpu(): # CUDA or ROCm GPU if self.enable_nsa_prefill_context_parallel: logger.warning( "Context parallel feature is still under experiment. It has only been verified on Hopper platform."