diff --git a/python/sglang/srt/layers/attention/nsa/nsa_indexer.py b/python/sglang/srt/layers/attention/nsa/nsa_indexer.py index 6e92533b7..66d83fa86 100644 --- a/python/sglang/srt/layers/attention/nsa/nsa_indexer.py +++ b/python/sglang/srt/layers/attention/nsa/nsa_indexer.py @@ -1062,6 +1062,19 @@ class Indexer(MultiPlatformOp): index_k_scale=k_scale, ) + def forward_xpu( + self, + x: torch.Tensor, + q_lora: torch.Tensor, + positions: torch.Tensor, + forward_batch: ForwardBatch, + layer_id: int, + return_indices: bool = True, + ) -> Optional[torch.Tensor]: + return self.forward_cuda( + x, q_lora, positions, forward_batch, layer_id, return_indices + ) + def forward_cuda( self, x: torch.Tensor, diff --git a/python/sglang/srt/server_args.py b/python/sglang/srt/server_args.py index 67d50dc9b..0a554e40d 100644 --- a/python/sglang/srt/server_args.py +++ b/python/sglang/srt/server_args.py @@ -1707,7 +1707,7 @@ class ServerArgs: self.attention_backend = "nsa" logger.info("Use nsa attention backend for DeepSeek with DSA.") - if not is_npu(): # CUDA or ROCm GPU + if not is_npu() and not is_xpu(): # CUDA or ROCm GPU if self.enable_nsa_prefill_context_parallel: logger.warning( "Context parallel feature is still under experiment. It has only been verified on Hopper platform."