diff --git a/python/sglang/srt/layers/attention/dsv4/compressor.py b/python/sglang/srt/layers/attention/dsv4/compressor.py index a09d8cbd7..0cc5bc312 100644 --- a/python/sglang/srt/layers/attention/dsv4/compressor.py +++ b/python/sglang/srt/layers/attention/dsv4/compressor.py @@ -104,7 +104,7 @@ class CompressorBackendMixin: freqs_cis_cache, plan, ) - return rotate_activation(kv_compressed.bfloat16()) if rotate else kv_compressed + return rotate_activation(kv_compressed) if rotate else kv_compressed def forward_core_compressor( self, diff --git a/python/sglang/srt/layers/attention/nsa/nsa_indexer.py b/python/sglang/srt/layers/attention/nsa/nsa_indexer.py index 78dcf0aec..84a32b30c 100644 --- a/python/sglang/srt/layers/attention/nsa/nsa_indexer.py +++ b/python/sglang/srt/layers/attention/nsa/nsa_indexer.py @@ -148,7 +148,6 @@ class BaseIndexerMetadata(ABC): def rotate_activation(x: torch.Tensor) -> torch.Tensor: - assert x.dtype == torch.bfloat16 # from sgl_kernel import hadamard_transform if _is_hip: from fast_hadamard_transform import hadamard_transform