From 4b0b0ea55f0c8bd418970d33c39262a1c90d446b Mon Sep 17 00:00:00 2001 From: Yibo Cai Date: Fri, 26 Jun 2026 08:23:43 +0800 Subject: [PATCH] [sgl-kernel/cpu]: exclude amx gemm source from arm build (#29286) --- sgl-kernel/csrc/cpu/CMakeLists.txt | 1 + sgl-kernel/csrc/cpu/aarch64/gemm_int8.cpp | 17 +++++++++++++++++ sgl-kernel/csrc/cpu/gemm_int8.cpp | 2 -- 3 files changed, 18 insertions(+), 2 deletions(-) diff --git a/sgl-kernel/csrc/cpu/CMakeLists.txt b/sgl-kernel/csrc/cpu/CMakeLists.txt index 2fa0cb82a..e69ee85c6 100644 --- a/sgl-kernel/csrc/cpu/CMakeLists.txt +++ b/sgl-kernel/csrc/cpu/CMakeLists.txt @@ -93,6 +93,7 @@ endif() # Keep them out of Arm64 bootstrap builds until native Arm paths land. set(SGLANG_CPU_X86_ONLY_SOURCES ${CMAKE_CURRENT_SOURCE_DIR}/gemm_int4.cpp + ${CMAKE_CURRENT_SOURCE_DIR}/gemm_int8.cpp ${CMAKE_CURRENT_SOURCE_DIR}/moe.cpp ${CMAKE_CURRENT_SOURCE_DIR}/moe_fp8.cpp ${CMAKE_CURRENT_SOURCE_DIR}/moe_int4.cpp diff --git a/sgl-kernel/csrc/cpu/aarch64/gemm_int8.cpp b/sgl-kernel/csrc/cpu/aarch64/gemm_int8.cpp index 8dae500e4..df8757338 100644 --- a/sgl-kernel/csrc/cpu/aarch64/gemm_int8.cpp +++ b/sgl-kernel/csrc/cpu/aarch64/gemm_int8.cpp @@ -56,6 +56,23 @@ void int8_scaled_mm_impl( } // anonymous namespace +std::tuple per_token_quant_int8_cpu(at::Tensor& /*A*/) { + TORCH_CHECK(false, "not implemented yet"); + return {at::Tensor(), at::Tensor()}; +} + +at::Tensor int8_scaled_mm_cpu( + at::Tensor& /*mat1*/, + at::Tensor& /*mat2*/, + at::Tensor& /*scales1*/, + at::Tensor& /*scales2*/, + const std::optional& /*bias*/, + at::ScalarType /*out_dtype*/, + bool /*is_vnni*/) { + TORCH_CHECK(false, "not implemented yet"); + return at::Tensor(); +} + // weight : static, per-channel, symmetric // activation : dynamic, per-token, symmetric // diff --git a/sgl-kernel/csrc/cpu/gemm_int8.cpp b/sgl-kernel/csrc/cpu/gemm_int8.cpp index 1da63f79e..f72616697 100644 --- a/sgl-kernel/csrc/cpu/gemm_int8.cpp +++ b/sgl-kernel/csrc/cpu/gemm_int8.cpp @@ -473,7 +473,6 @@ at::Tensor int8_scaled_mm_cpu( return out; } -#ifndef __aarch64__ // fused `per_token_quant_int8_cpu` and `int8_scaled_mm_cpu` at::Tensor int8_scaled_mm_with_quant( at::Tensor& mat1, @@ -540,4 +539,3 @@ at::Tensor int8_scaled_mm_with_quant( }); return out; } -#endif // #ifndef __aarch64__