From cbfe54fba86d33c426f41b3f2f7c544da2fcd1ee Mon Sep 17 00:00:00 2001 From: AMD-yanfeiwang Date: Thu, 27 Aug 2026 10:49:01 +0800 Subject: [PATCH] [AMD] Use fast exponentials in C4 and C128 ROCm kernels (#34296) --- python/sglang/kernels/jit/csrc/deepseek_v4/c128_v2.cuh | 4 ++-- python/sglang/kernels/jit/csrc/deepseek_v4/c4_v2.cuh | 2 +- 2 files changed, 3 insertions(+), 3 deletions(-) diff --git a/python/sglang/kernels/jit/csrc/deepseek_v4/c128_v2.cuh b/python/sglang/kernels/jit/csrc/deepseek_v4/c128_v2.cuh index b12c5ce1a..9591a50e1 100644 --- a/python/sglang/kernels/jit/csrc/deepseek_v4/c128_v2.cuh +++ b/python/sglang/kernels/jit/csrc/deepseek_v4/c128_v2.cuh @@ -190,7 +190,7 @@ SGL_DEVICE void c128_forward( float sum_product = 0.0f; #pragma unroll for (int32_t j = 0; j < kElementsPerWarp; ++j) { - const auto exp_score = expf(score[j] - max_value); + const auto exp_score = __expf(score[j] - max_value); sum_product += cast(kv[j][i]) * exp_score; sum_exp_value += exp_score; } @@ -238,7 +238,7 @@ SGL_DEVICE void c128_forward( float global_product = 0.0f; #pragma unroll for (uint32_t i = 0; i < kNumWarps; ++i) { - const auto exp_val = expf(local_val_max[i] - global_max); + const auto exp_val = __expf(local_val_max[i] - global_max); global_exp_sum += local_exp_sum[i] * exp_val; global_product += local_product[i] * exp_val; } diff --git a/python/sglang/kernels/jit/csrc/deepseek_v4/c4_v2.cuh b/python/sglang/kernels/jit/csrc/deepseek_v4/c4_v2.cuh index d8dce8c45..d6c7e0967 100644 --- a/python/sglang/kernels/jit/csrc/deepseek_v4/c4_v2.cuh +++ b/python/sglang/kernels/jit/csrc/deepseek_v4/c4_v2.cuh @@ -206,7 +206,7 @@ SGL_DEVICE void c4_forward( #pragma unroll for (int32_t j = 0; j < 8; ++j) { const auto fp32_score = score[j]; - const auto exp_score = expf(fp32_score - max_value); + const auto exp_score = __expf(fp32_score - max_value); sum_product += cast(kv[j][i]) * exp_score; sum_exp_value += exp_score; }