move all get_stream in sgl_kernel to c++ to reduce the launch overhead (#12521)
This commit is contained in:
@@ -27,8 +27,7 @@ void bmm_fp8(
|
||||
at::Tensor A_scale,
|
||||
at::Tensor B_scale,
|
||||
at::Tensor workspace_buffer,
|
||||
int64_t cublas_handle,
|
||||
int64_t cuda_stream) {
|
||||
int64_t cublas_handle) {
|
||||
TORCH_CHECK(A.is_cuda(), "A must be a CUDA tensor");
|
||||
TORCH_CHECK(B.is_cuda(), "B must be a CUDA tensor");
|
||||
TORCH_CHECK(D.is_cuda(), "D must be a CUDA tensor");
|
||||
@@ -51,7 +50,7 @@ void bmm_fp8(
|
||||
auto n = B.size(2);
|
||||
|
||||
auto lt_handle = reinterpret_cast<cublasLtHandle_t>(cublas_handle);
|
||||
auto stream = reinterpret_cast<cudaStream_t>(cuda_stream);
|
||||
auto stream = at::cuda::getCurrentCUDAStream();
|
||||
|
||||
auto status = flashinfer::bmm_fp8::bmm_fp8_internal_cublaslt(
|
||||
workspace_buffer.data_ptr(),
|
||||
|
||||
Reference in New Issue
Block a user