Commit Graph
17 Commits
Author SHA1 Message Date
Elfie Guo bebd0576e5 Integrate trtllm ragged attention for prefill self-attention (#9801) 2025-09-05 17:18:00 +08:00
Elfie Guo 66d5d0425c Minor update regarding issue #9704 (#9733) 2025-09-03 16:52:07 -07:00
Elfie Guo 243e745d07 Add trtllm_mla and cutlass_mla for ragged fmha for chunked prefill (#9480) 2025-08-21 23:01:36 -07:00
Elfie Guo 8723b4f146 Use FlashInfer's TRTLLM FP8 Blockscale GEMM (#8588) 2025-08-12 20:08:40 -07:00
Elfie Guo 92cbef59ec [bug fix] Ensure local token and global token buffers are pointing to different storage (#8785) 2025-08-08 15:13:32 -07:00
Elfie Guo e3f08c77bc Update cutlass_moe.py (#8545) 2025-07-29 23:46:34 -07:00
Elfie Guo 4d16c88b6e Update cutlass_moe.py (#8535) 2025-07-29 10:49:41 -07:00
Elfie Guo 5c9c275bc8 Use FlashInfer FP4 gemm. (#8241) 2025-07-27 01:05:22 -07:00
Elfie GuoandElfie Guo 3e56f557fd Add a CUDA kernel for fusing mapping and weighted sum for MoE. (#6916)
Co-authored-by: Elfie Guo <elfiegxf@gmail.com>
2025-06-07 15:24:39 -07:00
Elfie Guo 6fc9357503 [2/2] Add python wrapper for CUTLASS FP8 Blockscale MoE Kernel. (#5694) 2025-05-16 13:14:07 -07:00
Elfie Guoandzhyncs c23a7072b6 Upgrade CUTLASS 4.0 (#6336)
Co-authored-by: zhyncs <me@zhyncs.com>
2025-05-15 17:42:23 -07:00
Elfie Guo e62c49557d [1/2] Add FP8 Blockscale MoE CUTLASS kernel for Blackwell (#5281) 2025-04-22 22:28:20 -07:00
Elfie Guo 85ec0440a5 Update cutlass dependency. (#5447) 2025-04-15 23:28:04 -07:00
Elfie Guo a222945df2 Update Makefile / build script to avoid installing incompatible torch dependency (#5245) 2025-04-10 22:21:02 +00:00
Elfie Guo 7c86671131 Support Blackwell Block Scale FP8 Gemm (#4278) 2025-03-12 14:17:11 -07:00
Elfie Guo bf2eefc0c7 Uupdate cutalss dependency for its bug fix (#4277) 2025-03-10 17:00:05 -07:00
Elfie Guo 9e74ee91da Update cutlass dependency (#3966) 2025-02-28 16:16:31 -08:00