18 Commits
Author SHA1 Message Date
AMD-yanfeiwangandDuyi-Wang a813224e78 [ROCm][DSV4] Enable breakable CUDA graph prefill (#37810)
Co-authored-by: Duyi-Wang <duyi.wang@amd.com>
2026-09-16 08:52:11 -07:00
AMD-yanfeiwang 0163f8ff74 [AMD] Fix registered HiCache host pointer aliases (#35233) 2026-09-14 15:49:05 -07:00
AMD-yanfeiwang 69aa46b2fa [ROCm] Raise HiCache JIT block quota for mapped-host throughput (#39036) 2026-09-11 00:12:24 -07:00
AMD-yanfeiwang 2e8c03e2c7 Fix inflated row pitch when a CP round-robin shard has a single row (#34142) 2026-09-06 15:40:14 -07:00
AMD-yanfeiwangandkk 7f89cc5286 [AMD] Skip unused TOPK v2 plan kernel on ROCm (#37580)
Co-authored-by: kk <43161300+kkHuang-amd@users.noreply.github.com>
2026-09-04 00:00:38 -07:00
AMD-yanfeiwangandkk 7825e5ffca [AMD] Fix DSV4 unified attention sink TP slice (#35092)
Co-authored-by: kk <43161300+kkHuang-amd@users.noreply.github.com>
2026-09-03 22:59:53 -07:00
AMD-yanfeiwang 2ded8a6aea [AMD] Enable moe_a2a_backend=mori for DeepSeek-V4 prefill context parallelism (#35611) 2026-08-27 02:31:41 -07:00
AMD-yanfeiwang cbfe54fba8 [AMD] Use fast exponentials in C4 and C128 ROCm kernels (#34296) 2026-08-26 19:49:01 -07:00
AMD-yanfeiwang 24bce93c93 [AMD][MORI] Deduplicate CP-replicated state transfers (#36025) 2026-08-24 14:43:52 -07:00
AMD-yanfeiwangandZhangheng a34f81251f fix(hicache/umbp): support DeepSeek-V4 hybrid HostPoolGroup (multi-po… (#30762)
Co-authored-by: Zhangheng <hzh0425@apache.org>
2026-08-13 15:40:07 +08:00
AMD-yanfeiwang ca0f8a0f4c perf(hisparse): fuse the DSv4 value and scale swap-in copy on ROCm (#33484) 2026-08-10 14:30:15 -07:00
AMD-yanfeiwang 1a8e4876b6 perf(hisparse): 128-bit non-temporal swap-in copy on ROCm (#33085) 2026-08-10 13:27:15 -07:00
AMD-yanfeiwang a3194d3585 [AMD] Remove ROCm page_first+kernel -> layer_first HiCache fallback (follow-up to #28534) (#30622) 2026-07-14 22:48:16 -07:00
AMD-yanfeiwangandDuyi-Wang d74619b373 [AMD] Enable JIT staged HiCache write-back and fix CPU-index crash (#28534)
Co-authored-by: Duyi-Wang <duyi.wang@amd.com>
2026-07-09 01:22:37 -07:00
AMD-yanfeiwang 5141d8ae21 [AMD]fix: use CUDA event for targeted draft-to-verify sync in EAGLE overlap (#21940) 2026-04-26 21:58:34 -07:00
AMD-yanfeiwang 966ae87d02 [AMD] avoid correction_bias_dtype dtype convert (#20692) 2026-03-17 02:55:05 -07:00
AMD-yanfeiwangandDuyi-Wang f0153ad225 [AMD][Feature] support fp4 dispatch and fp8 combine in moriep (#19757)
Co-authored-by: Duyi-Wang <duyi.wang@amd.com>
2026-03-09 12:52:05 -07:00
AMD-yanfeiwangandroot f69ca93d49 [AMD] remove redundancy H2D op in aiter attention backend (#19416)
Co-authored-by: root <root@mia1-p01-g28.mia.tensorwave.lan>
2026-02-27 02:15:55 -08:00