 kkandwunhuang
|
c5326d28a3
|
[AMD] dsv4: pick kv_splits per index stream, not by occupancy alone (#39968)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-09-19 11:53:54 -07:00 |
|
 kkandwunhuang
|
dd091f43cd
|
[AMD] Update kimi-k3 amd cookbook 0903 (#37781)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-09-03 18:44:39 +08:00 |
|
 kkandwunhuang
|
a6001478f4
|
[AMD] Perf Kimi-K3 MoE optimization (#33838)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-09-03 02:28:28 -07:00 |
|
 kkandwunhuang
|
dc276264cb
|
[AMD] Perf Kimi-K3 fuse ROCm KDA decode boundary (#34198)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-09-01 18:35:48 -07:00 |
|
kk
|
65d62109dd
|
[AMD] Fix Triton 3.7 gfx950 extend-attention spills (#34741)
|
2026-08-14 00:05:42 -07:00 |
|
 
|
81735ecf80
|
[AMD ]Feat/dsv4 ep tbo prefill (#29362)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: At1a8 <fangyuan@amd.com>
|
2026-07-05 21:18:34 -07:00 |
|
 kkandwunhuang
|
b7d3c3016d
|
[AMD] Feat/dsv4 aiter reduce scatter decode (#29103)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-06-25 13:45:18 -07:00 |
|
 kkandwunhuang
|
af9027f6c9
|
[AMD] Improve performance of dsv4 in high concurrency (#28938)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-06-23 02:20:48 -07:00 |
|
 kkandwunhuang
|
47cad39f34
|
[AMD] Optimize o_proj gemm and attn output rope performance (#28722)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-06-20 02:11:01 -07:00 |
|
 
|
37ef295c78
|
[AMD] Feat/dp moe reduce scatter (#28216)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Wang, FangYuan <39615225+At1a8@users.noreply.github.com>
|
2026-06-16 18:12:39 -07:00 |
|
 kkandwunhuang
|
b8376aebd0
|
[AMD] Fix the dsv4 performance of MoE issue. (#27858)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-06-11 01:06:54 -07:00 |
|
 kkandwunhuang
|
1c73ff8ad3
|
[AMD] Optimize gpt-oss-120B performance (#27063)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-06-07 20:06:30 -07:00 |
|
 kkandwunhuang
|
aa55657e9e
|
[AMD][WA] force to use gate_mode interleaved to fix tp2/tp4/tp8 acc issue (#27201)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-06-05 20:18:11 -07:00 |
|
 
|
4226a6f13a
|
[AMD] Fix GPT-OSS MXFP4 accuracy on ROCm AITER path (#26884)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Bingxu Chen <bingxche@amd.com>
|
2026-06-01 22:30:43 -07:00 |
|
+2        
|
deaba74745
|
[AMD][DSV4] DSV4 MTP graph + sparse triton attn optimizations (#26383)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Thomas Wang <1am9trash@gmail.com>
Co-authored-by: Xinyi Song <86638975+RolaoDenthu@users.noreply.github.com>
Co-authored-by: HaiShaw <hixiao@gmail.com>
Co-authored-by: amd-danli103 <danli103@amd.com>
Co-authored-by: Lin, Soga <soga.lin@amd.com>
Co-authored-by: Raiden-Makoto <Raiden-Makoto@users.noreply.github.com>
Co-authored-by: Hubert Lu <55214931+hubertlu-tw@users.noreply.github.com>
Co-authored-by: yichiche@amd.com <jacky.cheng>
Co-authored-by: yctseng0211 <yctseng@amd.com>
Co-authored-by: Bingxu Chen <bingxche@amd.com>
|
2026-05-27 15:23:35 -07:00 |
|
+2        
|
3f5e2c7688
|
[AMD] Dsv4/pr2 compressor opt (#26208)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Thomas Wang <1am9trash@gmail.com>
Co-authored-by: Xinyi Song <86638975+RolaoDenthu@users.noreply.github.com>
Co-authored-by: HaiShaw <hixiao@gmail.com>
Co-authored-by: amd-danli103 <danli103@amd.com>
Co-authored-by: Lin, Soga <soga.lin@amd.com>
Co-authored-by: Raiden-Makoto <Raiden-Makoto@users.noreply.github.com>
Co-authored-by: Hubert Lu <55214931+hubertlu-tw@users.noreply.github.com>
Co-authored-by: yichiche@amd.com <jacky.cheng>
Co-authored-by: yctseng0211 <yctseng@amd.com>
Co-authored-by: Bingxu Chen <bingxche@amd.com>
|
2026-05-25 23:54:40 -07:00 |
|
+2        
|
af8f66940e
|
[AMD] Dsv4/pr1 fix run time issue (#25898)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Thomas Wang <1am9trash@gmail.com>
Co-authored-by: Xinyi Song <86638975+RolaoDenthu@users.noreply.github.com>
Co-authored-by: HaiShaw <hixiao@gmail.com>
Co-authored-by: amd-danli103 <danli103@amd.com>
Co-authored-by: Lin, Soga <soga.lin@amd.com>
Co-authored-by: Raiden-Makoto <Raiden-Makoto@users.noreply.github.com>
Co-authored-by: Hubert Lu <55214931+hubertlu-tw@users.noreply.github.com>
Co-authored-by: yichiche@amd.com <jacky.cheng>
Co-authored-by: yctseng0211 <yctseng@amd.com>
Co-authored-by: Bingxu Chen <bingxche@amd.com>
|
2026-05-23 16:04:14 -07:00 |
|
+3        
|
866793c502
|
Amd/deepseek v4 rebase main 0509 (#24933)
Co-authored-by: root <root@smci355-ccs-aus-m12-33.cs-aus.dcgpu>
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Thomas Wang <1am9trash@gmail.com>
Co-authored-by: Xinyi Song <86638975+RolaoDenthu@users.noreply.github.com>
Co-authored-by: HaiShaw <hixiao@gmail.com>
Co-authored-by: amd-danli103 <danli103@amd.com>
Co-authored-by: Lin, Soga <soga.lin@amd.com>
Co-authored-by: Raiden-Makoto <Raiden-Makoto@users.noreply.github.com>
Co-authored-by: Hubert Lu <55214931+hubertlu-tw@users.noreply.github.com>
Co-authored-by: yichiche@amd.com <jacky.cheng>
Co-authored-by: yctseng0211 <yctseng@amd.com>
Co-authored-by: Bingxu Chen <bingxche@amd.com>
|
2026-05-18 09:15:07 -07:00 |
|
 kkandroot
|
393252f514
|
[AMD] fused qk gemma norm kernels to reduce four kernels (#23575)
Co-authored-by: root <root@smci355-ccs-aus-g12-26.cs-aus.dcgpu>
|
2026-04-25 00:30:01 -07:00 |
|
 kkandwunhuang
|
036edf2533
|
Fix docker build error (#23413)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-04-21 16:45:33 -07:00 |
|
  
|
c122d343ad
|
[ROCm] Uniform docker to support AMD AINIC, BRCM Thor2 IBGDA NIC for MoRI-EP (#23263)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: HaiShaw <hixiao@gmail.com>
Co-authored-by: Lzy17 <36555117+Lzy17@users.noreply.github.com>
|
2026-04-20 23:39:19 -07:00 |
|
 kkandwunhuang
|
5bcbc9757c
|
[AMD] Resolve the performance degression when launch server with "--enable-aiter-allreduce-fusion" (#21947)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-04-02 22:10:24 -07:00 |
|
kk
|
67c295b5f5
|
[AMD] fix performance regression issue when run gpt-oss with "--context-length 13824" (#21691)
|
2026-03-30 16:30:16 -07:00 |
|
 kkandwunhuang
|
b9a68c304e
|
[AMD] Fused rope kv store (#21315)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-03-30 00:05:41 -07:00 |
|
 kkandwunhuang
|
86e2622097
|
[AMD] Add mha fp8-kv support (#21253)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-03-24 22:38:02 -07:00 |
|
   
|
3f0ba021fc
|
[AMD] Improve openai/gpt-oss performance (#21020)
Co-authored-by: root <root@smci355-ccs-aus-m15-21.cs-aus.dcgpu>
Co-authored-by: Hubert Lu <55214931+hubertlu-tw@users.noreply.github.com>
Co-authored-by: Hubert Lu <Hubert.Lu@amd.com>
Co-authored-by: HaiShaw <hixiao@gmail.com>
|
2026-03-20 23:16:47 -07:00 |
|
 kkandwunhuang
|
c8f0122acf
|
Fix gpu-fault issue when run deepseek-r1 and enable dp (#20841)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-03-19 02:36:12 -07:00 |
|
 kkandwunhuang
|
126cd5cfae
|
gpt-oss decode performance optimization (#20392)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-03-18 22:30:03 -07:00 |
|
 kkandwunhuang
|
318a40fdfb
|
[Bug-fix] Fix gpu fault when run the test with dp-attention-enabled and max-concurrency is over 256 (#20399)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-03-12 02:32:03 -07:00 |
|
kk
|
f016738f4c
|
fix syntax error: "&&" unexpected (#20093)
|
2026-03-07 02:06:21 -08:00 |
|
 kkandHAI
|
bd108a5971
|
Add workaround for aiter triton gemm config issue (#20090)
Co-authored-by: HAI <hixiao@gmail.com>
|
2026-03-07 01:21:31 -08:00 |
|
 kkandwunhuang
|
15af26d1e8
|
Add aiter attention support in prefill-attention-backend of gpt-oss (#18282)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-03-01 23:39:24 -08:00 |
|
 kkandwunhuang
|
ec76c390c9
|
Add ROCm + Mori docker build instructions in rocm.Dockerfile (#18018)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-01-30 19:12:07 -08:00 |
|
 kkandwunhuang
|
ef1c512754
|
Add aiter bias moe support in gpt-oss mxfp4 model (#17735)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2026-01-29 01:50:11 -08:00 |
|
  
|
f1384f5293
|
Integration mori backend for EP a2a data communication (#17012)
Co-authored-by: Duyi-Wang <duyi.wang@amd.com>
Co-authored-by: billishyahao <bill.he@amd.com>
Co-authored-by: HaiShaw <hixiao@gmail.com>
|
2026-01-28 19:07:34 -08:00 |
|
 kkandwunhuang
|
5d087891c9
|
Fix dp run error with fp8-kv enable in high concurrency test (#15241)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-12-17 11:49:18 -08:00 |
|
 kkandwunhuang
|
8c34e18140
|
Fix the accuracy issue when running mxfp4 dsv3 model and enable ep (#15304)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-12-17 01:53:22 -08:00 |
|
kk
|
888594333e
|
Fix gpu-fault when running mtp in eager mode (#15233)
|
2025-12-17 01:25:06 -08:00 |
|
kk
|
99401e7b1a
|
Fix accuracy issue when using a16w16 mla_decode_fwd (#14936)
|
2025-12-16 09:55:18 -08:00 |
|
kk
|
2ea844ec81
|
Fused two elementwise kernels for k_nope and k_pe concat (#14862)
1 TC failure to check, but irrelevant to this code change
|
2025-12-15 01:33:33 -08:00 |
|
kk
|
c106b54b57
|
Aiter fp8 kv cache (#13147)
|
2025-12-08 16:39:53 -08:00 |
|
 kkandwunhuang
|
90401cf7d2
|
Fix the run-time error when calling fused_rms_mxfp4_quant that change return output number (#12803)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-11-09 21:48:36 -08:00 |
|
 kkandwunhuang
|
8ebf72fef3
|
[Fix] RuntimeError: get_cfg Unsupported input_type:Float4_e2m1fn_x2 in using aiter-mxfp4-moe (#10981)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-09-26 22:12:22 -07:00 |
|
 
|
ec272dda9c
|
Temporay work-around for rocm 7.0.0 alpha with enabling data-parallel issue (#10434)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Sai Enduri <saimanas.enduri@amd.com>
|
2025-09-15 19:08:04 -07:00 |
|
 kkandColin Wang
|
eca59f96c3
|
Update ROCm docker image to add sgl-router support (#10406)
Co-authored-by: Colin Wang <kangwang@amd.com>
|
2025-09-13 10:52:18 -07:00 |
|
 kkandwunhuang
|
78b7465cad
|
Fix GPU fault issue when run dsv3 with dp mode and enable torch-compile (#10361)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-09-12 15:05:51 -07:00 |
|
  
|
400d3b97ae
|
Fix run time error in dsv3-fp8 model on mi35x (#10104)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: HaiShaw <hixiao@gmail.com>
Co-authored-by: Lianmin Zheng <lianminzheng@gmail.com>
|
2025-09-07 20:45:17 -07:00 |
|
 kkandwunhuang
|
918e3d4c27
|
Fix accuracy drop of dsv3 run in dp enablement (#8677)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-09-04 16:51:16 -07:00 |
|
  
|
e96973742c
|
Optimized deepseek-v3/r1 model performance on mxfp4 run (#10008)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: HAI <hixiao@gmail.com>
Co-authored-by: Hubert Lu <55214931+hubertlu-tw@users.noreply.github.com>
|
2025-09-04 15:11:22 -07:00 |
|
 kkandwunhuang
|
b648d86216
|
[Fix] gpt-oss mxfp4 model run failed on ROCm platform (#9994)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-09-03 22:34:17 -07:00 |
|
 
|
0dfd54d11d
|
Optimized deepseek-v3/r1 model performance on mxfp4 run (#9671)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: wghuang <wghuang@amd.com>
|
2025-09-02 22:26:28 -07:00 |
|
 
|
988accbc1e
|
Update docker file for supporting PD-Disaggregation on MI300x (#9494)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Colin Wang <kangwang@amd.com>
|
2025-08-21 23:48:40 -07:00 |
|
 kkandwunhuang
|
1c1f8a118e
|
Combine fp4.py and mxfp4.py into one file and support dynamic mxfp4 quantization in mxfp4.py (#9049)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-08-16 19:01:54 -07:00 |
|
 kkandwunhuang
|
983aa4967b
|
Fix nan value generated after custom all reduce (#8663)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-08-15 12:33:54 -07:00 |
|
 kkandwunhuang
|
35e6bc92e3
|
Update docker file for MI35x base image update to support gpt-oss mxfp4 model (#9111)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-08-13 00:55:31 -07:00 |
|
 kkandwunhuang
|
32d9e39a29
|
Fix potential memory fault issue and ncclSystemError in CI test (#8681)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-08-05 12:19:37 -07:00 |
|
 
|
d4bf5a8524
|
Support OCP MXFP4 quantization on AMD GPUs (#8255)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Hubert Lu <Hubert.Lu@amd.com>
|
2025-08-04 18:14:52 -07:00 |
|
kk
|
4a6e7a66a0
|
Fix nan value generated after custom all reduce (#8532)
|
2025-07-31 16:15:43 -07:00 |
|
kk
|
653b873b91
|
Fix cache modules of triton import error (#7832)
|
2025-07-08 02:50:09 -07:00 |
|
  
|
8aa68ed5c4
|
Solve docker build failed in the virtual machine (#7290)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Sai Enduri <saimanas.enduri@amd.com>
Co-authored-by: HAI <hixiao@gmail.com>
|
2025-06-23 09:10:30 +00:00 |
|
 
|
bd4f581896
|
Fix torch compile run (#7391)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Sai Enduri <saimanas.enduri@amd.com>
|
2025-06-22 15:33:09 -07:00 |
|
 kkandwunhuang
|
405780bcf0
|
[amd] Opt dsv3 moe (#7160)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-06-16 22:26:51 -07:00 |
|
 
|
8ea7df6114
|
[WA] fix output data is nan in CI test "test_moe_eval_accuracy_large.py" (#7021)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: HAI <hixiao@gmail.com>
|
2025-06-10 16:08:10 +00:00 |
|
 kkandmichael
|
7a5e6ce1cb
|
Fix GPU OOM (#6564)
Co-authored-by: michael <michael.zhang@amd.com>
|
2025-05-24 16:38:39 -07:00 |
|
 kkandwunhuang
|
92823069c4
|
Fix ci test "test_eval_fp8_accuracy" failed (#5185)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-04-09 02:44:05 -07:00 |
|
kk
|
88d6fd9a11
|
Fix torch compile errors (#5158)
|
2025-04-08 15:04:37 +00:00 |
|
 
|
5a144a8ab9
|
Fix run time error in ROCm platform (#5147)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: root <root@dell300x-pla-t10-17.pla.dcgpu>
|
2025-04-07 22:49:40 -07:00 |
|
 
|
b16af90bc3
|
AMD/ROCm: update base image string (#4137)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: yichiche <yichiche@amd.com>
|
2025-03-06 03:38:54 -08:00 |
|
kk
|
e0a2c96308
|
Fix breakage problem when using custom_ar (#4052)
|
2025-03-04 02:59:03 -08:00 |
|
 kkandwunhuang
|
11eea69e70
|
Fix assert options.num_stages != 0 error in the latest ROCm build image (#4049)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-03-03 20:37:03 -08:00 |
|
 kkandwunhuang
|
4885b90802
|
Use forward_cuda to execute custom op for hip platform (#3305)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-02-05 02:58:17 +00:00 |
|
 kkandwunhuang
|
b8cd09f27a
|
update ROCm docker for layernorm kernel optimization (#2885)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-01-14 16:59:43 +08:00 |
|
 kkandLin, Soga
|
42f3909963
|
Unify sglang coding style (#2856)
Co-authored-by: Lin, Soga <soga.lin@amd.com>
|
2025-01-13 02:12:44 -08:00 |
|
 
|
e808c1df3e
|
Integrate ROCm ater package for ck moe function feasibility (#2854)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Lin, Soga <soga.lin@amd.com>
|
2025-01-13 08:23:07 +00:00 |
|
 kkandwunhuang
|
148254d4db
|
Improve moe reduce sum kernel performance (#2705)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-01-02 01:11:06 -08:00 |
|
 kkandwunhuang
|
b6e0cfb5e1
|
ROCm base image update (#2692)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-01-01 12:12:19 +08:00 |
|
 
|
70dc2fbe2d
|
Change extend attention kernel launch parameter for ROCm platform to … (#2610)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: HAI <hixiao@gmail.com>
|
2024-12-27 00:32:17 -08:00 |
|
 kkandwunhuang
|
b438a2e512
|
Fix triton kernel performance regression (#2611)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2024-12-27 15:54:38 +08:00 |
|
 kkandwunhuang
|
7ca751ff7d
|
Fused moe triton cfg opt for rocm (#2612)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2024-12-26 23:38:22 -08:00 |
|
 
|
a9ca297d76
|
[3rdparty, document] Updated Documentation that for triton fused_moe kernel tuning for AMD Instinct GPUs (#2191)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: HAI <hixiao@gmail.com>
|
2024-11-28 02:23:10 +08:00 |
|
 kkandwunhuang
|
8cdc76f6d4
|
[Performance, Hardware] MoE tuning on AMD MI300x GPUs (#1554)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2024-10-02 09:52:46 -07:00 |
|