 kkandwunhuang
|
90401cf7d2
|
Fix the run-time error when calling fused_rms_mxfp4_quant that change return output number (#12803)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-11-09 21:48:36 -08:00 |
|
 kkandwunhuang
|
8ebf72fef3
|
[Fix] RuntimeError: get_cfg Unsupported input_type:Float4_e2m1fn_x2 in using aiter-mxfp4-moe (#10981)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-09-26 22:12:22 -07:00 |
|
 
|
ec272dda9c
|
Temporay work-around for rocm 7.0.0 alpha with enabling data-parallel issue (#10434)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Sai Enduri <saimanas.enduri@amd.com>
|
2025-09-15 19:08:04 -07:00 |
|
 kkandColin Wang
|
eca59f96c3
|
Update ROCm docker image to add sgl-router support (#10406)
Co-authored-by: Colin Wang <kangwang@amd.com>
|
2025-09-13 10:52:18 -07:00 |
|
 kkandwunhuang
|
78b7465cad
|
Fix GPU fault issue when run dsv3 with dp mode and enable torch-compile (#10361)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-09-12 15:05:51 -07:00 |
|
  
|
400d3b97ae
|
Fix run time error in dsv3-fp8 model on mi35x (#10104)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: HaiShaw <hixiao@gmail.com>
Co-authored-by: Lianmin Zheng <lianminzheng@gmail.com>
|
2025-09-07 20:45:17 -07:00 |
|
 kkandwunhuang
|
918e3d4c27
|
Fix accuracy drop of dsv3 run in dp enablement (#8677)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-09-04 16:51:16 -07:00 |
|
  
|
e96973742c
|
Optimized deepseek-v3/r1 model performance on mxfp4 run (#10008)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: HAI <hixiao@gmail.com>
Co-authored-by: Hubert Lu <55214931+hubertlu-tw@users.noreply.github.com>
|
2025-09-04 15:11:22 -07:00 |
|
 kkandwunhuang
|
b648d86216
|
[Fix] gpt-oss mxfp4 model run failed on ROCm platform (#9994)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-09-03 22:34:17 -07:00 |
|
 
|
0dfd54d11d
|
Optimized deepseek-v3/r1 model performance on mxfp4 run (#9671)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: wghuang <wghuang@amd.com>
|
2025-09-02 22:26:28 -07:00 |
|
 
|
988accbc1e
|
Update docker file for supporting PD-Disaggregation on MI300x (#9494)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Colin Wang <kangwang@amd.com>
|
2025-08-21 23:48:40 -07:00 |
|
 kkandwunhuang
|
1c1f8a118e
|
Combine fp4.py and mxfp4.py into one file and support dynamic mxfp4 quantization in mxfp4.py (#9049)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-08-16 19:01:54 -07:00 |
|
 kkandwunhuang
|
983aa4967b
|
Fix nan value generated after custom all reduce (#8663)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-08-15 12:33:54 -07:00 |
|
 kkandwunhuang
|
35e6bc92e3
|
Update docker file for MI35x base image update to support gpt-oss mxfp4 model (#9111)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-08-13 00:55:31 -07:00 |
|
 kkandwunhuang
|
32d9e39a29
|
Fix potential memory fault issue and ncclSystemError in CI test (#8681)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-08-05 12:19:37 -07:00 |
|
 
|
d4bf5a8524
|
Support OCP MXFP4 quantization on AMD GPUs (#8255)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Hubert Lu <Hubert.Lu@amd.com>
|
2025-08-04 18:14:52 -07:00 |
|
kk
|
4a6e7a66a0
|
Fix nan value generated after custom all reduce (#8532)
|
2025-07-31 16:15:43 -07:00 |
|
kk
|
653b873b91
|
Fix cache modules of triton import error (#7832)
|
2025-07-08 02:50:09 -07:00 |
|
  
|
8aa68ed5c4
|
Solve docker build failed in the virtual machine (#7290)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Sai Enduri <saimanas.enduri@amd.com>
Co-authored-by: HAI <hixiao@gmail.com>
|
2025-06-23 09:10:30 +00:00 |
|
 
|
bd4f581896
|
Fix torch compile run (#7391)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Sai Enduri <saimanas.enduri@amd.com>
|
2025-06-22 15:33:09 -07:00 |
|
 kkandwunhuang
|
405780bcf0
|
[amd] Opt dsv3 moe (#7160)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-06-16 22:26:51 -07:00 |
|
 
|
8ea7df6114
|
[WA] fix output data is nan in CI test "test_moe_eval_accuracy_large.py" (#7021)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: HAI <hixiao@gmail.com>
|
2025-06-10 16:08:10 +00:00 |
|
 kkandmichael
|
7a5e6ce1cb
|
Fix GPU OOM (#6564)
Co-authored-by: michael <michael.zhang@amd.com>
|
2025-05-24 16:38:39 -07:00 |
|
 kkandwunhuang
|
92823069c4
|
Fix ci test "test_eval_fp8_accuracy" failed (#5185)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-04-09 02:44:05 -07:00 |
|
kk
|
88d6fd9a11
|
Fix torch compile errors (#5158)
|
2025-04-08 15:04:37 +00:00 |
|
 
|
5a144a8ab9
|
Fix run time error in ROCm platform (#5147)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: root <root@dell300x-pla-t10-17.pla.dcgpu>
|
2025-04-07 22:49:40 -07:00 |
|
 
|
b16af90bc3
|
AMD/ROCm: update base image string (#4137)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: yichiche <yichiche@amd.com>
|
2025-03-06 03:38:54 -08:00 |
|
kk
|
e0a2c96308
|
Fix breakage problem when using custom_ar (#4052)
|
2025-03-04 02:59:03 -08:00 |
|
 kkandwunhuang
|
11eea69e70
|
Fix assert options.num_stages != 0 error in the latest ROCm build image (#4049)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-03-03 20:37:03 -08:00 |
|
 kkandwunhuang
|
4885b90802
|
Use forward_cuda to execute custom op for hip platform (#3305)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-02-05 02:58:17 +00:00 |
|
 kkandwunhuang
|
b8cd09f27a
|
update ROCm docker for layernorm kernel optimization (#2885)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-01-14 16:59:43 +08:00 |
|
 kkandLin, Soga
|
42f3909963
|
Unify sglang coding style (#2856)
Co-authored-by: Lin, Soga <soga.lin@amd.com>
|
2025-01-13 02:12:44 -08:00 |
|
 
|
e808c1df3e
|
Integrate ROCm ater package for ck moe function feasibility (#2854)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: Lin, Soga <soga.lin@amd.com>
|
2025-01-13 08:23:07 +00:00 |
|
 kkandwunhuang
|
148254d4db
|
Improve moe reduce sum kernel performance (#2705)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-01-02 01:11:06 -08:00 |
|
 kkandwunhuang
|
b6e0cfb5e1
|
ROCm base image update (#2692)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2025-01-01 12:12:19 +08:00 |
|
 
|
70dc2fbe2d
|
Change extend attention kernel launch parameter for ROCm platform to … (#2610)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: HAI <hixiao@gmail.com>
|
2024-12-27 00:32:17 -08:00 |
|
 kkandwunhuang
|
b438a2e512
|
Fix triton kernel performance regression (#2611)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2024-12-27 15:54:38 +08:00 |
|
 kkandwunhuang
|
7ca751ff7d
|
Fused moe triton cfg opt for rocm (#2612)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2024-12-26 23:38:22 -08:00 |
|
 
|
a9ca297d76
|
[3rdparty, document] Updated Documentation that for triton fused_moe kernel tuning for AMD Instinct GPUs (#2191)
Co-authored-by: wunhuang <wunhuang@amd.com>
Co-authored-by: HAI <hixiao@gmail.com>
|
2024-11-28 02:23:10 +08:00 |
|
 kkandwunhuang
|
8cdc76f6d4
|
[Performance, Hardware] MoE tuning on AMD MI300x GPUs (#1554)
Co-authored-by: wunhuang <wunhuang@amd.com>
|
2024-10-02 09:52:46 -07:00 |
|