  
|
dcd9014f15
|
[AMD][MXFP4] Reland "Online MXFP4 quantization 2/N - FP8 to MXFP4 requantization on AMD GPUs" (#28291)
Co-authored-by: Bowen Bao <bowenbao@amd.com>
Co-authored-by: HAI <hixiao@gmail.com>
Co-authored-by: Claude <noreply@anthropic.com>
|
2026-07-21 02:50:23 -07:00 |
|
 
|
3f4a338212
|
[AMD][Quantization] Online MXFP4 quantization 2/N - FP8 to MXFP4 requantization on AMD GPUs (#18182)
Co-authored-by: Bowen Bao <bowenbao@amd.com>
Co-authored-by: HAI <hixiao@gmail.com>
|
2026-06-13 16:08:19 -07:00 |
|
fxmarty-amd
|
99ab90c5b7
|
[AMD] Restore AMD piecewise CUDA graph support dropped by #23906 (#27811)
|
2026-06-10 17:43:48 -07:00 |
|
 
|
293816ab14
|
[AMD][MXFP4] Online MXFP4 quantization 1/N - dense and MOE models w. original BF16 weight (#18005)
Co-authored-by: Bowen Bao <bowenbao@amd.com>
Co-authored-by: Colin Zeng <Colin.Zeng@amd.com>
|
2026-06-03 12:55:24 -07:00 |
|
fxmarty-amd
|
031d0a2aad
|
[Qwen-MOE] Fix memory duplication issues in case layers weights are re-assigned during weight loading (#18255)
|
2026-03-10 17:34:56 +00:00 |
|
fxmarty-amd
|
9496bbd7b1
|
[AMD] Use tilelang as default NSA attention backend dispatch on AMD Instinct (#18319)
|
2026-02-27 01:43:34 -08:00 |
|
  
|
5af84c8af5
|
[AMD][Quantization] Add int4fp8_moe online quantization on ROCm (#7392)
Co-authored-by: Dehua Tang <dehtang@amd.com>
Co-authored-by: HAI <hixiao@gmail.com>
Co-authored-by: YC Tseng <yctseng@amd.com>
|
2026-01-14 01:44:40 -08:00 |
|