danielafrimi
|
33c33a7de9
|
[Quantization] Support config.json quantization_config format, fix exclude_modules matching, and fix KV cache scale loading for Nemotron (#18546)
Signed-off-by: root <dafrimi@nvidia.com>
|
2026-02-21 16:14:29 +08:00 |
|
danielafrimi
|
0ff24159a5
|
Fix modelopt FP8 create weights (#18447)
Signed-off-by: root <dafrimi@nvidia.com>
|
2026-02-17 00:59:50 +08:00 |
|
danielafrimi
|
e422bcaed8
|
[Mamba] Add float16 support for SSM cache dtype (#18444)
|
2026-02-12 11:27:47 +08:00 |
|
danielafrimi
|
3f1df322f9
|
[FIX] Always support TP > 4 for FP4 Gemm (#17300)
|
2026-02-05 15:10:26 +08:00 |
|
danielafrimi
|
8102e36b5d
|
Add NanoV3 reasoning parser support (#15113)
|
2025-12-14 12:09:44 -08:00 |
|