danielafrimi
|
f8bbf56de7
|
Refactor NemotronHConfig to canonical layers_block_type and add MTP block-type support (#19950)
Signed-off-by: dafrimi <dafrimi@nvidia.com>
|
2026-03-06 23:22:03 -08:00 |
|
danielafrimi
|
ff6048fb9c
|
rename nemotron reasoning parser (#19865)
Signed-off-by: dafrimi <dafrimi@nvidia.com>
|
2026-03-05 11:27:07 -08:00 |
|
danielafrimi
|
33c33a7de9
|
[Quantization] Support config.json quantization_config format, fix exclude_modules matching, and fix KV cache scale loading for Nemotron (#18546)
Signed-off-by: root <dafrimi@nvidia.com>
|
2026-02-21 16:14:29 +08:00 |
|
danielafrimi
|
0ff24159a5
|
Fix modelopt FP8 create weights (#18447)
Signed-off-by: root <dafrimi@nvidia.com>
|
2026-02-17 00:59:50 +08:00 |
|
danielafrimi
|
e422bcaed8
|
[Mamba] Add float16 support for SSM cache dtype (#18444)
|
2026-02-12 11:27:47 +08:00 |
|
danielafrimi
|
3f1df322f9
|
[FIX] Always support TP > 4 for FP4 Gemm (#17300)
|
2026-02-05 15:10:26 +08:00 |
|
danielafrimi
|
8102e36b5d
|
Add NanoV3 reasoning parser support (#15113)
|
2025-12-14 12:09:44 -08:00 |
|