Commit Graph
12 Commits
Author SHA1 Message Date
danielafrimi 4020bc95a7 Fix Nemotron W4A16 NVFP4 MoE backend (#33543)
Signed-off-by: dafrimi <dafrimi@nvidia.com>
2026-08-07 12:00:28 +00:00
danielafrimiandDaniel Afrimi 7de8792758 Fix FP8 Triton dtype selection on A100 (#31340)
Co-authored-by: Daniel Afrimi <dafrimi@aws-dfw-cs-001-login-01.cm.cluster>
2026-07-24 17:03:19 -07:00
danielafrimiandDaniel Afrimi 24da0e51b6 Warn on small Mamba chunked prefill size (#30938)
Co-authored-by: Daniel Afrimi <dafrimi@aws-dfw-cs-001-login-01.cm.cluster>
2026-07-22 15:09:53 -07:00
danielafrimiandDaniel Afrimi a2b5ce2ed1 Add stochastic rounding for FP16 Mamba SSM cache (#26929)
Signed-off-by: Daniel Afrimi <dafrimi@login-lyris01.lyris.clusters.nvidia.com>
Co-authored-by: Daniel Afrimi <dafrimi@login-lyris01.lyris.clusters.nvidia.com>
2026-06-29 01:47:09 -07:00
danielafrimi 8327270c72 [Kernel] Support FlashInfer TRTLLM-Gen fused MoE for non-gated FP4 & FP8 (Nemotron) (#21321) 2026-04-29 01:28:21 -07:00
danielafrimi f8bbf56de7 Refactor NemotronHConfig to canonical layers_block_type and add MTP block-type support (#19950)
Signed-off-by: dafrimi <dafrimi@nvidia.com>
2026-03-06 23:22:03 -08:00
danielafrimi ff6048fb9c rename nemotron reasoning parser (#19865)
Signed-off-by: dafrimi <dafrimi@nvidia.com>
2026-03-05 11:27:07 -08:00
danielafrimi 33c33a7de9 [Quantization] Support config.json quantization_config format, fix exclude_modules matching, and fix KV cache scale loading for Nemotron (#18546)
Signed-off-by: root <dafrimi@nvidia.com>
2026-02-21 16:14:29 +08:00
danielafrimi 0ff24159a5 Fix modelopt FP8 create weights (#18447)
Signed-off-by: root <dafrimi@nvidia.com>
2026-02-17 00:59:50 +08:00
danielafrimi e422bcaed8 [Mamba] Add float16 support for SSM cache dtype (#18444) 2026-02-12 11:27:47 +08:00
danielafrimi 3f1df322f9 [FIX] Always support TP > 4 for FP4 Gemm (#17300) 2026-02-05 15:10:26 +08:00
danielafrimi 8102e36b5d Add NanoV3 reasoning parser support (#15113) 2025-12-14 12:09:44 -08:00