 danielafrimiandDaniel Afrimi
|
7de8792758
|
Fix FP8 Triton dtype selection on A100 (#31340)
Co-authored-by: Daniel Afrimi <dafrimi@aws-dfw-cs-001-login-01.cm.cluster>
|
2026-07-24 17:03:19 -07:00 |
|
 danielafrimiandDaniel Afrimi
|
24da0e51b6
|
Warn on small Mamba chunked prefill size (#30938)
Co-authored-by: Daniel Afrimi <dafrimi@aws-dfw-cs-001-login-01.cm.cluster>
|
2026-07-22 15:09:53 -07:00 |
|
 danielafrimiandDaniel Afrimi
|
a2b5ce2ed1
|
Add stochastic rounding for FP16 Mamba SSM cache (#26929)
Signed-off-by: Daniel Afrimi <dafrimi@login-lyris01.lyris.clusters.nvidia.com>
Co-authored-by: Daniel Afrimi <dafrimi@login-lyris01.lyris.clusters.nvidia.com>
|
2026-06-29 01:47:09 -07:00 |
|
danielafrimi
|
8327270c72
|
[Kernel] Support FlashInfer TRTLLM-Gen fused MoE for non-gated FP4 & FP8 (Nemotron) (#21321)
|
2026-04-29 01:28:21 -07:00 |
|
danielafrimi
|
f8bbf56de7
|
Refactor NemotronHConfig to canonical layers_block_type and add MTP block-type support (#19950)
Signed-off-by: dafrimi <dafrimi@nvidia.com>
|
2026-03-06 23:22:03 -08:00 |
|
danielafrimi
|
ff6048fb9c
|
rename nemotron reasoning parser (#19865)
Signed-off-by: dafrimi <dafrimi@nvidia.com>
|
2026-03-05 11:27:07 -08:00 |
|
danielafrimi
|
33c33a7de9
|
[Quantization] Support config.json quantization_config format, fix exclude_modules matching, and fix KV cache scale loading for Nemotron (#18546)
Signed-off-by: root <dafrimi@nvidia.com>
|
2026-02-21 16:14:29 +08:00 |
|
danielafrimi
|
0ff24159a5
|
Fix modelopt FP8 create weights (#18447)
Signed-off-by: root <dafrimi@nvidia.com>
|
2026-02-17 00:59:50 +08:00 |
|
danielafrimi
|
e422bcaed8
|
[Mamba] Add float16 support for SSM cache dtype (#18444)
|
2026-02-12 11:27:47 +08:00 |
|
danielafrimi
|
3f1df322f9
|
[FIX] Always support TP > 4 for FP4 Gemm (#17300)
|
2026-02-05 15:10:26 +08:00 |
|
danielafrimi
|
8102e36b5d
|
Add NanoV3 reasoning parser support (#15113)
|
2025-12-14 12:09:44 -08:00 |
|