 Yuan Luoandluoyuan.luo
|
dd83b54611
|
Update linear attention code owner directory (#40389)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-09-19 21:13:47 -07:00 |
|
 Yuan Luoandluoyuan.luo
|
99060191e7
|
[KDA] Support ReplaySSM ring-write in the fused chain-verify kernel (#36821)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-09-15 10:22:41 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
5b04408784
|
[MoE] Add FlashInfer SM90 MXFP4 W4A8 CUTLASS MoE (#34967)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-08-31 20:04:41 -07:00 |
|
 Yuan Luoandluoyuan.luo
|
712a720c8a
|
[KDA] Fused-accept state advance for FlashInfer KDA MTP verify (#33722)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-08-31 16:11:49 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
77940dec80
|
[MoE] Gather the cutlass MoE activation and its scales in one launch (#34915)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-08-24 13:37:14 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
b95a746948
|
[MoE] Fuse swiglu moe up gemm epilogue (#32944)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-08-14 22:11:34 +08:00 |
|
Yuan Luo
|
5fdf6cd18f
|
[MoE] Single-launch moe_align for tiny batches with many experts (#32395)
|
2026-08-08 16:08:25 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
d9cf7b0a8b
|
[MTP] Cut spec-v2 host-seam overhead in hybrid-linear MTP decode (#32219)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-07-28 11:38:33 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
ae2bc3321e
|
[KDA] Fix mixed exponent bases in Triton chunk prefill (#31904)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-07-22 16:03:29 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
66ea79dc2e
|
Update FLA directory in CODEOWNERS (#31916)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-07-21 01:57:10 -07:00 |
|
 
|
c41c573ce9
|
[GDN] Support ReplaySSM Ring Spec-Verify (#28695)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
Co-authored-by: vincentzed <207368749+vincentzed@users.noreply.github.com>
|
2026-07-20 22:06:30 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
a798a2aeea
|
[GDN/KDA] Fuse SM100 CuteDSL prefill state I/O into the chunk h kernel (#30169)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-07-16 16:40:33 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
a649b5a9db
|
[KDA] Add FlashInfer SM100 KDA decode + MTP (target_verify) backend (#30113)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-07-15 15:04:20 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
eb23f9a86b
|
[KDA] Add FlashKDA prefill backend for safe-gate KDA linear attention (#29472)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-07-02 11:37:04 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
a10a24e9a7
|
[GDN][KDA] ReplaySSM buffered output-only decode for Linear Attention (#28451)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-06-26 14:17:02 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
0df796473b
|
[VLM] Qwen3-VL / Moss-VL ViT preprocessing optimizations (#28940)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-06-24 14:36:29 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
abb0717174
|
[CI] Fix lint brought by #27527 (#28988)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-06-22 20:40:06 -07:00 |
|
 Yuan Luoandluoyuan.luo
|
c0198fc277
|
[CI] Refactor int checkpoint tests style (#28813)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-06-22 14:59:06 -07:00 |
|
 Yuan Luoandluoyuan.luo
|
3b9db3a1f0
|
[Mamba][GDN] Deduplicate spec conv-window intermediate cache via sliding window layout (#28302)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-06-17 20:42:31 -07:00 |
|
 Yuan Luoandluoyuan.luo
|
3340f4e3da
|
[GDN][KDA][mem_cache] int8 checkpoint pool for the linear-attn prefix cache (#28185)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-06-17 20:41:46 -07:00 |
|
 Yuan Luoandluoyuan.luo
|
eb18416f9f
|
[jit-kernel] Support per token group quant 8bit v2 jit kernel (#27449)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-06-13 12:15:09 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
c80d8fe78a
|
[Perf] Skip per-call mat_a/scales_a padding in cutlass FP8 blockwise GEMM (#27896)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-06-12 12:01:53 -04:00 |
|
 Yuan Luoandluoyuan.luo
|
518e35fae7
|
[KDA] Add CuteDSL Prefill Kernel on SM100 (#27488)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-06-10 21:25:19 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
bc36231d65
|
[KDA] Support KDA packed decode (#26586)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-06-01 16:52:01 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
0d9a2a9de3
|
[MoE Refactor] Migrate SM90 Cutlass W4A16 to MoeRunner (#26489)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-05-30 02:02:56 -07:00 |
|
 Yuan Luoandluoyuan.luo
|
08ec19872c
|
[HotFix][Ling 2.6] Fix HybridLinearAttn dispatcher for Ling-2.6 (#26474)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-05-29 14:50:15 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
d34d4d9f5f
|
[GDN] Support SM100 CuTeDSL GDN Prefill Kernel (#26200)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-05-26 15:38:29 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
b7085d3860
|
[fp8] SM90 swap-AB scaled_mm dispatch (~1.16x kernel geomean, +5.8-18.5% end-to-end) (#25532)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-05-20 13:20:37 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
4c0ce0345d
|
Support Gemma4 Pipeline Parallelism (#25284)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-05-19 22:40:11 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
28758d37dd
|
Add FlashInfer SM90 cutlass MXFP4 MoE backend (W4A16) for GPT-OSS + DeepSeek-V4 (#24816)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-05-13 14:53:18 -07:00 |
|
 Yuan Luoandluoyuan.luo
|
d3fd91ed97
|
[Gemma4] Optimize Gemm4 with fused Q/K/V RMSNorm + per-expert FP8 ckpt loader (#24696)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-05-10 00:24:12 -07:00 |
|
 Yuan Luoandluoyuan.luo
|
a61a14f416
|
[KDA] Optimize prefill kernels with diagonal and recompute fuse (#24271)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-05-09 08:52:51 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
e5c58eb9d6
|
[VLM] Optimize Gemma4 VLM with PCG and fuse RMSNorm + residual add + scalar (#24048)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-05-04 09:36:26 -07:00 |
|
 Yuan Luoandluoyuan.luo
|
48daa831ea
|
[KDA] Fuse gate+cumsum and reuse chunk index for KDA (#23038)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-04-21 17:54:20 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
03a87068ea
|
[KDA] Fuse scaled_dot_kkt + solve_tril + recompute_w_u for KDA (#21604)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-03-31 20:57:27 -07:00 |
|
 Yuan Luoandluoyuan.luo
|
c7adca9992
|
Fix kimi-linear launch server error (#21752)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-03-31 21:07:08 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
343a7ac652
|
[GDN] Fuse GDN kkt + solve_tril into one kernel (#21411)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-03-29 12:02:07 +08:00 |
|
Yuan Luo
|
ee15c104ef
|
[CI] hot-fix ci lint (#21608)
|
2026-03-28 21:32:39 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
f273ba1ccc
|
[KDA] Support CuTeDSL KDA decode kernel (#21203)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-03-25 09:47:09 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
5bdc07d974
|
[Qwen3.5] Fuse split/reshape/cat ops in GDN projection with Triton kernel (#21019)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-03-23 23:17:01 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
d9794ef9f7
|
[Qwen3-Next] Fuse Qwen3-Next GDN's qkvz_proj and ba_proj (#19321)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-03-20 09:25:29 +08:00 |
|
Yuan Luo
|
9c87e137ee
|
[GDN] Support GDN packed decode (#20627)
|
2026-03-18 13:20:07 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
22e67876d6
|
[Omni] Optimize AudioEncoder for Qwen3_Omni_Thinker (#18185)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-03-14 23:00:17 +08:00 |
|
 
|
e29305c120
|
[GDN] Add benchmark for sglang gdn prefill (#20428)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
Co-authored-by: Kaixi Hou <kaixih@nvidia.com>
|
2026-03-12 22:25:02 +08:00 |
|
Yuan Luo
|
649d6f2bc8
|
[GDN] Change Attention State Layout from [N, HV, K, V] to [N, HV, V, K] (#20283)
|
2026-03-12 10:53:12 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
751c454099
|
Add DeepSeek3.2 and GlmMoeDsa into moe tune (#18876)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-03-10 17:12:58 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
97a2a9be0f
|
[VLM] Replace conv3d proj with linear for GLM4V (#20033)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-03-07 22:50:47 -08:00 |
|
 Yuan Luoandluoyuan.luo
|
7da590d4d0
|
[Qwen3.5] Support Qwen3.5 Pipeline Parallelism (#19670)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-03-07 23:34:08 +08:00 |
|
Yuan Luo
|
f7de9375ac
|
[GDN][Qwen3-Next][Qwen3.5] Fuse fused_gdn_gating and fused_recurrent_gated_delta_rule_update in verify_target (#19775)
|
2026-03-06 21:42:44 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
82e7139c06
|
[VLM] Support cos sin cache for Ernie4.5-VL (#19743)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-03-04 10:54:23 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
f6ee6dc8c3
|
[JIT-kernel] Add unit test for nsa indexer fused_store_k_cache (#19389)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-03-02 12:18:11 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
d2885a9094
|
[Qwen3-Next] Support gdn fused_rms_norm_gated (#19434)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-02-27 23:08:08 +08:00 |
|
 
|
4e843f1216
|
[DeepSeek-V3.2][JIT-kernel] Support nsa fuse store indexer k cache (#19148)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
Co-authored-by: DarkSharpness <76582120+darksharpness@users.noreply.github.com>
|
2026-02-26 10:23:10 +08:00 |
|
 
|
7c9e8e2def
|
[Re-land][jit kernel] Support per_token_group_quant_8bit jit kernel (#19140)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
Co-authored-by: Mohammad Miadh Angkad <mangkad.bsdsba2027@aim.edu>
|
2026-02-26 09:53:57 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
31c7dc9d99
|
[VLM] Introduce FlashInfer CUDNN Prefill as ViT Backend (#19003)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-02-24 19:49:22 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
7d953440ec
|
[jit kernel] Support per_token_group_quant_8bit jit kernel (#18905)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-02-20 21:01:05 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
8a82c70297
|
[VLM] Optimize Ernie4.5-VL rotary embedding with fused triton kernel (#18856)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-02-16 11:19:44 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
fa0ef6e4f7
|
[VLM][LLM] Optimize fused_moe triton kernel tma (#18782)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-02-14 14:35:26 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
9227d4f748
|
[Fix] Remove no use code in MiMo-V2-Flash (#18051)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-02-01 15:34:09 -08:00 |
|
 Yuan Luoandluoyuan.luo
|
afebb7ab78
|
Optimize custom-all-reduce (#17674)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-02-01 18:59:31 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
4ea4f2a20c
|
[VLM] Optimize get_rope_index for GLM4v (#17420)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-02-01 18:59:15 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
7bb41989fa
|
[1/N] Optimize All Reduce - Benchmark different AR operations (#13797)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-01-26 22:44:13 +08:00 |
|
Yuan Luo
|
1e8db18290
|
[Kimi-Linear] Remove duplicated code in kimi-linear (#17731)
|
2026-01-26 14:20:24 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
0c8165ffbd
|
[Kimi-Linear] Refactor Kimi-Linear to support RadixLinearAttention (#17506)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-01-24 21:27:13 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
e6b7c04947
|
[Kimi-Linear] Refactor kimi-linear gate calculation to avoid duplicated code (#17160)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-01-20 14:29:24 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
6d29d8ab16
|
[VLM][Reland] Refactor load_mm_data to improve performance (#16152)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-01-18 14:11:17 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
969faaa410
|
[diffusion] fix: revise fa4 backend to support blackwell (#17077)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-01-14 23:31:46 +08:00 |
|
Yuan Luo
|
feae615b11
|
[VLM] Support ViT CUDA Graph for InternVL (#16732)
|
2026-01-14 17:29:23 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
d1ec93e3ac
|
Optimize layernorm_gated for Qwen3-Next (#16397)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-01-10 20:55:31 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
ad20127359
|
[CI] Remove duplicate code in test_mamba_ut (#16854)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-01-10 16:16:56 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
08636f72b5
|
[Fix CI] Fix test_mamba_unittest.py (#16810)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-01-09 15:03:47 -08:00 |
|
 Yuan Luoandluoyuan.luo
|
53846746bf
|
[VLM] Fix CUDA IPC OOM (#16118)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-01-07 11:30:35 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
5f3eb377e0
|
[VLM] Support request level max_dynamic_patch for OpenAI request (#16268)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-01-04 13:04:43 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
9bd64d739b
|
[VLM] Add doc for ViT CUDA Graph (#16343)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-01-04 10:05:23 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
3a42c5e341
|
[VLM] Adopt jit qk_norm kernel in VLM (#16171)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2026-01-01 10:10:36 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
94bcc19bce
|
[VLM] Support Video for InternVL3_5 (#15942)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-30 17:07:49 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
086813ae8a
|
[VLM] refactor: refactor load_mm_data to improve performance (#14644)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-26 13:17:53 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
b9af8d2eb9
|
[VLM] Support apply qk norm in multi cuda streams (#15720)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-25 14:35:07 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
828dec1c7c
|
[VLM] Tiny: Unify VLM environment variables (#15572)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-22 17:32:37 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
050f108c29
|
Optimize Bailing-MoE with FlashInfer Fused All-Reduce (#15526)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-20 17:34:04 -08:00 |
|
 Yuan Luoandluoyuan.luo
|
019517a356
|
[VLM] Support ViT Piecewise CUDA Graph for Qwen3-VL (#15320)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-20 21:00:07 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
165f5c04cb
|
Optimize MiMo-V2-Flash by flashinfer fused allreduce (#15464)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-20 17:45:18 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
8fa3dc36c5
|
[VLM] Support cos sin cache for Qwen3-VL & GLM-4.1V (#15205)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-18 08:39:50 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
3912ee4991
|
[VLM] feat: support chunked vit attention (#14907)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-15 12:11:02 +08:00 |
|
 
|
3b8a824b8b
|
[VLM] Support VLM ViT Piecewise CUDA Graph (#14422)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
Co-authored-by: kousakawang <wanghanpei@bytedance.com>
|
2025-12-13 20:49:40 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
03836d85d2
|
[GLM-4.6V] Support Pipeline Parallelism for GLM-4.6V & GLM-4.1V (#14720)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-10 16:40:12 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
26d95008b6
|
[apply][2/2] Fused qk_norm_rope for Qwen3-MoE (#13998)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-07 20:25:18 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
b2b09f5f24
|
[VLM] Introduce Cache for positional embedding ids for Qwen-VL family (#14292)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-04 12:32:00 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
21ec99beff
|
[VLM][Doc] Document for VLM DP Encoder (#14279)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-02 15:08:37 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
26aebf83d3
|
[VLM] Support Piecewise CUDA Graph for Qwen3-Omni-MOE (#14222)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-02 10:12:10 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
630a693081
|
[VLM] Boost Memory Pool based CUDA IPC (#14123)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-12-01 17:17:46 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
e12c78aab6
|
[sgl-kernel][1/2] Fused qk_norm_rope for Qwen3-MoE (#14036)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-11-28 12:25:15 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
ca5c8b16f6
|
[VLM] Support InternVL Vision Encoder Data Parallelism (#13925)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-11-26 11:43:05 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
8ef11569a2
|
[VLM] Revise InternVL Piecewise CUDA Graph Supporting (#13846)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-11-24 22:15:10 +08:00 |
|
 
|
f56b9b42e6
|
[Bugfix] Add jit kernel files in packaging (#13829)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
Co-authored-by: Xu Yongfei <xuyongfei.xyf@antgroup.com>
|
2025-11-24 12:32:16 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
5625e32cae
|
[VLM] Replace torch.repeat_interleave with faster np.repeat for Qwen-VL series (#13736)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-11-22 22:45:32 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
475962a139
|
[VLM] Support Piecewise CUDA Graph for InternVL (#13640)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-11-21 13:21:51 +08:00 |
|
 
|
af6bcadcf7
|
[VLM] Support Piecewise CUDA Graph for Qwen2.5-VL (#13055)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
Co-authored-by: Yuhao Yang <yhyang201@gmail.com>
|
2025-11-20 10:23:44 +08:00 |
|
 Yuan Luoandluoyuan.luo
|
f0021c0dc8
|
Add feature flag for mm inputs processing optimization (#13278)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
|
2025-11-15 14:43:44 +08:00 |
|
 
|
706502ff6c
|
[VLM] Support PP for Qwen2.5-VL (#13075)
Co-authored-by: luoyuan.luo <luoyuan.luo@antgroup.com>
Co-authored-by: Tianyu Guo <guoty9@mail2.sysu.edu.cn>
|
2025-11-12 23:18:44 +08:00 |
|