Commit Graph
10 Commits
Author SHA1 Message Date
satyamk7054andSatyam Kumar 6d8330bdb7 Update CI_PERMISSIONS.json (#22465)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
2026-04-10 13:43:50 -07:00
satyamk7054andSatyam Kumar 059b287e25 Add offline auto-tuning for LoRA CSGMV kernel (#20391)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
2026-04-10 13:10:43 -07:00
satyamk7054andSatyam Kumar be0cca5596 Use torch.addmm instead of separate mm and add_ calls for LoRA torch.native (#20562)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
2026-03-26 14:35:20 -07:00
satyamk7054andSatyam Kumar e59ea4f6e9 fix: torch-native LoRA for multi-adapter case (#20564)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
2026-03-26 14:34:16 -07:00
satyamk7054andSatyam Kumar a54d71e967 [Benchmark] Add sglang-embedding backend to bench_serving (#20017)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
2026-03-11 13:13:16 -07:00
satyamk7054andSatyam Kumar 963def7f26 Move lora request validation to tokenizer_manager from server (#18962)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
2026-02-19 21:03:19 +08:00
satyamk7054andSatyam Kumar 355127c2e9 Fix benchmark_sglang_fused_moe_triton.py (#18940)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
2026-02-17 17:25:37 -05:00
satyamk7054 793bf9fc06 Update weight rename check for Qwen3 Embeddings (#17535) 2026-02-03 13:55:11 -08:00
satyamk7054andSatyam Kumar 38dd4fbb66 Add overlap scheduling for embeddings code path (#14032)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
2025-12-24 18:24:18 -08:00
satyamk7054andSatyam Kumar 9fc3e8aac7 Add support for Matryoshka embeddings (#126) (#11142)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
2025-10-28 02:49:36 +08:00