 satyamk7054andSatyam Kumar
|
6d8330bdb7
|
Update CI_PERMISSIONS.json (#22465)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
|
2026-04-10 13:43:50 -07:00 |
|
 satyamk7054andSatyam Kumar
|
059b287e25
|
Add offline auto-tuning for LoRA CSGMV kernel (#20391)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
|
2026-04-10 13:10:43 -07:00 |
|
 satyamk7054andSatyam Kumar
|
be0cca5596
|
Use torch.addmm instead of separate mm and add_ calls for LoRA torch.native (#20562)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
|
2026-03-26 14:35:20 -07:00 |
|
 satyamk7054andSatyam Kumar
|
e59ea4f6e9
|
fix: torch-native LoRA for multi-adapter case (#20564)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
|
2026-03-26 14:34:16 -07:00 |
|
 satyamk7054andSatyam Kumar
|
a54d71e967
|
[Benchmark] Add sglang-embedding backend to bench_serving (#20017)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
|
2026-03-11 13:13:16 -07:00 |
|
 satyamk7054andSatyam Kumar
|
963def7f26
|
Move lora request validation to tokenizer_manager from server (#18962)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
|
2026-02-19 21:03:19 +08:00 |
|
 satyamk7054andSatyam Kumar
|
355127c2e9
|
Fix benchmark_sglang_fused_moe_triton.py (#18940)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
|
2026-02-17 17:25:37 -05:00 |
|
satyamk7054
|
793bf9fc06
|
Update weight rename check for Qwen3 Embeddings (#17535)
|
2026-02-03 13:55:11 -08:00 |
|
 satyamk7054andSatyam Kumar
|
38dd4fbb66
|
Add overlap scheduling for embeddings code path (#14032)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
|
2025-12-24 18:24:18 -08:00 |
|
 satyamk7054andSatyam Kumar
|
9fc3e8aac7
|
Add support for Matryoshka embeddings (#126) (#11142)
Co-authored-by: Satyam Kumar <satyamk@linkedin.com>
|
2025-10-28 02:49:36 +08:00 |
|