Logo
Explore Help
Register Sign In
minke.yu/sglang
Watch 1
Star 0
Fork 0
Code Issues Pull Requests Actions 12 Packages Projects Releases Wiki Activity
16,391 Commits 3 Branches 0 Tags
8a7c8a72d64bce8731c40c45992ea349f966fad4
Commit Graph
8 Commits
This Branch
This Branch
All Branches
Author SHA1 Message Date
Po-Han Huang (NVIDIA) bae29f716a Fix inference mode mismatch in FlashInfer warmup (#33788) 2026-08-06 16:11:41 -07:00
Po-Han Huang (NVIDIA) 7eb27372b3 fix(server): capture legal multi-request prefill CUDA graph batches (#30206) 2026-08-03 16:56:59 -07:00
Po-Han Huang (NVIDIA) 5df193b4ac [Speculative Decoding] Fix GPT-OSS EAGLE3 hidden states (#32334) 2026-07-31 11:58:49 -07:00
Po-Han Huang (NVIDIA) 5d004a20c5 Fix FlashInfer A2A top-k ID dtype (#29929) 2026-07-15 17:56:11 -07:00
Po-Han Huang (NVIDIA) cfc3d0555e Fix ModelOpt NVFP4 scalar scales for merged linears (#29151) 2026-07-13 16:14:20 -07:00
Po-Han Huang (NVIDIA) 17cce6a85f Fix shared logits buffer for reduced-vocab draft models (#29943) 2026-07-02 16:08:56 -07:00
Po-Han Huang (NVIDIA) 72812db138 Avoid dynamic Q quantization in trtllm_mha (#29423) 2026-06-26 15:51:15 -07:00
Po-Han Huang (NVIDIA)andClaude Opus 4.6 ada52e5972 [Docs] Move ptxas sm_103a workaround into For CUDA 13 section (#22852)
Co-authored-by: Claude Opus 4.6 (1M context) <noreply@anthropic.com>
2026-04-14 22:30:21 -07:00
Powered by Gitea Version: 1.27.3 Page: 342ms Template: 4ms
GitHub Default Auto
English
Bahasa Indonesia Deutsch English Español Français Gaeilge Italiano Latviešu Magyar nyelv Nederlands Polski Português de Portugal Português do Brasil Suomi Svenska Türkçe Čeština Ελληνικά Български Русский Українська فارسی മലയാളം 日本語 简体中文 繁體中文(台灣) 繁體中文(香港) 한국어
Licenses API