From 87a27682693e261e32bf0163c1ac8b7021def908 Mon Sep 17 00:00:00 2001 From: Xinyuan Tong <115166877+JustinTong0323@users.noreply.github.com> Date: Wed, 1 Apr 2026 07:29:59 +0100 Subject: [PATCH] VLM: change default mm-attention backend from triton_attn to fa4 (on blackwell) (#21595) --- python/sglang/srt/layers/attention/vision.py | 6 +++++- 1 file changed, 5 insertions(+), 1 deletion(-) diff --git a/python/sglang/srt/layers/attention/vision.py b/python/sglang/srt/layers/attention/vision.py index 087e76baf..4c3f9e2f2 100644 --- a/python/sglang/srt/layers/attention/vision.py +++ b/python/sglang/srt/layers/attention/vision.py @@ -888,7 +888,9 @@ class VisionAttention(nn.Module): Priority: server args override > constructor arg > platform default. Platform defaults: - - CUDA: "triton_attn" + - CUDA (Hopper SM90): "fa3" + - CUDA (Blackwell SM100): "fa4" + - CUDA (other): "triton_attn" - Non-CUDA: "sdpa" """ override_backend = get_global_server_args().mm_attention_backend @@ -900,6 +902,8 @@ class VisionAttention(nn.Module): major, minor = get_device_capability() if major == 9: backend = "fa3" + elif major == 10: + backend = "fa4" else: backend = "triton_attn" elif _is_hip: