From 46c8a597ef5f37b334be0cdfedce4ca7517158c4 Mon Sep 17 00:00:00 2001 From: Piotr Mazurek Date: Wed, 15 Apr 2026 03:13:25 +0200 Subject: [PATCH] [VLM] fix LFM2-VL offline inference and GPU JPEG decode (#22448) --- python/sglang/srt/models/lfm2_vl.py | 2 +- python/sglang/srt/multimodal/processors/lfm2_vl.py | 1 + 2 files changed, 2 insertions(+), 1 deletion(-) diff --git a/python/sglang/srt/models/lfm2_vl.py b/python/sglang/srt/models/lfm2_vl.py index eaa8ac23f..2a209f8e5 100644 --- a/python/sglang/srt/models/lfm2_vl.py +++ b/python/sglang/srt/models/lfm2_vl.py @@ -274,7 +274,7 @@ class Lfm2VlForConditionalGeneration(nn.Module): return projected_packed - @torch.inference_mode() + @torch.no_grad() def forward( self, input_ids: torch.Tensor, diff --git a/python/sglang/srt/multimodal/processors/lfm2_vl.py b/python/sglang/srt/multimodal/processors/lfm2_vl.py index 0d57dd9dd..c80720651 100644 --- a/python/sglang/srt/multimodal/processors/lfm2_vl.py +++ b/python/sglang/srt/multimodal/processors/lfm2_vl.py @@ -32,6 +32,7 @@ class Lfm2VlImageProcessor(SGLangBaseProcessor): """ models = [Lfm2VlForConditionalGeneration] + gpu_image_decode = False def __init__(self, hf_config, server_args, _processor, *args, **kwargs): super().__init__(hf_config, server_args, _processor, *args, **kwargs)