From 794fdd39ef3dc347b0d7fc1c8765a55522b59bef Mon Sep 17 00:00:00 2001 From: hanwlax <278915462+hanwlax@users.noreply.github.com> Date: Thu, 28 May 2026 15:26:13 +0800 Subject: [PATCH] fix: adapt dots_vlm for transformers v5 (#25829) --- python/sglang/srt/multimodal/processors/dots_vlm.py | 12 ++++++++++-- 1 file changed, 10 insertions(+), 2 deletions(-) diff --git a/python/sglang/srt/multimodal/processors/dots_vlm.py b/python/sglang/srt/multimodal/processors/dots_vlm.py index bc269cdae..66fd62762 100644 --- a/python/sglang/srt/multimodal/processors/dots_vlm.py +++ b/python/sglang/srt/multimodal/processors/dots_vlm.py @@ -33,8 +33,16 @@ class DotsVLMImageProcessor(BaseMultimodalProcessor): merge_size = vision_config.spatial_merge_size self.IMAGE_FACTOR = patch_size * merge_size - self.MIN_PIXELS = _processor.image_processor.min_pixels - self.MAX_PIXELS = _processor.image_processor.max_pixels + self.MIN_PIXELS = getattr( + _processor.image_processor, + "min_pixels", + getattr(_processor.image_processor, "size", {}).get("shortest_edge"), + ) + self.MAX_PIXELS = getattr( + _processor.image_processor, + "max_pixels", + getattr(_processor.image_processor, "size", {}).get("longest_edge"), + ) self.MAX_RATIO = 200 self.mm_tokens = MultimodalSpecialTokens( image_token=self.IMAGE_TOKEN,