diff --git a/python/sglang/multimodal_gen/configs/pipeline_configs/flux.py b/python/sglang/multimodal_gen/configs/pipeline_configs/flux.py index 198ff7d0f..876c233ed 100644 --- a/python/sglang/multimodal_gen/configs/pipeline_configs/flux.py +++ b/python/sglang/multimodal_gen/configs/pipeline_configs/flux.py @@ -48,6 +48,7 @@ class FluxPipelineConfig(ImagePipelineConfig): dit_config: DiTConfig = field(default_factory=FluxConfig) # VAE vae_config: VAEConfig = field(default_factory=FluxVAEConfig) + vae_precision: str = "bf16" enable_autocast: bool = False diff --git a/python/sglang/multimodal_gen/configs/pipeline_configs/ltx_2.py b/python/sglang/multimodal_gen/configs/pipeline_configs/ltx_2.py index f425289f2..254946865 100644 --- a/python/sglang/multimodal_gen/configs/pipeline_configs/ltx_2.py +++ b/python/sglang/multimodal_gen/configs/pipeline_configs/ltx_2.py @@ -179,8 +179,9 @@ class LTX2PipelineConfig(PipelineConfig): # Audio VAE configuration vae_config: LTXVideoVAEConfig = field(default_factory=LTXVideoVAEConfig) + vae_precision: str = "bf16" audio_vae_config: LTXAudioVAEConfig = field(default_factory=LTXAudioVAEConfig) - audio_vae_precision: str = "fp32" + audio_vae_precision: str = "bf16" @property def vae_scale_factor(self): diff --git a/python/sglang/multimodal_gen/configs/pipeline_configs/mova.py b/python/sglang/multimodal_gen/configs/pipeline_configs/mova.py index 5de1ccf44..851dfb8c5 100644 --- a/python/sglang/multimodal_gen/configs/pipeline_configs/mova.py +++ b/python/sglang/multimodal_gen/configs/pipeline_configs/mova.py @@ -38,8 +38,9 @@ class MOVAPipelineConfig(PipelineConfig): # Video VAE (Wan) + Audio VAE (DAC) vae_config: WanVAEConfig = field(default_factory=WanVAEConfig) + vae_precision: str = "bf16" audio_vae_config: DacVAEConfig = field(default_factory=DacVAEConfig) - audio_vae_precision: str = "fp32" + audio_vae_precision: str = "bf16" # Text encoder (UMT5 compatible) text_encoder_configs: tuple = field(default_factory=lambda: (T5Config(),)) diff --git a/python/sglang/multimodal_gen/configs/pipeline_configs/qwen_image.py b/python/sglang/multimodal_gen/configs/pipeline_configs/qwen_image.py index 7b0eeed7e..4048ccdfc 100644 --- a/python/sglang/multimodal_gen/configs/pipeline_configs/qwen_image.py +++ b/python/sglang/multimodal_gen/configs/pipeline_configs/qwen_image.py @@ -148,6 +148,8 @@ class QwenImagePipelineConfig(QwenImageRolloutPipelineMixin, ImagePipelineConfig vae_sp: bool = False + vae_precision: str = "bf16" + dit_config: DiTConfig = field(default_factory=QwenImageDitConfig) # VAE vae_config: VAEConfig = field(default_factory=QwenImageVAEConfig) diff --git a/python/sglang/multimodal_gen/configs/pipeline_configs/zimage.py b/python/sglang/multimodal_gen/configs/pipeline_configs/zimage.py index a7e3dbd35..441c78abf 100644 --- a/python/sglang/multimodal_gen/configs/pipeline_configs/zimage.py +++ b/python/sglang/multimodal_gen/configs/pipeline_configs/zimage.py @@ -67,6 +67,7 @@ class ZImagePipelineConfig(ZImageRolloutPipelineMixin, ImagePipelineConfig): task_type: ModelTaskType = ModelTaskType.T2I dit_config: DiTConfig = field(default_factory=ZImageDitConfig) vae_config: VAEConfig = field(default_factory=FluxVAEConfig) + vae_precision: str = "bf16" text_encoder_precisions: tuple[str, ...] = field(default_factory=lambda: ("bf16",)) text_encoder_configs: tuple[EncoderConfig, ...] = field( default_factory=lambda: (Qwen3TextConfig(),) diff --git a/python/sglang/multimodal_gen/test/test_utils.py b/python/sglang/multimodal_gen/test/test_utils.py index de63df221..54a3d6c13 100644 --- a/python/sglang/multimodal_gen/test/test_utils.py +++ b/python/sglang/multimodal_gen/test/test_utils.py @@ -33,7 +33,7 @@ if TYPE_CHECKING: logger = init_logger(__name__) -SGL_TEST_FILES_CI_DATA_REVISION = "3ca3bad088ecc9ef80947d85c551cd335c75b87f" +SGL_TEST_FILES_CI_DATA_REVISION = "c8305f1dd8cc82197f36c17d0f503adc94016cc7" SGL_TEST_FILES_CONSISTENCY_GT_ROOT = ( "https://raw.githubusercontent.com/" f"sgl-project/ci-data/{SGL_TEST_FILES_CI_DATA_REVISION}/"