[diffusion] feat: allows quality adjustment of generated images/videos (#17937)
This commit is contained in:
@@ -393,3 +393,26 @@ Notes:
|
|||||||
curl -X POST http://localhost:30010/v1/set_lora -d '{"lora_nickname": "lora_b", "lora_path": "path/to/B"}'
|
curl -X POST http://localhost:30010/v1/set_lora -d '{"lora_nickname": "lora_b", "lora_path": "path/to/B"}'
|
||||||
```
|
```
|
||||||
5. Generate with LoRA B...
|
5. Generate with LoRA B...
|
||||||
|
|
||||||
|
### Adjust Output Quality
|
||||||
|
|
||||||
|
The server supports adjusting output quality and compression levels for both image and video generation through the `output-quality` and `output-compression` parameters.
|
||||||
|
|
||||||
|
#### Parameters
|
||||||
|
|
||||||
|
- **`output-quality`** (string, optional): Preset quality level that automatically sets compression. **Default is `"default"`**. Valid values:
|
||||||
|
- `"maximum"`: Highest quality (100)
|
||||||
|
- `"high"`: High quality (90)
|
||||||
|
- `"medium"`: Medium quality (55)
|
||||||
|
- `"low"`: Lower quality (35)
|
||||||
|
- `"default"`: Auto-adjust based on media type (50 for video, 75 for image)
|
||||||
|
|
||||||
|
- **`output-compression`** (integer, optional): Direct compression level override (0-100). **Default is `None`**. When provided (not `None`), takes precedence over `output-quality`.
|
||||||
|
- `0`: Lowest quality, smallest file size
|
||||||
|
- `100`: Highest quality, largest file size
|
||||||
|
|
||||||
|
#### Notes
|
||||||
|
|
||||||
|
- **Precedence**: When both `output-quality` and `output-compression` are provided, `output-compression` takes precedence
|
||||||
|
- **Format Support**: Quality settings apply to JPEG, and video formats. PNG uses lossless compression and ignores these settings
|
||||||
|
- **File Size vs Quality**: Lower compression values (or "low" quality preset) produce smaller files but may show visible artifacts
|
||||||
|
|||||||
@@ -97,6 +97,8 @@ class SamplingParams:
|
|||||||
prompt_path: str | None = None
|
prompt_path: str | None = None
|
||||||
output_path: str | None = None
|
output_path: str | None = None
|
||||||
output_file_name: str | None = None
|
output_file_name: str | None = None
|
||||||
|
output_quality: str | None = "default"
|
||||||
|
output_compression: int | None = None
|
||||||
|
|
||||||
# Batch info
|
# Batch info
|
||||||
num_outputs_per_prompt: int = 1
|
num_outputs_per_prompt: int = 1
|
||||||
@@ -207,6 +209,12 @@ class SamplingParams:
|
|||||||
if self.height is None:
|
if self.height is None:
|
||||||
self.height_not_provided = True
|
self.height_not_provided = True
|
||||||
|
|
||||||
|
# Handle output_quality to output_compression conversion
|
||||||
|
if self.output_compression is None and self.output_quality is not None:
|
||||||
|
self.output_compression = self._adjust_output_quality(
|
||||||
|
self.output_quality, self.data_type
|
||||||
|
)
|
||||||
|
|
||||||
self._validate()
|
self._validate()
|
||||||
|
|
||||||
# Allow env var to override num_inference_steps (for faster CI testing on AMD)
|
# Allow env var to override num_inference_steps (for faster CI testing on AMD)
|
||||||
@@ -214,6 +222,13 @@ class SamplingParams:
|
|||||||
if env_steps is not None and self.num_inference_steps is not None:
|
if env_steps is not None and self.num_inference_steps is not None:
|
||||||
self.num_inference_steps = int(env_steps)
|
self.num_inference_steps = int(env_steps)
|
||||||
|
|
||||||
|
def _adjust_output_quality(self, output_quality: str, data_type: DataType) -> int:
|
||||||
|
"""Convert output_quality string to compression level."""
|
||||||
|
output_quality_mapper = {"maximum": 100, "high": 90, "medium": 55, "low": 35}
|
||||||
|
if output_quality == "default":
|
||||||
|
return 50 if data_type == DataType.VIDEO else 75
|
||||||
|
return output_quality_mapper.get(output_quality)
|
||||||
|
|
||||||
def _validate(self):
|
def _validate(self):
|
||||||
"""
|
"""
|
||||||
check if the sampling params is correct by itself
|
check if the sampling params is correct by itself
|
||||||
@@ -567,6 +582,18 @@ class SamplingParams:
|
|||||||
default=SamplingParams.output_file_name,
|
default=SamplingParams.output_file_name,
|
||||||
help="Name of the output file",
|
help="Name of the output file",
|
||||||
)
|
)
|
||||||
|
parser.add_argument(
|
||||||
|
"--output-quality",
|
||||||
|
type=str,
|
||||||
|
default=SamplingParams.output_quality,
|
||||||
|
help="Output quality setting (default, low, medium, high, maximum)",
|
||||||
|
)
|
||||||
|
parser.add_argument(
|
||||||
|
"--output-compression",
|
||||||
|
type=int,
|
||||||
|
default=SamplingParams.output_compression,
|
||||||
|
help="Output compression level (0-100, higher means better quality but larger file size)",
|
||||||
|
)
|
||||||
parser.add_argument(
|
parser.add_argument(
|
||||||
"--num-outputs-per-prompt",
|
"--num-outputs-per-prompt",
|
||||||
type=int,
|
type=int,
|
||||||
|
|||||||
@@ -277,6 +277,7 @@ class DiffGenerator:
|
|||||||
samples_out=samples_out,
|
samples_out=samples_out,
|
||||||
audios_out=audios_out,
|
audios_out=audios_out,
|
||||||
frames_out=frames_out,
|
frames_out=frames_out,
|
||||||
|
output_compression=req.output_compression,
|
||||||
)
|
)
|
||||||
|
|
||||||
for output_idx in range(len(samples_out)):
|
for output_idx in range(len(samples_out)):
|
||||||
|
|||||||
@@ -22,6 +22,7 @@ from sglang.multimodal_gen.runtime.entrypoints.openai.stores import IMAGE_STORE
|
|||||||
from sglang.multimodal_gen.runtime.entrypoints.openai.utils import (
|
from sglang.multimodal_gen.runtime.entrypoints.openai.utils import (
|
||||||
_parse_size,
|
_parse_size,
|
||||||
add_common_data_to_response,
|
add_common_data_to_response,
|
||||||
|
adjust_output_quality,
|
||||||
merge_image_input_list,
|
merge_image_input_list,
|
||||||
process_generation_batch,
|
process_generation_batch,
|
||||||
save_image_to_path,
|
save_image_to_path,
|
||||||
@@ -63,6 +64,7 @@ def _build_sampling_params_from_request(
|
|||||||
negative_prompt: Optional[str] = None,
|
negative_prompt: Optional[str] = None,
|
||||||
enable_teacache: Optional[bool] = None,
|
enable_teacache: Optional[bool] = None,
|
||||||
num_frames: int = 1,
|
num_frames: int = 1,
|
||||||
|
output_compression: Optional[int] = None,
|
||||||
) -> SamplingParams:
|
) -> SamplingParams:
|
||||||
if size is None:
|
if size is None:
|
||||||
width, height = None, None
|
width, height = None, None
|
||||||
@@ -90,6 +92,11 @@ def _build_sampling_params_from_request(
|
|||||||
**({"guidance_scale": guidance_scale} if guidance_scale is not None else {}),
|
**({"guidance_scale": guidance_scale} if guidance_scale is not None else {}),
|
||||||
**({"negative_prompt": negative_prompt} if negative_prompt is not None else {}),
|
**({"negative_prompt": negative_prompt} if negative_prompt is not None else {}),
|
||||||
**({"true_cfg_scale": true_cfg_scale} if true_cfg_scale is not None else {}),
|
**({"true_cfg_scale": true_cfg_scale} if true_cfg_scale is not None else {}),
|
||||||
|
**(
|
||||||
|
{"output_compression": output_compression}
|
||||||
|
if output_compression is not None
|
||||||
|
else {}
|
||||||
|
),
|
||||||
)
|
)
|
||||||
|
|
||||||
if num_inference_steps is not None:
|
if num_inference_steps is not None:
|
||||||
@@ -122,11 +129,16 @@ async def generations(
|
|||||||
true_cfg_scale=request.true_cfg_scale,
|
true_cfg_scale=request.true_cfg_scale,
|
||||||
negative_prompt=request.negative_prompt,
|
negative_prompt=request.negative_prompt,
|
||||||
enable_teacache=request.enable_teacache,
|
enable_teacache=request.enable_teacache,
|
||||||
|
output_compression=request.output_compression,
|
||||||
)
|
)
|
||||||
batch = prepare_request(
|
batch = prepare_request(
|
||||||
server_args=get_global_server_args(),
|
server_args=get_global_server_args(),
|
||||||
sampling_params=sampling,
|
sampling_params=sampling,
|
||||||
)
|
)
|
||||||
|
if batch.output_compression is None:
|
||||||
|
batch.output_compression = adjust_output_quality(
|
||||||
|
request.output_quality, batch.data_type
|
||||||
|
)
|
||||||
# Add diffusers_kwargs if provided
|
# Add diffusers_kwargs if provided
|
||||||
if request.diffusers_kwargs:
|
if request.diffusers_kwargs:
|
||||||
batch.extra["diffusers_kwargs"] = request.diffusers_kwargs
|
batch.extra["diffusers_kwargs"] = request.diffusers_kwargs
|
||||||
@@ -217,6 +229,8 @@ async def edits(
|
|||||||
guidance_scale: Optional[float] = Form(None),
|
guidance_scale: Optional[float] = Form(None),
|
||||||
true_cfg_scale: Optional[float] = Form(None),
|
true_cfg_scale: Optional[float] = Form(None),
|
||||||
num_inference_steps: Optional[int] = Form(None),
|
num_inference_steps: Optional[int] = Form(None),
|
||||||
|
output_quality: Optional[str] = Form("default"),
|
||||||
|
output_compression: Optional[int] = Form(None),
|
||||||
enable_teacache: Optional[bool] = Form(False),
|
enable_teacache: Optional[bool] = Form(False),
|
||||||
num_frames: int = Form(1),
|
num_frames: int = Form(1),
|
||||||
):
|
):
|
||||||
@@ -264,12 +278,16 @@ async def edits(
|
|||||||
num_inference_steps=num_inference_steps,
|
num_inference_steps=num_inference_steps,
|
||||||
enable_teacache=enable_teacache,
|
enable_teacache=enable_teacache,
|
||||||
num_frames=num_frames,
|
num_frames=num_frames,
|
||||||
|
output_compression=output_compression,
|
||||||
)
|
)
|
||||||
batch = prepare_request(
|
batch = prepare_request(
|
||||||
server_args=get_global_server_args(),
|
server_args=get_global_server_args(),
|
||||||
sampling_params=sampling,
|
sampling_params=sampling,
|
||||||
)
|
)
|
||||||
|
if batch.output_compression is None:
|
||||||
|
batch.output_compression = adjust_output_quality(
|
||||||
|
output_quality, batch.data_type
|
||||||
|
)
|
||||||
save_file_path_list, result = await process_generation_batch(
|
save_file_path_list, result = await process_generation_batch(
|
||||||
async_scheduler_client, batch
|
async_scheduler_client, batch
|
||||||
)
|
)
|
||||||
|
|||||||
@@ -43,6 +43,8 @@ class ImageGenerationsRequest(BaseModel):
|
|||||||
seed: Optional[int] = 1024
|
seed: Optional[int] = 1024
|
||||||
generator_device: Optional[str] = "cuda"
|
generator_device: Optional[str] = "cuda"
|
||||||
negative_prompt: Optional[str] = None
|
negative_prompt: Optional[str] = None
|
||||||
|
output_quality: Optional[str] = "default"
|
||||||
|
output_compression: Optional[int] = None
|
||||||
enable_teacache: Optional[bool] = False
|
enable_teacache: Optional[bool] = False
|
||||||
diffusers_kwargs: Optional[Dict[str, Any]] = None # kwargs for diffusers backend
|
diffusers_kwargs: Optional[Dict[str, Any]] = None # kwargs for diffusers backend
|
||||||
|
|
||||||
@@ -88,6 +90,8 @@ class VideoGenerationsRequest(BaseModel):
|
|||||||
)
|
)
|
||||||
negative_prompt: Optional[str] = None
|
negative_prompt: Optional[str] = None
|
||||||
enable_teacache: Optional[bool] = False
|
enable_teacache: Optional[bool] = False
|
||||||
|
output_quality: Optional[str] = "default"
|
||||||
|
output_compression: Optional[int] = None
|
||||||
output_path: Optional[str] = None
|
output_path: Optional[str] = None
|
||||||
diffusers_kwargs: Optional[Dict[str, Any]] = None # kwargs for diffusers backend
|
diffusers_kwargs: Optional[Dict[str, Any]] = None # kwargs for diffusers backend
|
||||||
|
|
||||||
|
|||||||
@@ -21,6 +21,8 @@ from sglang.multimodal_gen.runtime.utils.logging_utils import (
|
|||||||
|
|
||||||
logger = init_logger(__name__)
|
logger = init_logger(__name__)
|
||||||
|
|
||||||
|
OUTPUT_QUALITY_MAPPER = {"maximum": 100, "high": 90, "medium": 55, "low": 35}
|
||||||
|
|
||||||
|
|
||||||
@dataclasses.dataclass
|
@dataclasses.dataclass
|
||||||
class SetLoraReq:
|
class SetLoraReq:
|
||||||
@@ -237,6 +239,7 @@ async def process_generation_batch(
|
|||||||
),
|
),
|
||||||
audio=result.audio,
|
audio=result.audio,
|
||||||
audio_sample_rate=audio_sample_rate,
|
audio_sample_rate=audio_sample_rate,
|
||||||
|
output_compression=batch.output_compression,
|
||||||
)
|
)
|
||||||
else:
|
else:
|
||||||
save_file_path_list = save_outputs(
|
save_file_path_list = save_outputs(
|
||||||
@@ -251,6 +254,7 @@ async def process_generation_batch(
|
|||||||
)
|
)
|
||||||
),
|
),
|
||||||
audio_sample_rate=audio_sample_rate,
|
audio_sample_rate=audio_sample_rate,
|
||||||
|
output_compression=batch.output_compression,
|
||||||
)
|
)
|
||||||
|
|
||||||
total_time = time.perf_counter() - total_start_time
|
total_time = time.perf_counter() - total_start_time
|
||||||
@@ -302,3 +306,9 @@ def add_common_data_to_response(
|
|||||||
response["id"] = request_id
|
response["id"] = request_id
|
||||||
|
|
||||||
return response
|
return response
|
||||||
|
|
||||||
|
|
||||||
|
def adjust_output_quality(output_quality: str, data_type: DataType = None) -> int:
|
||||||
|
if output_quality == "default":
|
||||||
|
return 50 if data_type == DataType.VIDEO else 75
|
||||||
|
return OUTPUT_QUALITY_MAPPER.get(output_quality, None)
|
||||||
|
|||||||
@@ -32,6 +32,7 @@ from sglang.multimodal_gen.runtime.entrypoints.openai.stores import VIDEO_STORE
|
|||||||
from sglang.multimodal_gen.runtime.entrypoints.openai.utils import (
|
from sglang.multimodal_gen.runtime.entrypoints.openai.utils import (
|
||||||
_parse_size,
|
_parse_size,
|
||||||
add_common_data_to_response,
|
add_common_data_to_response,
|
||||||
|
adjust_output_quality,
|
||||||
merge_image_input_list,
|
merge_image_input_list,
|
||||||
process_generation_batch,
|
process_generation_batch,
|
||||||
save_image_to_path,
|
save_image_to_path,
|
||||||
@@ -88,6 +89,8 @@ def _build_sampling_params_from_request(
|
|||||||
sampling_kwargs["enable_teacache"] = request.enable_teacache
|
sampling_kwargs["enable_teacache"] = request.enable_teacache
|
||||||
if request.output_path is not None:
|
if request.output_path is not None:
|
||||||
sampling_kwargs["output_path"] = request.output_path
|
sampling_kwargs["output_path"] = request.output_path
|
||||||
|
if request.output_compression is not None:
|
||||||
|
sampling_kwargs["output_compression"] = request.output_compression
|
||||||
sampling_params = SamplingParams.from_user_sampling_params_args(
|
sampling_params = SamplingParams.from_user_sampling_params_args(
|
||||||
model_path=server_args.model_path,
|
model_path=server_args.model_path,
|
||||||
server_args=server_args,
|
server_args=server_args,
|
||||||
@@ -173,6 +176,8 @@ async def create_video(
|
|||||||
guidance_scale: Optional[float] = Form(None),
|
guidance_scale: Optional[float] = Form(None),
|
||||||
num_inference_steps: Optional[int] = Form(None),
|
num_inference_steps: Optional[int] = Form(None),
|
||||||
enable_teacache: Optional[bool] = Form(False),
|
enable_teacache: Optional[bool] = Form(False),
|
||||||
|
output_quality: Optional[str] = Form("default"),
|
||||||
|
output_compression: Optional[int] = Form(None),
|
||||||
extra_body: Optional[str] = Form(None),
|
extra_body: Optional[str] = Form(None),
|
||||||
):
|
):
|
||||||
content_type = request.headers.get("content-type", "").lower()
|
content_type = request.headers.get("content-type", "").lower()
|
||||||
@@ -232,6 +237,8 @@ async def create_video(
|
|||||||
negative_prompt=negative_prompt,
|
negative_prompt=negative_prompt,
|
||||||
num_inference_steps=num_inference_steps,
|
num_inference_steps=num_inference_steps,
|
||||||
enable_teacache=enable_teacache,
|
enable_teacache=enable_teacache,
|
||||||
|
output_compression=output_compression,
|
||||||
|
output_quality=output_quality,
|
||||||
**(
|
**(
|
||||||
{"guidance_scale": guidance_scale} if guidance_scale is not None else {}
|
{"guidance_scale": guidance_scale} if guidance_scale is not None else {}
|
||||||
),
|
),
|
||||||
@@ -293,6 +300,10 @@ async def create_video(
|
|||||||
server_args=server_args,
|
server_args=server_args,
|
||||||
sampling_params=sampling_params,
|
sampling_params=sampling_params,
|
||||||
)
|
)
|
||||||
|
if batch.output_compression is None:
|
||||||
|
batch.output_compression = adjust_output_quality(
|
||||||
|
req.output_quality, batch.data_type
|
||||||
|
)
|
||||||
# Add diffusers_kwargs if provided
|
# Add diffusers_kwargs if provided
|
||||||
if req.diffusers_kwargs:
|
if req.diffusers_kwargs:
|
||||||
batch.extra["diffusers_kwargs"] = req.diffusers_kwargs
|
batch.extra["diffusers_kwargs"] = req.diffusers_kwargs
|
||||||
|
|||||||
@@ -266,6 +266,7 @@ def save_outputs(
|
|||||||
samples_out: Optional[list[Any]] = None,
|
samples_out: Optional[list[Any]] = None,
|
||||||
audios_out: Optional[list[Any]] = None,
|
audios_out: Optional[list[Any]] = None,
|
||||||
frames_out: Optional[list[Any]] = None,
|
frames_out: Optional[list[Any]] = None,
|
||||||
|
output_compression: Optional[int] = None,
|
||||||
) -> list[str]:
|
) -> list[str]:
|
||||||
"""Save outputs to files and return the list of file paths."""
|
"""Save outputs to files and return the list of file paths."""
|
||||||
output_paths: list[str] = []
|
output_paths: list[str] = []
|
||||||
@@ -281,6 +282,7 @@ def save_outputs(
|
|||||||
save_output,
|
save_output,
|
||||||
save_file_path,
|
save_file_path,
|
||||||
audio_sample_rate=audio_sample_rate,
|
audio_sample_rate=audio_sample_rate,
|
||||||
|
output_compression=output_compression,
|
||||||
)
|
)
|
||||||
if samples_out is not None:
|
if samples_out is not None:
|
||||||
samples_out.append(sample)
|
samples_out.append(sample)
|
||||||
@@ -307,6 +309,7 @@ def post_process_sample(
|
|||||||
save_output: bool = True,
|
save_output: bool = True,
|
||||||
save_file_path: Optional[str] = None,
|
save_file_path: Optional[str] = None,
|
||||||
audio_sample_rate: Optional[int] = None,
|
audio_sample_rate: Optional[int] = None,
|
||||||
|
output_compression: Optional[int] = None,
|
||||||
):
|
):
|
||||||
"""
|
"""
|
||||||
Process sample output and save video if necessary
|
Process sample output and save video if necessary
|
||||||
@@ -352,8 +355,9 @@ def post_process_sample(
|
|||||||
if save_file_path:
|
if save_file_path:
|
||||||
os.makedirs(os.path.dirname(save_file_path), exist_ok=True)
|
os.makedirs(os.path.dirname(save_file_path), exist_ok=True)
|
||||||
if data_type == DataType.VIDEO:
|
if data_type == DataType.VIDEO:
|
||||||
# TODO: make this configurable
|
quality = (
|
||||||
quality = 5
|
output_compression / 10 if output_compression is not None else 5
|
||||||
|
)
|
||||||
imageio.mimsave(
|
imageio.mimsave(
|
||||||
save_file_path,
|
save_file_path,
|
||||||
frames,
|
frames,
|
||||||
@@ -372,7 +376,7 @@ def post_process_sample(
|
|||||||
)
|
)
|
||||||
|
|
||||||
else:
|
else:
|
||||||
quality = 75
|
quality = output_compression if output_compression is not None else 75
|
||||||
if len(frames) > 1:
|
if len(frames) > 1:
|
||||||
for i, image in enumerate(frames):
|
for i, image in enumerate(frames):
|
||||||
parts = save_file_path.rsplit(".", 1)
|
parts = save_file_path.rsplit(".", 1)
|
||||||
|
|||||||
@@ -227,6 +227,7 @@ class GPUWorker:
|
|||||||
lambda idx: req.output_file_path(len(output_batch.output), idx),
|
lambda idx: req.output_file_path(len(output_batch.output), idx),
|
||||||
audio=output_batch.audio,
|
audio=output_batch.audio,
|
||||||
audio_sample_rate=output_batch.audio_sample_rate,
|
audio_sample_rate=output_batch.audio_sample_rate,
|
||||||
|
output_compression=req.output_compression,
|
||||||
)
|
)
|
||||||
output_batch.output_file_paths = output_paths
|
output_batch.output_file_paths = output_paths
|
||||||
output_batch.output = None
|
output_batch.output = None
|
||||||
|
|||||||
Reference in New Issue
Block a user