config: stop handing the record to code that does not read it (#36252)
This commit is contained in:
@@ -57,7 +57,6 @@ class TestDisaggregationServerWarmup(unittest.IsolatedAsyncioTestCase):
|
||||
|
||||
with patch("sglang.srt.entrypoints.http_server.aiohttp.ClientSession", Session):
|
||||
status_codes = await _send_disaggregation_warmup_requests(
|
||||
server_args=server_args,
|
||||
url="http://localhost:30000",
|
||||
headers={"Authorization": "Bearer token"},
|
||||
ssl_verify=False,
|
||||
|
||||
@@ -1200,10 +1200,6 @@ class TestMlxOverlapScheduler(unittest.TestCase):
|
||||
disaggregation_mode=None,
|
||||
enable_overlap=False,
|
||||
enable_overlap_mlx=False,
|
||||
server_args=SimpleNamespace(
|
||||
disaggregation_decode_enable_offload_kvcache=False,
|
||||
enable_hisparse=False,
|
||||
),
|
||||
model_config=None,
|
||||
token_to_kv_pool_allocator=None,
|
||||
tree_cache=tree_cache,
|
||||
|
||||
@@ -31,10 +31,6 @@ def _make_processor(case, server_mode: str = "full") -> SchedulerBatchResultProc
|
||||
disaggregation_mode=None,
|
||||
enable_overlap=False,
|
||||
enable_overlap_mlx=False,
|
||||
server_args=SimpleNamespace(
|
||||
enable_metrics=False,
|
||||
enable_hisparse=False,
|
||||
),
|
||||
model_config=SimpleNamespace(think_end_ids=None),
|
||||
token_to_kv_pool_allocator=Mock(),
|
||||
tree_cache=None,
|
||||
|
||||
@@ -60,7 +60,6 @@ def _make_processor() -> SchedulerBatchResultProcessor:
|
||||
disaggregation_mode=None,
|
||||
enable_overlap=True,
|
||||
enable_overlap_mlx=False,
|
||||
server_args=SimpleNamespace(),
|
||||
model_config=SimpleNamespace(think_end_ids=None),
|
||||
token_to_kv_pool_allocator=MagicMock(),
|
||||
tree_cache=SimpleNamespace(page_size=TRACK_INTERVAL),
|
||||
|
||||
@@ -65,7 +65,6 @@ def _make_processor() -> SchedulerBatchResultProcessor:
|
||||
disaggregation_mode=None,
|
||||
enable_overlap=False,
|
||||
enable_overlap_mlx=False,
|
||||
server_args=SimpleNamespace(enable_metrics=False),
|
||||
model_config=SimpleNamespace(think_end_ids=None),
|
||||
token_to_kv_pool_allocator=None,
|
||||
tree_cache=None,
|
||||
|
||||
@@ -81,21 +81,20 @@ class TestBaseProcessorConfigExtraction(CustomTestCase):
|
||||
BaseMultimodalProcessor,
|
||||
)
|
||||
|
||||
# The multimodal config comes from the bags.
|
||||
override = get_context().override_server_args(
|
||||
mm_process_config=mm_process_config,
|
||||
allowed_media_domains=[],
|
||||
mm_processor_worker_num=mm_processor_worker_num,
|
||||
mm_io_worker_num=mm_io_worker_num,
|
||||
mm_preprocess_cache_size_mb=None,
|
||||
tokenizer_worker_num=1,
|
||||
trust_mm_content_hashes=False,
|
||||
media_url_max_file_size_mb=64,
|
||||
)
|
||||
override.install()
|
||||
self.addCleanup(override.restore)
|
||||
|
||||
server_args = MagicMock()
|
||||
server_args.mm_processor_worker_num = mm_processor_worker_num
|
||||
server_args.mm_io_worker_num = mm_io_worker_num
|
||||
server_args.mm_preprocess_cache_size_mb = None
|
||||
server_args.tokenizer_worker_num = 1
|
||||
server_args.trust_mm_content_hashes = False
|
||||
server_args.media_url_max_file_size_mb = 64
|
||||
|
||||
hf_config = MagicMock()
|
||||
mock_hf_processor = MagicMock()
|
||||
|
||||
+1
-2
@@ -209,8 +209,7 @@ class TestStartupWeightLoadSelector(CustomTestCase):
|
||||
# The parallel sizes come from the bags, so the config has to be published.
|
||||
publish(server_args, role="test")
|
||||
self.addCleanup(reset_context)
|
||||
options = StartupWeightLoadOptions.from_server_args(
|
||||
server_args=server_args,
|
||||
options = StartupWeightLoadOptions.from_published_config(
|
||||
is_draft_worker=False,
|
||||
)
|
||||
|
||||
|
||||
@@ -648,6 +648,14 @@ def _k3_preprocess_config(
|
||||
)
|
||||
def test_kimi_processor_workers_clone_the_gpu_wrapper(processor_cls, wrapper_cls):
|
||||
server_args = SimpleNamespace(
|
||||
base_gpu_id=0,
|
||||
rl_on_policy_target=None,
|
||||
tp_size=1,
|
||||
)
|
||||
with get_context().override_server_args(
|
||||
mm_feature_transport="cpu",
|
||||
mm_process_config={},
|
||||
allowed_media_domains=[],
|
||||
image_processor_backend="auto",
|
||||
disable_fast_image_processor=False,
|
||||
skip_tokenizer_init=False,
|
||||
@@ -656,13 +664,7 @@ def test_kimi_processor_workers_clone_the_gpu_wrapper(processor_cls, wrapper_cls
|
||||
tokenizer_worker_num=1,
|
||||
mm_preprocess_cache_size_mb=0,
|
||||
trust_mm_content_hashes=False,
|
||||
base_gpu_id=0,
|
||||
rl_on_policy_target=None,
|
||||
media_url_max_file_size_mb=64,
|
||||
)
|
||||
# The multimodal config comes from the bags.
|
||||
with get_context().override_server_args(
|
||||
mm_feature_transport="cpu", mm_process_config={}, allowed_media_domains=[]
|
||||
):
|
||||
processor = processor_cls(
|
||||
hf_config=SimpleNamespace(media_placeholder_token_id=42),
|
||||
|
||||
@@ -89,14 +89,15 @@ def make_processor(case, config, image_processor_cls=None):
|
||||
allowed_media_domains=[],
|
||||
media_url_max_file_size_mb=64,
|
||||
)
|
||||
# The processor reads its media policy, transport and per-modality limits
|
||||
# from the mm bag, so the fixture publishes before building it.
|
||||
# Left at the default backend, the fast image processor sends the tensor to
|
||||
# `cuda:<base_gpu_id>`, which a CPU-only host cannot do.
|
||||
publish(
|
||||
ServerArgs(
|
||||
model_path="dummy",
|
||||
mm_feature_transport=server_args.mm_feature_transport,
|
||||
mm_process_config=server_args.mm_process_config,
|
||||
allowed_media_domains=server_args.allowed_media_domains,
|
||||
disable_fast_image_processor=server_args.disable_fast_image_processor,
|
||||
),
|
||||
role="tokenizer",
|
||||
)
|
||||
|
||||
@@ -134,14 +134,13 @@ class TestDraftPerRunnerConfig(CustomTestCase):
|
||||
|
||||
def test_an_unresolved_draft_falls_back_to_the_config_field(self):
|
||||
"""The v2 workers pass no backend: --speculative-draft-attention-backend."""
|
||||
server_args = self._seed(
|
||||
self._seed(
|
||||
attention_backend="fa3", speculative_draft_attention_backend="triton"
|
||||
)
|
||||
|
||||
def effective(*, is_draft_worker, passed=None):
|
||||
return resolve_draft_attention_backend(
|
||||
draft_attention_backend=passed,
|
||||
server_args=server_args,
|
||||
is_draft_worker=is_draft_worker,
|
||||
)
|
||||
|
||||
|
||||
@@ -137,7 +137,6 @@ _PASSED = frozenset({"model_path", "device", "random_seed"})
|
||||
_EXPOSED = {
|
||||
("dllm/config.py", "max_running_requests"),
|
||||
("dllm/config.py", "model_path"),
|
||||
("multimodal/processors/base_processor.py", "image_processor_backend"),
|
||||
("speculative/spec_registry.py", "disable_overlap_schedule"),
|
||||
("disaggregation/encoder/server.py", "model_loader_extra_config"),
|
||||
("layers/moe/utils.py", "deepep_mode"),
|
||||
@@ -165,8 +164,6 @@ _EXPOSED = {
|
||||
("entrypoints/engine.py", "enable_symm_mem"),
|
||||
("entrypoints/engine.py", "reasoning_parser"),
|
||||
("entrypoints/engine.py", "tool_call_parser"),
|
||||
("eplb/eplb_manager.py", "ep_dispatch_algorithm"),
|
||||
("eplb/eplb_manager.py", "expert_distribution_recorder_buffer_size"),
|
||||
("layers/cp/base.py", "attn_cp_size"),
|
||||
("layers/cp/base.py", "cp_strategy"),
|
||||
("layers/cp/base.py", "enable_prefill_cp"),
|
||||
@@ -178,11 +175,9 @@ _EXPOSED = {
|
||||
("layers/moe/utils.py", "moe_runner_backend"),
|
||||
("layers/moe/utils.py", "quantization"),
|
||||
("layers/moe/utils.py", "speculative_moe_runner_backend"),
|
||||
("lora/lora_manager.py", "enable_lora_overlap_loading"),
|
||||
("lora/marlin_lora_temp/policy.py", "lora_paths"),
|
||||
("model_loader/expert_pack_runtime.py", "model_path"),
|
||||
("model_loader/expert_pack_runtime.py", "tokenizer_path"),
|
||||
("multimodal/processors/base_processor.py", "image_processor_backend"),
|
||||
("parser/template_detection.py", "model_path"),
|
||||
("speculative/adaptive_spec_params.py", "speculative_algorithm"),
|
||||
("speculative/adaptive_spec_params.py", "speculative_eagle_topk"),
|
||||
|
||||
Reference in New Issue
Block a user