From 590b11a5efb55a11082eda9249d95f889e26440e Mon Sep 17 00:00:00 2001 From: Hank Han Date: Sat, 22 Aug 2026 05:09:27 +0800 Subject: [PATCH] [Runtime] Don't override CUDA_MODULE_LOADING (#35711) Co-authored-by: TRAE CLI --- python/sglang/srt/entrypoints/engine.py | 1 - 1 file changed, 1 deletion(-) diff --git a/python/sglang/srt/entrypoints/engine.py b/python/sglang/srt/entrypoints/engine.py index ca2c429fc..5e8c2fc8b 100644 --- a/python/sglang/srt/entrypoints/engine.py +++ b/python/sglang/srt/entrypoints/engine.py @@ -1672,7 +1672,6 @@ def _set_envs_and_config(server_args: ServerArgs): if server_args.dcp_size > 1: os.environ["NCCL_GRAPH_MIXING_SUPPORT"] = "0" os.environ["CUDA_DEVICE_MAX_CONNECTIONS"] = "8" - os.environ["CUDA_MODULE_LOADING"] = "AUTO" if os.environ.get("TRTLLM_ENABLE_PDL", "1") != "0": # flashinfer uses this environment variable for various kernels from MoE to quant kernels