[Runtime] Don't override CUDA_MODULE_LOADING (#35711)

Co-authored-by: TRAE CLI <traecli@bytedance.com>
This commit is contained in:
Hank Han
2026-08-21 14:09:27 -07:00
committed by GitHub
co-authored by TRAE CLI
parent 4d42deff0a
commit 590b11a5ef
-1
View File
@@ -1672,7 +1672,6 @@ def _set_envs_and_config(server_args: ServerArgs):
if server_args.dcp_size > 1:
os.environ["NCCL_GRAPH_MIXING_SUPPORT"] = "0"
os.environ["CUDA_DEVICE_MAX_CONNECTIONS"] = "8"
os.environ["CUDA_MODULE_LOADING"] = "AUTO"
if os.environ.get("TRTLLM_ENABLE_PDL", "1") != "0":
# flashinfer uses this environment variable for various kernels from MoE to quant kernels