[Runtime] Don't override CUDA_MODULE_LOADING (#35711)
Co-authored-by: TRAE CLI <traecli@bytedance.com>
This commit is contained in:
@@ -1672,7 +1672,6 @@ def _set_envs_and_config(server_args: ServerArgs):
|
||||
if server_args.dcp_size > 1:
|
||||
os.environ["NCCL_GRAPH_MIXING_SUPPORT"] = "0"
|
||||
os.environ["CUDA_DEVICE_MAX_CONNECTIONS"] = "8"
|
||||
os.environ["CUDA_MODULE_LOADING"] = "AUTO"
|
||||
|
||||
if os.environ.get("TRTLLM_ENABLE_PDL", "1") != "0":
|
||||
# flashinfer uses this environment variable for various kernels from MoE to quant kernels
|
||||
|
||||
Reference in New Issue
Block a user