docker: fix CUDA-13 build — rename NCCL_VERSION ARG to avoid base image ENV collision (#35587)
This commit is contained in:
+7
-3
@@ -9,7 +9,7 @@ ARG SGL_VERSION
|
||||
ARG SGL_DEEP_GEMM_VERSION=0.1.5.post2
|
||||
ARG USE_LATEST_SGLANG=0
|
||||
ARG GDRCOPY_VERSION=2.5.1
|
||||
ARG NCCL_VERSION=2.30.7
|
||||
ARG SGL_NCCL_VERSION=2.30.7
|
||||
ARG PIP_DEFAULT_INDEX
|
||||
ARG UBUNTU_MIRROR
|
||||
ARG GITHUB_ARTIFACTORY=github.com
|
||||
@@ -173,7 +173,11 @@ ARG CUDA_VERSION
|
||||
ARG BUILD_TYPE
|
||||
ARG SGL_KERNEL_VERSION
|
||||
ARG GITHUB_ARTIFACTORY
|
||||
ARG NCCL_VERSION
|
||||
# Renamed from NCCL_VERSION: the nvidia/cuda base image sets ENV NCCL_VERSION
|
||||
# (Debian apt format, e.g. 2.28.3-1), which shadows a same-named ARG inside RUN,
|
||||
# so the CUDA-13 nvidia-nccl-cu13 pip install below resolved an invalid PyPI
|
||||
# version. A distinct ARG name avoids the collision.
|
||||
ARG SGL_NCCL_VERSION
|
||||
|
||||
WORKDIR /sgl-workspace
|
||||
|
||||
@@ -251,7 +255,7 @@ RUN --mount=type=cache,target=/root/.cache/pip \
|
||||
&& python3 -m pip install --extra-index-url https://download.pytorch.org/whl/cu${CUINDEX} ".[${BUILD_TYPE}]" \
|
||||
&& if [ "${CUDA_VERSION%%.*}" = "13" ]; then \
|
||||
python3 -m pip install --force-reinstall --no-deps \
|
||||
"nvidia-nccl-cu13==${NCCL_VERSION}"; \
|
||||
"nvidia-nccl-cu13==${SGL_NCCL_VERSION}"; \
|
||||
fi \
|
||||
&& if [ "${CUDA_VERSION%%.*}" = "12" ]; then \
|
||||
pip list --format=freeze | awk -F'==' '/-cu13(==|$)/ {print $1}' \
|
||||
|
||||
Reference in New Issue
Block a user