diff --git a/backend/python/qwen-tts/install.sh b/backend/python/qwen-tts/install.sh index b7d487873f78..9c8bcf83f39c 100755 --- a/backend/python/qwen-tts/install.sh +++ b/backend/python/qwen-tts/install.sh @@ -10,4 +10,11 @@ else source $backend_dir/../common/libbackend.sh fi +# CUDA 13 has no prebuilt FlashAttention wheel, so the fallback source build +# exceeds the CI runner's memory when ninja compiles multiple units at once. +if [ "x${BUILD_PROFILE}" = "xcublas13" ]; then + export MAX_JOBS="${MAX_JOBS:-1}" + export NVCC_THREADS="${NVCC_THREADS:-1}" +fi + installRequirements diff --git a/backend/python/qwen-tts/requirements-cublas13-after.txt b/backend/python/qwen-tts/requirements-cublas13-after.txt new file mode 100644 index 000000000000..d0f50993616a --- /dev/null +++ b/backend/python/qwen-tts/requirements-cublas13-after.txt @@ -0,0 +1 @@ +flash-attn diff --git a/backend/python/qwen-tts/test.sh b/backend/python/qwen-tts/test.sh index eb59f2aaf3f3..97ea2faf916d 100755 --- a/backend/python/qwen-tts/test.sh +++ b/backend/python/qwen-tts/test.sh @@ -2,6 +2,15 @@ set -e backend_dir=$(dirname $0) + +for cuda_version in 12 13; do + grep -qx "flash-attn" "$backend_dir/requirements-cublas${cuda_version}-after.txt" +done + +grep -q 'BUILD_PROFILE.*cublas13' "$backend_dir/install.sh" +grep -q 'MAX_JOBS.*1' "$backend_dir/install.sh" +grep -q 'NVCC_THREADS.*1' "$backend_dir/install.sh" + if [ -d $backend_dir/common ]; then source $backend_dir/common/libbackend.sh else