diff --git a/.github/workflows/code-scans.yaml b/.github/workflows/code-scans.yaml index d6aaecd2..14046c9d 100644 --- a/.github/workflows/code-scans.yaml +++ b/.github/workflows/code-scans.yaml @@ -52,7 +52,7 @@ jobs: continue-on-error: true with: scan-type: 'image' - image-ref: 'vllm/vllm-openai-cpu:v0.21.0' + image-ref: 'vllm/vllm-openai-cpu:v0.24.0' severity: 'HIGH,CRITICAL' exit-code: 0 format: 'table' diff --git a/core/helm-charts/vllm/values.yaml b/core/helm-charts/vllm/values.yaml index cf384277..264806d7 100644 --- a/core/helm-charts/vllm/values.yaml +++ b/core/helm-charts/vllm/values.yaml @@ -25,7 +25,7 @@ image: # Uncomment the following line to set desired image pull policy if needed, as one of Always, IfNotPresent, Never. # pullPolicy: "" # Overrides the image tag whose default is the chart appVersion. - tag: "v0.21.0" + tag: "v0.24.0" imagePullSecrets: [] nameOverride: "" diff --git a/core/helm-charts/vllm/xeon-values.yaml b/core/helm-charts/vllm/xeon-values.yaml index 2e7f2beb..5f5c23ca 100644 --- a/core/helm-charts/vllm/xeon-values.yaml +++ b/core/helm-charts/vllm/xeon-values.yaml @@ -27,7 +27,7 @@ max_model_len: 8192 # vLLM CPU image configuration image: repository: vllm/vllm-openai-cpu - tag: "v0.21.0" + tag: "v0.24.0" pullPolicy: IfNotPresent # Node affinity for Xeon inference nodes @@ -59,6 +59,7 @@ modelConfigs: HF_HUB_DISABLE_XET: "1" VLLM_CPU_SGL_KERNEL: "1" USER: "vllm" + TRITON_CACHE_DIR: "/tmp/.triton" extraCmdArgs: [ "--block-size", @@ -91,6 +92,7 @@ modelConfigs: VLLM_CPU_SGL_KERNEL: "1" HF_HUB_DISABLE_XET: "1" USER: "vllm" + TRITON_CACHE_DIR: "/tmp/.triton" extraCmdArgs: [ "--block-size", @@ -123,6 +125,7 @@ modelConfigs: VLLM_CPU_SGL_KERNEL: "1" HF_HUB_DISABLE_XET: "1" USER: "vllm" + TRITON_CACHE_DIR: "/tmp/.triton" extraCmdArgs: [ "--block-size", @@ -153,6 +156,7 @@ modelConfigs: VLLM_CPU_SGL_KERNEL: "1" HF_HUB_DISABLE_XET: "1" USER: "vllm" + TRITON_CACHE_DIR: "/tmp/.triton" extraCmdArgs: [ "--block-size", @@ -183,6 +187,7 @@ modelConfigs: VLLM_CPU_SGL_KERNEL: "1" HF_HUB_DISABLE_XET: "1" USER: "vllm" + TRITON_CACHE_DIR: "/tmp/.triton" extraCmdArgs: [ "--block-size", @@ -215,6 +220,7 @@ modelConfigs: VLLM_CPU_SGL_KERNEL: "1" HF_HUB_DISABLE_XET: "1" USER: "vllm" + TRITON_CACHE_DIR: "/tmp/.triton" extraCmdArgs: [ "--block-size", @@ -249,6 +255,7 @@ modelConfigs: HF_HUB_DISABLE_XET: "1" LOGNAME: "vllm" USER: "vllm" + TRITON_CACHE_DIR: "/tmp/.triton" extraCmdArgs: [ "--block-size", @@ -281,6 +288,7 @@ defaultModelConfigs: VLLM_CPU_SGL_KERNEL: "1" HF_HUB_DISABLE_XET: "1" USER: "vllm" + TRITON_CACHE_DIR: "/tmp/.triton" extraCmdArgs: [ "--block-size", diff --git a/core/roles/inference-tools/tasks/main.yml b/core/roles/inference-tools/tasks/main.yml index 12801161..51ae0eec 100644 --- a/core/roles/inference-tools/tasks/main.yml +++ b/core/roles/inference-tools/tasks/main.yml @@ -19,7 +19,7 @@ ansible.builtin.pip: name: kubernetes state: present - extra_args: "--break-system-packages" + extra_args: "--break-system-packages --ignore-installed" become: true when: pip_install_result is failed tags: always diff --git a/core/scripts/vllm-quickstart/README.md b/core/scripts/vllm-quickstart/README.md index 5b113814..3a0977c3 100644 --- a/core/scripts/vllm-quickstart/README.md +++ b/core/scripts/vllm-quickstart/README.md @@ -116,7 +116,7 @@ The `models.json` file contains all configuration: ```json { "docker": { - "image": "vllm/vllm-openai-cpu:v0.21.0", + "image": "vllm/vllm-openai-cpu:v0.24.0", "port": "8000:8000", "environment": { ... }, "volumes": [ ... ] diff --git a/core/scripts/vllm-quickstart/models.json b/core/scripts/vllm-quickstart/models.json index fa0f3acb..330bbe3f 100644 --- a/core/scripts/vllm-quickstart/models.json +++ b/core/scripts/vllm-quickstart/models.json @@ -1,6 +1,6 @@ { "docker": { - "image": "vllm/vllm-openai-cpu:v0.21.0", + "image": "vllm/vllm-openai-cpu:v0.24.0", "port": "8000:8000", "environment": { "VLLM_CPU_SGL_KERNEL": "1",