Skip to content

Commit 68e502a

Browse files
authored
bump kimi-k2.5 int4 b200/b300 vllm images to v0.25.0 (#2256)
1 parent 476d0d2 commit 68e502a

2 files changed

Lines changed: 9 additions & 6 deletions

File tree

configs/nvidia-master.yaml

Lines changed: 2 additions & 6 deletions
Original file line numberDiff line numberDiff line change
@@ -1969,7 +1969,7 @@ qwen3.5-bf16-b300-sglang-mtp:
19691969
- { tp: 4, ep: 1, conc-start: 4, conc-end: 64, spec-decoding: mtp }
19701970

19711971
kimik2.5-int4-b200-vllm:
1972-
image: vllm/vllm-openai:v0.24.0
1972+
image: vllm/vllm-openai:v0.25.0
19731973
model: moonshotai/Kimi-K2.5
19741974
model-prefix: kimik2.5
19751975
runner: b200
@@ -1983,10 +1983,6 @@ kimik2.5-int4-b200-vllm:
19831983
search-space:
19841984
- { tp: 8, conc-start: 4, conc-end: 64 }
19851985

1986-
# NOTE: At the time of submission, https://docs.vllm.ai/projects/recipes/en/latest/moonshotai/Kimi-K2.5.html
1987-
# does not have a B300-specific recipe, so this config reuses the existing
1988-
# Kimi-K2.5 INT4 B200 vLLM recipe as-is until B300-specific tuning is available.
1989-
19901986
kimik2.5-int4-b200-vllm-agentic:
19911987
image: vllm/vllm-openai:v0.22.0
19921988
model: moonshotai/Kimi-K2.5
@@ -2003,7 +1999,7 @@ kimik2.5-int4-b200-vllm-agentic:
20031999
- { tp: 8, kv-offloading: dram, kv-offload-backend: { name: vllm-simple }, conc-list: [32, 64, 96, 128] }
20042000

20052001
kimik2.5-int4-b300-vllm:
2006-
image: vllm/vllm-openai:v0.24.0
2002+
image: vllm/vllm-openai:v0.25.0
20072003
model: moonshotai/Kimi-K2.5
20082004
model-prefix: kimik2.5
20092005
runner: b300

perf-changelog.yaml

Lines changed: 7 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -4933,3 +4933,10 @@
49334933
description:
49344934
- "Add MiniMax M3 NVFP4 B300 Dynamo-vLLM disaggregated EAGLE3 recipes"
49354935
pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2182
4936+
4937+
- config-keys:
4938+
- kimik2.5-int4-b200-vllm
4939+
- kimik2.5-int4-b300-vllm
4940+
description:
4941+
- "Bump vLLM image to v0.25.0"
4942+
pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2256

0 commit comments

Comments
 (0)