Skip to content

Commit a962cfb

Browse files
committed
fix(agentx): finish per-lane warmup migration
1 parent e0fc81e commit a962cfb

7 files changed

Lines changed: 2 additions & 7 deletions

File tree

.gitmodules

Lines changed: 0 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1,4 +1,3 @@
11
[submodule "utils/aiperf"]
22
path = utils/aiperf
33
url = https://github.com/SemiAnalysisAI/aiperf.git
4-
branch = main

benchmarks/multi_node/amd_utils/server_sglang.sh

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -986,7 +986,7 @@ if [ "$NODE_RANK" -eq 0 ]; then
986986
DECODE_NUM_WORKERS DECODE_TP DECODE_EP DECODE_DP_ATTN DECODE_HARDWARE \
987987
KV_OFFLOADING KV_OFFLOAD_BACKEND KV_OFFLOAD_BACKEND_METADATA TOTAL_CPU_DRAM_GB KV_P2P_TRANSFER \
988988
WEKA_LOADER_OVERRIDE AIPERF_FAILED_REQUEST_THRESHOLD \
989-
AIPERF_AGENTIC_CACHE_WARMUP_DURATION AIPERF_UNSAFE_OVERRIDE \
989+
AIPERF_WARMUP_REQUESTS_PER_LANE AIPERF_EXPERIMENTAL_FAST AIPERF_UNSAFE_OVERRIDE \
990990
AIPERF_TRAJECTORY_START_MIN_RATIO AIPERF_TRAJECTORY_START_MAX_RATIO \
991991
AIPERF_DATASET_WEKA_LIVE_ASSISTANT_RESPONSES ROUTER_PORT TQDM_MININTERVAL; do
992992
if [[ -n "${!_v+x}" ]]; then

benchmarks/multi_node/srt-slurm-recipes/vllm/deepseek-v4/agentic/agg-gb300-tp4-mtp-agentic.yaml

Lines changed: 0 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -141,7 +141,6 @@ benchmark:
141141
PORT: "8000"
142142
IS_MULTINODE: "true"
143143
AIPERF_USE_DYNAMO_CONV_AWARE_ROUTING: "0"
144-
AIPERF_AGENTIC_CACHE_WARMUP_DURATION: "600"
145144
AIPERF_DATASET_MMAP_CACHE_DIR: "/aiperf_mmap_cache"
146145
HF_HUB_CACHE: "/hf_hub_cache"
147146
WEKA_LOADER_OVERRIDE: "semianalysis_cc_traces_weka_062126"

benchmarks/multi_node/srt-slurm-recipes/vllm/deepseek-v4/agentic/agg-gb300-tp8-mtp-agentic.yaml

Lines changed: 0 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -144,7 +144,6 @@ benchmark:
144144
# the zero decode-worker count instead of duplicating TP into P and D.
145145
IS_MULTINODE: "true"
146146
AIPERF_USE_DYNAMO_CONV_AWARE_ROUTING: "0"
147-
AIPERF_AGENTIC_CACHE_WARMUP_DURATION: "600"
148147
AIPERF_DATASET_MMAP_CACHE_DIR: "/aiperf_mmap_cache"
149148
HF_HUB_CACHE: "/hf_hub_cache"
150149
WEKA_LOADER_OVERRIDE: "semianalysis_cc_traces_weka_062126"

benchmarks/multi_node/srt-slurm-recipes/vllm/deepseek-v4/agentic/disagg-gb300-1p1d-dep4-dep8-c128-mtp-agentic.yaml

Lines changed: 0 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -198,7 +198,6 @@ benchmark:
198198
IS_MULTINODE: "true"
199199
AIPERF_USE_DYNAMO_CONV_AWARE_ROUTING: "0"
200200
AIPERF_HTTP_X_DYNAMO_SESSION_ID_FROM_CORRELATION_ID: "true"
201-
AIPERF_AGENTIC_CACHE_WARMUP_DURATION: "600"
202201
AIPERF_DATASET_MMAP_CACHE_DIR: "/aiperf_mmap_cache"
203202
HF_HUB_CACHE: "/hf_hub_cache"
204203
WEKA_LOADER_OVERRIDE: "semianalysis_cc_traces_weka_062126"

benchmarks/multi_node/srt-slurm-recipes/vllm/deepseek-v4/agentic/disagg-gb300-1p1d-dep8-dep8-c384-mtp-agentic.yaml

Lines changed: 0 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -199,7 +199,6 @@ benchmark:
199199
IS_MULTINODE: "true"
200200
AIPERF_USE_DYNAMO_CONV_AWARE_ROUTING: "0"
201201
AIPERF_HTTP_X_DYNAMO_SESSION_ID_FROM_CORRELATION_ID: "true"
202-
AIPERF_AGENTIC_CACHE_WARMUP_DURATION: "600"
203202
AIPERF_DATASET_MMAP_CACHE_DIR: "/aiperf_mmap_cache"
204203
HF_HUB_CACHE: "/hf_hub_cache"
205204
WEKA_LOADER_OVERRIDE: "semianalysis_cc_traces_weka_062126"

perf-changelog.yaml

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -5234,7 +5234,7 @@
52345234
- config-keys:
52355235
- kimik3-fp4-b300-vllm-agentic
52365236
description:
5237-
- "Pin shared AIPerf to c57ad643 and replace duration-based warmup with 10 deterministic requests per lane."
5237+
- "Pin shared AIPerf to agentx-v1.0.0 (c57ad643) and replace duration-based warmup with 10 deterministic requests per lane."
52385238
- "Use one warmup request per lane with the 20-minute agentx-fast profile, and emit TTFT, ITL, and throughput metrics every 30 seconds."
52395239
- "Trigger an agentx-fast validation sweep on the existing Kimi K3 B300 AgentX configuration."
52405240
pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2415

0 commit comments

Comments
 (0)