From 5f301c02c5948deb539eed8a101792c8ff861f7b Mon Sep 17 00:00:00 2001 From: Sahithi Chigurupati Date: Thu, 23 Jul 2026 15:32:57 -0700 Subject: [PATCH 1/3] dsv4 gb300 agentic: Dynamo session-routing upgrade (dev20260718 + X-Dynamo-Session-ID) Update the six DeepSeek-V4-Pro GB300 Dynamo-SGLang AgentX sweep points: - Dynamo 1.3.0.dev1 -> 1.3.0.dev20260718 (router queueing off by default, targeting the high-concurrency regression seen with queueing enabled). - Migrate AgentX session affinity from nvext.session_control to X-Dynamo-Session-ID headers: recipes set AIPERF_HTTP_X_DYNAMO_SESSION_ID_FROM_CORRELATION_ID=true; nginx affinity + Dynamo router use X-Dynamo-Session-ID with a 3600s TTL. benchmark_lib retains the legacy --use-dynamo-conv-aware-routing path when the header opt-in is absent. - Pin the aiperf submodule to 6c84373b (X-Dynamo-Session-ID header support). - Remove DYN_ROUTER_TEMPERATURE=10000000, restoring Dynamo's deterministic 0.0 default. - Add SGLANG_DISABLE_DRAFT_EXTEND_CUDA_GRAPH=1 to the agg + 2p1d recipes to avoid the pathological DSV4 EAGLE draft-extend CUDA-graph capture. - SGLang nightly-dev-cu13-20260711-7de33ce8 -> nightly-dev-cu13-20260719-99f5a6f4. - Add gb300-nv hardware metadata to runners.yaml (available-cpu-dram-mib, gpus-per-node), required by the agentic DRAM-offload matrix logic. --- benchmarks/benchmark_lib.sh | 25 ++++++++++++------- .../agentic/agg-gb300-tp4-mtp-kvoffload.yaml | 19 +++++++------- ...-12p4d-dep8-dep16-c1024-mtp-kvoffload.yaml | 10 +++----- ...-gb300-2p1d-dep8-tp4-c8-mtp-kvoffload.yaml | 13 +++++----- ...00-2p4d-dep8-dep16-c256-mtp-kvoffload.yaml | 10 +++----- ...00-4p4d-dep8-dep16-c256-mtp-kvoffload.yaml | 10 +++----- ...00-6p4d-dep8-dep16-c512-mtp-kvoffload.yaml | 10 +++----- configs/nvidia-master.yaml | 8 +++--- configs/runners.yaml | 3 +++ perf-changelog.yaml | 10 ++++++++ utils/aiperf | 2 +- 11 files changed, 66 insertions(+), 54 deletions(-) diff --git a/benchmarks/benchmark_lib.sh b/benchmarks/benchmark_lib.sh index 9a01f63b4b..15691ec631 100644 --- a/benchmarks/benchmark_lib.sh +++ b/benchmarks/benchmark_lib.sh @@ -1794,16 +1794,23 @@ build_replay_cmd() { REPLAY_CMD+=" --use-server-token-count" # Dynamo's KV router needs an explicit conversation session binding to # keep later turns on the prefill worker that owns their prefix blocks. - # X-Correlation-ID is useful tracing metadata but does not establish that - # binding by itself. AIPerf emits nvext.session_control bind/close actions - # keyed by the stable conversation correlation ID when this flag is set. + # New Dynamo deployments use X-Dynamo-Session-ID headers, while existing + # pinned deployments retain the nvext.session_control behavior by default. if [[ "${FRAMEWORK:-}" == dynamo-* ]]; then - REPLAY_CMD+=" --use-dynamo-conv-aware-routing" - # The upstream 300s affinity TTL is shorter than an overloaded - # high-concurrency agentic request. Keep bindings alive across long - # prefills, generation, and capped inter-turn delay. This controls the - # router's inactivity lease; it does not relax HTTP/request failures. - REPLAY_CMD+=" --dynamo-session-timeout-seconds ${AIPERF_DYNAMO_SESSION_TIMEOUT_SECONDS:-3600}" + case "${AIPERF_HTTP_X_DYNAMO_SESSION_ID_FROM_CORRELATION_ID:-false}" in + true|True|TRUE|1) + # AIPerf PR #17's environment setting is inherited directly + # from benchmark.env and needs no routing CLI flag. + ;; + *) + # Existing Dynamo recipes retain the legacy nvext behavior. + REPLAY_CMD+=" --use-dynamo-conv-aware-routing" + # The upstream 300s affinity TTL is shorter than an overloaded + # high-concurrency agentic request. Keep bindings alive across + # long prefills, generation, and capped inter-turn delay. + REPLAY_CMD+=" --dynamo-session-timeout-seconds ${AIPERF_DYNAMO_SESSION_TIMEOUT_SECONDS:-3600}" + ;; + esac fi # Disable DCGM GPU telemetry collection. aiperf's GpuMetricTimeSeries # freezes its metric schema on the first DCGM scrape, then KeyErrors when diff --git a/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/agg-gb300-tp4-mtp-kvoffload.yaml b/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/agg-gb300-tp4-mtp-kvoffload.yaml index 3ff9e31924..7fee5dc431 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/agg-gb300-tp4-mtp-kvoffload.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/agg-gb300-tp4-mtp-kvoffload.yaml @@ -16,7 +16,7 @@ model: dynamo: install: true - wheel: "1.3.0.dev1" + wheel: "1.3.0.dev20260718" slurm: time_limit: "8:00:00" @@ -44,11 +44,10 @@ infra: frontend: type: dynamo nginx_session_affinity: true - nginx_session_affinity_header: X-Correlation-ID + nginx_session_affinity_header: X-Dynamo-Session-ID enable_multiple_frontends: true num_additional_frontends: 4 env: - DYN_ROUTER_TEMPERATURE: "10000000" # The sglang image is PEP 668 externally-managed; the runtime dynamo # install (dynamo_wheels.py / source build) runs pip and fails with # "externally-managed-environment" without this. Lets pip install into @@ -56,7 +55,7 @@ frontend: PIP_BREAK_SYSTEM_PACKAGES: "1" args: router-mode: "kv" - router-reset-states: true + router-session-affinity-ttl-secs: "3600" active-decode-blocks-threshold: "None" active-prefill-tokens-threshold: "None" active-prefill-tokens-threshold-frac: "None" @@ -66,6 +65,9 @@ backend: aggregated_environment: SGLANG_DEFAULT_THINKING: '1' + # TP4/bs128 can spend over an hour capturing the DSV4 EAGLE draft-extend + # graph. Keep the target/decode graphs and use the upstream eager fallback. + SGLANG_DISABLE_DRAFT_EXTEND_CUDA_GRAPH: "1" SGLANG_DSV4_REASONING_EFFORT: high SGLANG_SIMULATE_ACC_LEN: '2.49' SGLANG_SIMULATE_ACC_METHOD: match-expected @@ -139,11 +141,9 @@ benchmark: # in process_agentic_result.py instead. TP must match sglang_config tp-size. IS_MULTINODE: "false" TP: "4" - # Enable dynamo conv-aware routing (per-session affinity so multi-turn - # KV cache is reused across turns). Previously opted out because the - # frontend 400'd on aiperf's nvext.session_control actions; re-enabled - # to test with the current build. - AIPERF_USE_DYNAMO_CONV_AWARE_ROUTING: "1" + # Stamp X-Dynamo-Session-ID on every turn so both nginx and Dynamo's + # router keep the session on the worker that owns its KV prefix. + AIPERF_HTTP_X_DYNAMO_SESSION_ID_FROM_CORRELATION_ID: "true" # Container-side path of the aiperf mmap dataset cache; host-side mount # wired via launch_gb300-*.sh srtslurm.yaml default_mounts. Without it, # aiperf re-tokenizes + re-writes the dataset mmap on every run. @@ -151,4 +151,3 @@ benchmark: # Persistent HF hub cache (also via default_mounts) so the trace dataset # isn't re-downloaded each run; overrides the workflow-level HF_HUB_CACHE. HF_HUB_CACHE: "/hf_hub_cache" - diff --git a/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-12p4d-dep8-dep16-c1024-mtp-kvoffload.yaml b/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-12p4d-dep8-dep16-c1024-mtp-kvoffload.yaml index 715b0c631e..1e00283043 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-12p4d-dep8-dep16-c1024-mtp-kvoffload.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-12p4d-dep8-dep16-c1024-mtp-kvoffload.yaml @@ -15,7 +15,7 @@ model: dynamo: install: true - wheel: "1.3.0.dev1" + wheel: "1.3.0.dev20260718" slurm: time_limit: "8:00:00" @@ -41,15 +41,14 @@ infra: frontend: type: dynamo nginx_session_affinity: true - nginx_session_affinity_header: X-Correlation-ID + nginx_session_affinity_header: X-Dynamo-Session-ID enable_multiple_frontends: true num_additional_frontends: 4 env: - DYN_ROUTER_TEMPERATURE: "10000000" PIP_BREAK_SYSTEM_PACKAGES: "1" args: router-mode: "kv" - router-reset-states: true + router-session-affinity-ttl-secs: "3600" active-decode-blocks-threshold: "None" active-prefill-tokens-threshold: "None" active-prefill-tokens-threshold-frac: "None" @@ -206,7 +205,6 @@ benchmark: RESULT_DIR: /logs/agentic PORT: "8000" IS_MULTINODE: "true" - AIPERF_USE_DYNAMO_CONV_AWARE_ROUTING: "1" + AIPERF_HTTP_X_DYNAMO_SESSION_ID_FROM_CORRELATION_ID: "true" AIPERF_DATASET_MMAP_CACHE_DIR: "/aiperf_mmap_cache" HF_HUB_CACHE: "/hf_hub_cache" - diff --git a/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-2p1d-dep8-tp4-c8-mtp-kvoffload.yaml b/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-2p1d-dep8-tp4-c8-mtp-kvoffload.yaml index dc91c255ce..d926b9a937 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-2p1d-dep8-tp4-c8-mtp-kvoffload.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-2p1d-dep8-tp4-c8-mtp-kvoffload.yaml @@ -15,7 +15,7 @@ model: dynamo: install: true - wheel: "1.3.0.dev1" + wheel: "1.3.0.dev20260718" slurm: time_limit: "8:00:00" @@ -41,15 +41,14 @@ infra: frontend: type: dynamo nginx_session_affinity: true - nginx_session_affinity_header: X-Correlation-ID + nginx_session_affinity_header: X-Dynamo-Session-ID enable_multiple_frontends: true num_additional_frontends: 4 env: - DYN_ROUTER_TEMPERATURE: "10000000" PIP_BREAK_SYSTEM_PACKAGES: "1" args: router-mode: "kv" - router-reset-states: true + router-session-affinity-ttl-secs: "3600" active-decode-blocks-threshold: "None" active-prefill-tokens-threshold: "None" active-prefill-tokens-threshold-frac: "None" @@ -92,6 +91,9 @@ backend: decode_environment: SGLANG_DISAGGREGATION_WAITING_TIMEOUT: "900" + # Match the TP4 aggregate worker: avoid the pathological DSV4 EAGLE + # draft-extend graph capture while retaining the target/decode graphs. + SGLANG_DISABLE_DRAFT_EXTEND_CUDA_GRAPH: "1" SGLANG_SIMULATE_ACC_LEN: '2.49' SGLANG_SIMULATE_ACC_METHOD: match-expected SGLANG_SIMULATE_ACC_TOKEN_MODE: "real-draft-token" @@ -205,7 +207,6 @@ benchmark: RESULT_DIR: /logs/agentic PORT: "8000" IS_MULTINODE: "true" - AIPERF_USE_DYNAMO_CONV_AWARE_ROUTING: "1" + AIPERF_HTTP_X_DYNAMO_SESSION_ID_FROM_CORRELATION_ID: "true" AIPERF_DATASET_MMAP_CACHE_DIR: "/aiperf_mmap_cache" HF_HUB_CACHE: "/hf_hub_cache" - diff --git a/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-2p4d-dep8-dep16-c256-mtp-kvoffload.yaml b/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-2p4d-dep8-dep16-c256-mtp-kvoffload.yaml index 6df695b914..0c9df6f9ec 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-2p4d-dep8-dep16-c256-mtp-kvoffload.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-2p4d-dep8-dep16-c256-mtp-kvoffload.yaml @@ -15,7 +15,7 @@ model: dynamo: install: true - wheel: "1.3.0.dev1" + wheel: "1.3.0.dev20260718" slurm: time_limit: "8:00:00" @@ -41,15 +41,14 @@ infra: frontend: type: dynamo nginx_session_affinity: true - nginx_session_affinity_header: X-Correlation-ID + nginx_session_affinity_header: X-Dynamo-Session-ID enable_multiple_frontends: true num_additional_frontends: 4 env: - DYN_ROUTER_TEMPERATURE: "10000000" PIP_BREAK_SYSTEM_PACKAGES: "1" args: router-mode: "kv" - router-reset-states: true + router-session-affinity-ttl-secs: "3600" active-decode-blocks-threshold: "None" active-prefill-tokens-threshold: "None" active-prefill-tokens-threshold-frac: "None" @@ -206,7 +205,6 @@ benchmark: RESULT_DIR: /logs/agentic PORT: "8000" IS_MULTINODE: "true" - AIPERF_USE_DYNAMO_CONV_AWARE_ROUTING: "1" + AIPERF_HTTP_X_DYNAMO_SESSION_ID_FROM_CORRELATION_ID: "true" AIPERF_DATASET_MMAP_CACHE_DIR: "/aiperf_mmap_cache" HF_HUB_CACHE: "/hf_hub_cache" - diff --git a/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-4p4d-dep8-dep16-c256-mtp-kvoffload.yaml b/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-4p4d-dep8-dep16-c256-mtp-kvoffload.yaml index 107a787ba9..3fbe5268eb 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-4p4d-dep8-dep16-c256-mtp-kvoffload.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-4p4d-dep8-dep16-c256-mtp-kvoffload.yaml @@ -15,7 +15,7 @@ model: dynamo: install: true - wheel: "1.3.0.dev1" + wheel: "1.3.0.dev20260718" slurm: time_limit: "8:00:00" @@ -40,15 +40,14 @@ infra: frontend: type: dynamo nginx_session_affinity: true - nginx_session_affinity_header: X-Correlation-ID + nginx_session_affinity_header: X-Dynamo-Session-ID enable_multiple_frontends: true num_additional_frontends: 4 env: - DYN_ROUTER_TEMPERATURE: "10000000" PIP_BREAK_SYSTEM_PACKAGES: "1" args: router-mode: "kv" - router-reset-states: true + router-session-affinity-ttl-secs: "3600" active-decode-blocks-threshold: "None" active-prefill-tokens-threshold: "None" active-prefill-tokens-threshold-frac: "None" @@ -206,7 +205,6 @@ benchmark: RESULT_DIR: /logs/agentic PORT: "8000" IS_MULTINODE: "true" - AIPERF_USE_DYNAMO_CONV_AWARE_ROUTING: "1" + AIPERF_HTTP_X_DYNAMO_SESSION_ID_FROM_CORRELATION_ID: "true" AIPERF_DATASET_MMAP_CACHE_DIR: "/aiperf_mmap_cache" HF_HUB_CACHE: "/hf_hub_cache" - diff --git a/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-6p4d-dep8-dep16-c512-mtp-kvoffload.yaml b/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-6p4d-dep8-dep16-c512-mtp-kvoffload.yaml index 27a4e42d22..4b17f493ef 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-6p4d-dep8-dep16-c512-mtp-kvoffload.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/sglang/deepseek-v4/agentic/disagg-gb300-6p4d-dep8-dep16-c512-mtp-kvoffload.yaml @@ -15,7 +15,7 @@ model: dynamo: install: true - wheel: "1.3.0.dev1" + wheel: "1.3.0.dev20260718" slurm: time_limit: "8:00:00" @@ -41,15 +41,14 @@ infra: frontend: type: dynamo nginx_session_affinity: true - nginx_session_affinity_header: X-Correlation-ID + nginx_session_affinity_header: X-Dynamo-Session-ID enable_multiple_frontends: true num_additional_frontends: 4 env: - DYN_ROUTER_TEMPERATURE: "10000000" PIP_BREAK_SYSTEM_PACKAGES: "1" args: router-mode: "kv" - router-reset-states: true + router-session-affinity-ttl-secs: "3600" active-decode-blocks-threshold: "None" active-prefill-tokens-threshold: "None" active-prefill-tokens-threshold-frac: "None" @@ -206,7 +205,6 @@ benchmark: RESULT_DIR: /logs/agentic PORT: "8000" IS_MULTINODE: "true" - AIPERF_USE_DYNAMO_CONV_AWARE_ROUTING: "1" + AIPERF_HTTP_X_DYNAMO_SESSION_ID_FROM_CORRELATION_ID: "true" AIPERF_DATASET_MMAP_CACHE_DIR: "/aiperf_mmap_cache" HF_HUB_CACHE: "/hf_hub_cache" - diff --git a/configs/nvidia-master.yaml b/configs/nvidia-master.yaml index a167f49270..dee9c69e1d 100644 --- a/configs/nvidia-master.yaml +++ b/configs/nvidia-master.yaml @@ -7882,13 +7882,13 @@ dsv4-fp4-gb200-dynamo-vllm-agentic-2p1d-dep8-dep8: dp-attn: true dsv4-fp4-gb300-dynamo-sglang-agentic-agg: - image: lmsysorg/sglang:nightly-dev-cu13-20260711-7de33ce8 + image: lmsysorg/sglang:nightly-dev-cu13-20260719-99f5a6f4 model: deepseek-ai/DeepSeek-V4-Pro model-prefix: dsv4 runner: cluster:gb300-nv precision: fp4 framework: dynamo-sglang - router: { name: dynamo-router, version: "1.3.0.dev1" } + router: { name: dynamo-router, version: "1.3.0.dev20260718" } multinode: true disagg: false scenarios: @@ -7916,13 +7916,13 @@ dsv4-fp4-gb300-dynamo-sglang-agentic-agg: dp-attn: false dsv4-fp4-gb300-dynamo-sglang-agentic-disagg: - image: lmsysorg/sglang:nightly-dev-cu13-20260711-7de33ce8 + image: lmsysorg/sglang:nightly-dev-cu13-20260719-99f5a6f4 model: deepseek-ai/DeepSeek-V4-Pro model-prefix: dsv4 runner: cluster:gb300-nv precision: fp4 framework: dynamo-sglang - router: { name: dynamo-router, version: "1.3.0.dev1" } + router: { name: dynamo-router, version: "1.3.0.dev20260718" } kv-p2p-transfer: mooncake multinode: true disagg: true diff --git a/configs/runners.yaml b/configs/runners.yaml index 851b821ba2..69788865ad 100644 --- a/configs/runners.yaml +++ b/configs/runners.yaml @@ -315,6 +315,9 @@ hardware: cluster:gb200-nv: available-cpu-dram-mib: 860_160 gpus-per-node: 4 + cluster:gb300-nv: + available-cpu-dram-mib: 860_160 + gpus-per-node: 4 cluster:mi300x-amds: available-cpu-dram-mib: 2_321_924 gpus-per-node: 8 diff --git a/perf-changelog.yaml b/perf-changelog.yaml index 335245a6c3..85c3058c0b 100644 --- a/perf-changelog.yaml +++ b/perf-changelog.yaml @@ -5060,3 +5060,13 @@ - "Re-pin VLLM_ROUTER_IMAGE to vllm/vllm-router:nightly-20260716-1fbcde7 (previous nightly-20260629-e667ebb was garbage-collected from Docker Hub)" - "Exclude known-bad nodes mia1-p01-g09,g14 from the disagg node pool" pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2301 + +- config-keys: + - dsv4-fp4-gb300-dynamo-sglang-agentic-agg + - dsv4-fp4-gb300-dynamo-sglang-agentic-disagg + description: + - "Upgrade Dynamo from 1.3.0.dev1 to 1.3.0.dev20260718 so router queueing is disabled by default at high concurrency" + - "Pin AIPerf to PR #17 (6c84373b) and migrate AgentX session affinity from nvext.session_control to X-Dynamo-Session-ID headers with a 3600-second router TTL" + - "Remove the DYN_ROUTER_TEMPERATURE=10000000 override and restore Dynamo's deterministic 0.0 default" + - "Upgrade SGLang from nightly-dev-cu13-20260711-7de33ce8 to nightly-dev-cu13-20260719-99f5a6f4, the latest nightly before the scheduler WAR-barrier regression in SGLang #31687" + pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/XXX diff --git a/utils/aiperf b/utils/aiperf index 0d2aa0572a..6c84373b1d 160000 --- a/utils/aiperf +++ b/utils/aiperf @@ -1 +1 @@ -Subproject commit 0d2aa0572ac685943d38c580675c4a61023581d3 +Subproject commit 6c84373b1d638a7a9ac077ee8b90490b9e93e7d9 From eb527b69fdbb91ab5f918e27a37c6eb24f53061f Mon Sep 17 00:00:00 2001 From: Sahithi Chigurupati Date: Thu, 23 Jul 2026 15:43:33 -0700 Subject: [PATCH 2/3] perf-changelog: set dsv4 gb300 session-routing pr-link to #2319 --- perf-changelog.yaml | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/perf-changelog.yaml b/perf-changelog.yaml index 85c3058c0b..b3a800841c 100644 --- a/perf-changelog.yaml +++ b/perf-changelog.yaml @@ -5069,4 +5069,4 @@ - "Pin AIPerf to PR #17 (6c84373b) and migrate AgentX session affinity from nvext.session_control to X-Dynamo-Session-ID headers with a 3600-second router TTL" - "Remove the DYN_ROUTER_TEMPERATURE=10000000 override and restore Dynamo's deterministic 0.0 default" - "Upgrade SGLang from nightly-dev-cu13-20260711-7de33ce8 to nightly-dev-cu13-20260719-99f5a6f4, the latest nightly before the scheduler WAR-barrier regression in SGLang #31687" - pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/XXX + pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2319 From 269a70bcc1add09d6167d26639592bb1b7b64f7e Mon Sep 17 00:00:00 2001 From: Sahithi Chigurupati Date: Sun, 26 Jul 2026 17:47:55 -0700 Subject: [PATCH 3/3] aiperf: bump to agentx-v1.0 branch tip (session-routing re-landed via #19) Replace the frozen pin to the aiperf PR #17 merge (6c84373b, which the integration branch reverted in #18) with the current cquil11/aiperf-agentx-v1.0 tip (655792405), where the X-Dynamo-Session-ID session-routing support was re-landed via aiperf #19. This tracks the branch InferenceX's aiperf submodule targets instead of a stranded pre-revert commit. --- perf-changelog.yaml | 2 +- utils/aiperf | 2 +- 2 files changed, 2 insertions(+), 2 deletions(-) diff --git a/perf-changelog.yaml b/perf-changelog.yaml index b3a800841c..084fec3cf7 100644 --- a/perf-changelog.yaml +++ b/perf-changelog.yaml @@ -5066,7 +5066,7 @@ - dsv4-fp4-gb300-dynamo-sglang-agentic-disagg description: - "Upgrade Dynamo from 1.3.0.dev1 to 1.3.0.dev20260718 so router queueing is disabled by default at high concurrency" - - "Pin AIPerf to PR #17 (6c84373b) and migrate AgentX session affinity from nvext.session_control to X-Dynamo-Session-ID headers with a 3600-second router TTL" + - "Bump AIPerf to the agentx-v1.0 branch tip (6557924, X-Dynamo-Session-ID session-routing support) and migrate AgentX session affinity from nvext.session_control to X-Dynamo-Session-ID headers with a 3600-second router TTL" - "Remove the DYN_ROUTER_TEMPERATURE=10000000 override and restore Dynamo's deterministic 0.0 default" - "Upgrade SGLang from nightly-dev-cu13-20260711-7de33ce8 to nightly-dev-cu13-20260719-99f5a6f4, the latest nightly before the scheduler WAR-barrier regression in SGLang #31687" pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2319 diff --git a/utils/aiperf b/utils/aiperf index 6c84373b1d..6557924059 160000 --- a/utils/aiperf +++ b/utils/aiperf @@ -1 +1 @@ -Subproject commit 6c84373b1d638a7a9ac077ee8b90490b9e93e7d9 +Subproject commit 655792405980c5211722bc45a5f8401f3bad304a