Skip to content

Commit 9089fac

Browse files
1am9trashchunfangamdcquil11
authored
[AMD][MI35X] 0706 DSV4 sglang (#2093)
* Update config and change log * Fix format * Update config * Update dsv4_fp4_mi355x_sglang.sh * Fix changelog format --------- Co-authored-by: Chun Fang <chun.fang@amd.com> Co-authored-by: Cameron Quilici <cjquilici@gmail.com>
1 parent f7af076 commit 9089fac

3 files changed

Lines changed: 18 additions & 20 deletions

File tree

benchmarks/single_node/fixed_seq_len/dsv4_fp4_mi355x_sglang.sh

Lines changed: 9 additions & 19 deletions
Original file line numberDiff line numberDiff line change
@@ -26,27 +26,9 @@ if [[ "$MODEL" != /* ]]; then hf download "$MODEL"; fi
2626

2727
export SGLANG_DEFAULT_THINKING=1
2828
export SGLANG_DSV4_REASONING_EFFORT=max
29-
export SGLANG_OPT_DEEPGEMM_HC_PRENORM=false
30-
export SGLANG_USE_AITER=1
3129
export SGLANG_USE_ROCM700A=0
32-
export SGLANG_DP_USE_GATHERV=1
33-
export SGLANG_OPT_USE_FUSED_COMPRESS=true
3430
export SGLANG_HACK_FLASHMLA_BACKEND=unified_kv_triton
35-
export SGLANG_OPT_FP8_WO_A_GEMM=false
36-
export SGLANG_OPT_USE_JIT_INDEXER_METADATA=false
37-
export SGLANG_OPT_USE_TOPK_V2=false
38-
export SGLANG_OPT_USE_AITER_INDEXER=true
39-
export SGLANG_OPT_USE_TILELANG_INDEXER=false
40-
export SGLANG_OPT_USE_TILELANG_MHC_PRE=false
41-
export SGLANG_OPT_USE_TILELANG_MHC_POST=false
42-
export SGLANG_FP8_PAGED_MQA_LOGITS_TORCH=1
43-
export SGLANG_OPT_USE_FUSED_COMPRESS_TRITON=true
4431
export AITER_BF16_FP8_MOE_BOUND=0
45-
export SGLANG_EAGER_INPUT_NO_COPY=true
46-
47-
# multi-stream
48-
export SGLANG_OPT_USE_MULTI_STREAM_OVERLAP=false
49-
export SGLANG_ROCM_USE_MULTI_STREAM=false
5032

5133
SERVER_LOG=/workspace/server.log
5234

@@ -63,12 +45,18 @@ PARALLEL_ARGS=(
6345
)
6446
CHUNKED_PREFILL_SIZE=$ISL
6547
if [ "${DP_ATTENTION}" = "true" ]; then
48+
export SGLANG_SHARED_EXPERT_TP1=1
49+
export SGLANG_DP_SHARED_EXPERT_LOCAL=1
50+
export SGLANG_DP_USE_GATHERV=1
51+
export SGLANG_DP_USE_REDUCE_SCATTER=1
52+
export GPU_MAX_HW_QUEUES=5
53+
6654
CHUNKED_PREFILL_SIZE=$((ISL * TP))
6755
PARALLEL_ARGS+=(
6856
--dp "$TP"
6957
--enable-dp-attention
7058
--enable-prefill-delayer
71-
--prefill-delayer-max-delay-ms 5000
59+
--enable-two-batch-overlap
7260
)
7361
fi
7462
if [ "${EP_SIZE:-1}" -gt 1 ]; then
@@ -83,10 +71,12 @@ sglang serve \
8371
--trust-remote-code \
8472
--disable-radix-cache \
8573
--attention-backend dsv4 \
74+
--cuda-graph-max-bs ${CONC} \
8675
--max-running-requests ${CONC} \
8776
--mem-fraction-static 0.90 \
8877
--swa-full-tokens-ratio 0.15 \
8978
--page-size 256 \
79+
--kv-cache-dtype fp8_e4m3 \
9080
--context-length $MAX_MODEL_LEN \
9181
--chunked-prefill-size $CHUNKED_PREFILL_SIZE \
9282
--disable-shared-experts-fusion \

configs/amd-master.yaml

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -1736,7 +1736,7 @@ dsr1-fp4-mi355x-sglang-disagg-8k1k-mtp:
17361736
- "DECODE_MTP_SIZE=1"
17371737

17381738
dsv4-fp4-mi355x-sglang:
1739-
image: lmsysorg/sglang-rocm:v0.5.13.post1-rocm720-mi35x-20260618
1739+
image: lmsysorg/sglang-rocm:v0.5.14-rocm720-mi35x-20260706
17401740
model: deepseek-ai/DeepSeek-V4-Pro
17411741
model-prefix: dsv4
17421742
runner: mi355x

perf-changelog.yaml

Lines changed: 8 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -4684,3 +4684,11 @@
46844684
- "Image: lmsysorg/sglang:v0.5.11-cu130"
46854685
- "11 topologies across 1k/1k and 8k/1k (prefill TP4 + decode wide-EP: 8k/1k DEP16/24/32/40, 1k/1k DEP48/56; per-node TP4 low-latency); MTP flags: speculative-algorithm EAGLE, num-steps 2, eagle-topk 1, num-draft-tokens 3"
46864686
pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/1907
4687+
4688+
- config-keys:
4689+
- dsv4-fp4-mi355x-sglang
4690+
description:
4691+
- "Bump image to lmsysorg/sglang-rocm:v0.5.14-rocm720-mi35x-20260706"
4692+
- "Clean the export envs"
4693+
- "Enable two batch overlap"
4694+
pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2093

0 commit comments

Comments
 (0)