Skip to content

Commit b6abf19

Browse files
feat: add DSV4 B300 Dynamo-SGLang MTP configuration / 新增 DSV4 B300 Dynamo-SGLang MTP 配置 (#2363)
* feat: add DSV4 FP4 B300 Dynamo-SGLang MTP config 中文:新增 DSV4 FP4 B300 Dynamo-SGLang MTP 配置,并接入启用聊天模板输入和 EAGLE 投机解码的共享 srt-slurm 配方矩阵。 * chore: link perf changelog to #2363 中文:将性能变更日志链接更新为 #2363。 * fix: use B300 DSV4 NVFP4 model path 中文:将 B300 DSV4 Dynamo-SGLang 配置指向服务器上预置的 DeepSeek-V4-Pro-NVFP4 模型路径。 * fix: pin srt-slurm recipe revision 固定 srt-slurm 配方版本,确保 DSV4 B300 Dynamo-SGLang 运行使用可复现的配置。 * fix(dsv4): pin UCX-enabled srt-slurm revision 修复(dsv4):固定包含 UCX CUDA 传输配置的 srt-slurm 版本。 * fix: use checked-in DSV4 MTP recipes Pin NVIDIA/srt-slurm main, overlay the checked-in recipes, and enable CUDA-aware UCX transport for every MTP topology. 修复:固定 NVIDIA/srt-slurm main 提交,覆盖仓库内置配方,并为所有 MTP 拓扑启用支持 CUDA 的 UCX 传输。 --------- Co-authored-by: Ankur-singh <ankusingh@nvidia.com>
1 parent 6b6d4c8 commit b6abf19

10 files changed

Lines changed: 1214 additions & 0 deletions
Lines changed: 134 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -0,0 +1,134 @@
1+
name: "disagg-b300-1p1d-dep4-dep8-mtp"
2+
3+
frontend:
4+
type: dynamo
5+
enable_multiple_frontends: true
6+
num_additional_frontends: 8
7+
8+
dynamo:
9+
hash: "41882ae9b07232eed4850fb1daf8c958abb2556a"
10+
install: true
11+
12+
model:
13+
path: "deepseek-v4-pro"
14+
container: "lmsysorg/sglang:nightly-dev-cu13-20260721-8905cbd4"
15+
precision: "fp4"
16+
17+
sbatch_directives:
18+
cpus-per-task: "144"
19+
mem: "0"
20+
21+
resources:
22+
gpu_type: "b300"
23+
gpus_per_node: 8
24+
prefill_nodes: 1
25+
prefill_workers: 1
26+
gpus_per_prefill: 4
27+
decode_nodes: 1
28+
decode_workers: 1
29+
gpus_per_decode: 8
30+
31+
backend:
32+
type: sglang
33+
34+
prefill_environment:
35+
PYTHONUNBUFFERED: "1"
36+
SGLANG_RADIX_FORCE_MISS: "1"
37+
SGLANG_JIT_DEEPGEMM_FAST_WARMUP: "1"
38+
SGLANG_DEFAULT_THINKING: "1"
39+
SGLANG_DSV4_REASONING_EFFORT: "max"
40+
SGLANG_OPT_SWA_SPLIT_LEAF_ON_INSERT: "1"
41+
SGLANG_OPT_USE_CUSTOM_ALL_REDUCE_V2: "1"
42+
SGLANG_OPT_DEEPGEMM_MEGA_MOE_USE_FP4_ACTS: "1"
43+
SGLANG_OPT_DEEPGEMM_MEGA_MOE_USE_MXF4_KIND: "1"
44+
SGLANG_OPT_DEEPGEMM_MEGA_MOE_NUM_MAX_TOKENS_PER_RANK: "9216"
45+
NCCL_MNNVL_ENABLE: "1"
46+
NCCL_CUMEM_ENABLE: "1"
47+
MC_FORCE_MNNVL: "1"
48+
SGLANG_DISAGGREGATION_BOOTSTRAP_TIMEOUT: "100000"
49+
SGLANG_DISAGGREGATION_WAITING_TIMEOUT: "100000"
50+
SGLANG_OPT_SWA_RELEASE_LEAF_LOCK_AFTER_WINDOW: "1"
51+
UCX_TLS: "cuda_copy,rc"
52+
53+
decode_environment:
54+
PYTHONUNBUFFERED: "1"
55+
SGLANG_RADIX_FORCE_MISS: "1"
56+
SGLANG_JIT_DEEPGEMM_FAST_WARMUP: "1"
57+
SGLANG_DEFAULT_THINKING: "1"
58+
SGLANG_DSV4_REASONING_EFFORT: "max"
59+
SGLANG_OPT_SWA_SPLIT_LEAF_ON_INSERT: "1"
60+
SGLANG_OPT_DEEPGEMM_MEGA_MOE_USE_FP4_ACTS: "1"
61+
SGLANG_OPT_DEEPGEMM_MEGA_MOE_USE_MXF4_KIND: "1"
62+
SGLANG_OPT_DEEPGEMM_MEGA_MOE_NUM_MAX_TOKENS_PER_RANK: "2048"
63+
NCCL_MNNVL_ENABLE: "1"
64+
NCCL_CUMEM_ENABLE: "1"
65+
MC_FORCE_MNNVL: "1"
66+
SGLANG_DISAGGREGATION_BOOTSTRAP_TIMEOUT: "100000"
67+
SGLANG_DISAGGREGATION_WAITING_TIMEOUT: "100000"
68+
SGLANG_OPT_SWA_RELEASE_LEAF_LOCK_AFTER_WINDOW: "1"
69+
UCX_TLS: "cuda_copy,rc"
70+
SGLANG_OPT_USE_CUSTOM_ALL_REDUCE_V2: "0"
71+
72+
sglang_config:
73+
prefill:
74+
served-model-name: "deepseek-ai/DeepSeek-V4-Pro"
75+
model-path: "/model/"
76+
trust-remote-code: true
77+
tool-call-parser: deepseekv4
78+
79+
disaggregation-mode: "prefill"
80+
watchdog-timeout: 86400
81+
disaggregation-transfer-backend: nixl
82+
83+
tensor-parallel-size: 4
84+
data-parallel-size: 4
85+
expert-parallel-size: 4
86+
87+
enable-dp-attention: true
88+
enable-dp-lm-head: true
89+
moe-a2a-backend: "megamoe"
90+
mem-fraction-static: 0.9
91+
max-running-requests: 256
92+
cuda-graph-max-bs: 256
93+
chunked-prefill-size: 32768
94+
stream-interval: 60
95+
96+
decode:
97+
served-model-name: "deepseek-ai/DeepSeek-V4-Pro"
98+
model-path: "/model/"
99+
trust-remote-code: true
100+
tool-call-parser: deepseekv4
101+
102+
disaggregation-mode: "decode"
103+
watchdog-timeout: 86400
104+
disaggregation-transfer-backend: nixl
105+
106+
tensor-parallel-size: 8
107+
data-parallel-size: 8
108+
expert-parallel-size: 8
109+
110+
enable-dp-attention: true
111+
enable-dp-lm-head: true
112+
moe-a2a-backend: "megamoe"
113+
114+
speculative-algo: "EAGLE"
115+
speculative-num-steps: 3
116+
speculative-eagle-topk: 1
117+
speculative-num-draft-tokens: 4
118+
119+
mem-fraction-static: 0.94
120+
max-running-requests: 3072
121+
cuda-graph-max-bs: 256
122+
swa-full-tokens-ratio: 0.15
123+
context-length: 16384
124+
stream-interval: 60
125+
126+
benchmark:
127+
type: "sa-bench"
128+
isl: 8192
129+
osl: 1024
130+
random_range_ratio: 0.8
131+
concurrencies: "256"
132+
req_rate: "inf"
133+
use_chat_template: true
134+
custom_tokenizer: "sa_bench_tokenizers.sglang_deepseek_v4.SGLangDeepseekV4Tokenizer"
Lines changed: 125 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -0,0 +1,125 @@
1+
name: "disagg-b300-1p1d-tp4-tp4-mtp"
2+
3+
frontend:
4+
type: dynamo
5+
enable_multiple_frontends: true
6+
num_additional_frontends: 8
7+
8+
dynamo:
9+
hash: "41882ae9b07232eed4850fb1daf8c958abb2556a"
10+
install: true
11+
12+
model:
13+
path: "deepseek-v4-pro"
14+
container: "lmsysorg/sglang:nightly-dev-cu13-20260721-8905cbd4"
15+
precision: "fp4"
16+
17+
sbatch_directives:
18+
cpus-per-task: "144"
19+
mem: "0"
20+
21+
resources:
22+
gpu_type: "b300"
23+
gpus_per_node: 8
24+
prefill_nodes: 1
25+
prefill_workers: 1
26+
gpus_per_prefill: 4
27+
decode_nodes: 1
28+
decode_workers: 1
29+
gpus_per_decode: 4
30+
31+
backend:
32+
type: sglang
33+
34+
prefill_environment:
35+
PYTHONUNBUFFERED: "1"
36+
SGLANG_RADIX_FORCE_MISS: "1"
37+
SGLANG_JIT_DEEPGEMM_FAST_WARMUP: "1"
38+
SGLANG_DEFAULT_THINKING: "1"
39+
SGLANG_DSV4_REASONING_EFFORT: "max"
40+
SGLANG_OPT_SWA_SPLIT_LEAF_ON_INSERT: "1"
41+
NCCL_MNNVL_ENABLE: "1"
42+
NCCL_CUMEM_ENABLE: "1"
43+
MC_FORCE_MNNVL: "1"
44+
SGLANG_DISAGGREGATION_BOOTSTRAP_TIMEOUT: "100000"
45+
SGLANG_DISAGGREGATION_WAITING_TIMEOUT: "100000"
46+
SGLANG_OPT_SWA_RELEASE_LEAF_LOCK_AFTER_WINDOW: "1"
47+
UCX_TLS: "cuda_copy,rc"
48+
49+
decode_environment:
50+
PYTHONUNBUFFERED: "1"
51+
SGLANG_RADIX_FORCE_MISS: "1"
52+
SGLANG_JIT_DEEPGEMM_FAST_WARMUP: "1"
53+
SGLANG_DEFAULT_THINKING: "1"
54+
SGLANG_DSV4_REASONING_EFFORT: "max"
55+
SGLANG_OPT_SWA_SPLIT_LEAF_ON_INSERT: "1"
56+
NCCL_MNNVL_ENABLE: "1"
57+
NCCL_CUMEM_ENABLE: "1"
58+
MC_FORCE_MNNVL: "1"
59+
SGLANG_DISAGGREGATION_BOOTSTRAP_TIMEOUT: "100000"
60+
SGLANG_DISAGGREGATION_WAITING_TIMEOUT: "100000"
61+
SGLANG_OPT_SWA_RELEASE_LEAF_LOCK_AFTER_WINDOW: "1"
62+
UCX_TLS: "cuda_copy,rc"
63+
64+
sglang_config:
65+
prefill:
66+
served-model-name: "deepseek-ai/DeepSeek-V4-Pro"
67+
model-path: "/model/"
68+
trust-remote-code: true
69+
tool-call-parser: deepseekv4
70+
71+
disaggregation-mode: "prefill"
72+
watchdog-timeout: 86400
73+
disaggregation-transfer-backend: nixl
74+
75+
tensor-parallel-size: 4
76+
data-parallel-size: 1
77+
expert-parallel-size: 1
78+
79+
moe-runner-backend: "flashinfer_mxfp4"
80+
disable-flashinfer-autotune: true
81+
82+
mem-fraction-static: 0.9
83+
max-running-requests: 8
84+
cuda-graph-max-bs: 8
85+
chunked-prefill-size: 32768
86+
87+
88+
decode:
89+
served-model-name: "deepseek-ai/DeepSeek-V4-Pro"
90+
model-path: "/model/"
91+
trust-remote-code: true
92+
tool-call-parser: deepseekv4
93+
94+
disaggregation-mode: "decode"
95+
watchdog-timeout: 86400
96+
disaggregation-transfer-backend: nixl
97+
98+
tensor-parallel-size: 4
99+
data-parallel-size: 1
100+
expert-parallel-size: 1
101+
102+
moe-runner-backend: "flashinfer_mxfp4"
103+
disable-flashinfer-autotune: true
104+
105+
speculative-algo: "EAGLE"
106+
speculative-num-steps: 3
107+
speculative-eagle-topk: 1
108+
speculative-num-draft-tokens: 4
109+
110+
mem-fraction-static: 0.9
111+
max-running-requests: 8
112+
cuda-graph-max-bs: 8
113+
swa-full-tokens-ratio: 0.1
114+
context-length: 16384
115+
116+
117+
benchmark:
118+
type: "sa-bench"
119+
isl: 8192
120+
osl: 1024
121+
random_range_ratio: 0.8
122+
concurrencies: "1"
123+
req_rate: "inf"
124+
use_chat_template: true
125+
custom_tokenizer: "sa_bench_tokenizers.sglang_deepseek_v4.SGLangDeepseekV4Tokenizer"
Lines changed: 135 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -0,0 +1,135 @@
1+
name: "disagg-b300-1p2d-dep4-dep8-mtp"
2+
3+
frontend:
4+
type: dynamo
5+
enable_multiple_frontends: true
6+
num_additional_frontends: 8
7+
8+
dynamo:
9+
hash: "41882ae9b07232eed4850fb1daf8c958abb2556a"
10+
install: true
11+
12+
model:
13+
path: "deepseek-v4-pro"
14+
container: "lmsysorg/sglang:nightly-dev-cu13-20260721-8905cbd4"
15+
precision: "fp4"
16+
17+
sbatch_directives:
18+
cpus-per-task: "144"
19+
mem: "0"
20+
21+
resources:
22+
gpu_type: "b300"
23+
gpus_per_node: 8
24+
prefill_nodes: 1
25+
prefill_workers: 1
26+
gpus_per_prefill: 4
27+
decode_nodes: 2
28+
decode_workers: 2
29+
gpus_per_decode: 8
30+
31+
backend:
32+
type: sglang
33+
34+
prefill_environment:
35+
PYTHONUNBUFFERED: "1"
36+
SGLANG_RADIX_FORCE_MISS: "1"
37+
SGLANG_JIT_DEEPGEMM_FAST_WARMUP: "1"
38+
SGLANG_DEFAULT_THINKING: "1"
39+
SGLANG_DSV4_REASONING_EFFORT: "max"
40+
SGLANG_OPT_SWA_SPLIT_LEAF_ON_INSERT: "1"
41+
SGLANG_OPT_USE_CUSTOM_ALL_REDUCE_V2: "1"
42+
SGLANG_OPT_DEEPGEMM_MEGA_MOE_USE_FP4_ACTS: "1"
43+
SGLANG_OPT_DEEPGEMM_MEGA_MOE_USE_MXF4_KIND: "1"
44+
SGLANG_OPT_DEEPGEMM_MEGA_MOE_NUM_MAX_TOKENS_PER_RANK: "9216"
45+
NCCL_MNNVL_ENABLE: "1"
46+
NCCL_CUMEM_ENABLE: "1"
47+
MC_FORCE_MNNVL: "1"
48+
SGLANG_DISAGGREGATION_BOOTSTRAP_TIMEOUT: "100000"
49+
SGLANG_DISAGGREGATION_WAITING_TIMEOUT: "100000"
50+
SGLANG_OPT_SWA_RELEASE_LEAF_LOCK_AFTER_WINDOW: "1"
51+
UCX_TLS: "cuda_copy,rc"
52+
53+
decode_environment:
54+
PYTHONUNBUFFERED: "1"
55+
SGLANG_RADIX_FORCE_MISS: "1"
56+
SGLANG_JIT_DEEPGEMM_FAST_WARMUP: "1"
57+
SGLANG_DEFAULT_THINKING: "1"
58+
SGLANG_DSV4_REASONING_EFFORT: "max"
59+
SGLANG_OPT_SWA_SPLIT_LEAF_ON_INSERT: "1"
60+
SGLANG_OPT_DEEPGEMM_MEGA_MOE_USE_FP4_ACTS: "1"
61+
SGLANG_OPT_DEEPGEMM_MEGA_MOE_USE_MXF4_KIND: "1"
62+
SGLANG_OPT_DEEPGEMM_MEGA_MOE_NUM_MAX_TOKENS_PER_RANK: "2048"
63+
NCCL_MNNVL_ENABLE: "1"
64+
NCCL_CUMEM_ENABLE: "1"
65+
MC_FORCE_MNNVL: "1"
66+
SGLANG_DISAGGREGATION_BOOTSTRAP_TIMEOUT: "100000"
67+
SGLANG_DISAGGREGATION_WAITING_TIMEOUT: "100000"
68+
SGLANG_OPT_SWA_RELEASE_LEAF_LOCK_AFTER_WINDOW: "1"
69+
UCX_TLS: "cuda_copy,rc"
70+
SGLANG_OPT_USE_CUSTOM_ALL_REDUCE_V2: "0"
71+
72+
sglang_config:
73+
prefill:
74+
served-model-name: "deepseek-ai/DeepSeek-V4-Pro"
75+
model-path: "/model/"
76+
trust-remote-code: true
77+
tool-call-parser: deepseekv4
78+
79+
disaggregation-mode: "prefill"
80+
watchdog-timeout: 86400
81+
disaggregation-transfer-backend: nixl
82+
83+
tensor-parallel-size: 4
84+
data-parallel-size: 4
85+
expert-parallel-size: 4
86+
87+
enable-dp-attention: true
88+
enable-dp-lm-head: true
89+
moe-a2a-backend: "megamoe"
90+
91+
mem-fraction-static: 0.9
92+
max-running-requests: 256
93+
cuda-graph-max-bs: 256
94+
chunked-prefill-size: 32768
95+
stream-interval: 60
96+
97+
decode:
98+
served-model-name: "deepseek-ai/DeepSeek-V4-Pro"
99+
model-path: "/model/"
100+
trust-remote-code: true
101+
tool-call-parser: deepseekv4
102+
103+
disaggregation-mode: "decode"
104+
watchdog-timeout: 86400
105+
disaggregation-transfer-backend: nixl
106+
107+
tensor-parallel-size: 8
108+
data-parallel-size: 8
109+
expert-parallel-size: 8
110+
111+
enable-dp-attention: true
112+
enable-dp-lm-head: true
113+
moe-a2a-backend: "megamoe"
114+
115+
speculative-algo: "EAGLE"
116+
speculative-num-steps: 3
117+
speculative-eagle-topk: 1
118+
speculative-num-draft-tokens: 4
119+
120+
mem-fraction-static: 0.94
121+
max-running-requests: 3072
122+
cuda-graph-max-bs: 256
123+
swa-full-tokens-ratio: 0.15
124+
context-length: 16384
125+
stream-interval: 60
126+
127+
benchmark:
128+
type: "sa-bench"
129+
isl: 8192
130+
osl: 1024
131+
random_range_ratio: 0.8
132+
concurrencies: "256"
133+
req_rate: "inf"
134+
use_chat_template: true
135+
custom_tokenizer: "sa_bench_tokenizers.sglang_deepseek_v4.SGLangDeepseekV4Tokenizer"

0 commit comments

Comments
 (0)