Skip to content

Commit 4720c3e

Browse files
committed
fix: set rope_max_timescale to 1M for qwen3-30b-a3b-base and update HF configuration
- Set rope_max_timescale to 1,000,000 in qwen3-30b-a3b-base.yml config. - Update qwen3_30b_a3b_base_config in hf_model_configs.py: eos_token_id=151645, max_position_embeddings=40960.
1 parent 61c225f commit 4720c3e

2 files changed

Lines changed: 39 additions & 2 deletions

File tree

src/maxtext/checkpoint_conversion/utils/hf_model_configs.py

Lines changed: 38 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -718,6 +718,43 @@
718718
vocab_size=151936,
719719
)
720720

721+
qwen3_30b_a3b_base_config = transformers.Qwen3MoeConfig(
722+
architectures=["Qwen3MoeForCausalLM"],
723+
attention_bias=False,
724+
attention_dropout=0.0,
725+
bos_token_id=151643,
726+
decoder_sparse_step=1,
727+
eos_token_id=151645,
728+
head_dim=128,
729+
hidden_act="silu",
730+
hidden_size=2048,
731+
initializer_range=0.02,
732+
intermediate_size=6144,
733+
max_position_embeddings=40960,
734+
max_window_layers=48,
735+
mlp_only_layers=[],
736+
model_type="qwen3_moe",
737+
moe_intermediate_size=768,
738+
norm_topk_prob=True,
739+
num_attention_heads=32,
740+
num_experts=128,
741+
num_experts_per_tok=8,
742+
num_hidden_layers=48,
743+
num_key_value_heads=4,
744+
output_router_logits=False,
745+
rms_norm_eps=1e-06,
746+
rope_scaling=None,
747+
rope_theta=1000000,
748+
router_aux_loss_coef=0.001,
749+
sliding_window=None,
750+
tie_word_embeddings=False,
751+
torch_dtype="bfloat16",
752+
transformers_version="4.51.0",
753+
use_cache=True,
754+
use_sliding_window=False,
755+
vocab_size=151936,
756+
)
757+
721758
qwen3_235b_a22b_thinking_2507_config = transformers.Qwen3MoeConfig(
722759
architectures=["Qwen3MoeForCausalLM"],
723760
attention_bias=False,
@@ -1579,7 +1616,7 @@ def __init__(self, **kwargs):
15791616
"llama3.1-70b": llama31_70b_config,
15801617
"llama3.1-405b": llama31_405b_config,
15811618
"qwen3-30b-a3b": qwen3_30b_a3b_thinking_2507_config,
1582-
"qwen3-30b-a3b-base": qwen3_30b_a3b_thinking_2507_config,
1619+
"qwen3-30b-a3b-base": qwen3_30b_a3b_base_config,
15831620
"qwen3-235b-a22b": qwen3_235b_a22b_thinking_2507_config,
15841621
"qwen3-480b-a35b": qwen3_coder_480b_a35b_config,
15851622
"deepseek2-16b": deepseek2_16b_config,

src/maxtext/configs/models/qwen3-30b-a3b-base.yml

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -34,7 +34,7 @@ base_moe_mlp_dim: 768
3434
norm_topk_prob: true
3535

3636
# RoPE Settings
37-
rope_max_timescale: 10_000_000
37+
rope_max_timescale: 1_000_000
3838

3939
# General Model Settings
4040
enable_dropout: false

0 commit comments

Comments
 (0)