@@ -1269,7 +1269,9 @@ def concat_ba_and_transpose(input_tensor, target_shape=None):
12691269 hooks [f"{ mlp_prefix } -shared_expert-wo-kernel" ] = transpose
12701270 hooks [f"{ mlp_prefix } -shared_expert_gate-kernel" ] = transpose
12711271
1272- hooks [(f"{ mlp_prefix } -routed_experts-wi_0" , f"{ mlp_prefix } -routed_experts-wi_1" )] = process_wi_0_wi_1 # pyrefly: ignore[unsupported-operation]
1272+ hooks [(f"{ mlp_prefix } -routed_experts-wi_0" , f"{ mlp_prefix } -routed_experts-wi_1" )] = (
1273+ process_wi_0_wi_1 # pyrefly: ignore[unsupported-operation]
1274+ )
12731275 hooks [f"{ mlp_prefix } -routed_experts-wo" ] = transpose_expert
12741276
12751277 # Vision hooks for Qwen3.5
@@ -1340,7 +1342,9 @@ def reshape_vision_attn_out(input_tensor, target_shape):
13401342 return input_tensor .T .reshape (target_shape )
13411343
13421344 # Apply vision hooks
1343- hooks ["params-vision_encoder-Qwen3_5MoeVisionEncoder_0-patch_embed-proj-kernel" ] = reshape_conv3d_patch_embed # pyrefly: ignore[bad-assignment]
1345+ hooks ["params-vision_encoder-Qwen3_5MoeVisionEncoder_0-patch_embed-proj-kernel" ] = (
1346+ reshape_conv3d_patch_embed # pyrefly: ignore[bad-assignment]
1347+ )
13441348
13451349 for i in range (n_vision_layers ):
13461350 prefix = f"params-vision_encoder-Qwen3_5MoeVisionEncoder_0-blocks_{ i } "
@@ -1355,8 +1359,12 @@ def reshape_vision_attn_out(input_tensor, target_shape):
13551359 hooks [f"{ prefix } -mlp_out-kernel" ] = reshape_kernel_vision # pyrefly: ignore[bad-assignment]
13561360
13571361 # Vision projector
1358- hooks ["params-vision_encoder-Qwen3_5MoeVisionProjector_0-merger-mlp_0-kernel" ] = reshape_kernel_vision # pyrefly: ignore[bad-assignment]
1359- hooks ["params-vision_encoder-Qwen3_5MoeVisionProjector_0-merger-mlp_2-kernel" ] = reshape_kernel_vision # pyrefly: ignore[bad-assignment]
1362+ hooks ["params-vision_encoder-Qwen3_5MoeVisionProjector_0-merger-mlp_0-kernel" ] = (
1363+ reshape_kernel_vision # pyrefly: ignore[bad-assignment]
1364+ )
1365+ hooks ["params-vision_encoder-Qwen3_5MoeVisionProjector_0-merger-mlp_2-kernel" ] = (
1366+ reshape_kernel_vision # pyrefly: ignore[bad-assignment]
1367+ )
13601368
13611369 return hooks
13621370
@@ -1384,7 +1392,9 @@ def QWEN3_NEXT_MAXTEXT_TO_HF_PARAM_MAPPING(config, maxtext_config, scan_layers=F
13841392 prefix = f"params-decoder-layers-layer_{ block_idx } "
13851393
13861394 # Layer norms
1387- mapping [f"{ prefix } -input_layernorm-scale" ] = [f"model.layers.{ i } .input_layernorm.weight" for i in hf_indices ] # pyrefly: ignore[bad-assignment]
1395+ mapping [f"{ prefix } -input_layernorm-scale" ] = [
1396+ f"model.layers.{ i } .input_layernorm.weight" for i in hf_indices
1397+ ] # pyrefly: ignore[bad-assignment]
13881398 mapping [f"{ prefix } -post_attention_layernorm-scale" ] = [ # pyrefly: ignore[bad-assignment]
13891399 f"model.layers.{ i } .post_attention_layernorm.weight" for i in hf_indices
13901400 ]
@@ -1943,7 +1953,9 @@ def interleave(input_tensor, target_shape=None):
19431953 hooks [f"{ prefix } -GptOssMlp-gate-kernel" ] = transpose
19441954 # `composite_mt_key`: A hook for combining multiple MaxText params.
19451955 hooks [(f"{ prefix } -GptOssMlp-wi_0" , f"{ prefix } -GptOssMlp-wi_1" )] = interleave # pyrefly: ignore[unsupported-operation]
1946- hooks [(f"{ prefix } -GptOssMlp-wi_0_bias" , f"{ prefix } -GptOssMlp-wi_1_bias" )] = interleave # pyrefly: ignore[unsupported-operation]
1956+ hooks [(f"{ prefix } -GptOssMlp-wi_0_bias" , f"{ prefix } -GptOssMlp-wi_1_bias" )] = (
1957+ interleave # pyrefly: ignore[unsupported-operation]
1958+ )
19471959
19481960 return hooks
19491961
0 commit comments