@@ -1366,15 +1366,15 @@ class TensorNameMap:
13661366 "mlp_AR.linear_{bid}" , # PaddleOCR-VL
13671367 "merger.mlp.{bid}" ,
13681368 "vision_tower.merger.mlp.{bid}" , # dots.ocr
1369- "vit.perceive.proj.{bid}" , # HunyuanOCR (proj.0 = conv1, proj.2 = conv2)
1369+ "vit.perceive.proj.{bid}" , # HunyuanVL (proj.0 = conv1, proj.2 = conv2)
13701370 ),
13711371
13721372 MODEL_TENSOR .V_MMPROJ_FC : (
13731373 "model.connector.modality_projection.proj" , # SmolVLM
13741374 "model.vision.linear_proj.linear_proj" , # cogvlm
13751375 "model.projector.layers" , # Deepseek-OCR
13761376 "visual.merger.proj" , # glm4v
1377- "vit.perceive.mlp" , # HunyuanOCR
1377+ "vit.perceive.mlp" , # HunyuanVL
13781378 ),
13791379
13801380 MODEL_TENSOR .V_MMPROJ_MLP : (
@@ -1403,7 +1403,7 @@ class TensorNameMap:
14031403 "model.vision_tower.embeddings.patch_embeddings.projection" , # Intern-S1
14041404 "vpm.embeddings.patch_embedding" ,
14051405 "model.vision_model.embeddings.patch_embedding" , # SmolVLM
1406- "vit.embeddings.patch_embedding" , # HunyuanOCR
1406+ "vit.embeddings.patch_embedding" , # HunyuanVL
14071407 "vision_tower.patch_conv" , # pixtral-hf
14081408 "vision_encoder.patch_conv" , # pixtral
14091409 "vision_model.patch_embedding.linear" , # llama 4
@@ -1429,7 +1429,7 @@ class TensorNameMap:
14291429 "model.vision_tower.embeddings.position_embeddings" , # Intern-S1
14301430 "vpm.embeddings.position_embedding" ,
14311431 "model.vision_model.embeddings.position_embedding" , # SmolVLM
1432- "vit.embeddings.position_embedding" , # HunyuanOCR
1432+ "vit.embeddings.position_embedding" , # HunyuanVL
14331433 "vision_model.positional_embedding_vlm" , # llama 4
14341434 "vision_tower.patch_embed.pos_emb" , # kimi-vl
14351435 "visual.pos_embed" , # qwen3vl
@@ -1442,12 +1442,12 @@ class TensorNameMap:
14421442
14431443 MODEL_TENSOR .V_ENC_EMBD_IMGNL : (
14441444 "model.image_newline" , # Deepseek-OCR
1445- "vit.perceive.image_newline" , # HunyuanOCR
1445+ "vit.perceive.image_newline" , # HunyuanVL
14461446 ),
14471447
14481448 MODEL_TENSOR .V_ENC_EMBD_VSEP : (
14491449 "model.view_seperator" , # Deepseek-OCR
1450- "vit.perceive.image_sep" , # HunyuanOCR
1450+ "vit.perceive.image_sep" , # HunyuanVL
14511451 ),
14521452
14531453 MODEL_TENSOR .V_ENC_ATTN_QKV : (
@@ -1466,7 +1466,7 @@ class TensorNameMap:
14661466 "model.vision_tower.encoder.layer.{bid}.attention.q_proj" , # Intern-S1
14671467 "vpm.encoder.layers.{bid}.self_attn.q_proj" ,
14681468 "model.vision_model.encoder.layers.{bid}.self_attn.q_proj" , # SmolVLM
1469- "vit.layers.{bid}.self_attn.q_proj" , # HunyuanOCR
1469+ "vit.layers.{bid}.self_attn.q_proj" , # HunyuanVL
14701470 "vision_model.model.layers.{bid}.self_attn.q_proj" , # llama4
14711471 "vision_tower.transformer.layers.{bid}.attention.q_proj" , # pixtral-hf
14721472 "vision_encoder.transformer.layers.{bid}.attention.wq" , # pixtral
@@ -1490,7 +1490,7 @@ class TensorNameMap:
14901490 "model.vision_tower.encoder.layer.{bid}.attention.k_proj" , # Intern-S1
14911491 "vpm.encoder.layers.{bid}.self_attn.k_proj" ,
14921492 "model.vision_model.encoder.layers.{bid}.self_attn.k_proj" , # SmolVLM
1493- "vit.layers.{bid}.self_attn.k_proj" , # HunyuanOCR
1493+ "vit.layers.{bid}.self_attn.k_proj" , # HunyuanVL
14941494 "vision_model.model.layers.{bid}.self_attn.k_proj" , # llama4
14951495 "vision_tower.transformer.layers.{bid}.attention.k_proj" , # pixtral-hf
14961496 "vision_encoder.transformer.layers.{bid}.attention.wk" , # pixtral
@@ -1514,7 +1514,7 @@ class TensorNameMap:
15141514 "model.vision_tower.encoder.layer.{bid}.attention.v_proj" , # Intern-S1
15151515 "vpm.encoder.layers.{bid}.self_attn.v_proj" ,
15161516 "model.vision_model.encoder.layers.{bid}.self_attn.v_proj" , # SmolVLM
1517- "vit.layers.{bid}.self_attn.v_proj" , # HunyuanOCR
1517+ "vit.layers.{bid}.self_attn.v_proj" , # HunyuanVL
15181518 "vision_model.model.layers.{bid}.self_attn.v_proj" , # llama4
15191519 "vision_tower.transformer.layers.{bid}.attention.v_proj" , # pixtral-hf
15201520 "vision_encoder.transformer.layers.{bid}.attention.wv" , # pixtral
@@ -1532,7 +1532,7 @@ class TensorNameMap:
15321532 "model.vision_tower.encoder.layer.{bid}.layernorm_before" , # Intern-S1
15331533 "vpm.encoder.layers.{bid}.layer_norm1" ,
15341534 "model.vision_model.encoder.layers.{bid}.layer_norm1" , # SmolVLM
1535- "vit.layers.{bid}.input_layernorm" , # HunyuanOCR
1535+ "vit.layers.{bid}.input_layernorm" , # HunyuanVL
15361536 "vision_tower.transformer.layers.{bid}.attention_norm" , # pixtral-hf
15371537 "vision_encoder.transformer.layers.{bid}.attention_norm" , # pixtral
15381538 "vision_model.model.layers.{bid}.input_layernorm" , # llama4, gemma4
@@ -1553,7 +1553,7 @@ class TensorNameMap:
15531553 "model.vision_tower.encoder.layer.{bid}.attention.projection_layer" , # Intern-S1
15541554 "vpm.encoder.layers.{bid}.self_attn.out_proj" ,
15551555 "model.vision_model.encoder.layers.{bid}.self_attn.out_proj" , # SmolVLM
1556- "vit.layers.{bid}.self_attn.o_proj" , # HunyuanOCR
1556+ "vit.layers.{bid}.self_attn.o_proj" , # HunyuanVL
15571557 "model.vision_model.encoder.layers.{bid}.self_attn.projection_layer" , # Janus Pro
15581558 "vision_model.model.layers.{bid}.self_attn.o_proj" , # llama4
15591559 "vision_tower.transformer.layers.{bid}.attention.o_proj" , # pixtral-hf
@@ -1580,7 +1580,7 @@ class TensorNameMap:
15801580 "model.vision_tower.encoder.layer.{bid}.layernorm_after" , # Intern-S1
15811581 "vpm.encoder.layers.{bid}.layer_norm2" ,
15821582 "model.vision_model.encoder.layers.{bid}.layer_norm2" , # SmolVLM
1583- "vit.layers.{bid}.post_attention_layernorm" , # HunyuanOCR
1583+ "vit.layers.{bid}.post_attention_layernorm" , # HunyuanVL
15841584 "vision_model.model.layers.{bid}.post_attention_layernorm" , # llama4
15851585 "vision_tower.transformer.layers.{bid}.ffn_norm" , # pixtral-hf
15861586 "vision_encoder.transformer.layers.{bid}.ffn_norm" , # pixtral
@@ -1601,7 +1601,7 @@ class TensorNameMap:
16011601 "model.vision_tower.encoder.layer.{bid}.mlp.fc1" , # Intern-S1
16021602 "vpm.encoder.layers.{bid}.mlp.fc1" ,
16031603 "model.vision_model.encoder.layers.{bid}.mlp.fc1" , # SmolVLM, gemma3
1604- "vit.layers.{bid}.mlp.dense_h_to_4h" , # HunyuanOCR
1604+ "vit.layers.{bid}.mlp.dense_h_to_4h" , # HunyuanVL
16051605 "vision_tower.transformer.layers.{bid}.feed_forward.up_proj" , # pixtral-hf
16061606 "vision_encoder.transformer.layers.{bid}.feed_forward.w3" , # pixtral
16071607 "vision_model.model.layers.{bid}.mlp.fc1" , # llama4
@@ -1630,7 +1630,7 @@ class TensorNameMap:
16301630 "model.vision_tower.encoder.layer.{bid}.mlp.fc2" , # Intern-S1
16311631 "vpm.encoder.layers.{bid}.mlp.fc2" ,
16321632 "model.vision_model.encoder.layers.{bid}.mlp.fc2" , # SmolVLM, gemma3
1633- "vit.layers.{bid}.mlp.dense_4h_to_h" , # HunyuanOCR
1633+ "vit.layers.{bid}.mlp.dense_4h_to_h" , # HunyuanVL
16341634 "vision_tower.transformer.layers.{bid}.feed_forward.down_proj" , # pixtral-hf
16351635 "vision_encoder.transformer.layers.{bid}.feed_forward.w2" , # pixtral
16361636 "vision_model.model.layers.{bid}.mlp.fc2" , # llama4
@@ -1694,7 +1694,7 @@ class TensorNameMap:
16941694 MODEL_TENSOR .V_MM_POST_NORM : (
16951695 "visual.merger.post_projection_norm" , # glm4v
16961696 "vision_tower.post_trunk_norm" , # dots.ocr
1697- "vit.perceive.after_rms" , # HunyuanOCR
1697+ "vit.perceive.after_rms" , # HunyuanVL
16981698 ),
16991699
17001700 MODEL_TENSOR .V_MM_INP_PROJ : (
@@ -1899,15 +1899,15 @@ class TensorNameMap:
18991899 ),
19001900
19011901 MODEL_TENSOR .V_MM_PRE_NORM : (
1902- "vit.perceive.before_rms" , # HunyuanOCR
1902+ "vit.perceive.before_rms" , # HunyuanVL
19031903 ),
19041904
19051905 MODEL_TENSOR .V_TOK_IMG_BEGIN : (
1906- "vit.perceive.image_begin" , # HunyuanOCR
1906+ "vit.perceive.image_begin" , # HunyuanVL
19071907 ),
19081908
19091909 MODEL_TENSOR .V_TOK_IMG_END : (
1910- "vit.perceive.image_end" , # HunyuanOCR
1910+ "vit.perceive.image_end" , # HunyuanVL
19111911 ),
19121912
19131913 MODEL_TENSOR .V_STD_BIAS : (
0 commit comments