@@ -126,6 +126,9 @@ class LLM:
126126 EXPERTS_PER_GROUP = "{arch}.experts_per_group"
127127 MOE_EVERY_N_LAYERS = "{arch}.moe_every_n_layers"
128128 MOE_LATENT_SIZE = "{arch}.moe_latent_size"
129+ SITU_BETA = "{arch}.situ_beta"
130+ SITU_LINEAR_BETA = "{arch}.situ_linear_beta"
131+ ATTN_RES_BLOCK_SIZE = "{arch}.attn_res_block_size"
129132 NEXTN_PREDICT_LAYERS = "{arch}.nextn_predict_layers"
130133 NUM_DEEPSTACK_LAYERS = "{arch}.n_deepstack_layers"
131134 DEEPSTACK_MAPPING = "{arch}.deepstack_mapping"
@@ -243,7 +246,8 @@ class SSM:
243246 DT_B_C_RMS = "{arch}.ssm.dt_b_c_rms"
244247
245248 class KDA :
246- HEAD_DIM = "{arch}.kda.head_dim"
249+ HEAD_DIM = "{arch}.kda.head_dim"
250+ GATE_LOWER_BOUND = "{arch}.kda.gate_lower_bound"
247251
248252 class WKV :
249253 HEAD_SIZE = "{arch}.wkv.head_size"
@@ -545,6 +549,7 @@ class MODEL_ARCH(IntEnum):
545549 LLAMA_EMBED = auto ()
546550 MAINCODER = auto ()
547551 KIMI_LINEAR = auto ()
552+ KIMI_K3 = auto ()
548553 TALKIE = auto ()
549554 MELLUM = auto ()
550555 NANBEIGE = auto ()
@@ -620,6 +625,13 @@ class MODEL_TENSOR(IntEnum):
620625 FFN_GATE_TID2EID = auto ()
621626 MOE_LATENT_DOWN = auto () # nemotron 3 super
622627 MOE_LATENT_UP = auto () # nemotron 3 super
628+ MOE_LATENT_NORM = auto () # kimi k3
629+ ATTN_RES_NORM = auto () # kimi k3
630+ ATTN_RES_PROJ = auto () # kimi k3
631+ FFN_RES_NORM = auto () # kimi k3
632+ FFN_RES_PROJ = auto () # kimi k3
633+ OUTPUT_RES_NORM = auto () # kimi k3
634+ OUTPUT_RES_PROJ = auto () # kimi k3
623635 ATTN_Q_NORM = auto ()
624636 ATTN_K_NORM = auto ()
625637 LAYER_OUT_NORM = auto ()
@@ -1135,6 +1147,7 @@ class MODEL_TENSOR(IntEnum):
11351147 MODEL_ARCH .LLAMA_EMBED : "llama-embed" ,
11361148 MODEL_ARCH .MAINCODER : "maincoder" ,
11371149 MODEL_ARCH .KIMI_LINEAR : "kimi-linear" ,
1150+ MODEL_ARCH .KIMI_K3 : "kimi-k3" ,
11381151 MODEL_ARCH .TALKIE : "talkie" ,
11391152 MODEL_ARCH .MELLUM : "mellum" ,
11401153 MODEL_ARCH .NANBEIGE : "nanbeige" ,
@@ -1210,6 +1223,13 @@ class MODEL_TENSOR(IntEnum):
12101223 MODEL_TENSOR .FFN_GATE_TID2EID : "blk.{bid}.ffn_gate_tid2eid" ,
12111224 MODEL_TENSOR .MOE_LATENT_DOWN : "blk.{bid}.ffn_latent_down" , # nemotron 3 super
12121225 MODEL_TENSOR .MOE_LATENT_UP : "blk.{bid}.ffn_latent_up" , # nemotron 3 super
1226+ MODEL_TENSOR .MOE_LATENT_NORM : "blk.{bid}.ffn_latent_norm" , # kimi k3
1227+ MODEL_TENSOR .ATTN_RES_NORM : "blk.{bid}.attn_res_norm" , # kimi k3
1228+ MODEL_TENSOR .ATTN_RES_PROJ : "blk.{bid}.attn_res_proj" , # kimi k3
1229+ MODEL_TENSOR .FFN_RES_NORM : "blk.{bid}.ffn_res_norm" , # kimi k3
1230+ MODEL_TENSOR .FFN_RES_PROJ : "blk.{bid}.ffn_res_proj" , # kimi k3
1231+ MODEL_TENSOR .OUTPUT_RES_NORM : "output_res_norm" , # kimi k3
1232+ MODEL_TENSOR .OUTPUT_RES_PROJ : "output_res_proj" , # kimi k3
12131233 MODEL_TENSOR .LAYER_OUT_NORM : "blk.{bid}.layer_output_norm" ,
12141234 MODEL_TENSOR .LAYER_OUT_SCALE : "blk.{bid}.layer_output_scale" ,
12151235 MODEL_TENSOR .PER_LAYER_TOKEN_EMBD : "per_layer_token_embd" , # gemma3n
@@ -4438,6 +4458,55 @@ class MODEL_TENSOR(IntEnum):
44384458 MODEL_TENSOR .FFN_DOWN ,
44394459 MODEL_TENSOR .FFN_UP ,
44404460 ],
4461+ MODEL_ARCH .KIMI_K3 : [
4462+ MODEL_TENSOR .TOKEN_EMBD ,
4463+ MODEL_TENSOR .OUTPUT_NORM ,
4464+ MODEL_TENSOR .OUTPUT ,
4465+ MODEL_TENSOR .OUTPUT_RES_NORM ,
4466+ MODEL_TENSOR .OUTPUT_RES_PROJ ,
4467+ MODEL_TENSOR .ATTN_NORM ,
4468+ MODEL_TENSOR .ATTN_Q ,
4469+ MODEL_TENSOR .ATTN_K ,
4470+ MODEL_TENSOR .ATTN_V ,
4471+ MODEL_TENSOR .ATTN_OUT ,
4472+ MODEL_TENSOR .ATTN_GATE ,
4473+ MODEL_TENSOR .ATTN_Q_A ,
4474+ MODEL_TENSOR .ATTN_Q_B ,
4475+ MODEL_TENSOR .ATTN_KV_A_MQA ,
4476+ MODEL_TENSOR .ATTN_KV_B ,
4477+ MODEL_TENSOR .ATTN_K_B ,
4478+ MODEL_TENSOR .ATTN_V_B ,
4479+ MODEL_TENSOR .ATTN_Q_A_NORM ,
4480+ MODEL_TENSOR .ATTN_KV_A_NORM ,
4481+ MODEL_TENSOR .ATTN_RES_NORM ,
4482+ MODEL_TENSOR .ATTN_RES_PROJ ,
4483+ MODEL_TENSOR .FFN_RES_NORM ,
4484+ MODEL_TENSOR .FFN_RES_PROJ ,
4485+ MODEL_TENSOR .FFN_NORM ,
4486+ MODEL_TENSOR .FFN_GATE ,
4487+ MODEL_TENSOR .FFN_DOWN ,
4488+ MODEL_TENSOR .FFN_UP ,
4489+ MODEL_TENSOR .FFN_GATE_INP ,
4490+ MODEL_TENSOR .FFN_GATE_EXP ,
4491+ MODEL_TENSOR .FFN_DOWN_EXP ,
4492+ MODEL_TENSOR .FFN_UP_EXP ,
4493+ MODEL_TENSOR .MOE_LATENT_DOWN ,
4494+ MODEL_TENSOR .MOE_LATENT_NORM ,
4495+ MODEL_TENSOR .MOE_LATENT_UP ,
4496+ MODEL_TENSOR .SSM_CONV1D_Q ,
4497+ MODEL_TENSOR .SSM_CONV1D_K ,
4498+ MODEL_TENSOR .SSM_CONV1D_V ,
4499+ MODEL_TENSOR .SSM_F_A ,
4500+ MODEL_TENSOR .SSM_F_B ,
4501+ MODEL_TENSOR .SSM_BETA ,
4502+ MODEL_TENSOR .SSM_A ,
4503+ MODEL_TENSOR .SSM_DT ,
4504+ MODEL_TENSOR .SSM_NORM ,
4505+ MODEL_TENSOR .FFN_EXP_PROBS_B ,
4506+ MODEL_TENSOR .FFN_GATE_SHEXP ,
4507+ MODEL_TENSOR .FFN_DOWN_SHEXP ,
4508+ MODEL_TENSOR .FFN_UP_SHEXP ,
4509+ ],
44414510 MODEL_ARCH .KIMI_LINEAR : [
44424511 MODEL_TENSOR .TOKEN_EMBD ,
44434512 MODEL_TENSOR .OUTPUT_NORM ,
0 commit comments