@@ -44,7 +44,7 @@ def preprocess_mm_data(config):
4444
4545 images = [mm_utils .load_image_from_path (p ) for p in config .image_path .split ("," )]
4646 processor_outputs = preprocess_mm_data_llama4 (images )
47- elif config .model_name in ["qwen3-omni-30b-a3b" , "qwen3-vl-4b" , "qwen3.5-35b-a3b" , "qwen3.5-397b-a17b" ]:
47+ elif config .model_name in ["qwen3-omni-30b-a3b" , "qwen3-vl-2b" , "qwen3-vl- 4b" , "qwen3.5-35b-a3b" , "qwen3.5-397b-a17b" ]:
4848 from maxtext .multimodal .processor_qwen3_omni import preprocess_mm_data_qwen3_omni # pylint: disable=import-outside-toplevel
4949
5050 processor_outputs = preprocess_mm_data_qwen3_omni (config )
@@ -68,7 +68,7 @@ def preprocess_image_for_training(image, config):
6868 from maxtext .multimodal .processor_llama4 import preprocess_mm_data_llama4 # pylint: disable=import-outside-toplevel
6969
7070 return preprocess_mm_data_llama4 (image )
71- elif config .model_name in ["qwen3-omni-30b-a3b" , "qwen3-vl-4b" , "qwen3.5-35b-a3b" , "qwen3.5-397b-a17b" ]:
71+ elif config .model_name in ["qwen3-omni-30b-a3b" , "qwen3-vl-2b" , "qwen3-vl- 4b" , "qwen3.5-35b-a3b" , "qwen3.5-397b-a17b" ]:
7272 from maxtext .multimodal .processor_qwen3_omni import preprocess_mm_data_qwen3_omni_for_training # pylint: disable=import-outside-toplevel
7373
7474 return preprocess_mm_data_qwen3_omni_for_training (image , config )
@@ -90,7 +90,7 @@ def get_image_offsets(config, processor_output: mm_utils.PreprocessorOutput | No
9090 from maxtext .multimodal .processor_llama4 import get_image_offsets_llama4 # pylint: disable=import-outside-toplevel
9191
9292 return get_image_offsets_llama4 (processor_output )
93- elif config .model_name in ["qwen3-omni-30b-a3b" , "qwen3-vl-4b" , "qwen3.5-35b-a3b" , "qwen3.5-397b-a17b" ]:
93+ elif config .model_name in ["qwen3-omni-30b-a3b" , "qwen3-vl-2b" , "qwen3-vl- 4b" , "qwen3.5-35b-a3b" , "qwen3.5-397b-a17b" ]:
9494 from maxtext .multimodal .processor_qwen3_omni import get_mm_offsets_qwen3_omni # pylint: disable=import-outside-toplevel
9595
9696 return get_mm_offsets_qwen3_omni (config , processor_output )
@@ -112,7 +112,7 @@ def reformat_prompt(prompt, image_placeholder, model_name, num_images, video_pla
112112 from maxtext .multimodal .processor_llama4 import reformat_prompt_llama4 # pylint: disable=import-outside-toplevel
113113
114114 return reformat_prompt_llama4 (prompt , image_placeholder , num_images )
115- elif model_name in ["qwen3-omni-30b-a3b" , "qwen3-vl-4b" , "qwen3.5-35b-a3b" , "qwen3.5-397b-a17b" ]:
115+ elif model_name in ["qwen3-omni-30b-a3b" , "qwen3-vl-2b" , "qwen3-vl- 4b" , "qwen3.5-35b-a3b" , "qwen3.5-397b-a17b" ]:
116116 from maxtext .multimodal .processor_qwen3_omni import reformat_prompt_qwen3_omni # pylint: disable=import-outside-toplevel
117117
118118 return reformat_prompt_qwen3_omni (
@@ -137,7 +137,7 @@ def reformat_response(response, model_name):
137137 elif model_name in ["gemma4-26b" , "gemma4-31b" , "gemma4-e2b" , "gemma4-e4b" ]:
138138 formatted_response = f"{ response } <turn|>"
139139 return formatted_response
140- elif model_name in ["qwen3-omni-30b-a3b" , "qwen3-vl-4b" , "qwen3.5-35b-a3b" , "qwen3.5-397b-a17b" ]:
140+ elif model_name in ["qwen3-omni-30b-a3b" , "qwen3-vl-2b" , "qwen3-vl- 4b" , "qwen3.5-35b-a3b" , "qwen3.5-397b-a17b" ]:
141141 formatted_response = f"{ response } <|im_end|>"
142142 return formatted_response
143143 else :
@@ -158,7 +158,7 @@ def prepare_text_for_image_fusion(tokens, config, processor_output=None):
158158 from maxtext .multimodal .processor_llama4 import add_extra_tokens_for_images_llama4 # pylint: disable=import-outside-toplevel
159159
160160 return add_extra_tokens_for_images_llama4 (tokens , processor_output )
161- elif config .model_name in ["qwen3-omni-30b-a3b" , "qwen3-vl-4b" , "qwen3.5-35b-a3b" , "qwen3.5-397b-a17b" ]:
161+ elif config .model_name in ["qwen3-omni-30b-a3b" , "qwen3-vl-2b" , "qwen3-vl- 4b" , "qwen3.5-35b-a3b" , "qwen3.5-397b-a17b" ]:
162162 from maxtext .multimodal .processor_qwen3_omni import add_extra_tokens_for_qwen3_omni # pylint: disable=import-outside-toplevel
163163
164164 return add_extra_tokens_for_qwen3_omni (tokens , config , processor_output )
@@ -222,7 +222,7 @@ def get_bidirectional_mask_vision(config, decoder_input_tokens, is_video: bool =
222222 from maxtext .multimodal .processor_llama4 import LLAMA4_PATCH_TOKEN # pylint: disable=import-outside-toplevel
223223
224224 bidirectional_mask_vision = decoder_input_tokens == LLAMA4_PATCH_TOKEN
225- elif config .model_name in ["qwen3-omni-30b-a3b" , "qwen3-vl-4b" , "qwen3.5-35b-a3b" , "qwen3.5-397b-a17b" ]:
225+ elif config .model_name in ["qwen3-omni-30b-a3b" , "qwen3-vl-2b" , "qwen3-vl- 4b" , "qwen3.5-35b-a3b" , "qwen3.5-397b-a17b" ]:
226226 from maxtext .multimodal .processor_qwen3_omni import QwenTokens # pylint: disable=import-outside-toplevel
227227
228228 tokens = QwenTokens (config )
0 commit comments