feat: add support for mamba cp

kmehant · kmehant · commit 3fcedfb62f92 · 2025-11-13T23:43:38.000+05:30
Signed-off-by: Mehant Kammakomati &lt;mehant.kammakomati2@ibm.com&gt;
diff --git a/tuning/config/acceleration_configs/__init__.py b/tuning/config/acceleration_configs/__init__.py
@@ -18,5 +18,6 @@
 from .callbacks import get_additional_accel_framework_callbacks
 from .fast_moe import FastMoeConfig
 from .fused_ops_and_kernels import FusedOpsAndKernelsConfig
+from .mcp import MCP, MCPConfig
 from .odm import ODM, ODMConfig
 from .quantized_lora_config import QuantizedLoraConfig
diff --git a/tuning/config/acceleration_configs/acceleration_framework_config.py b/tuning/config/acceleration_configs/acceleration_framework_config.py
@@ -24,6 +24,7 @@
 from .attention_and_distributed_packing import MultiPack, PaddingFree
 from .fast_moe import FastMoe
 from .fused_ops_and_kernels import FastKernelsConfig, FusedLoraConfig
+from .mcp import MCP
 from .odm import ODM
 from .quantized_lora_config import AutoGPTQLoraConfig, BNBQLoraConfig
 from tuning.utils.import_utils import is_fms_accelerate_available
@@ -133,6 +134,17 @@ class AccelerationFrameworkConfig:
         ),
     ] = None
 
+    mcp: Annotated[
+        MCP,
+        ConfigAnnotation(
+            path="training.mamba",
+            key="cp",
+            standalone=True,
+            experimental=True,
+            required_packages=["mcp"],
+        ),
+    ] = None
+
     multipack: Annotated[
         MultiPack,
         ConfigAnnotation(
diff --git a/tuning/config/acceleration_configs/mcp.py b/tuning/config/acceleration_configs/mcp.py
@@ -0,0 +1,39 @@
+# Copyright The FMS HF Tuning Authors
+#
+# Licensed under the Apache License, Version 2.0 (the "License");
+# you may not use this file except in compliance with the License.
+# You may obtain a copy of the License at
+#
+#     http://www.apache.org/licenses/LICENSE-2.0
+#
+# Unless required by applicable law or agreed to in writing, software
+# distributed under the License is distributed on an "AS IS" BASIS,
+# WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.
+# See the License for the specific language governing permissions and
+# limitations under the License.
+
+# Standard
+from dataclasses import dataclass
+from typing import Union
+
+# Local
+from .utils import ensure_nested_dataclasses_initialized, parsable_dataclass
+
+
+@parsable_dataclass
+@dataclass
+class MCP:
+    degree: int = None
+    mamba_impl: str = None
+    attn_impl: str = None
+    mamba_recompute: bool = None
+
+
+@dataclass
+class MCPConfig:
+
+    cp: MCP = None
+
+    def __post_init__(self):
+        # ensure nested dataclasses initialized
+        ensure_nested_dataclasses_initialized(self)
diff --git a/tuning/sft_trainer.py b/tuning/sft_trainer.py
@@ -47,6 +47,7 @@
     AttentionAndDistributedPackingConfig,
     FastMoeConfig,
     FusedOpsAndKernelsConfig,
+    MCPConfig,
     ODMConfig,
     QuantizedLoraConfig,
     get_additional_accel_framework_callbacks,
@@ -87,6 +88,7 @@ def train(
         AttentionAndDistributedPackingConfig
     ] = None,
     fast_moe_config: Optional[FastMoeConfig] = None,
+    mcp_config: Optional[MCPConfig] = None,
     additional_data_handlers: Optional[Dict[str, DataHandler]] = None,
 ) -> tuple[SFTTrainer, dict]:
     """Call the SFTTrainer
@@ -198,6 +200,8 @@ def train(
             )
     if fast_moe_config is not None and fast_moe_config.fast_moe is None:
         fast_moe_config = None
+    if mcp_config is not None and mcp_config.cp is None:
+        mcp_config = None
     if fast_moe_config is not None:
         # If LoRA with ScatterMoE detected, raise warning
         accepted_layers = ["all-linear"]
@@ -261,6 +265,7 @@ def train(
         quantized_lora_config,
         fusedops_kernels_config,
         odm_config,
+        mcp_config,
     ).get_framework()
 
     # option to set multimodal var here
@@ -567,6 +572,7 @@ def get_parser():
             FusedOpsAndKernelsConfig,
             AttentionAndDistributedPackingConfig,
             FastMoeConfig,
+            MCPConfig,
             TrackerConfigs,
         )
     )
@@ -648,6 +654,7 @@ def parse_arguments(parser, json_config=None):
             fusedops_kernels_config,
             attention_and_distributed_packing_config,
             fast_moe_config,
+            mcp_config,
             tracker_configs,
         ) = parser.parse_dict(json_config, allow_extra_keys=True)
         peft_method = json_config.get("peft_method")
@@ -667,6 +674,7 @@ def parse_arguments(parser, json_config=None):
             fusedops_kernels_config,
             attention_and_distributed_packing_config,
             fast_moe_config,
+            mcp_config,
             tracker_configs,
             additional,
             _,
@@ -703,6 +711,7 @@ def parse_arguments(parser, json_config=None):
         fusedops_kernels_config,
         attention_and_distributed_packing_config,
         fast_moe_config,
+        mcp_config,
         tracker_configs,
         exp_metadata,
     )
@@ -725,6 +734,7 @@ def main():
             fusedops_kernels_config,
             attention_and_distributed_packing_config,
             fast_moe_config,
+            mcp_config,
             tracker_configs,
             exp_metadata,
         ) = parse_arguments(parser, job_config)
@@ -746,6 +756,7 @@ def main():
                 "AADP (fms-acceleration) Config": attention_and_distributed_packing_config,
                 "Fused Ops Kernels Config": fusedops_kernels_config,
                 "Fast MoE Config": fast_moe_config,
+                "MCP Config": mcp_config,
                 "Tracker Config": tracker_configs,
                 "Extra Metadata": exp_metadata,
                 "Trainer Controller Config": trainer_controller_args,
@@ -789,6 +800,7 @@ def main():
             quantized_lora_config=quantized_lora_config,
             fusedops_kernels_config=fusedops_kernels_config,
             attention_and_distributed_packing_config=attention_and_distributed_packing_config,
+            mcp_config=mcp_config,
             fast_moe_config=fast_moe_config,
         )
     except (MemoryError, OutOfMemoryError) as e: