Skip to content

Commit c4ed8f5

Browse files
committed
Fixing activation sharding during fusion
1 parent a56dc04 commit c4ed8f5

1 file changed

Lines changed: 5 additions & 0 deletions

File tree

src/maxtext/layers/linears.py

Lines changed: 5 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -506,6 +506,11 @@ def __call__(
506506
activations = []
507507
if cfg.fused_mlp:
508508
x = self.wi(inputs, out_sharding=intermediate_sharding)
509+
510+
# Enforce fused activations don't shard on num_activations axis
511+
fused_intermediate_logical = self.intermediate_logical[:2] + (None,) + self.intermediate_logical[2:]
512+
x = self._maybe_shard_with_logical(x, fused_intermediate_logical)
513+
509514
x = checkpoint_name(x, "mlpwi")
510515
for idx, act_fn in enumerate(self.activations):
511516
y = _convert_to_activation_function(act_fn)(x[:, :, idx, ...])

0 commit comments

Comments
 (0)