Enable TP for Mamba-based models (#14811)
Signed-off-by: Roi Koren <roik@nvidia.com>
This commit is contained in:
@@ -339,7 +339,6 @@ class MambaMixer2(torch.nn.Module):
|
|||||||
input_is_parallel=True,
|
input_is_parallel=True,
|
||||||
quant_config=quant_config,
|
quant_config=quant_config,
|
||||||
prefix=f"{prefix}.out_proj",
|
prefix=f"{prefix}.out_proj",
|
||||||
reduce_results=False,
|
|
||||||
)
|
)
|
||||||
|
|
||||||
self.norm = Mixer2RMSNormGated(
|
self.norm = Mixer2RMSNormGated(
|
||||||
|
|||||||
Reference in New Issue
Block a user