diff --git a/python/sglang/srt/arg_groups/overrides.py b/python/sglang/srt/arg_groups/overrides.py index 7f430022d..14dc15ad0 100644 --- a/python/sglang/srt/arg_groups/overrides.py +++ b/python/sglang/srt/arg_groups/overrides.py @@ -774,7 +774,7 @@ def _granite_moe_hybrid_overrides(server_args: Any, hf_config: Any) -> dict: return {} -@_register_for("Lfm2ForCausalLM") +@_register_for("Lfm2ForCausalLM", "Lfm2MoeForCausalLM") def _lfm2_overrides(server_args: Any, hf_config: Any) -> dict: if is_sm100_supported() and server_args.attention_backend is None: return {"attention_backend": "flashinfer"} @@ -1123,6 +1123,7 @@ _MAMBA_RADIX_CACHE_ARCHS = frozenset( "JetNemotronForCausalLM", "JetVLMForConditionalGeneration", "Lfm2ForCausalLM", + "Lfm2MoeForCausalLM", "ZayaForCausalLM", } ) diff --git a/python/sglang/srt/server_args.py b/python/sglang/srt/server_args.py index 509bb82d0..35525e372 100644 --- a/python/sglang/srt/server_args.py +++ b/python/sglang/srt/server_args.py @@ -5395,7 +5395,7 @@ class ServerArgs: # _glm4_moe_overrides). pass - elif model_arch in ["Lfm2ForCausalLM"]: + elif model_arch in ["Lfm2ForCausalLM", "Lfm2MoeForCausalLM"]: # Attention backend selection moved to the override registry # (arg_groups/overrides.py: _lfm2_overrides). assert resolved_view(self).attention_backend != "triton", (