diff --git a/python/sglang/srt/models/lfm2.py b/python/sglang/srt/models/lfm2.py index 1f4f7544e..fb2fde239 100644 --- a/python/sglang/srt/models/lfm2.py +++ b/python/sglang/srt/models/lfm2.py @@ -125,13 +125,13 @@ class Lfm2Attention(nn.Module): if rope_parameters is not None and "rope_theta" in rope_parameters: rope_theta = rope_parameters["rope_theta"] else: - rope_theta = config.rope_parameters["rope_theta"] + rope_theta = getattr(config, "rope_theta", 1000000.0) self.rotary_emb = get_rope( head_size=self.head_dim, rotary_dim=self.head_dim, max_position=getattr(config, "max_position_embeddings", 8192), - rope_scaling=config.rope_parameters, + rope_scaling=rope_parameters or getattr(config, "rope_scaling", None), base=rope_theta, is_neox_style=True, dtype=torch.get_default_dtype(), diff --git a/python/sglang/srt/models/lfm2_moe.py b/python/sglang/srt/models/lfm2_moe.py index 4846b0b99..c37167faa 100644 --- a/python/sglang/srt/models/lfm2_moe.py +++ b/python/sglang/srt/models/lfm2_moe.py @@ -196,7 +196,7 @@ class Lfm2MoeAttention(nn.Module): head_size=self.head_dim, rotary_dim=self.head_dim, max_position=getattr(config, "max_position_embeddings", 128000), - rope_scaling=getattr(config, "rope_scaling", None), + rope_scaling=rope_parameters or getattr(config, "rope_scaling", None), base=rope_theta, is_neox_style=True, dtype=torch.get_default_dtype(),