fix(kimi-k3): preserve dense ModelSlim MLA weights (#36603)
This commit is contained in:
@@ -10,18 +10,29 @@ from sglang.srt.layers.quantization.gguf import (
|
||||
GGUFLinearMethod,
|
||||
_ordered_gguf_shard_ids,
|
||||
)
|
||||
from sglang.srt.layers.quantization.modelslim.modelslim import ModelSlimConfig
|
||||
from sglang.srt.model_loader.kimi_k3_gguf import (
|
||||
_kda_a_log_target_value,
|
||||
_residual_target_value,
|
||||
kimi_k3_checkpoint_targets,
|
||||
routed_expert_tensor,
|
||||
)
|
||||
from sglang.srt.models.kimi_k3 import _uses_split_gguf_kv_b
|
||||
from sglang.test.ci.ci_register import register_cpu_ci
|
||||
|
||||
register_cpu_ci(est_time=10, suite="base-a-test-cpu")
|
||||
|
||||
|
||||
class TestKimiK3GGUFMapping(unittest.TestCase):
|
||||
def test_split_kv_capability_is_expert_pack_specific(self) -> None:
|
||||
self.assertTrue(ModelSlimConfig.supports_kimi_k3_quantized_latent_projections)
|
||||
self.assertFalse(_uses_split_gguf_kv_b(ModelSlimConfig))
|
||||
self.assertTrue(
|
||||
_uses_split_gguf_kv_b(
|
||||
SimpleNamespace(supports_kimi_k3_split_gguf_kv_b=True)
|
||||
)
|
||||
)
|
||||
|
||||
def test_maps_dense_kda_mla_moe_and_residual_tensors(self) -> None:
|
||||
cases = {
|
||||
"token_embd.weight": ("model.embed_tokens.weight",),
|
||||
|
||||
Reference in New Issue
Block a user