[feat] Support extra_buffer in Mamba2-based models (#15829)

Signed-off-by: Roi Koren <roik@nvidia.com>
This commit is contained in:
roikoren755
2026-05-26 16:03:29 +08:00
committed by GitHub
parent 7e6e5efe51
commit e958f4561f
17 changed files with 405 additions and 130 deletions
@@ -0,0 +1,33 @@
import unittest
from sglang.test.kits.eval_accuracy_kit import GSM8KMixin
from sglang.test.kits.kl_divergence_kit import KLDivergenceMixin
from sglang.test.kits.prefix_cache_branching_kit import PrefixCacheBranchingMixin
from sglang.test.server_fixtures.default_fixture import DefaultServerBase
GRANITE_MOE_HYBRID_MODEL = "ibm-granite/granite-4.0-h-micro"
class TestGraniteMoeHybrid(GSM8KMixin, DefaultServerBase):
model = GRANITE_MOE_HYBRID_MODEL
gsm8k_accuracy_thres = 0.78
class TestGraniteMoeHybridExtraBuffer(
GSM8KMixin, KLDivergenceMixin, PrefixCacheBranchingMixin, DefaultServerBase
):
model = GRANITE_MOE_HYBRID_MODEL
cache_chunk_size = 256
gsm8k_accuracy_thres = 0.78
kl_div_thres = 0.002
kl_div_thres_prefill = 0.02
other_args = [
"--mem-fraction-static",
"0.8",
"--mamba-scheduler-strategy",
"extra_buffer",
]
if __name__ == "__main__":
unittest.main()