diff --git a/test/registered/cpu/test_intel_amx_attention_backend_a.py b/test/registered/cpu/test_intel_amx_attention_backend_a.py index 9037d4f50..0d20b96f9 100644 --- a/test/registered/cpu/test_intel_amx_attention_backend_a.py +++ b/test/registered/cpu/test_intel_amx_attention_backend_a.py @@ -34,7 +34,7 @@ class TestIntelAMXAttnBackend(CustomTestCase): return DEFAULT_MLA_MODEL_NAME_FOR_TEST @intel_amx_benchmark( - extra_args=["--batch-size", "4", "--mem-fraction-static", "0.1"], + extra_args=["--batch-size", "4", "--mem-fraction-static", "0.2"], min_throughput=40, ) def test_latency_default_model(self): @@ -84,7 +84,7 @@ class TestDPAttention(CustomTestCase): "--attention-backend", "intel_amx", "--mem-fraction-static", - "0.1", + "0.2", "--disable-overlap-schedule", "--tp", "2", diff --git a/test/registered/cpu/test_intel_amx_attention_backend_b.py b/test/registered/cpu/test_intel_amx_attention_backend_b.py index c504cf0c9..401b19684 100644 --- a/test/registered/cpu/test_intel_amx_attention_backend_b.py +++ b/test/registered/cpu/test_intel_amx_attention_backend_b.py @@ -20,14 +20,14 @@ register_cpu_ci(est_time=47, suite="base-b-test-cpu") class TestIntelAMXAttnBackendQuant(CustomTestCase): @intel_amx_benchmark( - extra_args=["--batch-size", "4", "--mem-fraction-static", "0.1"], + extra_args=["--batch-size", "4", "--mem-fraction-static", "0.2"], min_throughput=150, ) def test_latency_fp8_qwen(self): return DEFAULT_MODEL_NAME_FOR_TEST_QWEN_FP8 @intel_amx_benchmark( - extra_args=["--batch-size", "4", "--mem-fraction-static", "0.1"], + extra_args=["--batch-size", "4", "--mem-fraction-static", "0.2"], min_throughput=50, ) def test_latency_fp8_moe_model(self):