Files
sglang/test/registered/unit/mem_cache/test_mem_pool_host.py
T

187 lines
6.5 KiB
Python

"""Unit tests for host-pool allocation and free-list bookkeeping."""
import threading
import unittest
import torch
from sglang.srt.mem_cache.memory_pool import MHATokenToKVPool
from sglang.srt.mem_cache.memory_pool_host import (
DeepSeekV4PagedHostPool,
MambaPoolHost,
)
from sglang.srt.mem_cache.pool_host.mha import MHATokenToKVPoolHost
from sglang.test.ci.ci_register import register_cpu_ci
from sglang.test.test_utils import CustomTestCase
register_cpu_ci(est_time=2, suite="base-a-test-cpu")
class TestHostKVCache(CustomTestCase):
def setUp(self):
self.page_size = 2
# Small device pool is enough to construct the host pool.
self.device_pool = MHATokenToKVPool(
size=self.page_size * 2,
page_size=self.page_size,
dtype=torch.float16,
head_num=2,
head_dim=4,
layer_num=2,
device="cpu",
enable_memory_saver=False,
)
self.host_pool = MHATokenToKVPoolHost(
device_pool=self.device_pool,
host_to_device_ratio=2.0,
host_size=0,
page_size=self.page_size,
layout="layer_first",
pin_memory=False,
device="cpu",
allocator_type="default",
)
def test_double_alloc(self):
indices = self.host_pool.alloc(4)
self.assertEqual(len(indices), 4)
# Mimic bookkeeping corruption: push an already-used slot back to the
# head of free_slots so the next alloc would hand out an in-use slot.
leak = torch.tensor([int(indices[0])])
self.host_pool.free_slots = torch.cat([leak, self.host_pool.free_slots])
with self.assertRaises(AssertionError) as ctx:
self.host_pool.alloc(4)
msg = str(ctx.exception)
self.assertIn("Double-alloc", msg)
self.assertIn(f"[{int(leak[0])}]", msg)
def test_double_free(self):
indices = self.host_pool.alloc(4)
self.assertEqual(len(indices), 4)
self.host_pool.free(indices[:2])
# indices[1] is double freed.
with self.assertRaises(AssertionError) as ctx:
self.host_pool.free(indices[1:])
msg = str(ctx.exception)
self.assertIn("Double-free", msg)
self.assertIn(f"[{int(indices[1])}]", msg)
def test_free_unallocated(self):
indices = torch.tensor([1])
with self.assertRaises(AssertionError) as ctx:
self.host_pool.free(indices)
msg = str(ctx.exception)
self.assertIn("Double-free", msg)
self.assertIn(f"[{int(indices[0])}]", msg)
def test_free_after_clear(self):
indices = self.host_pool.alloc(4)
self.host_pool.clear()
with self.assertRaises(AssertionError) as ctx:
self.host_pool.free(indices)
msg = str(ctx.exception)
self.assertIn("Double-free", msg)
self.assertIn(str(indices.tolist()), msg)
def test_shm_allocator(self):
shm_host_pool = MHATokenToKVPoolHost(
device_pool=self.device_pool,
host_to_device_ratio=2.0,
host_size=0,
page_size=self.page_size,
layout="layer_first",
pin_memory=False,
device="cpu",
allocator_type="shm",
)
self.assertIsNotNone(shm_host_pool.fd)
self.assertGreaterEqual(shm_host_pool.fd, 0)
indices = shm_host_pool.alloc(4)
self.assertEqual(len(indices), 4)
shm_host_pool.free(indices)
def test_empty_free_keeps_release_list_empty(self):
self.assertEqual(self.host_pool.free(torch.empty(0, dtype=torch.int64)), 0)
self.assertEqual(self.host_pool.num_release_slots, 0)
self.assertEqual(self.host_pool.release_slots, [])
class TestLazyHostPoolRelease(CustomTestCase):
@staticmethod
def _make_mamba_pool():
pool = MambaPoolHost.__new__(MambaPoolHost)
pool.size = 8
pool.page_size = 1
pool.device = "cpu"
pool.lock = threading.RLock()
pool.clear()
return pool
@staticmethod
def _make_deepseek_v4_pool():
pool = DeepSeekV4PagedHostPool.__new__(DeepSeekV4PagedHostPool)
pool.size = 8
pool.slot_page_size = 2
pool.lock = threading.RLock()
pool.clear()
return pool
def _assert_lazy_release(self, pool):
self.assertEqual(pool.free(torch.empty(0, dtype=torch.int64)), 0)
self.assertEqual(pool.num_release_slots, 0)
self.assertEqual(pool.release_slots, [])
allocated = pool.alloc(6)
free_slots_before = pool.free_slots
pool.free(allocated[:2])
# free() should keep the primary free-list untouched and only record
# the released chunk for a later merge.
self.assertIs(pool.free_slots, free_slots_before)
self.assertEqual(pool.num_release_slots, 2)
self.assertEqual(len(pool.release_slots), 1)
self.assertEqual(pool.available_size(), 4)
# Consume the primary free-list first without merging pending slots.
self.assertTrue(torch.equal(pool.alloc(2), torch.tensor([6, 7])))
self.assertEqual(pool.num_release_slots, 2)
# Once the primary free-list is exhausted, alloc() merges and reuses
# the pending slots.
self.assertTrue(torch.equal(pool.alloc(2), torch.tensor([0, 1])))
self.assertEqual(pool.num_release_slots, 0)
self.assertEqual(pool.release_slots, [])
self.assertEqual(pool.available_size(), 0)
pool.free(torch.tensor([0, 1]))
pool.clear()
self.assertEqual(pool.num_release_slots, 0)
self.assertEqual(pool.release_slots, [])
self.assertEqual(pool.available_size(), 8)
# Exercise the general merge path with multiple released chunks.
allocated = pool.alloc(8)
pool.free(allocated[:2])
pool.free(allocated[2:4])
self.assertEqual(len(pool.release_slots), 2)
self.assertTrue(torch.equal(pool.alloc(4), torch.tensor([0, 1, 2, 3])))
self.assertEqual(pool.num_release_slots, 0)
self.assertEqual(pool.release_slots, [])
def test_mamba_pool_lazy_release(self):
self._assert_lazy_release(self._make_mamba_pool())
def test_deepseek_v4_pool_lazy_release(self):
pool = self._make_deepseek_v4_pool()
self._assert_lazy_release(pool)
# Preserve the pool's page-aligned allocation behavior.
pool.clear()
self.assertEqual(len(pool.alloc(1)), 2)
if __name__ == "__main__":
unittest.main()