[mem_cache][6/N] refactor: move MHA host-pool into pool_host/mha.py (#30249)

This commit is contained in:
shuwenn
2026-07-08 20:12:52 +08:00
committed by GitHub
parent 4c5fe42be4
commit 108a183f6b
15 changed files with 1266 additions and 1222 deletions
@@ -18,10 +18,8 @@ from sglang.srt.mem_cache.memory_pool import (
MLATokenToKVPool,
ReqToTokenPool,
)
from sglang.srt.mem_cache.memory_pool_host import (
MLATokenToKVPoolHost,
get_mha_host_pool_cls,
)
from sglang.srt.mem_cache.memory_pool_host import MLATokenToKVPoolHost
from sglang.srt.mem_cache.pool_host.mha import get_mha_host_pool_cls
from sglang.srt.server_args import ServerArgs
from sglang.srt.utils.common import ceil_align
+2 -4
View File
@@ -47,10 +47,8 @@ from sglang.srt.mem_cache.memory_pool import (
MiniMaxSparseKVPool,
MLATokenToKVPool,
)
from sglang.srt.mem_cache.memory_pool_host import (
MLATokenToKVPoolHost,
get_mha_host_pool_cls,
)
from sglang.srt.mem_cache.memory_pool_host import MLATokenToKVPoolHost
from sglang.srt.mem_cache.pool_host.mha import get_mha_host_pool_cls
from sglang.srt.mem_cache.radix_cache import (
RadixCache,
RadixKey,
@@ -19,9 +19,11 @@ from sglang.srt.mem_cache.memory_pool_host import (
HostPoolGroup,
LogicalHostPool,
MambaPoolHost,
MHATokenToKOnlyPoolHost,
MLATokenToKVPoolHost,
PoolEntry,
)
from sglang.srt.mem_cache.pool_host.mha import (
MHATokenToKOnlyPoolHost,
get_mha_host_pool_cls,
)
from sglang.srt.mem_cache.unified_cache_components import ComponentType
@@ -89,10 +89,8 @@ def maybe_register_hicache_draft(
MHATokenToKVPool,
MLATokenToKVPool,
)
from sglang.srt.mem_cache.memory_pool_host import (
MLATokenToKVPoolHost,
get_mha_host_pool_cls,
)
from sglang.srt.mem_cache.memory_pool_host import MLATokenToKVPoolHost
from sglang.srt.mem_cache.pool_host.mha import get_mha_host_pool_cls
pool = draft_kv_pool
if isinstance(pool, HybridLinearKVPool):
File diff suppressed because it is too large Load Diff
@@ -24,6 +24,8 @@ _is_hip = is_hip()
# Host RAM to leave free when sizing HiCache pools (OS, other processes).
HICACHE_HOST_MEMORY_RESERVE_BYTES: int = 10 * (1024**3)
_WRITE_BACK_STAGING_PAGE_CHUNK = 64
def sync_fixed_hicache_size(size: int, host_size: int) -> int:
"""Sync fixed-size HiCache token capacity across PP ranks.
File diff suppressed because it is too large Load Diff
@@ -8,7 +8,7 @@ from aibrix_kvcache_storage import AibrixKVCacheStorage
from sglang.srt.mem_cache.hicache_storage import HiCacheStorageConfig
from sglang.srt.mem_cache.memory_pool import MHATokenToKVPool
from sglang.srt.mem_cache.memory_pool_host import MHATokenToKVPoolHost
from sglang.srt.mem_cache.pool_host.mha import MHATokenToKVPoolHost
logging.basicConfig(
level=logging.INFO, format="%(asctime)s - %(levelname)s - %(message)s"