diff --git a/python/sglang/srt/mem_cache/kv_vmm_backing.py b/python/sglang/srt/mem_cache/kv_vmm_backing.py index 94f614de2..a20d4db4c 100644 --- a/python/sglang/srt/mem_cache/kv_vmm_backing.py +++ b/python/sglang/srt/mem_cache/kv_vmm_backing.py @@ -152,7 +152,8 @@ class KvVmmArena: # no_split so the caching allocator hands our bump pointers back verbatim. self.pool = torch.cuda.MemPool(self._allocator, no_split=True) logger.info( - "KvVmmArena[%s] ready: device=%d reserved=%.1f GiB granularity=%d KiB", + "KvVmmArena[%s] ready: device=%d reserved_va=%.1f GiB " + "granularity=%d KiB", self._sfx, self.device_id, self.reserved / (1024**3), diff --git a/python/sglang/srt/mem_cache/memory_pool.py b/python/sglang/srt/mem_cache/memory_pool.py index a9b2b8b99..bcd757288 100644 --- a/python/sglang/srt/mem_cache/memory_pool.py +++ b/python/sglang/srt/mem_cache/memory_pool.py @@ -1667,7 +1667,7 @@ class KVCache(abc.ABC): k_size_GB = k_size / GB v_size_GB = v_size / GB logger.info( - f"{cache_name} is allocated. dtype: {self.dtype}, " + f"{cache_name} {'VA upper bound' if self.post_capture_active else 'is allocated'}. dtype: {self.dtype}, " f"#tokens: {num_tokens}, K size: {k_size_GB:.2f} GB, " f"V size: {v_size_GB:.2f} GB" ) @@ -1675,7 +1675,7 @@ class KVCache(abc.ABC): else: kv_size_GB = kv_size_bytes / GB logger.info( - f"{cache_name} is allocated. dtype: {self.dtype}, " + f"{cache_name} {'VA upper bound' if self.post_capture_active else 'is allocated'}. dtype: {self.dtype}, " f"#tokens: {num_tokens}, KV size: {kv_size_GB:.2f} GB" ) self.mem_usage = kv_size_GB diff --git a/python/sglang/srt/mem_cache/swa_memory_pool.py b/python/sglang/srt/mem_cache/swa_memory_pool.py index 8be872db4..1ec9d3aa8 100644 --- a/python/sglang/srt/mem_cache/swa_memory_pool.py +++ b/python/sglang/srt/mem_cache/swa_memory_pool.py @@ -86,7 +86,7 @@ class SWAKVPool(BaseSWAKVPool): k_size, v_size = self.get_kv_size_bytes() self.mem_usage = (k_size + v_size) / GB logger.info( - f"SWAKVPool mem usage: {self.mem_usage:.2f} GB, swa size: {self.size_swa}, full size: {self.size}" + f"SWAKVPool {'VA upper bound' if self.post_capture_active else 'mem usage'}: {self.mem_usage:.2f} GB, swa size: {self.size_swa}, full size: {self.size}" ) @property