diff --git a/python/sglang/srt/mem_cache/storage/mooncake_store/mooncake_store.py b/python/sglang/srt/mem_cache/storage/mooncake_store/mooncake_store.py index a8e4b0887..5ee3d24a5 100644 --- a/python/sglang/srt/mem_cache/storage/mooncake_store/mooncake_store.py +++ b/python/sglang/srt/mem_cache/storage/mooncake_store/mooncake_store.py @@ -497,7 +497,8 @@ class MooncakeStore(HiCacheStorage, MooncakeBaseStore): "page_first", "page_first_direct", "page_head", - ], "mooncake store storage backend only support page first or page first direct layout" + "page_first_kv_spilt", + ], "mooncake store storage backend only support page first, page first direct, page head and page_first_kv_spilt layout" buffer = self.mem_pool_host.kv_buffer try: super().register_buffer(buffer) diff --git a/python/sglang/srt/model_executor/model_runner.py b/python/sglang/srt/model_executor/model_runner.py index 74cec2565..7c1f2c792 100644 --- a/python/sglang/srt/model_executor/model_runner.py +++ b/python/sglang/srt/model_executor/model_runner.py @@ -449,12 +449,12 @@ class ModelRunner(ModelRunnerKVCacheMixin): if self.device == "cpu": self.init_threads_binding() - # Initialize MooncakeTransferEngine - self.init_shared_mooncake_transfer_engine() - # Get available memory before model loading pre_model_load_memory = self.init_torch_distributed() + # Initialize MooncakeTransferEngine + self.init_shared_mooncake_transfer_engine() + # Init forward stream for overlap schedule self.forward_stream = torch.get_device_module(self.device).Stream()