hicache storage backend mooncake support ascend hixl (#20016)
This commit is contained in:
@@ -497,7 +497,8 @@ class MooncakeStore(HiCacheStorage, MooncakeBaseStore):
|
|||||||
"page_first",
|
"page_first",
|
||||||
"page_first_direct",
|
"page_first_direct",
|
||||||
"page_head",
|
"page_head",
|
||||||
], "mooncake store storage backend only support page first or page first direct layout"
|
"page_first_kv_spilt",
|
||||||
|
], "mooncake store storage backend only support page first, page first direct, page head and page_first_kv_spilt layout"
|
||||||
buffer = self.mem_pool_host.kv_buffer
|
buffer = self.mem_pool_host.kv_buffer
|
||||||
try:
|
try:
|
||||||
super().register_buffer(buffer)
|
super().register_buffer(buffer)
|
||||||
|
|||||||
@@ -449,12 +449,12 @@ class ModelRunner(ModelRunnerKVCacheMixin):
|
|||||||
if self.device == "cpu":
|
if self.device == "cpu":
|
||||||
self.init_threads_binding()
|
self.init_threads_binding()
|
||||||
|
|
||||||
# Initialize MooncakeTransferEngine
|
|
||||||
self.init_shared_mooncake_transfer_engine()
|
|
||||||
|
|
||||||
# Get available memory before model loading
|
# Get available memory before model loading
|
||||||
pre_model_load_memory = self.init_torch_distributed()
|
pre_model_load_memory = self.init_torch_distributed()
|
||||||
|
|
||||||
|
# Initialize MooncakeTransferEngine
|
||||||
|
self.init_shared_mooncake_transfer_engine()
|
||||||
|
|
||||||
# Init forward stream for overlap schedule
|
# Init forward stream for overlap schedule
|
||||||
self.forward_stream = torch.get_device_module(self.device).Stream()
|
self.forward_stream = torch.get_device_module(self.device).Stream()
|
||||||
|
|
||||||
|
|||||||
Reference in New Issue
Block a user