[RL] enable offloading hybrid linear attn model (#13336)
This commit is contained in:
@@ -366,6 +366,10 @@ class HybridReqToTokenPool(ReqToTokenPool):
|
|||||||
device=device,
|
device=device,
|
||||||
enable_memory_saver=enable_memory_saver,
|
enable_memory_saver=enable_memory_saver,
|
||||||
)
|
)
|
||||||
|
memory_saver_adapter = TorchMemorySaverAdapter.create(
|
||||||
|
enable=enable_memory_saver
|
||||||
|
)
|
||||||
|
with memory_saver_adapter.region(GPU_MEMORY_TYPE_KV_CACHE):
|
||||||
self._init_mamba_pool(
|
self._init_mamba_pool(
|
||||||
size=mamba_size,
|
size=mamba_size,
|
||||||
cache_params=cache_params,
|
cache_params=cache_params,
|
||||||
@@ -948,6 +952,7 @@ class HybridLinearKVPool(KVCache):
|
|||||||
enable_kvcache_transpose: bool,
|
enable_kvcache_transpose: bool,
|
||||||
device: str,
|
device: str,
|
||||||
mamba_pool: MambaPool,
|
mamba_pool: MambaPool,
|
||||||
|
enable_memory_saver: bool,
|
||||||
# TODO: refactor mla related args
|
# TODO: refactor mla related args
|
||||||
use_mla: bool = False,
|
use_mla: bool = False,
|
||||||
kv_lora_rank: int = None,
|
kv_lora_rank: int = None,
|
||||||
@@ -979,7 +984,7 @@ class HybridLinearKVPool(KVCache):
|
|||||||
head_dim=head_dim,
|
head_dim=head_dim,
|
||||||
layer_num=self.full_layer_nums,
|
layer_num=self.full_layer_nums,
|
||||||
device=device,
|
device=device,
|
||||||
enable_memory_saver=False,
|
enable_memory_saver=enable_memory_saver,
|
||||||
)
|
)
|
||||||
else:
|
else:
|
||||||
TokenToKVPoolClass = MLATokenToKVPool
|
TokenToKVPoolClass = MLATokenToKVPool
|
||||||
@@ -991,7 +996,7 @@ class HybridLinearKVPool(KVCache):
|
|||||||
device=device,
|
device=device,
|
||||||
kv_lora_rank=kv_lora_rank,
|
kv_lora_rank=kv_lora_rank,
|
||||||
qk_rope_head_dim=qk_rope_head_dim,
|
qk_rope_head_dim=qk_rope_head_dim,
|
||||||
enable_memory_saver=False,
|
enable_memory_saver=enable_memory_saver,
|
||||||
)
|
)
|
||||||
self.full_attention_layer_id_mapping = {
|
self.full_attention_layer_id_mapping = {
|
||||||
id: i for i, id in enumerate(full_attention_layer_ids)
|
id: i for i, id in enumerate(full_attention_layer_ids)
|
||||||
|
|||||||
@@ -1837,6 +1837,7 @@ class ModelRunner:
|
|||||||
enable_kvcache_transpose=False,
|
enable_kvcache_transpose=False,
|
||||||
device=self.device,
|
device=self.device,
|
||||||
mamba_pool=self.req_to_token_pool.mamba_pool,
|
mamba_pool=self.req_to_token_pool.mamba_pool,
|
||||||
|
enable_memory_saver=self.server_args.enable_memory_saver,
|
||||||
use_mla=self.use_mla_backend,
|
use_mla=self.use_mla_backend,
|
||||||
**extra_args,
|
**extra_args,
|
||||||
)
|
)
|
||||||
|
|||||||
Reference in New Issue
Block a user