Fix Kimi K2.5 PP layer range exposure for PD disaggregation (#19959)
Signed-off-by: yafeng.li <yafeng.li@mthreads.com>
This commit is contained in:
@@ -719,6 +719,14 @@ class KimiK25ForConditionalGeneration(nn.Module):
|
|||||||
pattern = MultiModalityDataPaddingPatternMultimodalTokens()
|
pattern = MultiModalityDataPaddingPatternMultimodalTokens()
|
||||||
return pattern.pad_input_tokens(input_ids, mm_inputs)
|
return pattern.pad_input_tokens(input_ids, mm_inputs)
|
||||||
|
|
||||||
|
@property
|
||||||
|
def start_layer(self) -> int:
|
||||||
|
return self.language_model.start_layer
|
||||||
|
|
||||||
|
@property
|
||||||
|
def end_layer(self) -> int:
|
||||||
|
return self.language_model.end_layer
|
||||||
|
|
||||||
def forward(
|
def forward(
|
||||||
self,
|
self,
|
||||||
input_ids: torch.Tensor,
|
input_ids: torch.Tensor,
|
||||||
|
|||||||
Reference in New Issue
Block a user