[Spec] Enable FlashInfer autotune for spec draft (#29595)
This commit is contained in:
@@ -276,6 +276,7 @@ class TinyModelConfig:
|
||||
self.is_encoder_decoder = False
|
||||
self.is_multimodal = False
|
||||
self.is_generation = True
|
||||
self.quantization = None
|
||||
self.is_hybrid_swa = sliding_window_size is not None
|
||||
self.is_local_attention_model = sliding_window_size is not None
|
||||
self.attention_chunk_size = None
|
||||
|
||||
@@ -242,6 +242,7 @@ class TinyDSAModelConfig:
|
||||
self.is_encoder_decoder = False
|
||||
self.is_multimodal = False
|
||||
self.is_generation = True
|
||||
self.quantization = None
|
||||
self.is_hybrid_swa = False
|
||||
self.attention_chunk_size = None
|
||||
self.sliding_window_size = None
|
||||
|
||||
@@ -265,6 +265,7 @@ class TinyDSV4ModelConfig:
|
||||
self.is_encoder_decoder = False
|
||||
self.is_multimodal = False
|
||||
self.is_generation = True
|
||||
self.quantization = None
|
||||
self.is_hybrid_swa = False
|
||||
self.is_local_attention_model = False
|
||||
self.attention_chunk_size = None
|
||||
|
||||
@@ -274,6 +274,7 @@ class TinyDualChunkModelConfig:
|
||||
self.is_encoder_decoder = False
|
||||
self.is_multimodal = False
|
||||
self.is_generation = True
|
||||
self.quantization = None
|
||||
self.is_hybrid_swa = False
|
||||
self.attention_chunk_size = None
|
||||
self.sliding_window_size = None
|
||||
|
||||
@@ -178,6 +178,7 @@ class TinyGDNModelConfig:
|
||||
self.is_encoder_decoder = False
|
||||
self.is_multimodal = False
|
||||
self.is_generation = True
|
||||
self.quantization = None
|
||||
self.is_hybrid_swa = False
|
||||
self.is_local_attention_model = False
|
||||
self.attention_chunk_size = None
|
||||
|
||||
@@ -184,6 +184,7 @@ class TinyKDAModelConfig:
|
||||
self.is_encoder_decoder = False
|
||||
self.is_multimodal = False
|
||||
self.is_generation = True
|
||||
self.quantization = None
|
||||
self.is_hybrid_swa = False
|
||||
self.is_local_attention_model = False
|
||||
self.attention_chunk_size = None
|
||||
|
||||
@@ -187,6 +187,7 @@ class TinyLightningModelConfig:
|
||||
self.is_encoder_decoder = False
|
||||
self.is_multimodal = False
|
||||
self.is_generation = True
|
||||
self.quantization = None
|
||||
self.is_hybrid_swa = False
|
||||
self.is_local_attention_model = False
|
||||
self.attention_chunk_size = None
|
||||
|
||||
@@ -275,6 +275,7 @@ class TinyMamba2ModelConfig:
|
||||
self.is_encoder_decoder = False
|
||||
self.is_multimodal = False
|
||||
self.is_generation = True
|
||||
self.quantization = None
|
||||
self.is_hybrid_swa = False
|
||||
self.is_local_attention_model = False
|
||||
self.attention_chunk_size = None
|
||||
|
||||
@@ -178,6 +178,7 @@ class TinyMLAModelConfig:
|
||||
self.is_encoder_decoder = False
|
||||
self.is_multimodal = False
|
||||
self.is_generation = True
|
||||
self.quantization = None
|
||||
self.is_hybrid_swa = False
|
||||
self.is_local_attention_model = False
|
||||
self.attention_chunk_size = None
|
||||
|
||||
Reference in New Issue
Block a user