[Spec] Enable FlashInfer autotune for spec draft (#29595)

This commit is contained in:
Mohammad Miadh Angkad
2026-07-01 13:36:07 -07:00
committed by GitHub
parent 4a8e76805c
commit 8f0d320d31
16 changed files with 313 additions and 172 deletions
@@ -276,6 +276,7 @@ class TinyModelConfig:
self.is_encoder_decoder = False
self.is_multimodal = False
self.is_generation = True
self.quantization = None
self.is_hybrid_swa = sliding_window_size is not None
self.is_local_attention_model = sliding_window_size is not None
self.attention_chunk_size = None
@@ -242,6 +242,7 @@ class TinyDSAModelConfig:
self.is_encoder_decoder = False
self.is_multimodal = False
self.is_generation = True
self.quantization = None
self.is_hybrid_swa = False
self.attention_chunk_size = None
self.sliding_window_size = None
@@ -265,6 +265,7 @@ class TinyDSV4ModelConfig:
self.is_encoder_decoder = False
self.is_multimodal = False
self.is_generation = True
self.quantization = None
self.is_hybrid_swa = False
self.is_local_attention_model = False
self.attention_chunk_size = None
@@ -274,6 +274,7 @@ class TinyDualChunkModelConfig:
self.is_encoder_decoder = False
self.is_multimodal = False
self.is_generation = True
self.quantization = None
self.is_hybrid_swa = False
self.attention_chunk_size = None
self.sliding_window_size = None
@@ -178,6 +178,7 @@ class TinyGDNModelConfig:
self.is_encoder_decoder = False
self.is_multimodal = False
self.is_generation = True
self.quantization = None
self.is_hybrid_swa = False
self.is_local_attention_model = False
self.attention_chunk_size = None
@@ -184,6 +184,7 @@ class TinyKDAModelConfig:
self.is_encoder_decoder = False
self.is_multimodal = False
self.is_generation = True
self.quantization = None
self.is_hybrid_swa = False
self.is_local_attention_model = False
self.attention_chunk_size = None
@@ -187,6 +187,7 @@ class TinyLightningModelConfig:
self.is_encoder_decoder = False
self.is_multimodal = False
self.is_generation = True
self.quantization = None
self.is_hybrid_swa = False
self.is_local_attention_model = False
self.attention_chunk_size = None
@@ -275,6 +275,7 @@ class TinyMamba2ModelConfig:
self.is_encoder_decoder = False
self.is_multimodal = False
self.is_generation = True
self.quantization = None
self.is_hybrid_swa = False
self.is_local_attention_model = False
self.attention_chunk_size = None
@@ -178,6 +178,7 @@ class TinyMLAModelConfig:
self.is_encoder_decoder = False
self.is_multimodal = False
self.is_generation = True
self.quantization = None
self.is_hybrid_swa = False
self.is_local_attention_model = False
self.attention_chunk_size = None