diff --git a/python/sglang/srt/constrained/llguidance_backend.py b/python/sglang/srt/constrained/llguidance_backend.py index b3d32301c..91b948408 100644 --- a/python/sglang/srt/constrained/llguidance_backend.py +++ b/python/sglang/srt/constrained/llguidance_backend.py @@ -51,7 +51,6 @@ class GuidanceGrammar(BaseGrammarObject): ) self._check_err() - self.bitmask = None self.eos_token = self.llguidance_tokenizer.eos_token def accept_token(self, token: int): @@ -83,16 +82,7 @@ class GuidanceGrammar(BaseGrammarObject): def allocate_vocab_mask( self, vocab_size: int, batch_size: int, device ) -> torch.Tensor: - if self.bitmask is None or self.bitmask.shape[0] < batch_size: - # only create bitmask when batch gets larger - self.bitmask = allocate_token_bitmask( - batch_size, self.llguidance_tokenizer.vocab_size - ) - bitmask = self.bitmask - else: - bitmask = self.bitmask[:batch_size] - - return bitmask + return allocate_token_bitmask(batch_size, self.llguidance_tokenizer.vocab_size) @staticmethod def move_vocab_mask(vocab_mask: torch.Tensor, device) -> torch.Tensor: