Support FlashAttention3 page_size > 1 and topk > 1 case with paged attn and spec decode (#7725)

This commit is contained in:
Yubo Wang
2025-11-26 11:44:41 +08:00
committed by GitHub
parent ca5c8b16f6
commit 18fb51583f
9 changed files with 706 additions and 86 deletions
+2 -2
View File
@@ -38,7 +38,7 @@ def write_answers(filename, model_id, questions, answers):
"model_id": model_id,
"choices": {
"index": 0,
"turns": [answers[i][0], answers[i][1]],
"prompt": [answers[i][0], answers[i][1]],
},
"tstamp": time.time(),
}
@@ -60,7 +60,7 @@ def main(args):
# Construct prompts
questions = load_questions(args.question_file)[: args.num_questions]
arguments = [
{"question_1": q["turns"][0], "question_2": q["turns"][1]} for q in questions
{"question_1": q["prompt"][0], "question_2": q["prompt"][1]} for q in questions
]
# Select backend