Support FlashAttention3 page_size > 1 and topk > 1 case with paged attn and spec decode (#7725)
This commit is contained in:
@@ -38,7 +38,7 @@ def write_answers(filename, model_id, questions, answers):
|
||||
"model_id": model_id,
|
||||
"choices": {
|
||||
"index": 0,
|
||||
"turns": [answers[i][0], answers[i][1]],
|
||||
"prompt": [answers[i][0], answers[i][1]],
|
||||
},
|
||||
"tstamp": time.time(),
|
||||
}
|
||||
@@ -60,7 +60,7 @@ def main(args):
|
||||
# Construct prompts
|
||||
questions = load_questions(args.question_file)[: args.num_questions]
|
||||
arguments = [
|
||||
{"question_1": q["turns"][0], "question_2": q["turns"][1]} for q in questions
|
||||
{"question_1": q["prompt"][0], "question_2": q["prompt"][1]} for q in questions
|
||||
]
|
||||
|
||||
# Select backend
|
||||
|
||||
Reference in New Issue
Block a user