[diffusion] fix: fix using the sub-optimal fa kernel (#16382)
This commit is contained in:
@@ -201,18 +201,15 @@ class FlashAttentionImpl(AttentionImpl):
|
|||||||
|
|
||||||
if use_upstream:
|
if use_upstream:
|
||||||
bsz, seqlen, nheads_q, d = q_shape
|
bsz, seqlen, nheads_q, d = q_shape
|
||||||
bsz_k, seqlen_k, nheads_k, d_k = k_shape
|
q_ = query.contiguous()
|
||||||
bsz_v, seqlen_v, nheads_v, d_v = v_shape
|
k_ = key.contiguous()
|
||||||
q_ = query.contiguous().reshape(bsz * seqlen, nheads_q, d)
|
v_ = value.contiguous()
|
||||||
k_ = key.contiguous().reshape(bsz * seqlen, nheads_k, d)
|
|
||||||
v_ = value.contiguous().reshape(bsz * seqlen, nheads_v, d)
|
|
||||||
cu = _get_cu_seqlens(q_.device.index, bsz, seqlen)
|
|
||||||
out = flash_attn_varlen_func_upstream(
|
out = flash_attn_varlen_func_upstream(
|
||||||
q_,
|
q_,
|
||||||
k_,
|
k_,
|
||||||
v_,
|
v_,
|
||||||
cu,
|
None,
|
||||||
cu,
|
None,
|
||||||
seqlen,
|
seqlen,
|
||||||
seqlen,
|
seqlen,
|
||||||
softmax_scale=self.softmax_scale,
|
softmax_scale=self.softmax_scale,
|
||||||
|
|||||||
Reference in New Issue
Block a user