多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

self attention 中的 K 和 Q 是用来做什么的?

self attention 中的 K 和 Q 是用来做什么的? 👨‍⚕️主页: gis分享者👨‍⚕️感谢各位大佬 点赞👍 收藏⭐ 留言📝 加关注✅!👨‍⚕️收录于专栏:AI大模型原理和应用面试题文章目录一、🍀回答重点二、🍀扩展知识一、🍀回答重点在 self attention(自注意力机制)中,K(Key)和 Q(Query)主要是用来衡量输入序列中各个元素之间的相似度和相关性。具体来说,query(Q)向量用于表示查询,key(K)向量用于表示我们用来比对的键,通过计算 query 和 key 的点积,我们可以得到一组注意力权重(attention weights)。这些权重表示了查询和每个键之间的相关性,权重越高,表示查询与键越相关。最终,这些权重用于加权求和 value(V)向量,得到最终的输出。二、🍀扩展知识1)更详细的过程解释: 自注意力机制中的基本步骤如下:线性变换: 原始输入序列通过线性变换产生 Q、K 和 V 矩阵。这些线性变换一般是通过权重矩阵 Wq、Wk 和 Wv 实现的,即 Q = XWq, K = XWk, V = XWv。计算注意力得分: 对于 Query 向量 Q 和 Key 向量 K,计算他们的点积(类似余弦相似度),然后缩放(除以sqrt(d_k)),得出一个注意力得分矩阵。Softmax 归一
返回列表