跳到主要内容
面试之前,先来面栈
题库
/
模型基础与推理
Transformer 与注意力
8
个专题 ·
179
道题
专题概览
题目列表
179
Transformer 与注意力
继续复习
待复习
0
问题类型
问题类型
比较选型
代码题
原理机制
问题类型
技术难度
技术难度
基础
进阶
深入
技术难度
复习状态
复习状态
未标记
待复习
已掌握
复习状态
已筛选
清除筛选
共
21
道题
开始复习
排序:
排序
相关面经最多
题集收录最多
题号顺序
最新更新
题号
题目
技术难度
收录情况
复习状态
2781
多头注意力机制如何工作?
模型基础与推理
Transformer 与注意力
原理机制
已有答案
面前必看
进阶
暂无面经
多头注意力机制如何工作?的复习状态
未标记
待复习
已掌握
2898
多轮 Agent 对话中 Attention 有哪些局限?
模型基础与推理
Transformer 与注意力
原理机制
已有答案
面前必看
进阶
暂无面经
多轮 Agent 对话中 Attention 有哪些局限?的复习状态
未标记
待复习
已掌握
2964
Transformer Decoder 的结构和机制是什么?
模型基础与推理
Transformer 与注意力
原理机制
已有答案
面前必看
进阶
暂无面经
Transformer Decoder 的结构和机制是什么?的复习状态
未标记
待复习
已掌握
2965
为什么使用多头注意力而不换成单头?
模型基础与推理
Transformer 与注意力
比较选型
已有答案
面前必看
基础
暂无面经
1
份题集
为什么使用多头注意力而不换成单头?的复习状态
未标记
待复习
已掌握
3646
Attention 的 Q、K、V 如何由输入变换得到?
模型基础与推理
Transformer 与注意力
原理机制
已有答案
面前必看
基础
暂无面经
1
份题集
Attention 的 Q、K、V 如何由输入变换得到?的复习状态
未标记
待复习
已掌握
3647
Attention 为什么除以根号 d_k,不这样缩放还有什么替代方案?
模型基础与推理
Transformer 与注意力
原理机制
已有答案
面前必看
进阶
暂无面经
1
份题集
Attention 为什么除以根号 d_k,不这样缩放还有什么替代方案?的复习状态
未标记
待复习
已掌握
3701
Transformer 编码器与解码器中的注意力机制有什么区别?
模型基础与推理
Transformer 与注意力
比较选型
已有答案
面前必看
基础
暂无面经
1
份题集
Transformer 编码器与解码器中的注意力机制有什么区别?的复习状态
未标记
待复习
已掌握
3702
Decoder 自注意力为什么需要因果掩码,具体如何实现?
模型基础与推理
Transformer 与注意力
原理机制
已有答案
面前必看
进阶
暂无面经
1
份题集
Decoder 自注意力为什么需要因果掩码,具体如何实现?的复习状态
未标记
待复习
已掌握
3703
多头注意力为什么要降低每个 Head 的维度?
模型基础与推理
Transformer 与注意力
原理机制
已有答案
面前必看
进阶
暂无面经
1
份题集
多头注意力为什么要降低每个 Head 的维度?的复习状态
未标记
待复习
已掌握
3704
交叉注意力与自注意力有什么区别?
模型基础与推理
Transformer 与注意力
比较选型
已有答案
面前必看
基础
暂无面经
1
份题集
交叉注意力与自注意力有什么区别?的复习状态
未标记
待复习
已掌握
2781
多头注意力机制如何工作?
模型基础与推理
Transformer 与注意力
原理机制
已有答案
面前必看
进阶
暂无面经
多头注意力机制如何工作?的复习状态
未标记
待复习
已掌握
未找到相关题目
换个关键词,或清除筛选。
清除筛选
共
21
道题 · 显示 11–20 道
上一页
1
2
3
2 / 3
下一页
启用 JavaScript 后可筛选和浏览完整题库;当前显示前 10 道题。