已筛选

3697 道题

排序:

3697
为什么部分推理模型不能直接完成 MCP 工具调用?
Agent 原理与系统MCP、A2A 与工具协议
原理机制
进阶
3698
如何让 LLM 形成可执行、可校验的任务规划?
Agent 原理与系统规划、推理与任务执行
方案设计
进阶
3699
为什么主流大语言模型多采用 Decoder-only 架构?
模型基础与推理模型架构与表示
原理机制
进阶
3700
Decoder-only 模型在训练和推理阶段的输入形式有什么不同?
模型基础与推理推理与解码
原理机制
进阶
3701
Transformer 编码器与解码器中的注意力机制有什么区别?
模型基础与推理Transformer 与注意力
比较选型
基础
3702
Decoder 自注意力为什么需要因果掩码,具体如何实现?
模型基础与推理Transformer 与注意力
原理机制
进阶
3703
多头注意力为什么要降低每个 Head 的维度?
模型基础与推理Transformer 与注意力
原理机制
进阶
3704
交叉注意力与自注意力有什么区别?
模型基础与推理Transformer 与注意力
比较选型
基础
3705
MoE 模型有哪些优势和局限?
模型基础与推理模型架构与表示
比较选型
进阶
3706
为什么越来越多的大模型采用 MoE 架构?
模型基础与推理模型架构与表示
技术决策
进阶