已筛选

3697 道题

排序:

2692
模型如何决定是否需要召回长期记忆?
Agent 原理与系统记忆系统
原理机制
进阶
2693
动态 Prompt 与静态 Prompt 有什么区别,如何在项目中选择?
AI 应用工程与治理Prompt 与结构化输出
比较选型
基础
2694
GraphRAG 与纯向量检索有什么区别,适合解决哪些问题?
RAG 与知识系统知识图谱与 GraphRAG
比较选型
进阶
2695
RAG 场景中怎样识别需要推理的查询?
RAG 与知识系统召回策略与检索
原理机制
进阶
2697
SFT、DPO、PPO 与 GRPO 的目标、机制和适用条件如何比较?
模型训练与对齐强化学习与奖励
比较选型
进阶
2699
如何评估微调或训练后模型的效果?
模型训练与对齐Verifier 与训练评测
方案设计
进阶
2701
PPO 的 Value Model 或 Critic 起什么作用?
模型训练与对齐强化学习与奖励
原理机制
基础
2702
GRPO 如何估计组内优势?
模型训练与对齐强化学习与奖励
原理机制
进阶
2703
轨迹级奖励与 Token 级优化之间如何分配贡献?
模型训练与对齐强化学习与奖励
原理机制
进阶
2705
训练时如何选择关键超参数并判断其影响?
模型训练与对齐训练框架、调参与排障
方案设计
进阶