模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

2697
SFT、DPO、PPO 与 GRPO 的目标、机制和适用条件如何比较?
模型训练与对齐强化学习与奖励
比较选型
进阶
2699
如何评估微调或训练后模型的效果?
模型训练与对齐Verifier 与训练评测
方案设计
进阶
2701
PPO 的 Value Model 或 Critic 起什么作用?
模型训练与对齐强化学习与奖励
原理机制
基础
2702
GRPO 如何估计组内优势?
模型训练与对齐强化学习与奖励
原理机制
进阶
2703
轨迹级奖励与 Token 级优化之间如何分配贡献?
模型训练与对齐强化学习与奖励
原理机制
进阶
2705
训练时如何选择关键超参数并判断其影响?
模型训练与对齐训练框架、调参与排障
方案设计
进阶
2706
如何构建 chosen/rejected 偏好对,模型答案优于标注答案时如何处理?
模型训练与对齐偏好对齐
方案设计
进阶
2715
微调过程中遇到过哪些问题,如何定位并解决?
模型训练与对齐训练框架、调参与排障
项目深挖
进阶
2716
QLoRA 如何工作,与 LoRA 有什么关系?
模型训练与对齐参数高效微调
原理机制
进阶
2770
生成式推荐 SFT 阶段训练哪些任务?
模型训练与对齐预训练、续训与 SFT
原理机制
进阶