模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

0104
GRPO 算法如何工作?
模型训练与对齐强化学习与奖励
原理机制
进阶
0514
PPO 算法原理是什么?
模型训练与对齐强化学习与奖励
原理机制
进阶
0515
DPO 与 PPO 有什么区别?
模型训练与对齐强化学习与奖励
比较选型
进阶
2704
如何根据业务目标设计强化学习奖励?
模型训练与对齐强化学习与奖励
方案设计
进阶
0081
如何合成 Agent 训练任务,并验证任务设计带来的增益?
模型训练与对齐训练数据构建与治理
方案设计
深入
0089
训练数据如何合成与筛选?
模型训练与对齐训练数据构建与治理
项目深挖
进阶
0168
LoRA 的原理、常见超参数与注入模块是什么?
模型训练与对齐参数高效微调
原理机制
进阶
0615
什么情况下使用 PPO,什么情况下使用 GRPO?
模型训练与对齐强化学习与奖励
比较选型
进阶
0692
是否独立做过模型训练或微调?
模型训练与对齐预训练、续训与 SFT
经历介绍
2490
GRPO 相比 PPO 做了哪些改进?
模型训练与对齐强化学习与奖励
比较选型
进阶