模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

2901
微调 Qwen 时如何选择训练阶段和损失函数?
模型训练与对齐参数高效微调
方案设计
进阶
2904
LoRA 训练后推理是否必须挂载 Adapter?
模型训练与对齐参数高效微调
原理机制
进阶
2912
如何理解任务微调的权重更新具有低内在秩这一假设?
模型训练与对齐参数高效微调
原理机制
进阶
2914
为什么选择 DPO 而不选择 GRPO?
模型训练与对齐强化学习与奖励
比较选型
进阶
2916
多路 System 增强策略如何实现?
模型训练与对齐训练数据构建与治理
方案设计
进阶
2970
蒸馏时如何避免学生学到教师错误的推理链?
模型训练与对齐蒸馏与模型合并
方案设计
进阶
3007
Agent 后训练中的 Verifier 如何设计?
模型训练与对齐Verifier 与训练评测
方案设计
进阶
3008
Agent 训练中的 Bad Case 如何回流?
模型训练与对齐训练数据构建与治理
方案设计
进阶
3009
PPO 的 Value Model 如何训练?
模型训练与对齐强化学习与奖励
原理机制
进阶
3010
PPO 的 Reward Model 如何训练?
模型训练与对齐强化学习与奖励
原理机制
进阶