模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

0638
大模型微调的机制是什么?
模型训练与对齐预训练、续训与 SFT
原理机制
进阶
0639
是否有从零训练大模型的经历?
模型训练与对齐预训练、续训与 SFT
项目深挖
进阶
0678
Query Agent 相关性模型如何标注训练样本?
模型训练与对齐训练数据构建与治理
方案设计
进阶
0679
强化学习训练中的 Reference Model 起什么作用?
模型训练与对齐强化学习与奖励
原理机制
基础
0680
SFT 与 RL 数据如何构造,如何选择点对点或点对面方式?
模型训练与对齐训练数据构建与治理
方案设计
进阶
0681
为什么在 SFT 后采用 RL,SFT 遇到了什么问题?
模型训练与对齐预训练、续训与 SFT
比较选型
进阶
0732
冷启动使用了多少数据,分布如何?
模型训练与对齐训练数据构建与治理
项目深挖
进阶
0735
RL 训练中通常观察哪些参数和指标?
模型训练与对齐训练框架、调参与排障
效果评估
基础
0737
DPO 是否需要额外加入 KL 约束?
模型训练与对齐偏好对齐
原理机制
进阶
0763
什么是高质量数据?
模型训练与对齐训练数据构建与治理
原理机制
进阶