模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

2019
统一管线构造和用户数据回流在方法论上有什么差异?
模型训练与对齐训练数据构建与治理
比较选型
进阶
2021
Mid-training 与 Post-training 有什么区别?
模型训练与对齐预训练、续训与 SFT
比较选型
进阶
2022
业务算法什么时候应该训练模型?
模型训练与对齐预训练、续训与 SFT
比较选型
进阶
2144
SFT、强化学习和 Agentic CFT 分别解决什么问题?
模型训练与对齐强化学习与奖励
比较选型
进阶
2145
Agent 训练为什么可能需要 Mask Observation Token?
模型训练与对齐预训练、续训与 SFT
原理机制
进阶
2323
Agent 如何通过 SFT 训练?
模型训练与对齐预训练、续训与 SFT
方案设计
进阶
2324
工具调用本身与基于结果继续生成,哪部分更依赖 SFT?
模型训练与对齐预训练、续训与 SFT
比较选型
进阶
2468
GRPO 的 Loss 如何计算?
模型训练与对齐强化学习与奖励
原理机制
进阶
2469
Deep Research 如何与强化学习结合?
模型训练与对齐强化学习与奖励
方案设计
进阶
2474
GRPO 训练实际使用什么数据?
模型训练与对齐强化学习与奖励
项目深挖
进阶