模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

2772
GRPO 生成只命中商品 SID 前两个 Token 时如何给奖励?
模型训练与对齐强化学习与奖励
方案设计
进阶
2789
过程监督信号如何设计,还能用于哪些任务?
模型训练与对齐预训练、续训与 SFT
方案设计
进阶
2790
如何平衡强化学习训练效率与稳定性?
模型训练与对齐强化学习与奖励
方案设计
进阶
2792
大模型还有哪些值得增强的能力?
模型训练与对齐预训练、续训与 SFT
开放讨论
2794
小模型做强化学习是否有效,如何选择模型与每轮数据规模?
模型训练与对齐强化学习与奖励
比较选型
进阶
2796
论文方法能否泛化到垂直领域?
模型训练与对齐Verifier 与训练评测
效果评估
进阶
2834
GRPO 训练数据应满足哪些要求?
模型训练与对齐强化学习与奖励
方案设计
进阶
2837
显存受限时如何选择模型训练方案?
模型训练与对齐分布式训练与计算硬件
方案设计
进阶
2848
A2C 的基本原理是什么?
模型训练与对齐强化学习与奖励
原理机制
进阶
2899
DPO 训练有哪些需要注意的事项?
模型训练与对齐偏好对齐
方案设计
进阶