模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

3011
GRPO 的 Reward 能否迁移到 PPO?
模型训练与对齐强化学习与奖励
比较选型
进阶
3048
逻辑推理微调的 LoRA 秩 r 是否需要高于对话生成任务?
模型训练与对齐参数高效微调
比较选型
进阶
3049
垂直领域微调后通用能力衰减,如何优化?
模型训练与对齐训练框架、调参与排障
故障排查
进阶
3051
DPO 为什么不需要在线采样,训练数据采用什么格式?
模型训练与对齐偏好对齐
原理机制
进阶
3052
GRPO 中 KL 散度损失如何计算实现?
模型训练与对齐强化学习与奖励
原理机制
深入
3173
如何为海底捞智能点餐 Agent 设计后训练方案?
模型训练与对齐预训练、续训与 SFT
系统设计
深入
3174
智能点餐场景的多轮 RL Reward 如何设计?
模型训练与对齐强化学习与奖励
方案设计
进阶
3268
项目是否使用 GPU,公司是否部署 GPU 训练大模型?
模型训练与对齐分布式训练与计算硬件
经历介绍
3270
什么是知识蒸馏?
模型训练与对齐蒸馏与模型合并
概念解释
基础
3297
简单介绍后训练和强化学习。
模型训练与对齐强化学习与奖励
概念解释
基础