已筛选

3697 道题

排序:

2678
如何估算并优化 7B 模型 GRPO 训练的显存开销?
模型训练与对齐分布式训练与计算硬件
方案设计
深入
2679
K-Means 等聚类方法如何工作,能否保证全局最优?
模型基础与推理机器学习与推荐系统
原理机制
进阶
2681
多场景训练数据应如何混合并确定采样配比?
模型训练与对齐训练数据构建与治理
方案设计
进阶
2682
SFT 中如何平衡简单任务和复杂任务的训练权重?
模型训练与对齐预训练、续训与 SFT
方案设计
进阶
2683
微调时如何判断并缓解过拟合?
模型训练与对齐训练框架、调参与排障
故障排查
进阶
2684
SFT 常用的损失函数是什么,如何选择和计算?
模型训练与对齐训练框架、调参与排障
原理机制
进阶
2685
开启或关闭 Thinking 对 SFT 训练有什么影响?
模型训练与对齐预训练、续训与 SFT
比较选型
进阶
2686
字段提取任务的奖励函数应如何设计?
模型训练与对齐强化学习与奖励
方案设计
进阶
2688
RL 训练初期奖励先降后升时,如何解释和排查?
模型训练与对齐强化学习与奖励
故障排查
进阶
2691
静态长期记忆和动态长期记忆有什么区别,为什么需要分别设计?
Agent 原理与系统记忆系统
比较选型
进阶