已筛选

3697 道题

排序:

1225
在多大规模的评估集上评测,评估集如何获得?
AI 应用工程与治理评测体系与实验设计
项目深挖
进阶
1226
采用 SFT 和 GRPO 后相对原模型改了什么,数据层面有哪些问题和修改?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1227
模型最终输出的具体结果是什么?
模型基础与推理模型选型与能力边界
项目深挖
进阶
1229
不同项目为什么分别选择 PPO 和 DDPG?
模型训练与对齐强化学习与奖励
比较选型
进阶
1230
DDPG 项目的 reward 如何设计?
模型训练与对齐强化学习与奖励
方案设计
进阶
1231
智驾场景中如何处理交互博弈、保守策略与多种行为风格?
模型训练与对齐强化学习与奖励
方案设计
进阶
1232
行为风格如何输入智能体,输入是连续值还是离散值?
模型训练与对齐强化学习与奖励
原理机制
进阶
1233
如何证明模型学到了不同风格的影响,并评估效果?
模型训练与对齐强化学习与奖励
方案设计
进阶
1234
PPO 与 TRPO 有何区别?
模型训练与对齐强化学习与奖励
比较选型
进阶
1235
训练中出现策略坍缩如何解决?
模型训练与对齐强化学习与奖励
故障排查
进阶