已筛选

3697 道题

排序:

1729
项目微调具体更新模型的哪些部分?
模型训练与对齐预训练、续训与 SFT
项目深挖
进阶
1730
项目的 SFT 和 GRPO 是否分为两个阶段?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1731
准确率提升主要来自 SFT 还是后续 GRPO,如何区分贡献?
AI 应用工程与治理评测体系与实验设计
效果评估
进阶
1732
简历中的多个强化学习决策项目是同一大项目的组成部分吗?
项目与综合面试项目背景、架构与职责
项目深挖
基础
1733
强化学习项目的决策和动作空间是离散的吗?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1734
当前动作空间不够细致时,如何解释这种粒度设计?
模型训练与对齐强化学习与奖励
项目深挖
深入
1735
决策项目采用多智能体协同有哪些优势和难点?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1736
强化学习决策算法的输入是什么,还使用哪些输入特征?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1737
项目中 Transformer 的表示是显式还是隐式,属于中间结果还是最终输出?
模型基础与推理模型架构与表示
项目深挖
进阶
1738
项目中的 Transformer 特征模块具体如何实现?
模型基础与推理模型架构与表示
项目深挖
深入