已筛选

3697 道题

排序:

2789
过程监督信号如何设计,还能用于哪些任务?
模型训练与对齐预训练、续训与 SFT
方案设计
进阶
2790
如何平衡强化学习训练效率与稳定性?
模型训练与对齐强化学习与奖励
方案设计
进阶
2791
混合推理如何实现,增强推理时如何避免遗忘通用能力?
模型基础与推理模型选型与能力边界
原理机制
进阶
2792
大模型还有哪些值得增强的能力?
模型训练与对齐预训练、续训与 SFT
开放讨论
2793
是否阅读过 Qwen2.5-VL 技术报告,理解哪些内容?
模型基础与推理多模态与生成模型
经历介绍
2794
小模型做强化学习是否有效,如何选择模型与每轮数据规模?
模型训练与对齐强化学习与奖励
比较选型
进阶
2795
科研中遇到哪些困难和失败路线,如何判断并调整?
项目与综合面试能力成长与学习方法
行为面
2796
论文方法能否泛化到垂直领域?
模型训练与对齐Verifier 与训练评测
效果评估
进阶
2797
RPA、LLM、Agent 与 Workflow 有什么关系?
Agent 原理与系统Agent 应用架构与场景设计
比较选型
基础
2798
AI 产品经理与 AI 解决方案岗位有什么区别?
项目与综合面试技术决策与业务理解
比较选型
进阶