已筛选

3697 道题

排序:

3006
如何理解 GLM-5.2、Claude Code 和 Codex 这类系统?
Agent 原理与系统Agent 框架与 Harness
开放讨论
3007
Agent 后训练中的 Verifier 如何设计?
模型训练与对齐Verifier 与训练评测
方案设计
进阶
3008
Agent 训练中的 Bad Case 如何回流?
模型训练与对齐训练数据构建与治理
方案设计
进阶
3009
PPO 的 Value Model 如何训练?
模型训练与对齐强化学习与奖励
原理机制
进阶
3010
PPO 的 Reward Model 如何训练?
模型训练与对齐强化学习与奖励
原理机制
进阶
3011
GRPO 的 Reward 能否迁移到 PPO?
模型训练与对齐强化学习与奖励
比较选型
进阶
3012
Code Agent 的 Verifier 如何设计?
AI 应用工程与治理评测体系与实验设计
方案设计
进阶
3013
实现 Softmax。
模型基础与推理模型架构与表示
代码题
基础
3014
ICPC 是什么?
项目与综合面试个人介绍与教育经历
经历介绍
3015
你对目标公司有哪些了解,如何看待它?
项目与综合面试求职动机、职业选择与安排
行为面