同程旅行

1 篇面经6 道面试题

开始复习

已筛选

6 道题

排序:

0048
如何理解 Agent 中 Harness 的作用?
Agent 原理与系统Agent 框架与 Harness
概念解释
基础
0736
什么是 Reward Hacking,如何识别、定位并治理?
模型训练与对齐强化学习与奖励
故障排查
进阶
1742
项目奖励函数是稀疏还是稠密的,具体如何设计?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1899
介绍实习中的 GUI Agent 工作。
Agent 原理与系统GUI、Computer Use 与多模态 Agent
项目深挖
进阶
2490
GRPO 相比 PPO 做了哪些改进?
模型训练与对齐强化学习与奖励
比较选型
进阶
3719
OpenClaw 的记忆系统如何设计?
Agent 原理与系统记忆系统
原理机制
进阶