美团Agent 算法工程师面经发布时间:2025-09-27作者:匿名牛油查看原帖 ↗收藏完整信息归档编号:MJ-NC-2026-0344原帖标题:美团 agent算法 面经所属公司:美团岗位:Agent 算法工程师发布时间:2025-09-27面试问题 10原贴正文8 条问法 · 10 道题本篇目录原帖正文两三句介绍下agent以及当前的挑战 transformer架构 有哪些机制 解释下交叉注意力机制 介绍下ppo dpo grpo算法 grpo的loss怎么计算的 数据用的什么 deepresearch和强化学习怎么结合应用 解释下topk topp的实现原理 手撕:非hot100 投递的时候一定要看岗位偏应用落地还是偏算法。楼主算法功底比较薄弱,没有真实业务场景下的模型训练微调经验,在面试偏算法岗的时候,算法原理和训练过程被追着问本篇目录01 两三句介绍下agent以及当前的挑战02 transformer架构 有哪些机制03 解释下交叉注意力机制04 介绍下ppo dpo grpo算法05 grpo的loss怎么计算的06 数据用的什么07 deepresearch和强化学习怎么结合应用08 解释下topk topp的实现原理01两三句介绍下agent以及当前的挑战关联题目用两三句话介绍 Agent 及当前挑战。Agent 原理与系统 / Agent 基础与运行循环概念解释基础2篇相关面经↗02transformer架构 有哪些机制关联题目Transformer 的整体原理是什么?模型基础与推理 / Transformer 与注意力原理机制进阶4篇相关面经↗03解释下交叉注意力机制关联题目交叉注意力如何工作?模型基础与推理 / Transformer 与注意力原理机制进阶1篇相关面经↗04介绍下ppo dpo grpo算法关联题目PPO 算法原理是什么?模型训练与对齐 / 强化学习与奖励原理机制进阶6篇相关面经↗关联题目DPO 的算法原理是什么?模型训练与对齐 / 偏好对齐原理机制进阶2篇相关面经↗关联题目GRPO 算法如何工作?模型训练与对齐 / 强化学习与奖励原理机制进阶6篇相关面经↗05追问grpo的loss怎么计算的上一问 ↑关联题目GRPO 的 Loss 如何计算?模型训练与对齐 / 强化学习与奖励原理机制进阶1篇相关面经↗06追问数据用的什么上一问 ↑关联题目GRPO 训练实际使用什么数据?模型训练与对齐 / 强化学习与奖励项目深挖进阶1篇相关面经↗07deepresearch和强化学习怎么结合应用关联题目Deep Research 如何与强化学习结合?模型训练与对齐 / 强化学习与奖励方案设计进阶1篇相关面经↗08解释下topk topp的实现原理关联题目Temperature、Top-k 和 Top-p 怎样影响模型采样?模型基础与推理 / 推理与解码原理机制进阶4篇相关面经↗相关公司美团→22篇面经248道题