百度

端到端决策规划控制算法工程师一面面经

完整信息

39 条问法 · 34 道题

本篇目录
日期:2026.8.11 时长:约50分钟 面试类型:技术面 面试岗位:端到端决策规划控制算法工程师 工作地:上海 内容: 1 自我介绍 依旧围绕简历介绍 2 你的两端简历与决策规划/感知貌似没有关联,第二段是和Agent有关的,那从第二段讲起吧(其实和Agent关系很小) 介绍负责业务,介绍业务问题,介绍问题难点,基于难点选择模型,初代模型效果如何,有什么问题和潜在改进方向,所以采用了xxx LLM,在xxx样本上LoRA微调,效果如何,又遇到什么问题,有什么改进方向,因此又进一步……。 a 我理解一下,你的模型是输入xxx,然后输出xxx?那么你微调具体微调哪一部分,不太可能是全量微调吧? 我的r选用128,因为模型参数量还是比较大,所以综合选择的是128还是64有点忘了,因为我认为这个子任务其实还算是比较复杂的。其中难点之一在于,样本中会包含xxx干扰,同时还面临xxx问题,因此我也主要对注意力及NLP(已经记不得说的啥了这三个字)进行微调,总参数量大约是10%。 b 为什么用了GRPO而不是DPO? RL部分我做的是25%样本集的demo,实际上数据量不够大,效果提升非常小。出发点在于对模型思考过程进行监督,但由于数据量不太够,所以没办法让做到让模型学会真正意义上的推理。对于GRPO的话,当时认为在当前场景中GRPO更易实现,所以就用GRPO了。 c reward是如何设计的呢? 这部分主要是基于业务中的难点、样本中的问题来设计的,xxx……。 d 你的分布式如何理解? 就是多卡训练和推理。 e SFT和GRPO是分两阶段的吗? 是 f 加上GRPO后提升明显吗? 其实没有太明显提升 g 那你写的准确率提升至xx,是不是大部分都是SFT的功劳? 可以这么说,其实在评估集上,模型准确率只有xx,为什么我写的是xx呢?因为在我人工校验的时候,发现了样本中存在x%的噪声,也就是人工标签存在错误,那么结合样本数量简单估计之后,大约就是这个准确率,具体是多少没法确定。 3 项目拷打 a 我看项目做的还挺多,这些都是强化学习决策,是大项目吗? 不是,是我自己归纳的,确实是技术栈相对集中 b 你的xx项目决策是离散的吗? 是 c 介绍一下这个项目背景 介绍 d 你动作空间无非是xx xx xx,那么在这个场景中不够细致啊 其实对于网络来说可以更加细致,但是不利于网络参数更新与收敛 e 我不太理解你项目做多智能体协同和xx,这是有什么优点和难点吗? 难点主要是xxx,因此目标在于xx。所以这个更多是瞄准未来20年或者30年后的场景?更加xxx。 f 算法输入是什么? 感知之后,已经处理完的特征,如xxxx。 g 除了这个还有吗? 比如一些基于Transformer的xxx,不过这基本都是基于最基础特征提取出来的xxx,最原始输入都是xx。 h 这个基于Transformer的xxx,是显式还是隐式?是中间结果还是最终输出结果一部分? 算是中间结果, 目前是高维隐式,可以解码为显式 i 详细讲下怎么做的 目前来说我设计了一个xxx数据缓存池,这样在参数更新的时候就可以把xxx和缓存的xxx一起计算loss来联合更新Transformer。 j 与仿真环境是否有交互?所有项目都是吗? 是的,不过各个项目环境有所不同。 k 如果没有环境是否还可以实现你的模型? 可以,其实这些可视化的都是渲染结果,不渲染也可以跑。 l 我看你用了MHA做特征增强,这个怎么做的? 用注意力计算之后,就可以了。 m 奖励函数怎么写的? 结合场景一起说了一些动作空间和奖励函数的设计。 n 听起来奖励函数还听离散,你的具体设计师比较稀疏还是稠密的? 具体是怎么设计的,奖励函数面临什么固有问题,做出什么样的改进 o 对于xx和xx项奖励,前者貌似更重要,你是如何去平衡不同项的权重的? 先讲了一些权重的设计方法,但是面试官追问具体设计,就说了 p 为什么某个项目没用TD3,这不是改进算法吗? 老师让用的。面试官说这么久应该有时间学习的,我说我们专业重点更倾向于用已有技术解决尚未解决的一些问题,当然您说的也很重要,对于后续项目我也会积极用更加先进的方案来尝试并解决。 q 那你了解TD3相比DDPG有什么改进吗?除了PPO、GRPO、DDPG,你还了解哪些RL算法? 不太知道。有些经典的我看过,DQN、SAC,但这些算法的改进就不太记得了,看的比较早。 r 讲讲你场景中的level K博弈 讲了构建思路(此时已经到第四个项目了),如何实现。 s 和你之前的模型如何串起来? 对于xx采用xxx+xxx模型,可以横纵向解耦,因此他们已经实现xxx,那么我再xxx,就构建好了。 t 讲一下cross-att的qkv分别是? u 会cpp吗? 可以学 4 手撕 a MHA 一边讲维度变化,一边说了一些MHA设计的初衷(最后别忘了多个头拼接还有个权重矩阵) 追问:用torch写下 不会(面试官也没说什么) b PPO loss 不会(我chovy,动手学强化学习这本书里好像没看到这个,不知道是不是漏看了) 然后面试官给我手撕了(秀我一脸,还有kl散度他也撕了) 5 cpp 是否有cpp经验? 完全没有 让我学下,后续会用到 6 反问 a 我先自我总结一下,对于今天可能有些表现不够好的地方,比如PPO loss,经典RL算法……。对于其他地方,我应该是勉强达到合格线。不知道我的描述是否准确? 你项目经历讲的挺清楚的,包括如何用PPO做决策,这和我们的工作内容是比较契合的。对于PPO loss其实也不好说,可能有点类似于八股,但对于真正做过项目的应该还是能记得住的(我听到这有点尬,应该记住的没记住)。反而是对于前向KL还是反向KL,有什么区别,这个更偏理论,可能我们大多数也是拿到开源代码就进一步研究了,也不太深究是哪一个。整体我觉得还好。 b 对于我个人倾向,有一定时间沉淀和职业规划,我更期望在第一份工作或说第一个工作岗位上有3年5年或者是更长时间的发展。期望您能简单介绍一下您所在团队的主要工作内容和组织架构。 你做xxx方向也知道xxx吧,那么其实大的团队一共有xxx,主要做……,后续团队会……,目前主要在做长尾case的RL。 (追问)近年兴起VLA、VLM等,是否有相关技术沉淀? (补充)有的,……。 c 对于今天面试结果,大概几个工作日或自然日我可以得到反馈? 我会……,具体不知道。 7 后续 hr第二天约了二面
本篇目录
  1. 01
  2. 02
    项目追问
    你的两端简历与决策规划/感知貌似没有关联,第二段是和Agent有关的,那从第二段讲起吧(其实和Agent关系很小)
  3. 03
    项目追问
    我理解一下,你的模型是输入xxx,然后输出xxx?那么你微调具体微调哪一部分,不太可能是全量微调吧?
  4. 04
  5. 05
  6. 06
  7. 07
  8. 08
  9. 09
  10. 10
  11. 11
  12. 12
  13. 13
  14. 14
  15. 15
  16. 16
  17. 17
  18. 18
  19. 19
  20. 20
  21. 21
  22. 22
  23. 23
  24. 24
  25. 25
  26. 26
  27. 27
  28. 28
  29. 29
  30. 30
  31. 31
  32. 32
  33. 33
  34. 34
  35. 35
  36. 36
    反问
    我先自我总结一下,对于今天可能有些表现不够好的地方,比如PPO loss,经典RL算法……。对于其他地方,我应该是勉强达到合格线。不知道我的描述是否准确?
  37. 37
  38. 38
  39. 39
    反问
    对于今天面试结果,大概几个工作日或自然日我可以得到反馈?

相关公司