端到端决策规划控制算法工程师一面面经
完整信息
本篇目录
日期:2026.8.11
时长:约50分钟
面试类型:技术面
面试岗位:端到端决策规划控制算法工程师
工作地:上海
内容:
1 自我介绍
依旧围绕简历介绍
2 你的两端简历与决策规划/感知貌似没有关联,第二段是和Agent有关的,那从第二段讲起吧(其实和Agent关系很小)
介绍负责业务,介绍业务问题,介绍问题难点,基于难点选择模型,初代模型效果如何,有什么问题和潜在改进方向,所以采用了xxx LLM,在xxx样本上LoRA微调,效果如何,又遇到什么问题,有什么改进方向,因此又进一步……。
a 我理解一下,你的模型是输入xxx,然后输出xxx?那么你微调具体微调哪一部分,不太可能是全量微调吧?
我的r选用128,因为模型参数量还是比较大,所以综合选择的是128还是64有点忘了,因为我认为这个子任务其实还算是比较复杂的。其中难点之一在于,样本中会包含xxx干扰,同时还面临xxx问题,因此我也主要对注意力及NLP(已经记不得说的啥了这三个字)进行微调,总参数量大约是10%。
b 为什么用了GRPO而不是DPO?
RL部分我做的是25%样本集的demo,实际上数据量不够大,效果提升非常小。出发点在于对模型思考过程进行监督,但由于数据量不太够,所以没办法让做到让模型学会真正意义上的推理。对于GRPO的话,当时认为在当前场景中GRPO更易实现,所以就用GRPO了。
c reward是如何设计的呢?
这部分主要是基于业务中的难点、样本中的问题来设计的,xxx……。
d 你的分布式如何理解?
就是多卡训练和推理。
e SFT和GRPO是分两阶段的吗?
是
f 加上GRPO后提升明显吗?
其实没有太明显提升
g 那你写的准确率提升至xx,是不是大部分都是SFT的功劳?
可以这么说,其实在评估集上,模型准确率只有xx,为什么我写的是xx呢?因为在我人工校验的时候,发现了样本中存在x%的噪声,也就是人工标签存在错误,那么结合样本数量简单估计之后,大约就是这个准确率,具体是多少没法确定。
3 项目拷打
a 我看项目做的还挺多,这些都是强化学习决策,是大项目吗?
不是,是我自己归纳的,确实是技术栈相对集中
b 你的xx项目决策是离散的吗?
是
c 介绍一下这个项目背景
介绍
d 你动作空间无非是xx xx xx,那么在这个场景中不够细致啊
其实对于网络来说可以更加细致,但是不利于网络参数更新与收敛
e 我不太理解你项目做多智能体协同和xx,这是有什么优点和难点吗?
难点主要是xxx,因此目标在于xx。所以这个更多是瞄准未来20年或者30年后的场景?更加xxx。
f 算法输入是什么?
感知之后,已经处理完的特征,如xxxx。
g 除了这个还有吗?
比如一些基于Transformer的xxx,不过这基本都是基于最基础特征提取出来的xxx,最原始输入都是xx。
h 这个基于Transformer的xxx,是显式还是隐式?是中间结果还是最终输出结果一部分?
算是中间结果, 目前是高维隐式,可以解码为显式
i 详细讲下怎么做的
目前来说我设计了一个xxx数据缓存池,这样在参数更新的时候就可以把xxx和缓存的xxx一起计算loss来联合更新Transformer。
j 与仿真环境是否有交互?所有项目都是吗?
是的,不过各个项目环境有所不同。
k 如果没有环境是否还可以实现你的模型?
可以,其实这些可视化的都是渲染结果,不渲染也可以跑。
l 我看你用了MHA做特征增强,这个怎么做的?
用注意力计算之后,就可以了。
m 奖励函数怎么写的?
结合场景一起说了一些动作空间和奖励函数的设计。
n 听起来奖励函数还听离散,你的具体设计师比较稀疏还是稠密的?
具体是怎么设计的,奖励函数面临什么固有问题,做出什么样的改进
o 对于xx和xx项奖励,前者貌似更重要,你是如何去平衡不同项的权重的?
先讲了一些权重的设计方法,但是面试官追问具体设计,就说了
p 为什么某个项目没用TD3,这不是改进算法吗?
老师让用的。面试官说这么久应该有时间学习的,我说我们专业重点更倾向于用已有技术解决尚未解决的一些问题,当然您说的也很重要,对于后续项目我也会积极用更加先进的方案来尝试并解决。
q 那你了解TD3相比DDPG有什么改进吗?除了PPO、GRPO、DDPG,你还了解哪些RL算法?
不太知道。有些经典的我看过,DQN、SAC,但这些算法的改进就不太记得了,看的比较早。
r 讲讲你场景中的level K博弈
讲了构建思路(此时已经到第四个项目了),如何实现。
s 和你之前的模型如何串起来?
对于xx采用xxx+xxx模型,可以横纵向解耦,因此他们已经实现xxx,那么我再xxx,就构建好了。
t 讲一下cross-att的qkv分别是?
u 会cpp吗?
可以学
4 手撕
a MHA
一边讲维度变化,一边说了一些MHA设计的初衷(最后别忘了多个头拼接还有个权重矩阵)
追问:用torch写下
不会(面试官也没说什么)
b PPO loss
不会(我chovy,动手学强化学习这本书里好像没看到这个,不知道是不是漏看了)
然后面试官给我手撕了(秀我一脸,还有kl散度他也撕了)
5 cpp
是否有cpp经验?
完全没有
让我学下,后续会用到
6 反问
a 我先自我总结一下,对于今天可能有些表现不够好的地方,比如PPO loss,经典RL算法……。对于其他地方,我应该是勉强达到合格线。不知道我的描述是否准确?
你项目经历讲的挺清楚的,包括如何用PPO做决策,这和我们的工作内容是比较契合的。对于PPO loss其实也不好说,可能有点类似于八股,但对于真正做过项目的应该还是能记得住的(我听到这有点尬,应该记住的没记住)。反而是对于前向KL还是反向KL,有什么区别,这个更偏理论,可能我们大多数也是拿到开源代码就进一步研究了,也不太深究是哪一个。整体我觉得还好。
b 对于我个人倾向,有一定时间沉淀和职业规划,我更期望在第一份工作或说第一个工作岗位上有3年5年或者是更长时间的发展。期望您能简单介绍一下您所在团队的主要工作内容和组织架构。
你做xxx方向也知道xxx吧,那么其实大的团队一共有xxx,主要做……,后续团队会……,目前主要在做长尾case的RL。
(追问)近年兴起VLA、VLM等,是否有相关技术沉淀?
(补充)有的,……。
c 对于今天面试结果,大概几个工作日或自然日我可以得到反馈?
我会……,具体不知道。
7 后续
hr第二天约了二面
本篇目录
- 01
1 自我介绍
- 02
你的两端简历与决策规划/感知貌似没有关联,第二段是和Agent有关的,那从第二段讲起吧(其实和Agent关系很小)
- 03
我理解一下,你的模型是输入xxx,然后输出xxx?那么你微调具体微调哪一部分,不太可能是全量微调吧?
- 04
为什么用了GRPO而不是DPO?
- 05
reward是如何设计的呢?
- 06
你的分布式如何理解?
- 07
SFT和GRPO是分两阶段的吗?
- 08
加上GRPO后提升明显吗?
上一问 ↑ - 09
那你写的准确率提升至xx,是不是大部分都是SFT的功劳?
上一问 ↑ - 10
我看项目做的还挺多,这些都是强化学习决策,是大项目吗?
- 11
你的xx项目决策是离散的吗?
- 12
介绍一下这个项目背景
- 13
你动作空间无非是xx xx xx,那么在这个场景中不够细致啊
上一问 ↑ - 14
我不太理解你项目做多智能体协同和xx,这是有什么优点和难点吗?
- 15
算法输入是什么?
- 16
除了这个还有吗?
上一问 ↑ - 17
这个基于Transformer的xxx,是显式还是隐式?是中间结果还是最终输出结果一部分?
上一问 ↑ - 18
详细讲下怎么做的
上一问 ↑ - 19
与仿真环境是否有交互?所有项目都是吗?
- 20
如果没有环境是否还可以实现你的模型?
上一问 ↑ - 21
我看你用了MHA做特征增强,这个怎么做的?
- 22
奖励函数怎么写的?
- 23
听起来奖励函数还听离散,你的具体设计师比较稀疏还是稠密的?
上一问 ↑ - 24
对于xx和xx项奖励,前者貌似更重要,你是如何去平衡不同项的权重的?
上一问 ↑ - 25
为什么某个项目没用TD3,这不是改进算法吗?
- 26
那你了解TD3相比DDPG有什么改进吗?
上一问 ↑ - 27
除了PPO、GRPO、DDPG,你还了解哪些RL算法?
- 28
讲讲你场景中的level K博弈
- 29
和你之前的模型如何串起来?
上一问 ↑ - 30
讲一下cross-att的qkv分别是?
- 31
会cpp吗?
- 32
是否有cpp经验?
- 33
a MHA
- 34
追问:用torch写下
上一问 ↑ - 35
b PPO loss
- 36
我先自我总结一下,对于今天可能有些表现不够好的地方,比如PPO loss,经典RL算法……。对于其他地方,我应该是勉强达到合格线。不知道我的描述是否准确?
- 37
期望您能简单介绍一下您所在团队的主要工作内容和组织架构。
- 38
(追问)近年兴起VLA、VLM等,是否有相关技术沉淀?
上一问 ↑ - 39
对于今天面试结果,大概几个工作日或自然日我可以得到反馈?