Agent 算法工程师一面、二面面经
完整信息
本篇目录
📳对于想求职算法岗的同学,如果想参加高质量项目辅导,提升面试能力,欢迎后台联系。
本篇目录
- 01
SFT 和 RL 之间的衔接点如何判断?什么时候应该从 SFT 进入 RL?
- 02
如何判断 SFT 阶段是否训练充分,可以进入 RL?是否应该以指标最高为标准?
- 03
你设计的双维度奖励函数具体包含哪两个维度?各自解决什么问题?
- 04
一致性奖励和完整性奖励是如何定义的?评分机制是怎样的?
- 05
奖励函数是否依赖 ground truth label?如何利用大模型进行奖励打分?
- 06
奖励分数是连续值还是二值(0/1)?为什么选择二值奖励而非阶梯式奖励?
- 07
使用大模型(如Qwen-3)做奖励打分时,是否需要微调?为什么?
- 08
RAG 项目中你做了哪些微调?
- 09
为什么没有使用 RL?
上一问 ↑ - 10
Ranker 模型是如何微调的?使用了什么数据格式和模型架构?
- 11
你如何解决大模型记忆遗忘问题?
- 12
是否使用过分布式训练框架(如 DeepSpeed、DDP)?
- 13
你调用过 OpenAI 的哪些接口?主要使用的是 chat completion 还是 embedding?
- 14
你在阿里实习中使用了8B模型反超14B模型的效果,你是如何设计基于商的困难样本挖掘方法的?
- 15
为什么在电商客服场景中,小模型比大模型效果更好?
- 16
PPO中的critic模型是如何计算奖励的?它的公式是什么?
- 17
你做SFT时为什么选择全量微调而不是LoRA或QLoRA?
- 18
你提到使用双维度奖励函数,具体是哪两个维度?如何设计的?
- 19
你如何解决强化学习中的reward hacking问题?
- 20
为什么在你的场景中不适合使用DPO?
- 21
你如何构建SFT和RL阶段的训练数据?
- 22
reason是由人标注还是模型生成?
上一问 ↑ - 23
如果让你重新设计这个系统,你会如何改进SFT和RL流程?
