大模型算法工程师一面、二面面经
完整信息
本篇目录
一面(技术基础+项目+模型八股+手撕)
一、常规问答
1. 简单介绍个人职业发展规划
2. 面试官主动讲解团队业务方向、日常工作内容与技术落地场景
二、大模型核心八股
1. 已经构建推理类Reasoning训练数据,为什么还需要接入RL训练?仅依靠SFT能否满足业务需求?
2. SFT训练达到怎样的效果指标后,才适合接入RL优化阶段?
3. 在模型结构、训练策略层面,是否做过针对性优化改进?
4. Attention机制中为什么需要去除DK相关计算维度,核心作用是什么?
5. 详细区分Workflow和Agent的核心差异与适用场景
6. 对比Memory机制与RAG检索增强的区别、优势和落地场景差异
7. LLM输入维度为b、s的情况下,完整推理过程中Tensor维度的变化逻辑
8. 7B规模模型使用GRPO训练时的显存占用开销及优化方式
9. 简述聚类算法的核心原理、主流实现方法,同时说明K-Means算法是否存在全局最优解
三、手撕算法
基础算法题:两数之和
二面(业务场景专项面,无手撕、无常规项目提问
一、数据层相关问题
1. 实际业务中,如何量化、评估标注数据集的质量?
2. 定义标注数据的合格标准,从哪些维度判定标注有效?
3. 多类型、多场景训练数据的混合策略与配比思路
二、SFT微调专项问题
1. SFT训练过程中,如何平衡简单任务与复杂任务的训练权重?
2. 微调阶段防止模型过拟合的常用方案与实操技巧
3. LLM SFT训练常用的Loss函数及适用场景
4. 模型开启/关闭Thinking推理机制,对微调训练效果的影响
5. SFT的终止判定条件,满足哪些标准可切入RL训练?
6. 大模型训练为什么必须拆分SFT预微调+RL强化优化两个阶段,能否简化流程?
三、RL强化学习专项问题
1. 针对字段提取业务,需要设计哪些维度的Reward函数?
2. 项目中是否遇到过Reward Hacking问题,对应的识别与解决方案?
3. RL训练数据集的构建思路,能否直接复用SFT阶段的训练数据?
4. 如何解释RL训练初期Reward数值先降后升的现象?
5. RL全流程需要重点监控哪些核心训练指标,如何根据指标调优?
6. RL训练中如何兼顾难易样本,提升模型对高难度业务任务的探索能力?
本篇目录
- 01
简单介绍个人职业发展规划
- 02
已经构建推理类Reasoning训练数据,为什么还需要接入RL训练?仅依靠SFT能否满足业务需求?
- 03
SFT训练达到怎样的效果指标后,才适合接入RL优化阶段?
- 04
在模型结构、训练策略层面,是否做过针对性优化改进?
- 05
Attention机制中为什么需要去除DK相关计算维度,核心作用是什么?
- 06
详细区分Workflow和Agent的核心差异与适用场景
- 07
对比Memory机制与RAG检索增强的区别、优势和落地场景差异
- 08
LLM输入维度为b、s的情况下,完整推理过程中Tensor维度的变化逻辑
- 09
7B规模模型使用GRPO训练时的显存占用开销及优化方式
- 10
简述聚类算法的核心原理、主流实现方法,同时说明K-Means算法是否存在全局最优解
- 11
基础算法题:两数之和
- 12
实际业务中,如何量化、评估标注数据集的质量?
- 13
定义标注数据的合格标准,从哪些维度判定标注有效?
- 14
多类型、多场景训练数据的混合策略与配比思路
- 15
SFT训练过程中,如何平衡简单任务与复杂任务的训练权重?
- 16
微调阶段防止模型过拟合的常用方案与实操技巧
- 17
LLM SFT训练常用的Loss函数及适用场景
- 18
模型开启/关闭Thinking推理机制,对微调训练效果的影响
- 19
SFT的终止判定条件,满足哪些标准可切入RL训练?
- 20
大模型训练为什么必须拆分SFT预微调+RL强化优化两个阶段,能否简化流程?
- 21
针对字段提取业务,需要设计哪些维度的Reward函数?
- 22
项目中是否遇到过Reward Hacking问题,对应的识别与解决方案?
- 23
RL训练数据集的构建思路,能否直接复用SFT阶段的训练数据?
- 24
如何解释RL训练初期Reward数值先降后升的现象?
- 25
RL全流程需要重点监控哪些核心训练指标,如何根据指标调优?
- 26
RL训练中如何兼顾难易样本,提升模型对高难度业务任务的探索能力?