算法工程师面经
完整信息
本篇目录
#发面经攒人品# 1. PPO / GRPO / DPO 的区别和适用场景
2.PPO 里 value model / critic 的作用
3.GRPO 的组内优势怎么估计
4.group 里 reward 全 0 / 全 1 会有什么问题
5.样本难度分层、课程学习和有效样本选择
6.训练时 reward、KL、clip fraction 这些指标怎么看
7.trajectory-level reward 和 token-level optimization 之间的 gap
8.Token级训练里 credit assignment 不精确的问题
9.工具调用型 Agent 的基本流程怎么设计
10.Transformer、attention、softmax 相关基础问题
11. 业务场景里的 reward 应该怎么设计
本篇目录
- 01
#发面经攒人品# 1. PPO / GRPO / DPO 的区别和适用场景
- 02
PPO 里 value model / critic 的作用
- 03
GRPO 的组内优势怎么估计
- 04
group 里 reward 全 0 / 全 1 会有什么问题
- 05
样本难度分层、课程学习和有效样本选择
- 06
训练时 reward、KL、clip fraction 这些指标怎么看
- 07
trajectory-level reward 和 token-level optimization 之间的 gap
- 08
Token级训练里 credit assignment 不精确的问题
- 09
工具调用型 Agent 的基本流程怎么设计
- 10
Transformer、attention、softmax 相关基础问题
- 11
业务场景里的 reward 应该怎么设计