滴滴

算法工程师面经

完整信息

11 条问法 · 10 道题

本篇目录
#发面经攒人品# 1. PPO / GRPO / DPO 的区别和适用场景 2.PPO 里 value model / critic 的作用 3.GRPO 的组内优势怎么估计 4.group 里 reward 全 0 / 全 1 会有什么问题 5.样本难度分层、课程学习和有效样本选择 6.训练时 reward、KL、clip fraction 这些指标怎么看 7.trajectory-level reward 和 token-level optimization 之间的 gap 8.Token级训练里 credit assignment 不精确的问题 9.工具调用型 Agent 的基本流程怎么设计 10.Transformer、attention、softmax 相关基础问题 11. 业务场景里的 reward 应该怎么设计
本篇目录
  1. 01
  2. 02
  3. 03
  4. 04
  5. 05
  6. 06
  7. 07
  8. 08
  9. 09
  10. 10
  11. 11

相关公司