阿里巴巴

大模型算法工程师一面面经

完整信息

26 条问法 · 26 道题

本篇目录
#发面经攒人品#

一、Transformer核心基础

1. 自注意力机制的底层数学逻辑是什么?多头注意力机制设计的核心作用有哪些? 2. 原生自注意力架构,在多轮对话式Agent场景中存在哪些天然短板?

二、大模型训练微调

1. 简述SFT监督微调完整执行流程,配套训练数据集该如何搭建与构造? 2. SFT完成后主流的后置训练方案包含哪些,各类方案的优化目标有什么区别? 3. 完整参数微调、LoRA低秩微调、QLoRA量化低秩微调三者核心差异对比? 4. 针对逻辑推理类任务做微调,设置的低秩矩阵秩r,是否需要高于对话生成任务? 5. 线上推理环节,为消除LoRA带来的额外耗时,行业内是否会将LoRA权重与基座模型合并? 6. 模型经过垂直领域指令微调后,通用基础能力出现衰减,有哪些可行优化方案?

三、检索增强生成RAG

1. RAG技术整体定义是什么?可以从哪些维度优化最终生成文本质量?对比传统检索+生成流水线,核心优势在哪? 2. 一套完整RAG系统,该从哪些维度设计量化评估指标,衡量整体效果好坏?

四、大模型强化学习对齐

1. PPO与DPO两种人类对齐方案核心区别是什么?DPO无需在线采样的底层原理,配套训练数据采用何种格式? 2. GRPO相比传统强化学习方案做了哪些优化改进,其中KL散度损失如何计算实现? 3. 举例说明奖励劫持(reward hacking)典型场景,分析该现象产生根源,以及对应的解决手段。

五、Agent工程落地项目

1. 模块化智能Agent如何实现多步骤任务规划?工具调用的调度逻辑如何搭建?系统异常兜底容错方案怎么设计? 2. 评估一套Agent系统能力,需要覆盖哪些考核维度? 3. 用户输入模糊、需求不明确时,Agent优先反问用户确认需求,还是直接检索知识库作答? 4. 搭建Agent系统时,在不降低任务效果的前提下,如何减少整体token开销?

六、现场手撕算法代码

二选一完成编码: 1. 岛屿数量问题 2. 无重复字符最长子串问题
本篇目录
  1. 01
  2. 02
  3. 03
  4. 04
  5. 05
  6. 06
  7. 07
  8. 08
    线上推理环节,为消除LoRA带来的额外耗时,行业内是否会将LoRA权重与基座模型合并?
  9. 09
  10. 10
  11. 11
  12. 12
  13. 13
    一套完整RAG系统,该从哪些维度设计量化评估指标,衡量整体效果好坏?
  14. 14
  15. 15
  16. 16
    GRPO相比传统强化学习方案做了哪些优化改进,其中KL散度损失如何计算实现?
  17. 17
  18. 18
    举例说明奖励劫持(reward hacking)典型场景,分析该现象产生根源,以及对应的解决手段。
  19. 19
  20. 20
  21. 21
  22. 22
  23. 23
    用户输入模糊、需求不明确时,Agent优先反问用户确认需求,还是直接检索知识库作答?
  24. 24
    搭建Agent系统时,在不降低任务效果的前提下,如何减少整体token开销?
  25. 25
  26. 26

相关公司