阿里巴巴

74 篇面经595 道面试题

已筛选

595 道题

排序:

0604
DPO 中好坏样例生成概率都下降的问题如何理解?
模型训练与对齐偏好对齐
原理机制
进阶
0605
DPOP 的全称是什么?
模型训练与对齐偏好对齐
原理机制
进阶
0606
快速排序的分区、递归过程如何实现?
算法与编程题排序、查找与 Top-K
代码题
基础
0615
什么情况下使用 PPO,什么情况下使用 GRPO?
模型训练与对齐强化学习与奖励
比较选型
进阶
0625
Transformer 的整体原理是什么?
模型基础与推理Transformer 与注意力
原理机制
进阶
0664
如何处理用户问题输入不标准的情况?
RAG 与知识系统召回策略与检索
方案设计
进阶
0672
Claude Code 属于单 Agent 还是多 Agent 架构?
Agent 原理与系统Agent 框架与 Harness
原理机制
进阶
0673
Skill 很多且描述很长时,如何避免上下文膨胀?
Agent 原理与系统Skills 能力系统
方案设计
进阶
0680
SFT 与 RL 数据如何构造,如何选择点对点或点对面方式?
模型训练与对齐训练数据构建与治理
方案设计
进阶
0692
是否独立做过模型训练或微调?
模型训练与对齐预训练、续训与 SFT
经历介绍