阿里巴巴

74 篇面经595 道面试题

已筛选

595 道题

排序:

3472
为什么使用二值奖励,而不采用连续或阶梯式奖励?
模型训练与对齐强化学习与奖励
比较选型
进阶
3473
用 Qwen-3 等大模型奖励打分时是否需要微调?
模型训练与对齐强化学习与奖励
比较选型
进阶
3474
RAG 项目具体做过哪些微调?
模型训练与对齐预训练、续训与 SFT
项目深挖
进阶
3475
RAG 项目为什么没有采用强化学习?
模型训练与对齐强化学习与奖励
比较选型
进阶
3476
Ranker 如何微调,使用什么数据格式和模型架构?
RAG 与知识系统混合检索与重排序
项目深挖
进阶
3477
如何解决大模型记忆遗忘问题?
模型训练与对齐训练框架、调参与排障
故障排查
进阶
3478
是否使用过 DeepSpeed、DDP 等分布式训练框架?
模型训练与对齐分布式训练与计算硬件
经历介绍
3479
调用过 OpenAI 哪些接口,主要用于对话还是 Embedding?
Agent 原理与系统Agent 框架与 Harness
经历介绍
3480
如何设计困难样本挖掘,使项目中的 8B 模型效果超过 14B 模型?
模型训练与对齐训练数据构建与治理
项目深挖
进阶
3481
电商客服场景中为什么小模型可能比大模型效果更好?
模型基础与推理模型选型与能力边界
比较选型
进阶