已筛选

3697 道题

排序:

3475
RAG 项目为什么没有采用强化学习?
模型训练与对齐强化学习与奖励
比较选型
进阶
3476
Ranker 如何微调,使用什么数据格式和模型架构?
RAG 与知识系统混合检索与重排序
项目深挖
进阶
3477
如何解决大模型记忆遗忘问题?
模型训练与对齐训练框架、调参与排障
故障排查
进阶
3478
是否使用过 DeepSpeed、DDP 等分布式训练框架?
模型训练与对齐分布式训练与计算硬件
经历介绍
3479
调用过 OpenAI 哪些接口,主要用于对话还是 Embedding?
Agent 原理与系统Agent 框架与 Harness
经历介绍
3480
如何设计困难样本挖掘,使项目中的 8B 模型效果超过 14B 模型?
模型训练与对齐训练数据构建与治理
项目深挖
进阶
3481
电商客服场景中为什么小模型可能比大模型效果更好?
模型基础与推理模型选型与能力边界
比较选型
进阶
3482
PPO 的 Critic 如何计算,公式是什么?
模型训练与对齐强化学习与奖励
原理机制
进阶
3483
为什么 DPO 不适合当前项目场景?
模型训练与对齐偏好对齐
比较选型
进阶
3484
SFT 与 RL 数据中的 Reason 是人工标注还是模型生成?
模型训练与对齐训练数据构建与治理
项目深挖
进阶