已筛选

3697 道题

排序:

3370
如何避免奖励坍缩和 Reward Hacking?
模型训练与对齐强化学习与奖励
故障排查
进阶
3371
有哪些工程方法处理较长的问答?
Agent 原理与系统上下文工程
方案设计
进阶
3372
多轮对话如何微调?
模型训练与对齐预训练、续训与 SFT
原理机制
进阶
3373
Agentic RL 如何设计?
模型训练与对齐强化学习与奖励
方案设计
进阶
3374
如何评估 Agentic RL 的效果?
AI 应用工程与治理评测体系与实验设计
效果评估
进阶
3375
为什么接入质押理财模块,原先对账精度差的原因是什么?
软件工程基础系统架构与业务设计
项目深挖
进阶
3376
如何定位对账差异的来源?
软件工程基础系统架构与业务设计
故障排查
进阶
3377
如何看待实习中只做 CRUD,进阶应关注哪些方面?
项目与综合面试能力成长与学习方法
开放讨论
3378
AI 导购系统的具体流程是什么?
Agent 原理与系统Agent 应用架构与场景设计
项目深挖
进阶
3379
数据库没有检索到商品时,大模型在导购系统中起什么作用?
Agent 原理与系统Agent 应用架构与场景设计
项目深挖
进阶