已筛选

3697 道题

排序:

3536
平时多大比例的工作会使用 AI?
AI 应用工程与治理AI Coding 与研发流程
经历介绍
3537
实现 0/1 背包。
算法与编程题动态规划、贪心与回溯
代码题
进阶
3538
0/1 背包同时受重量和体积约束时如何实现?
算法与编程题动态规划、贪心与回溯
代码题
进阶
3539
0/1 背包具有 n 个约束条件时如何实现?
算法与编程题动态规划、贪心与回溯
代码题
深入
3540
PPO 训练应监测哪些指标,如何评价效果?
模型训练与对齐Verifier 与训练评测
效果评估
进阶
3541
RLHF 如何定义对话偏好和好坏标注标准,并构建偏好数据集?
模型训练与对齐偏好对齐
方案设计
进阶
3542
Reward Model 与 Critic 的网络结构如何设计?
模型训练与对齐强化学习与奖励
方案设计
进阶
3543
如何验证并调优 Reward Model 与 Critic 的有效性?
模型训练与对齐Verifier 与训练评测
效果评估
进阶
3544
如何量化评估整体对话效果?
AI 应用工程与治理评测体系与实验设计
效果评估
进阶
3545
Agent 对齐优化为什么选择强化学习,如何与 SFT、DPO、PPO、GRPO 和 RAG 比较?
模型训练与对齐强化学习与奖励
比较选型
进阶