已筛选

3697 道题

排序:

1739
强化学习项目是否与仿真环境交互,各项目是否相同?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1740
没有原有仿真环境时,是否仍能实现当前强化学习模型?
模型训练与对齐强化学习与奖励
方案设计
进阶
1741
项目如何使用 MHA 做特征增强?
模型基础与推理模型架构与表示
项目深挖
进阶
1742
项目奖励函数是稀疏还是稠密的,具体如何设计?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1743
奖励项重要程度不同时,如何平衡各项权重?
模型训练与对齐强化学习与奖励
项目深挖
进阶
1744
项目为什么没有采用 TD3?
模型训练与对齐强化学习与奖励
比较选型
进阶
1745
TD3 相比 DDPG 有哪些改进?
模型训练与对齐分布式训练与计算硬件
比较选型
进阶
1746
项目场景中的 Level-K 博弈如何实现?
模型基础与推理机器学习与推荐系统
项目深挖
进阶
1747
Level-K 博弈模块如何与之前的模型串联?
模型基础与推理模型选型与能力边界
项目深挖
进阶
1748
Cross-Attention 中 Q、K、V 分别来自哪里?
模型基础与推理Transformer 与注意力
原理机制
基础