大模型算法工程师一面面经
完整信息
本篇目录
8月25
1.项目当中强化学习框架怎么搭建的
2.verl框架当中agent loop是怎么实现的
3.平时有用过coding agent吗?介绍一下熟悉的agent
4.介绍一下强化学习都包括哪些组件
5.详细介绍一下grpo算法
6.介绍一下on policy和off policy的区别
手撕: 股票II
本篇目录
- 01
项目当中强化学习框架怎么搭建的
- 02
verl框架当中agent loop是怎么实现的
- 03
平时有用过coding agent吗?介绍一下熟悉的agent
- 04
介绍一下强化学习都包括哪些组件
- 05
详细介绍一下grpo算法
- 06
介绍一下on policy和off policy的区别
- 07
手撕: 股票II