AI 评测工程师二面面经
完整信息
本篇目录
1.开场聊天
2.项目相关
用的什么基础模型?做过基础模型选型对比吗?
介绍一下 RAG Agent 项目
评测集的整体构建思路?题目和真值是怎么设计的?
做评测观测哪些指标?为什么选这两个?
有没有研究过行业通用/开源的评测基准?
3.其他问题
假设你入职后,我让你做"评测集生成 + 更新维护"的行业调研,你怎么开展工作?最快交付什么成果?
追问一:线上 log 是海量的,怎么转化成有限的线下评测集?直白的方法是随机抽样,但随机抽样为什么不行?
追问二:能不能不走"线上转线下评测集",直接对线上 case 做无 GT的打分和效果观测?可行吗?用什么方法推进?
