Agent开发面试题(附链接版
什么是 AI Agent?它与传统 LLM 应用(如 ChatBot / Chain)相比的核心区别是什么?
原题一个完整的 Agent 系统通常包含哪些核心模块(如 Planning、Memory、Tool Use 等)?
原题Agent 的整体执行流程(Agent Loop)是怎样的?
原题Agent 如何实现推理(Reasoning)、决策(Decision)和自主执行(Action)?
原题单 Agent 与 Multi-Agent 架构的区别、优缺点及适用场景是什么?
原题在复杂任务中,如何设计多 Agent 协作架构?常见协作模式有哪些?
原题Agent 中 Workflow 和 Agent 的区别是什么?分别适用于什么场景?
原题如何设计一个支持可扩展工具调用的 Agent 架构?
原题Agent 系统中状态管理如何设计?如何避免状态混乱或状态爆炸?
原题Agent 架构如何支持高并发、多租户和多用户隔离?
原题Prompt Engineering 的核心方法有哪些(如 Few-shot、CoT 等)?
原题如何设计高质量 Prompt?如何评估 Prompt 优化是否有效?
原题Prompt 模板系统如何设计与管理(版本控制、复用等)?
原题上下文工程(Context Engineering)如何设计?
原题如何构建多轮对话的上下文结构?
原题如何避免上下文过长导致模型性能下降?
原题当上下文窗口不足时,如何选择保留哪些信息?
原题如何解决“Lost in the Middle”问题?
原题如何设计结构化上下文(如 JSON / slot)以提升稳定性?
原题System Prompt 和 User Prompt 的职责边界如何划分?混用会带来什么问题?
原题如何设计多角色对话(System / User / Assistant / Tool)的消息结构?
原题如何在 Prompt 中注入结构化数据(表格、JSON、代码)而不破坏模型理解?
原题如何设计 Prompt 的版本管理和 A/B 测试体系?
原题动态 Prompt 拼接(根据运行时状态组装 Prompt)的设计模式有哪些?
原题Prompt Caching(如 Anthropic / OpenAI 提供的 Prompt Cache)的原理和使用场景是什么?
原题Agent 的记忆机制有哪些类型(短期、长期、工作记忆)?
原题短期记忆和长期记忆的设计与本质区别是什么?
原题如何实现长期记忆的存储与检索(如基于向量数据库)?
原题记忆的更新、压缩与淘汰策略如何设计?
原题长期记忆是否必须淘汰?是否可以通过检索代替删除?
原题如何将短期记忆转化为长期记忆?
原题如何避免记忆占用上下文窗口导致性能下降?
原题多用户、多 session 场景下,记忆如何隔离与绑定?
原题RAG 的核心概念及完整流程是什么?
原题RAG 系统的主要组成模块有哪些?
原题文档分块(chunking)的策略有哪些?如何选择 chunk size?
原题向量检索的原理是什么?embedding 的作用是什么?
原题为什么需要向量数据库?与传统数据库有何区别?
原题混合检索(BM25 + 向量)如何设计与融合?
原题为什么需要 rerank?常见 rerank 方法有哪些?
原题RAG 的评测指标有哪些(如准确率、召回率等)?
原题如何构建高质量 RAG 评测数据集?
原题如何优化 RAG 的召回效果与生成质量?
原题如何处理 RAG 中上下文过长或不相关信息干扰问题?
原题RAG 与直接将文档输入模型相比的优势是什么?
原题RAG 与微调(Fine-tuning)适用场景如何选择?
原题知识图谱(Knowledge Graph)与向量检索的适用场景如何区分?
原题GraphRAG 的核心思路是什么?与传统 RAG 相比解决了什么问题?
原题如何将结构化数据库(SQL)和非结构化文档结合进行混合检索?
原题Text-to-SQL 在 Agent 中如何应用?存在哪些风险和限制?
原题如何处理知识库中的冲突信息(同一问题有多个矛盾来源)?
原题什么是 Function Calling?其底层机制和执行流程是什么?
原题Agent 如何决定是否调用工具以及调用哪个工具?
原题Tool 调用的完整执行链路是怎样的?
原题Tool 的输入输出接口如何设计?如何标准化?
原题如何处理 Tool 调用失败或返回异常?
原题MCP(Model Context Protocol)是什么?解决了什么问题?
原题MCP 与 Function Calling、Skill 的区别是什么?
原题Skill 的本质是什么?它的核心价值是什么?
原题如何设计可插拔的工具系统?
原题如何限制 Agent 调用敏感工具(权限控制)?
原题Agent 的任务规划(Planning)有哪些实现方式(如 ReAct、Plan-and-Execute)?
原题如何拆分复杂任务?任务粒度如何确定?
原题多工具调用时如何决定调用顺序?
原题Agent 如何避免执行死循环(Loop)?
原题如何实现自我反思(Self-Reflection / Self-Correction)?
原题如何设计长任务(跨天执行)的 Agent?
原题如何避免多 Agent 之间无限循环或通信冗余?
原题为什么需要 Multi-Agent 系统?
原题多 Agent 之间如何通信(协议、数据结构)?
原题多 Agent 如何进行任务分发与调度?
原题多 Agent 并发执行时如何处理冲突与一致性问题?
原题主 Agent 与子 Agent 的职责如何划分?
原题子 Agent 与 Skill 的区别是什么?
原题多 Agent 系统如何做上下文隔离?
原题如何设计一个生产级 AI Agent 系统架构?
原题Agent 系统如何实现高可用、容错与降级?
原题如何设计限流(令牌桶、滑动窗口等)?
原题如何实现分布式环境下的并发控制与一致性?
原题如何设计缓存策略(Redis 等)以提升性能?
原题Agent 系统中如何做持久化(对话、状态、结果)?
原题如何设计流式输出(Streaming / SSE)机制?
原题如何处理客户端断连后的恢复?
原题Agent 系统如何做日志、监控与链路追踪?
原题Agent 系统面临哪些安全风险(Prompt Injection、越权调用等)?
原题如何防御 Prompt 注入攻击?
原题如何设计工具调用的权限控制机制?
原题如何防止数据泄露(如访问数据库)?
原题如何设计沙箱环境限制 Agent 行为?
原题LLM 的输入本质是什么?模型如何处理上下文?
原题Transformer 中 Attention 的核心原理是什么?
原题为什么 Attention 能建模长距离依赖?
原题如何优化长上下文推理性能?
原题大模型幻觉产生的原因是什么?如何降低?
原题如何提升模型生成质量?
原题如何选择不同模型(成本 vs 效果)?
原题什么情况下应该用小模型(如 GPT-4o-mini)代替大模型?如何设计路由策略?
原题如何设计模型级联(Cascade):先用弱模型快速判断,再用强模型处理复杂任务?
原题Batch API 和实时 API 的选型策略是什么?
原题如何在多个模型供应商之间做容灾切换(Fallback Provider)?
原题如何评估 Agent 系统的整体效果?
原题Agent 评测指标有哪些?如何定义“高质量回答”?
原题如何设计自动化评测(Eval)体系?
原题如何验证优化是否有效?
原题如何构建线上反馈闭环(用户反馈 → 模型优化)?
原题Agent 的训练数据如何构建?
原题Tool Calling 的训练数据应包含哪些类型?
原题LoRA 与全参数微调的区别是什么?
原题DPO / PPO / GRPO 的区别是什么?
原题如何利用真实数据进行模型优化?
原题如何避免微调导致能力退化?
原题Agent 系统延迟高的原因有哪些?如何优化?
原题RAG 系统的性能优化方法有哪些?
原题如何减少无关上下文对模型的干扰?
原题如何利用缓存与并行提升性能?
原题如何控制 token 消耗成本?
原题设计一个能自主完成代码审查的 Agent 系统,接入公司的 GitHub 仓库,PR 提交后自动触发,团队规模 50 人,日均 PR 量约 80 个。
原题Orchestrator 把任务分发给四个 Specialist 时,每个 Specialist 拿到的上下文应该是什么?
原题上线两周后,安全 Agent 的误报率高达 40%,工程师开始忽略它的输出。怎么处理?
原题CTO 要求把每个 PR 的 review 成本控制在 0.05 以内,但架构 Agent 单次调用就要 0.08。怎么办?
原题如何设计一个智能客服 Agent 系统?
原题如何设计一个代码生成 / AI Coding Agent?
原题如何设计一个运维排障 Agent(AIOps)?
原题如何设计一个推荐或电商 Agent?
原题Agent 在真实生产环境中的主要挑战是什么?
原题如何保证 Agent 输出稳定且可控?
原题当前 Agent 技术发展的主要瓶颈是什么?
原题Agent 与传统软件工程范式的关系如何变化?
原题如何让 Agent 具备持续学习与经验沉淀能力?
原题AI Coding 对软件工程的影响是什么?
原题如何判断一个 Agent 是否“真正有用”?
原题如何强制 LLM 输出结构化 JSON?常见方法(JSON Mode、Grammar Sampling、Schema 约束)的原理和区别是什么?
原题输出格式校验失败时的 Fallback 机制如何设计?
原题如何处理 LLM 输出截断(max_tokens 不足)导致 JSON 不完整的问题?
原题如何设计 Agent 输出的置信度评估机制?
原题流式输出(Streaming)场景下如何做结构化解析?
原题如何为 Agentic Loop 设计结构化 Trace(记录每步 Thought / Action / Observation)?
原题如何定位“Agent 为什么做了错误的工具选择”?调试思路是什么?
原题如何设计 Agent 的 Replay 机制(回放历史执行路径)?
原题如何在不中断生产流量的情况下对 Agent 做 Shadow Testing?
原题Agent 的 Cost Tracking(Token 消耗 + API 调用费用)如何在任务粒度上实现?
原题什么情况下 Agent 应该主动暂停并请求人工确认?判断标准如何设计?
原题Human-in-the-loop 的中断与恢复机制如何实现(状态持久化 + 任务队列)?
原题如何设计人工确认节点(Approval Gate)而不影响整体任务的异步执行?
原题人工反馈如何被 Agent 吸收并影响后续执行(短期修正 vs 长期学习)?
原题如何衡量引入 Human-in-the-loop 后对系统吞吐量和延迟的影响?
原题Agent 执行写操作时,如何保证幂等性?
原题什么是 Compensating Transaction?在 Agent 回滚场景中如何应用?
原题如何区分可重试操作和不可重试操作,并在工具设计时显式声明?
原题长链路任务的 Checkpoint 机制如何设计?故障恢复从哪个粒度重启?
原题如何防止 Agent 在重试时对外部系统造成重复副作用(如重复下单)?
原题如何处理任务失败、重试和补偿机制?
原题Agent-to-Agent 通信协议(如 Google 的 A2A Protocol)解决了什么问题?
原题MCP(Model Context Protocol)的 Server / Client 架构是什么?如何自己实现一个 MCP Server?
原题OpenAI 的 Assistants API 与自建 Agent 框架相比,适用场景如何选择?
原题Agent 的标准化接口(如统一的 Tool Schema 规范)对跨系统集成有什么价值?
原题当前主流 Agent 框架(LangGraph、AutoGen、CrewAI、Dify)的核心设计理念和适用场景分别是什么?
原题如何设计 Agent 的行为边界(Guardrail)?有哪些实现层次(规则 / 模型 / 人工)?
原题Agent 输出涉及法律、医疗、金融等高风险领域时,如何设计免责和降级机制?
原题如何记录 Agent 的决策链路以满足合规审计要求(可解释性)?
原题如何防止 Agent 被用于生成有害内容或被恶意用户滥用?
原题数据隐私保护(如用户对话数据不出境、PII 脱敏)在 Agent 系统中如何落地?
原题Braintrust / LangSmith / Weave / PromptFoo 这类 eval 平台解决了什么核心问题?选型时如何权衡?
原题如何设计 LLM-as-Judge 评测?Judge Prompt 如何防止位置偏差(position bias)和自我偏好(self-preference)?
原题Eval dataset 的构建策略有哪些?如何从生产流量中自动挖掘高价值测试用例?
原题如何为 Agent 的多步执行设计 trajectory-level eval(不只评估最终输出,而是评估整条执行路径)?
原题如何设计 regression test suite,确保每次 Prompt 修改或模型升级不引入退化?
原题Benchmark 过拟合问题(Benchmark contamination / Goodhart's Law)在 Agent eval 中如何规避?
原题
暂无题目