🧊 前沿科技知识库
全部 / 人工智能(AI)

Agent 工程实践(Agent Engineering Patterns)

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:AI·提示、Agent 与应用 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

Agent 工程(Agent Engineering)指把大语言模型(LLM)从单轮文本补全扩展为能自主规划、调用工具、维护状态并多步完成任务的系统的实践体系。2026 年的业界共识是:决定 Agent 成败的往往不是更大的模型,而是如何拆分工作、如何管理上下文与记忆、如何评估与观测(5 Key Concepts Behind Agentic AI Every Engineer Must Understand)。一个标准做法是把工作拆给多个各有聚焦上下文的 Agent,并由一个编排者(orchestrator)统一协调,而非让单个 Agent 试图把一切塞进脑海(同上)。

最新进展(2025–2026)

2025–2026 年,Agent 架构讨论从"哪种框架"转向"哪种模式适配哪类任务"。2026 年的综述把主流架构归纳为八种模式:ReAct、Plan-and-Execute、反思式(Reflective)、多 Agent、记忆增强、RAG、自主循环等,并逐一给出强项、局限与适用场景(The 8 AI Agent Architectures That Matter in 2026)。

记忆层在这一时期快速标准化。Letta(MemGPT 研究项目的生产化版本)提出三层记忆架构并推出基于 git 的 Context Repositories,用于编码 Agent 的程序化上下文管理与版本化(Letta Research);Mem0 采用带时间戳的版本化记忆与 LLM 驱动的冲突消解,报告在 LoCoMo 上较 OpenAI Memory 提升约 26%(Graph-Native Cognitive Memory for AI Agents)。

生产级 Agent 的内存设计也在工程化。2026 年有实践文章把长期记忆抽象为"五阶段流水线 + 四种设计模式",其中 Checkpoint Memory(崩溃恢复)模式在每次关键动作后写入检查点,并区分三层存储——原始事件的 operational log、当前任务的 state、经整理的长期 lessons;该模式适合批处理、CI/CD 与无人值守自动化,并需要写入密集、低延迟的存储(如 Redis AOF、DynamoDB)(Designing Persistent Memory for Production AI Agents: A Five-Stage Pipeline and Four Design Patterns)。另有 Loop Engineering 指南把 Agent 记忆分为有限短期记忆(LLM 上下文窗口)与可扩展长期记忆(向量库、知识库、传统数据库),并由 Agent Orchestrator 持久化目标、计划与进度以支持恢复(Agent Memory, State Management, and Persistent Data Storage)。

核心技术与关键概念

ReAct:以紧凑的"思考—工具—观察"循环逐步推进,下一步动作取决于上一次观察结果。适合路径未知、需要边跑边调工具(API、搜索、抓取)的任务;优点是可追溯、迭代快,但长程任务上要注意 token 漂移与成本膨胀(The 8 AI Agent Architectures That Matter in 2026;AI Agent Workflow Patterns (2026))。

Plan-and-Execute:先显式分解出计划,再由独立循环逐步执行,必要时根据环境变化修订。适合流程确定、工具调用昂贵、分支因子大的任务;计划降低冗余探索、便于监控(可对比实际执行与计划),但上游数据中途变化会让计划过期,显得脆弱(AI Agent Architecture 2026;When to Choose ReAct vs Plan-and-Execute vs Multi-Agent)。在二 Agent 形态中,这被描述为 ReAct 的经典泛化:"规划者—执行者"结构适合规划者用更强模型、执行者用更便宜模型的情形(Multi-Agent AI Systems in 2026: Frameworks, Patterns, and Production Observability)。

Reflexion / 反思式:在生成后加入自我批判与修订环节,改进后续尝试(AI Agent Workflow Patterns (2026))。

多 Agent 编排:编排者 + 专家子 Agent。适合大而可切分的目标,能力最强也最昂贵;当存在真实角色边界(不同技能、模型或权限层级)时价值最大(When to Choose ReAct vs Plan-and-Execute vs Multi-Agent)。业界常见的混合方式是"外层用计划、内层用 ReAct",以兼顾可审计性与灵活性(同上)。2026 年的生产指南把多 Agent 编排归纳为五种核心模式——orchestrator/worker(编排者/工人)、pipeline(流水线)、fan-out/fan-in(扇出/扇入)、peer debate(对等辩论)、specialist routing(专家路由)(Multi-Agent Orchestration Patterns: A Production Guide (2026))。另有资料区分 Supervisor(协调者 + 专家)与 Hierarchical Supervisor(监督者只决定下一个该由哪个工人行动、自身不执行,常见于 CrewAI 的 hierarchical 流程与 OpenAI Agents SDK 的 handoffs)以及 Maker-Checker(一方产出、另一方打分或核验)(Multi-Agent AI Systems in 2026)。工程上常建议让单个 Agent 拥有决策权与状态,工人近乎无状态、只处理单一任务,并把外部调用统一路由经过决策 Agent、按任务记录可关联的 trace(Multi-Agent Orchestration in Production: The Patterns That Survive When the Demo Ends)。

记忆与状态:Letta 的三层记忆借鉴计算机体系结构——最内层 Core Memory 常驻上下文(类比 RAM),保存用户名、偏好、当前任务状态;中层 Recall Memory 是过往对话的可检索归档;最外层 Archival Memory 是向量索引化的长期存储,通过 LLM 函数调用完成分页,让 Agent 自主决定记什么、忘什么(MemGPT to Memory Standards;AI Agent Memory Architectures)。Mem0 把记忆抽取为事实存入向量库;Zep 构建于时序知识图谱(Graphiti)之上,跟踪事实随时间的变化(Mem0 vs Letta vs Zep (2026))。工程上,长期记忆常被拆为"向量化 + 语义分块 + 事实抽取"三环节:先做语义检索,再按保留自然边界的语义分块(通常优于固定长度切分),而后把关键事实与偏好抽取为结构化形式以支持精确匹配与范围查询(Build AI agents with short-term & long-term memory in Redis)。另有资料归纳出五种通用记忆模式——Buffer Memory(全量历史)、Sliding Window(最近 N 条)、Summary Memory(压缩摘要)、Vector Memory(语义检索)、Hybrid Memory(组合方案),复杂度递增(AI Agent Memory Patterns: Building Stateful AI Applications with Long-Term Memory in 2026)。跨会话持久化还有一种低成本做法是外部文件记忆:会话开始前读取一个或多个文件注入系统提示,会话结束或学到重要信息时写回文件,即所谓的 CLAUDE.md 模式(AI Agent Memory Across Sessions (Agents 101, Part 3))。

工具设计:工具 schema、错误返回与幂等性是可靠性的关键;Anthropic 的做法是让文件系统成为上下文的一部分,大文件由模型用 grep、tail 等命令按需加载(Building agents with the Claude Agent SDK)。Anthropic 还指出最常见的失败模式之一是臃肿的工具集覆盖过多功能,导致"该用哪个工具"的决策点含糊;若人类工程师都无法确定某场景该用哪个工具,就不能指望 AI Agent 做得更好(Effective context engineering for AI agents)。一份工具定义规范建议包含清晰工具名(避免泛化命名如 process_data)、若干句说明"何时使用"而非仅"做什么"的描述、类型化输入 schema 与记录错误状态的输出 schema(Tools for AI Agents — MLflow)。面向 Agent 的工具设计原则还包括:每个工具单一自然语言意图、用枚举替代自由文本字段、尽可能给出默认值、预校验参数以强制安全执行、内置失败指引告知模型下一步、明确记录副作用,并动态加载工具以避免上下文膨胀(What Is AI Agent Tool Calling? MCP, Function Calling, and A2A Explained (2026))。Anthropic 引入 programmatic tool calling(编程式工具调用),允许在代码中编排工具调用;OpenAI 的实践指南则建议对每个工具按只读/写、可逆性、所需账户权限与财务影响等维度打风险等级(低/中/高),并配 PII 过滤器与内容审核(Programmatic tool calling;A practical guide to building agents)。

评估与可观测:Agent 可观测指把每一步(LLM 调用、工具调用、检索、控制流决策)作为结构化 trace 捕获,因为失败通常藏在中间步骤而非最终答案里(AI Agent Observability, Tracing & Evaluation with Langfuse)。Langfuse 把 tracing、监控、数据集、实验与评估连成一个闭环(Langfuse);LangSmith 则覆盖 tracing、生产评估与管理部署全生命周期,并支持 OpenTelemetry 摄入与标注队列(Annotation Queues)把专家反馈沉淀为评测数据集(LangSmith vs. Langfuse;LLM Observability Tools)。

关键数据与评测结果

失败模式与工程建议

常见失败模式包括:长程任务中上下文漂移与 token 成本失控(ReAct)、计划中途过期(Plan-and-Execute)、多 Agent 通信开销与责任边界模糊、记忆写入噪声与冲突(如"囤积者"式从不遗忘)、以及工具调用不可重试导致的非幂等副作用(Designing Persistent Memory for Production AI Agents)。工程上普遍建议"从最简单的可行方案开始",先用最小提示与最强模型测试,再针对失败模式补充指令并跟踪上下文使用与成功率等指标(A Guide for Effective Context Engineering for AI Agents)。评估上则建议不要只看单次通过率,而要用 pass^k 等一致性指标衡量可靠性(Tau-Bench)。对多 Agent 系统,还要注意流水线模式的通病:任一步骤失败会使整条流水线停止,因而重试与超时逻辑应建在流水线层而非单个节点内部(Multi-Agent AI Systems: When One Agent Isn't Enough)。

趋势与争议

一是"多 Agent"是否被过度使用:支持者认为编排者 + 子 Agent 是解决上下文过载的标准方案(5 Key Concepts),批评者则指出它在成本与可靠性上代价高昂,仅在存在真实角色边界时才划算(When to Choose ReAct vs Plan-and-Execute vs Multi-Agent)。二是记忆架构尚无标准:Mem0 的"事实 + 向量库"、Letta 的显式记忆块、Zep 的时序知识图谱路线并存,召回精度、延迟与运维成本各有取舍;外部文件记忆(CLAUDE.md 模式)则以极低复杂度作为起点(Mem0 vs Letta vs Zep (2026);AI Agent Memory Across Sessions)。三是评估可信度危机:有观点认为 2026 年出现"Agent 评测信任危机",基准被利用、单次指标失真,需要更诚实的可靠性报告方式(Exploiting AI Agent Benchmarks)。四是自改进多 Agent 的成熟度存疑:让 Agent 观察自身输出、更新自身提示并自我改进的模式在 2026 年仍属研究级,生产使用有限、规模化可靠性尚未被证明(Multi-Agent Systems 2026: Orchestration, Memory, Tooling, Reliability)。

参考来源

  1. The 8 AI Agent Architectures That Matter in 2026
  2. AI Agent Workflow Patterns (2026): ReAct to Multi-Agent
  3. AI Agent Architecture 2026: Building Production-Grade Systems
  4. When to Choose ReAct vs Plan-and-Execute vs Multi-Agent
  5. 5 Key Concepts Behind Agentic AI Every Engineer Must Understand
  6. Letta Research
  7. MemGPT to Memory Standards
  8. AI Agent Memory Architectures: From Context Windows to Persistent Knowledge
  9. Graph-Native Cognitive Memory for AI Agents
  10. Mem0 vs Letta vs Zep: Agent Memory for Production AI Agents (2026)
  11. Building agents with the Claude Agent SDK — Anthropic
  12. A Guide for Effective Context Engineering for AI Agents — MarkTechPost
  13. AI Agent Observability, Tracing & Evaluation with Langfuse
  14. Langfuse
  15. LangSmith vs. Langfuse
  16. LLM Observability Tools to Monitor & Eval Agents
  17. Towards a Science of AI Agent Reliability
  18. Exploiting AI Agent Benchmarks: The 2026 Crisis of Trust in Agent Evaluation
  19. Tau-Bench: Customer-Service Agents Under Realistic Policy
  20. τ-bench 官方网站
  21. GAIA Benchmark — AI Wiki
  22. SWE-bench vs τ-bench vs GAIA: Which Agent Benchmark Actually Predicts Production
  23. Designing Persistent Memory for Production AI Agents: A Five-Stage Pipeline and Four Design Patterns
  24. Agent Memory, State Management, and Persistent Data Storage
  25. Build AI agents with short-term & long-term memory in Redis
  26. AI Agent Memory Patterns: Building Stateful AI Applications with Long-Term Memory in 2026
  27. AI Agent Memory Across Sessions (Agents 101, Part 3)
  28. Multi-Agent Orchestration Patterns: A Production Guide (2026)
  29. Multi-Agent AI Systems in 2026: Frameworks, Patterns, and Production Observability
  30. Multi-Agent Orchestration in Production: The Patterns That Survive When the Demo Ends
  31. Multi-Agent AI Systems: When One Agent Isn't Enough
  32. Multi-Agent Systems 2026: Orchestration, Memory, Tooling, Reliability
  33. Tools for AI Agents — MLflow
  34. What Is AI Agent Tool Calling? MCP, Function Calling, and A2A Explained (2026)
  35. Programmatic tool calling
  36. A practical guide to building agents — OpenAI
  37. Agent Eval Benchmark
  38. OmnilingualGAIA2: Evaluating the Multilingual Gap in Frontier AI Agents
  39. TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents
  40. Effective context engineering for AI agents — Anthropic
← 3D 与高斯泼溅Agent 框架与工具链 →