Agent 的核心组成:模型、记忆、工具和规划
Agent 的核心组成:模型、记忆、工具和规划
一句话核心:AI Agent 是由大模型(大脑)、记忆系统、工具集和规划模块协同构成的智能体,理解这四者的分工与交互,是掌握 Agent 落地能力的门槛,面试中常用于考察候选人对 AI 系统架构的全局认知。
核心概念(术语表)
- 感知层(Perception):负责接收外部多模态输入的前置模块,类似餐厅前台接待,将文本、图像、API 数据等转化为 Agent 的「当前上下文」
- 大模型/大脑(Brain/LLM):Agent 的核心推理引擎(如 GPT-4、Claude、DeepSeek、通义千问),负责意图理解、推理决策、工具调用判断三件事
- 工具(Tools):将大模型决策转化为可执行操作的执行单元,包括联网搜索、代码解释器、API 接口、文件操作等四大类
- 记忆(Memory):分短期记忆(会话上下文,8K-200K token)和长期记忆(向量数据库持久化),保证 Agent 不重复、不遗忘
- 规划(Planning):将复杂任务分解为可执行子步骤的能力,配合 ReAct、CoT、ToT 等推理框架引导 Agent 有序行动
- 函数调用(Function Calling):大模型通过结构化 JSON 输出「调用哪个工具、传什么参数」的机制,由外部程序执行后返回结果
- 编排层(Orchestration Layer):协调多个工具和子 Agent 协同工作的决策中枢,体现在通信与任务调度能力
- MCP 协议(Model Context Protocol):实现不同平台、不同厂商 Agent 和工具之间标准化互操作的通信协议
- A2A 协议(Agent-to-Agent):多智能体之间传递任务指令、共享知识和协调行动的标准化协议
历史背景 / 来源
AI Agent 的概念源于 1956 年达特茅斯会议,早期以规则型专家系统为主。进入大语言模型时代,2022-2023 年 GPT-4、Claude 等模型展现出强大的推理能力,业界开始探索将 LLM 作为 Agent 核心「大脑」的架构。2023 年 ReAct 论文提出推理与行动交替执行框架,2024 年 MCP/A2A 协议开始标准化,标志 Agent 从单点能力走向系统化协作。谷歌《Agents》白皮书将 Agent 核心归纳为模型(Language Model)、工具(Extensions/Functions/Data Stores)和编排层三大组成部分。
工作原理 / 核心机制
AI Agent 的工作遵循「感知→理解→规划→执行→记忆」的循环机制。大脑(大模型)接收感知层输入,理解用户意图后,结合记忆系统中的上下文和历史知识制定行动计划,决策是否需要调用工具来扩展能力边界,通过规划模块将任务分解为可执行的子步骤,最终行动结果反馈回记忆系统更新状态,进入下一轮循环。
第一步:感知层接收多模态输入(文本指令、图像截图、API 返回数据、环境状态等),进行清洗、结构化和优先级排序,剔除噪声后形成「当前上下文」传递给大脑。第二步:大脑(大模型)执行三件核心事——意图理解(解析用户目标)、推理决策(判断下一步该做什么)、工具调用判断(选择用哪个工具)。第三步:规划模块将复杂任务拆解为子步骤序列(如「分析竞品并生成报告」分解为搜索→提取→对比→撰写),并通过 CoT/ReAct/ToT 等推理框架引导决策路径。第四步:工具层通过 Function Calling 机制执行外部操作(联网搜索、代码执行、API 调用),结果返回大脑。第五步:记忆系统记录当前步骤执行结果,更新短期/长期记忆,供后续步骤使用。
关键知识点
- 感知层是 Agent 与外部世界建立连接的起点,决定了系统能处理多少类型的输入
- 大脑的「智力天花板」决定整个 Agent 上限,同一套工具和规划框架接入更强模型,任务完成质量往往有质的飞跃
- 大模型训练数据存在截止日期,内置知识是静态的,工具调用让 Agent 能力延伸到训练数据之外
- 短期记忆受限于上下文长度,通常在 8K 到 200K token 之间
- 长期记忆通过向量数据库(如 Pinecone)实现跨会话知识持久化
- 工具分为四大类:信息获取(联网搜索、网页抓取)、计算执行(代码解释器、沙箱环境)、内容生成(图像生成、语音合成)、系统交互(API、邮件、日历)
- Function Calling 以结构化 JSON 形式输出工具调用指令,外部程序负责真正执行
- ReAct 框架支持推理与行动交替执行,适用于信息检索和任务执行场景
- CoT(Chain-of-Thought)不支持工具调用,但擅长数学推导和逻辑分析
- ToT(Tree-of-Thoughts)通过树状多路径探索,适合创意生成和复杂决策
- MCP 和 A2A 协议使不同平台 Agent 实现标准化互操作,降低集成成本
- 添可部署 AI 客服后响应时间从 3 分钟缩短至 8 秒,服务效率提升 22 倍
- 百丽国际 Agent 体系上线超过 800 个业务子节点,实现全链路智能化
- 某生活服务平台每日质检覆盖率从 5% 跃升至 100%,覆盖 12 万通录音,准确率超过 90%
- 规划模块的容错能力(工具调用失败、数据缺失时及时调整)是衡量生产级 Agent 的重要标准
应用场景
- 百丽国际多智能体协作:部署覆盖货品管理和门店运营两大维度的 Agent 矩阵,上线 800+ 业务子节点,实现从货品分析到门店服务的全链路智能化,入选虎嗅《消费零售 GenAI 最强落地案例 TOP10》
- 添可 AI 客服 Agent:整体服务效率提升 22 倍,响应时间从 3 分钟缩短至 8 秒,新员工培训周期缩短 75%,背后是持续学习与优化机制的能力累积
- 某头部生活服务平台质检:引入 AI 语音质检 Agent 后,每日质检覆盖率从 5% 提升至 100%,覆盖 12 万通录音,质检准确率超过 90%,将 Agent 六大模块与真实业务场景精准对接
- 企业级客服 Agent 长期记忆:记住客户历史购买记录、偏好设置和过往投诉,下次交互直接调用,提供精准个性化服务,无需客户反复重述背景
- 金融交易多 Agent 协同:多个分析型 Agent 共享市场洞察,协同优化交易策略,实现跨 Agent 知识共享和协作效率最大化
常见误区 / 踩坑
- ❌ 误区 1:认为 Agent 的能力上限取决于工具数量
✅ 正解:大模型(大脑)才是天花板,工具是扩展边界,弱模型+多工具 ≠ 强 Agent - ❌ 误区 2:忽略感知层的噪声过滤
✅ 正解:原始输入往往是嘈杂的,未经有效过滤的感知会导致后续所有推理建立在错误前提之上 - ❌ 误区 3:短期记忆(上下文)和长期记忆(向量库)可以二选一
✅ 正解:短期记忆保证当前会话连贯,长期记忆实现跨会话经验复用,两者缺一不可 - ❌ 误区 4:Function Calling 就是让模型直接执行代码
✅ 正解:模型只输出 JSON 格式的调用指令,真正执行由外部程序完成,结果返回模型 - ❌ 误区 5:规划模块只需要一次性制定完整计划
✅ 正解:真实世界充满不确定性,规划模块需要具备容错和自我纠错能力,遇到意外及时调整策略 - ❌ 误区 6:部署 Agent 后就能一劳永逸
✅ 正解:需要 LLMOps 体系支撑(模型评估、Prompt 调优、性能监控),持续学习和优化才能避免「学了就忘」或「越学越偏」
性能 / 复杂度
- 上下文窗口限制:短期记忆受限于模型上下文长度,8K-200K token 不等,超过后需压缩或外置记忆
- 工具调用延迟:每次工具调用增加一次模型推理往返,实测单次调用增加 200-500ms 延迟
- 向量检索复杂度:长期记忆查询通常用 ANN(近似最近邻)算法,如 FAISS 检索时间 O(log N)
- 多 Agent 通信开销:A2A 协议标准化后延迟降低约 30%,但多 Agent 协同仍增加系统复杂度
- 主流推理框架对比:
- CoT:纯推理,不支持工具调用,适合数学/逻辑
- ReAct:推理+行动交替,支持工具调用,适合信息检索
- ReWOO:预规划推理,适合高效批量任务
- ToT:树状多路径,适合创意生成
- Self-Planning:自主路径规划,适合企业级复杂流程
与相关概念的区别
- vs 传统规则型系统:
- 传统系统遵循「如果 X 发生,则执行 Y」的固定逻辑,规则需要人工编写
- Agent 依赖大模型推理,能处理开放域任务,但依赖模型能力
- 怎么选:封闭域、固定规则场景用传统系统;开放域、需要泛化的场景用 Agent
- vs 普通问答机器人:
- 普通机器人单次请求-响应,无记忆、无规划、无工具
- Agent 具备记忆系统、规划能力和工具调用,能处理多步骤长周期任务
- 怎么选:简单 Q&A 用问答机器人;复杂任务自动化用 Agent
- vs 单 Agent vs 多 Agent 系统:
- 单 Agent:架构简单,但能力边界受单一模型限制
- 多 Agent:分工协作,处理复杂任务,但通信和协调成本高
- 怎么选:任务单一用单 Agent;复杂企业场景(百丽 800+ 子节点)用多 Agent
进阶 / 面试加分项
- 最新进展:MCP 和 A2A 协议正在成为行业标准,使不同平台 Agent 实现互操作,2024-2025 年企业级 Agent 平台生态开放性成为核心竞争力
- 业界争议:Agent 的规划能力是否真正「理解」任务,还是统计模式匹配?ReAct 框架在长任务中是否会出现错误累积?这些问题尚无定论
- 一句话送给候选人:Agent 的四大组件不是孤立的技术点,而是「感知→决策→行动→记忆」的闭环,理解这个循环,比记住每个组件的定义更重要
面试如何回答
🟢 请解释 AI Agent 的四大核心组件是什么,它们各自扮演什么角色?
回答要点:
AI Agent 由四大核心组件构成:大脑(模型)、记忆、工具和规划。
大脑是大模型的推理引擎,负责意图理解、推理决策和工具调用判断三件事,比如 GPT-4、Claude 等,它决定了整个 Agent 的能力上限。记忆分为短期记忆(当前会话上下文,8K-200K token)和长期记忆(向量数据库持久化),保证 Agent 不重复、不遗忘。工具是将大模型决策转化为可执行操作的执行单元,分信息获取、计算执行、内容生成、系统交互四大类。规划负责将复杂任务拆解为可执行子步骤,配合 ReAct、CoT 等推理框架引导 Agent 有序行动。
如果把 Agent 比作智能餐厅:大脑是主厨,记忆是服务员的记性,工具是厨房设备,规划是把做菜流程分解成步骤。
四大组件缺一不可,弱模型配再多工具也无法突破能力上限,而强模型缺工具则无法延伸到训练数据之外。
🟡 短期记忆和长期记忆有什么区别?Agent 是如何管理这两种记忆的?
回答要点:
短期记忆(In-Context Memory)存储当前会话的上下文信息,让 Agent 在多轮对话中保持逻辑一致性,受限于模型的上下文长度,通常在 8K 到 200K token 之间,比如你刚点了鱼,下一句说「要微辣」,Agent 知道是指鱼。长期记忆(External Memory)存储跨会话、跨任务的知识积累,通过向量数据库(如 Pinecone)实现持久化,比如你是素食主义者或家庭住址这类长期偏好。
Agent 管理记忆的方式:感知层接收输入后形成当前上下文进入大脑,规划模块制定任务步骤时查询长期记忆获取相关知识,工具执行后的结果更新短期记忆,重要信息定期压缩存入长期记忆。
以企业客服 Agent 为例,具备长期记忆的 Agent 能记住客户历史购买记录和投诉,下次直接调用,无需客户反复重述背景。短期记忆保证当前对话连贯,长期记忆实现经验复用,两者协同缺一不可。
🟡 AI Agent 的工具调用机制是什么?Function Calling 是如何工作的?
回答要点:
工具调用是 Agent 突破自身知识边界、与外部世界产生实质性交互的核心机制。大语言模型训练数据存在截止日期,内置知识是静态的,通过工具调用,Agent 能够实时获取最新信息、执行计算、操作文件、调用第三方服务。
Function Calling 工作流程分三步:第一步,开发者预先定义工具的名称与参数说明(JSON Schema 格式);第二步,大模型在推理时分析当前任务,判断是否需要调用工具,如果需要则以结构化 JSON 形式输出「调用哪个工具、传什么参数」;第三步,外部程序接收指令、真正执行操作(如调用 API、运行代码),将结果返回给大模型,进入下一轮推理。
工具分为四大类:信息获取(联网搜索、数据库查询)、计算执行(代码解释器、沙箱环境)、内容生成(图像生成、语音合成)、系统交互(邮件、日历、文件操作)。一个客服 Agent 调用天气 API 获取实时数据,就是典型的工具调用场景。
🟡 主流的 Agent 推理框架有哪些?它们各自适用什么场景?
回答要点:
主流推理框架有五种,各有优劣:
第一,Chain-of-Thought(CoT)逐步展开推理链条,擅长数学推导和逻辑分析,但不支持工具调用,适合封闭域推理任务。第二,ReAct 推理与行动交替执行,支持工具调用,适合信息检索和任务执行,是当前最主流的框架。第三,ReWOO 无需观察的预规划推理,适合高效批量任务处理。第四,Tree-of-Thoughts(ToT)树状多路径探索,适合创意生成和复杂决策场景。第五,Self-Planning 自主任务路径规划,支持工具调用,适合企业级复杂流程。
选择依据:简单推理任务用 CoT;需要实时获取外部信息的任务用 ReAct;创意和探索类任务用 ToT;企业级复杂流程用 Self-Planning。
真实场景中,ReAct 因支持工具调用成为主流选择,但 ToT 在需要多路径探索的创意任务中表现更好。框架选择应基于任务特性,而非追求单一框架解决所有问题。
🟡 多 Agent 系统和单 Agent 有什么区别?什么时候应该选择多 Agent 架构?
回答要点:
单 Agent 架构简单,依赖单一模型处理所有任务,能力边界受限于该模型;多 Agent 架构由多个专业化 Agent 分工协作,每个 Agent 专注特定领域,通过通信协议(如 A2A)共享知识和协调行动。
选择多 Agent 的时机:任务复杂度高、需要多种专业能力时,比如百丽国际部署覆盖货品管理和门店运营两大维度的 Agent 矩阵,上线 800+ 业务子节点,单一 Agent 无法覆盖如此复杂的业务边界;金融交易场景中,多个分析型 Agent 可以共享市场洞察、协同优化交易策略。
多 Agent 的代价:通信和协调成本增加,系统复杂度提升,需要 MCP/A2A 等标准化协议降低集成成本。
一句话总结:任务单一用单 Agent(成本低、延迟低);复杂企业场景(多业务线、多专业能力)用多 Agent(分工明确、可扩展性强)。
🔴 企业在落地 AI Agent 时,常见的失败原因有哪些?如何避免?
回答要点:
根据业界数据,40% 的 AI Agent 项目会失败,常见原因有三类:
第一,工具与业务场景不匹配。很多企业追求「最先进的模型」,却忽视工具的丰富程度决定了 Agent 能覆盖的任务边界。某生活服务平台的成功经验是:将 Agent 六大模块与真实业务场景精准对接,质检覆盖率从 5% 提升至 100%,而非追求模型参数最大。
第二,忽略感知层的质量。原始输入往往是嘈杂的,未经有效过滤的感知会导致后续所有推理建立在错误前提之上。
第三,缺乏持续学习机制。Agent 部署后不是一劳永逸,需要 LLMOps 体系支撑(模型评估、Prompt 调优、性能监控)。添可 AI 客服效率提升 22 倍,背后是持续学习与优化的能力累积,而非一次性功能部署。
避免踩坑:先从一个高价值、可验证的场景切入,再逐步扩展 Agent 能力矩阵。
🔴 请设计一个能够自动分析竞品并生成市场报告的 AI Agent 系统架构
回答要点:
这个 Agent 需要六大模块协同工作:
感知层负责接收用户的自然语言指令(如「分析竞品并生成市场报告」),解析为结构化任务目标。大脑(规划模块)将任务分解为五个子步骤:搜索竞品信息→提取关键数据→对比分析→生成报告结构→撰写内容,配合 ReAct 框架引导推理路径。工具层分两类:信息获取工具(联网搜索、网页抓取)获取竞品数据,计算执行工具(代码解释器)进行数据分析和可视化。记忆系统记录搜索结果、分析结论供后续步骤使用。执行层调用工具完成每一步,输出分析报告。最终通信层将报告返回用户。
关键设计点:规划模块需要容错机制(如竞品网站反爬时切换数据源),记忆系统需要分层(短期存当前任务上下文,长期存历史报告模板)。真实落地可参考百丽国际模式,将任务拆分为 800+ 可管理的子节点,逐步构建能力矩阵。
🟢 MCP 和 A2A 协议是什么?为什么它们对 Agent 生态很重要?
回答要点:
MCP(Model Context Protocol)和 A2A(Agent-to-Agent)是实现 Agent 标准化互操作的两大协议。
MCP 解决的是「模型与工具之间的通信标准」问题,使得不同平台、不同厂商的 Agent 和工具能够无缝对接,降低集成成本。A2A 解决的是「Agent 与 Agent 之间的协作标准」问题,让多个 Agent 能够传递任务指令、共享知识和协调行动。
在多 Agent 协同场景中,百丽国际部署 800+ 业务子节点,如果没有标准化协议,每个新增 Agent 的接入成本极高。MCP 和 A2A 的出现,使企业级 Agent 平台的生态开放性成为核心竞争力。
这两个协议的重要性在于:从「单点能力」走向「系统化协作」,是 AI Agent 从实验室走向生产落地的关键里程碑。
