ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

【必看收藏】大模型Agent架构设计全指南:从单智能体到多智能体系统的实践与优化

【必看收藏】大模型Agent架构设计全指南:从单智能体到多智能体系统的实践与优化 一、单Agent一个合格的Agent需要三大核心能力作为其大脑中枢:Planning(规划):如同一位棋手能将复杂局面分解为一系列精妙的子步骤Tool use(工具使用):宛如工匠懂得从工具箱中选取最合适的工具并熟练使用Memory(记忆):既有短期记忆存储即时信息又有长期记忆沉淀持久知识整个应用由模型作为大脑来驱动和决策任何问题我们预期模型都能够正确的推理、选择合适的工具、检索到正确的上下文最终生成符合预期的答案。然而这非常依赖底层模型能力在当前的实践中模型能力是受限的(不够聪明、上下文窗口等)单智能体模式面临很多的挑战。为此业内才设计出其它模式在工程上做更多事情来弥补模型能力的不足。以下是单智能体架构下的一些典型问题:如果一个 Agent包含有太多的可用 Tools模型会在决策工具选择时无所适从效果变差。多轮执行下来消息上下文会变得很大消耗大量的Token且影响模型当前专注度。很多复杂的任务需要很多个步骤通常在某些环节还需要专业领域技能支持比如科学计算深入研究、写代码、绘画、任务规划等。单 Agent在复杂任务场景下的可维护性会变差。1.反思Reflection(1)基础介绍在行动后或思考过程中Agent主动评估自身输出或行为的效果、质量、逻辑性与一致性发现问题并据此调整后续行动或优化内部状态。这样处理能起到以下关键作用纠错与改进检查代码错误、逻辑漏洞、事实性错误幻觉、答案的完整性。例如生成代码后运行测试发现报错则分析原因并修正。优化输出对生成的文本进行润色、精炼、调整风格或结构以满足更高要求如让摘要更简洁让故事更生动。知识验证与推理校准 检查推理链条是否合理结论是否有证据支持减少“一本正经胡说八道”。策略调整评估当前行动策略是否有效是否需要改变方法。例如多次尝试调用某个API失败后反思是否参数有误或应换用其他工具。(2)典型技术/方法ReAct: 在行动链中显式加入推理步骤。Chain of Verification (CoVe): 生成问题来验证自己答案的潜在缺陷。Self-Critique 或 Self-Refine 机制让模型扮演“审查者”角色批判自己的输出。引入外部验证器使用代码解释器、搜索引擎结果、知识图谱等验证输出。(3)ReAct先推理再行动。思考Thought面对一个问题我们需要进行深入的思考。这个思考过程是关于如何定义问题、确定解决问题所需的关键信息和推理步骤。行动Action确定了思考的方向后接下来就是行动的时刻。根据我们的思考采取相应的措施或执行特定的任务以期望推动问题向解决的方向发展。观察Observation行动之后我们必须仔细观察结果。这一步是检验我们的行动是否有效是否接近了问题的答案。循环迭代ReAct方式的作用就是协调LLM模型和外部的信息获取与其他功能交互。如果说LLM模型是大脑那ReAct框架就是这个大脑的手脚和五官。同时具备帮助LLM模型获取信息、输出内容与执行决策的能力。对于一个指定的任务目标ReAct框架会自动补齐LLM应该具备的知识和相关信息然后再让LLM模型做出决策并执行LLM的决策。①优点ReAct将推理过程显性地记录下来提升了模型的可信度和人类可解释性。相比直接给出答案ReAct 通过逐步推理可以降低幻觉率。由于每一步只需考虑当前子问题响应速度较快成本也较低。②缺点LLM大模型的通病即产出内容不稳定不仅仅是输出内容存在波动也体现在对复杂问题的分析解决上存在一定的波动成本采用ReAct方式我们是无法控制输入内容的。因为在任务提交给LLM后LLM对任务的拆解、循环次数是不可控的。因此存在一种可能性过于复杂的任务导致Token过量消耗。响应时间比起大部分API接口毫秒级的响应LLM响应时间是秒级以上。在ReAct模式下这个时间变得更加不可控。因为无法确定需要拆分多少步骤需要访问多少次LLM模型。因此在在秒级接口响应的背景下做成同步接口显然是不合适的需要采用异步的方式。而异步方式又会影响用户体验对应用场景的选择又造成了限制。③适用场景ReAct 模式适用于相对中等复杂度的任务尤其当任务步骤需根据中间结果动态调整时如某个任务需要根据查询资料来决定给后续如果任务流程无法提前确定或需要频繁工具调用ReAct 能提供较好的灵活性和实时反应能力。2.工具使用模式Tool Use工具使用让Agent突破大模型固有的限制如时效性、计算能力、特定领域知识能调用外部资源和能力。 Agent识别任务需求判断需要何种外部工具正确调用工具提供符合要求的输入并理解、整合工具的返回结果。(1)关键作用扩展能力边界 获取实时信息搜索引擎API、执行精确计算计算器、操作软件/系统如发送邮件、操作数据库、访问专业领域知识法律/医疗数据库。克服模型弱点 解决知识过时、数学计算易错、无法直接操作外部系统等问题。自动化工作流 串联多个工具完成复杂任务如查天气 - 推荐行程 - 预订酒店。(2)典型技术/方法函数调用 (Function Calling)大模型核心支持能力模型识别需要调用哪个预设函数并生成符合要求的参数。API 调用连接各种网络服务如 Google Search, Wolfram Alpha, Zapier。代码解释器 (Code Interpreter) 执行生成的代码通常是Python进行数据处理、可视化、复杂计算等。插件 (Plugins) 为特定平台如 ChatGPT扩展的工具集。3.Plan-and-Execute先规划后调整在行动之前先生成一个较完整的计划将任务拆解成子任务清单然后逐一执行。规划阶段Planning分析任务目标将其拆分为更小的步骤形成一个有序的执行计划。规划可以通过LLM根据任务要求输出一个步骤列表也可以结合工具或模板约束来确保计划的结构更完整。执行阶段Execution按照计划顺序逐个执行各个步骤并处理每步的结果。在执行过程中智能体可以根据实际执行情况动态调整计划比如某一步如果结果不如预期则可以修改后续步骤或重新规划。(1)优点流程更可控可以审查或调整生成的计划对执行结果有一定把控的效果。可以实现可视化的任务执行过程 有助于提升用户体验。(2)缺点开销更大需要先额外一次或多次LLM调用来规划再逐步执行速度慢token消耗也更高 。对初始计划的正确性要求很高如果初始计划不佳执行阶段可能走弯路甚至失败。虽然可以动态调整但调整本身又需要额外逻辑和模型交互。(3)适用场景适合较复杂的多步骤任务尤其是可以在一定程度上预见步骤的场景 。例如数据分析任务可以先规划“获取数据-清洗-分析-可视化”的步骤。当正确性比速度更重要时Plan-and-Execute 是值得选择的策略 。(4)典型技术/方法思维链 (Chain of Thought - CoT)显式展示推理步骤的基础。任务分解与调度算法 如基于LLM生成任务列表可能结合传统规划算法或启发式规则进行排序。旅行规划器模式 处理具有强时空顺序的任务。基于状态的规划 根据环境状态变化决定下一步行动。思维树 (Tree of Thoughts - ToT)模拟多路径探索评估不同思考路径的前景。像树一样展开再通过评估机制选出最佳分支。比如解一道数独时Agent会尝试多个候选解法(分支A、B、C)逐步排除错误分支最终选出唯一解。适合复杂规划和解谜任务。4.Agent常见的优化方法工具标注增强为每个工具补充足够的结构化元数据比如功能、输入/输出模式、耗时、幂等性、前置条件等丰富LLM决策依据。加入自我反思在规划执行的过程中注入反思环节。比如在计划生成后立即审视并改进且在任务完成后总结本次的成功或失败经验存到案例库。“案例增强”的规划基于案例库的“历史最优调用轨迹”LLM 先检索相似任务的成功案例用来帮助规划当前任务步骤。“检索增强”的工具选择构建工具池的向量库描述、调用示例、输入输出、业务标签等在决策之前借助检索增强来缩小候选工具集。微调Planner模型记录实际调用‑执行‑结果链打标签“成功/失败”用 RL 奖励或对比学习微调专门的Planner模型。思维链或深度思考利用CoT让 LLM 显式输出逐步推理强制模型按顺序拆解步骤或使用深度思考模型提升决策合理性。二、工作流工作流是一种编排模式需要开发者将一个复杂任务拆解为一系列有序步骤这些步骤之间的调用关系和条件分支在设计阶段就明确好。一个复杂的问题大模型可能不能很好的解决那么我们可以把复杂问题拆解成多个小问题不同小问题交给不同agent或者是工具来执行。当任务可以轻松且清晰地分解成固定的子任务时这个工作流是最理想的。1.静态顺序Workflow人做整体规划的决策LLM是链路的一个节点LLM和各类工具通过预定义的代码路径进行编排提供可预测性和一致性适用于明确定义的任务该种方式几乎不让智能体自主决定流程而是由开发者根据对任务的理解将任务拆分成固定流程的子任务并把这些子任务串起来执行。某些子任务可能由LLM完成例如生成一段文字但LLM在此不决定下一步做什么 — 下一步已经在程序固化。也就是说智能体遵循一个事先画好的脚本/流程图来执行没有决策自由度(1)优点静态工作流最大的优点是确定性和可控性。所有步骤由开发者掌控因而系统行为可预测、易测试避免了让LLM自己规划可能带来的不确定性。从工程角度看这种方式更像传统软件开发调试和监控相对简单。静态流程通常执行速度更快、成本更低因为不需要额外的决策推理步骤。每个LLM调用都有明确目的减少了无效对话。(2)缺点最大缺点是缺乏灵活性智能化不足。一旦预设流程无法完全匹配实际任务需求Agent 就会表现不佳甚至失败。不具有通用智能只能覆盖开发者想到的那些路径。特别对于未知领域或复杂任务开发者往往难以提前设计出完善的流程图。如果业务流程发生变化通常需要进行应用的调整或升级成本较高不如让智能体自主学习来得方便。(3)适用场景静态工作流适合规则明确、变化少的重复性任务。比如企业中的固定功能、固定报表生成等。特别在企业场景下如果业务流程高度重复且标准化静态工作流能提供稳健的自动化方案 不必担心AI“越俎代庖”引入不确定性和风险。2.静态Workflow局部智能在整体上采用固定流程但在特定步骤上授予智能体一定的自主规划或推理权限。(1)优点这种模式最大优点是兼顾可控性与灵活性。与全自主Agent相比整体行为更可控因为智能部分被限制在局部范围内不会干涉整个流程结构。相比纯静态流程又具备了一定灵活应变能力——至少在那些标记出的复杂环节上智能体可以随机应变。可以逐步引入智能节点从全静态开始逐步引入智能环节。(2)缺点增加系统复杂度依赖开发者对任务的理解和持续调整。局部智能体的表现仍然可能不稳定。(3)适用场景适用于流程较固定但存在关键智能决策点的任务场景。又或者一些长流程的子任务本身是复杂AI问题如代码生成、数据分析就特别适合拆出来让智能体发挥。实际项目中可以采用“静态框架 智能插件”的思路框架提供流程壳子插件Agent完成具体智能任务。3.Routing-路由工作流路由工作流通过对输入进行分类将它们分派到专门设计的下游任务或处理路径(通常也叫做意图识别)以实现关注点分离与更精准的响应。例如在客服系统中可以将用户咨询、退款请求、用户投诉等不同类型的用户问题路由到不同的处理流程与工具或者在成本和速度优化中根据问题复杂度将简单请求分发给小模型而复杂或罕见问题则交给更强大的模型处理。4.并行Workflow分割将任务分解成可以并行运行的独立子任务。实施防护措施其中一个模型实例处理用户查询而另一个筛选它们以防止不当内容或请求。这通常比让同一个LLM调用同时处理防护措施和核心响应表现得更好。自动化评估用于评估LLM性能每个LLM调用评估模型在给定提示上的不同方面的性能。投票多次运行相同的任务以获得多样化的输出。审查代码中的漏洞多个不同的提示审查并标记代码如果它们发现问题。评估给定内容是否不适当多个提示评估不同的方面或需要不同的投票阈值来平衡误报和漏报。三、多智能体(也可以放到工作流之中)随着任务复杂度增加单一智能体需要理解的语境和工具使用面临上下文窗口限制导致性能下降。多智能体协作通过动态任务分解、专业化分工和协同工作克服这一挑战。在处理复杂任务时系统会将任务分解为多个子任务。每个子任务由专门的智能体处理这些智能体在特定领域具有专长。智能体之间通过持续的信息交换和任务协调来实现整体目标这种协作方法可能产生智能涌现即系统整体表现超越单个智能体能力之和。在当前的现实中在开发一个单智能体系统时会遇到的问题智能体可用的工具过多在决定下一步调用哪个工具时效果不佳上下文过多对于单个智能体来说过于复杂难以跟踪系统中需要多个专业领域(如规划器、研究员、数学专家等)…为了解决上述的问题可以考虑将应用拆分为多个更小的独立智能体并将它们组合成一个多智能体系统期望达到的效果模块化独立的智能体使开发、测试和维护变得更容易专业化可以创建专注于特定领域的专家智能体这有助于提高整个系统的性能。控制可以明确控制智能体之间的通信方式(而不是依赖于函数调用)。1.多智能体使用方式(1)架构①Network(协作模式)每个Agent都可与其他Agent通信。任何Agent都可以决定接下来调用哪个其他Agent。较为常见的使用方式为评估器-优化器模式LLM一个调用会产生响应而另一个调用则会循环提供评估和反馈。当我们有明确的评估标准并且迭代改进提供可衡量的价值时此工作流程特别有效。良好契合的两个标志是首先LLM当人类表达他们的反馈时反应可以得到明显改善其次LLM可以提供这样的反馈。这类似于人类作家在撰写一篇精美的文档时可能经历的迭代写作过程。②Supervisor(指挥官模式)-常用每个Agent与一个监督者Agent通信。监督者Agent决定接下来应该调用哪个Agent。分层规划包含至少两个层级高层Agent规划者/经理面向最终目标制定子任务或子目标清单分配给低层Agent。高层Agent关注全局进展可能不直接与环境交互而是通过检查下级完成情况来决定接下来做什么。低层Agent执行者/员工接受高层指派的具体子任务在其自己能力范围内完成。低层Agent可能本身用ReAct或其他模式来解决子任务然后将结果汇报给高层。这种架构下高层和低层可以都是LLM实例扮演不同角色进行多轮协作高层发号施令低层报告结果循环往复直到任务完成。充分利用了职责分离的思想每个Agent专注于其擅长的层面提高效率和效果。高层Agent擅长宏观计划确保不偏离大方向低层Agent专注微观执行可以投入更多细节推理团队协作胜过一人包办。多子任务并行处理提高速度比如高层把任务分给两个低层Agent同时做不同部分。某个子任务失败可以局部重新规划与执行提高健壮性。(2)协调者/控制器Orchestrator/Controller这是整个系统的大脑负责任务调度和Agent协同。它的主要职责包括任务分解接收用户初始请求并将其分解为一系列子任务。工作流管理决定任务执行的顺序和逻辑顺序、并行、条件分支。Agent调度根据子任务的要求选择最合适的Agent来执行。状态管理跟踪每个子任务的完成状态和整个项目的进度。(3)通信机制消息传递如基于聊天黑板模型所有Agent都可以读写一个共享的存储区域如数据库、内存数据结构。Agent将结果写入共享区其他Agent从中读取所需信息。这种方式更适用于数据流密集的应用。发布/订阅等Agent之间通过发送和接收结构化的消息如JSON格式进行交互(4)协作协议辩论机制投票机制竞标机制领导协调机制2.适用场景当任务规模庞大或专业模块众多时分层/多Agent是很自然的选择。例如一项软件工程任务从需求分析、设计、编码、测试到文档每一步都可由不同Agent完成由总负责人Agent协调。再如学术研究Agent一个负责制定研究计划几个分别去查文献、做实验、分析数据最后综合。四、低代码与高代码1.从低代码到高代码在 AI 原生应用的早期探索中低代码工具发挥了重要作用。Dify、Coze、阿里云百炼、Cloud Flow、n8n 等产品通过可视化编排和模板化配置使非专业开发者也能快速拼装出应用雏形。这类工具极大降低了试错成本为企业内部的概念验证(PoC)和小规模试点提供了便利。低代码平台在运行时也离不开底层引擎的支撑大多数低代码平台的底层引擎和管控部署在一起这限制了 Agent 的性能和可扩展性。但更重要的原因在于低代码平台是对于高代码的一层封装其抽象层次很难满足所有场景无法在性能、可扩展性和复杂业务逻辑方面满足大规模生产的要求。这也是为什么在进入大规模生产应用阶段后很多低代码方案都需要迁移到高代码框架中实现。高代码则代表了当下 AI原生应用生产落地的主流形态。ADK、LangGraph、AutoGen、AgentScope、Spring Al Alibaba等框架为开发者提供了面向 Agent 的编程接口。相比低代码高代码具备更高的性能可控性、更强的灵活性以及更好的可预测性能够支撑复杂场景下的业务逻辑实现与系统集成。2.高代码的演进在 AI 原生应用的三种构建模式中高代码模式最贴近工程师对系统的可控需求。此类开发方式不限于使用现成 Agent 框架更注重灵活的编排、精准的上下文控制、可靠的执行机制以及对复杂任务的支撑能力。框架使得上手变得容易。然而它们经常创建额外的抽象层这可能会掩盖底层的提示和响应使得调试变得更加困难。高代码模式本身经历了从 ChatClient→Workflow→Agentic 的演进过程。ChatClient 阶段:最初的实现仅是一次单一的 LLM 调用简单但缺乏复杂任务执行能力;Workflow 阶段:通过将传统工作流转化为 LLM 节点编排实现了自主性与确定性的初步平衡但由于编排复杂维护成本较高;Agentic 阶段:逐渐成为主流形态。它通过提供面向 Agent的 API并内置多种通用的协作模式(Pattern)使开发者能够在 Agentic自主性 和 Predictability(可预测性)之间取得平衡从而兼顾开发效率与执行准确性。普通人如何抓住AI大模型的风口为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。AI大模型开发工程师对AI大模型需要了解到什么程度呢我们先看一下招聘需求知道人家要什么能力一切就好办了我整理了AI大模型开发工程师需要掌握的知识如下大模型基础知识你得知道市面上的大模型产品生态和产品线还要了解Llama、Qwen等开源大模型与OpenAI等闭源模型的能力差异以及了解开源模型的二次开发优势以及闭源模型的商业化限制等等。了解这些技术的目的在于建立与算法工程师的共通语言确保能够沟通项目需求同时具备管理AI项目进展、合理分配项目资源、把握和控制项目成本的能力。产品经理还需要有业务sense这其实就又回到了产品人的看家本领上。我们知道先阶段AI的局限性还非常大模型生成的内容不理想甚至错误的情况屡见不鲜。因此AI产品经理看技术更多的是从技术边界、成本等角度出发选择合适的技术方案来实现需求甚至用业务来补足技术的短板。AI Agent现阶段AI Agent的发展可谓是百花齐放甚至有人说Agent就是未来应用该有的样子所以这个LLM的重要分支必须要掌握。Agent中文名为“智能体”由控制端Brain、感知端Perception和行动端Action组成是一种能够在特定环境中自主行动、感知环境、做出决策并与其他Agent或人类进行交互的计算机程序或实体。简单来说就是给大模型这个大脑装上“记忆”、装上“手”和“脚”让它自动完成工作。Agent的核心特性自主性能够独立做出决策不依赖人类的直接控制。适应性能够根据环境的变化调整其行为。交互性能够与人类或其他系统进行有效沟通和交互。对于大模型开发工程师来说学习Agent更多的是理解它的设计理念和工作方式。零代码的大模型应用开发平台也有很多比如dify、coze拿来做一个小项目你就会发现其实并不难。AI 应用项目开发流程如果产品形态和开发模式都和过去不一样了那还画啥原型怎么排项目周期这将深刻影响产品经理这个岗位本身的价值构成所以每个AI产品经理都必须要了解它。看着都是新词其实接触起来也不难。从0到1的大模型系统学习籽料最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师吴文俊奖得主给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】适学人群应届毕业生‌无工作经验但想要系统学习AI大模型技术期待通过实战项目掌握核心技术。零基础转型‌非技术背景但关注AI应用场景计划通过低代码工具实现“AI行业”跨界‌。业务赋能突破瓶颈传统开发者Java/前端等学习Transformer架构与LangChain框架向AI全栈工程师转型‌。AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。基础篇包括了大模型的基本情况核心原理带你认识了解大模型提示词Transformer架构预训练、SFT、RLHF等一些基础概念用最易懂的方式带你入门AI大模型进阶篇你将掌握RAGLangchain、Agent的核心原理和应用学习如何微调大模型让大模型更适合自己的行业需求私有化部署大模型让自己的数据更加安全项目实战篇会手把手一步步带着大家练习企业级落地项目比如电商行业的智能客服、智能销售项目教育行业的智慧校园、智能辅导项目等等但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下AI时代企业最需要的是既懂技术、又有实战经验的复合型人才**当前人工智能岗位需求多薪资高前景好。**在职场里选对赛道就能赢在起跑线。抓住AI这个风口相信下一个人生赢家就是你机会永远留给有准备的人。如何获取这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表