90%的AI Agent都是“假的”?长文拆解对话型AI与代理型AI的底层差异
AI Agent:一个被定义三年、仍被误解的概念
2023年,OpenAI研究主管Lilian Weng写了一篇博客——《LLM Powered Autonomous Agents》,文章里她给AI Agent下了一个定义:
LLM + Planning + Tool Use + Memory
·Planning负责拆解任务和排序
·Tool Use提供调用外部系统的能力
·Memory让Agent能跨会话记住上下文
·LLM作为大脑做推理和生成

这个定义发表三年后,仍然是AI Agent领域被引用最多的框架之一。
但有一个比较尴尬的事实——市面上自称"AI Agent"的产品,大多数只做到了其中两个:LLM和Tool Use。Planning和Memory,基本缺失。比如能调API,但没有规划,没有记忆。比如能执行,但不会思考先做什么、后做什么。比如做完了也不会检查结果对不对。
也就是说,严格意义上讲,现在市面上大多数的AI Agent,都是假的Agent。
Gartner的一份报告中给出了一个冷酷的数字:数千家宣称有Agent能力的厂商中,仅约130家是真的。
本文我们试图探讨:AI Agent分为哪些类型,从底层架构、能力分层、企业落地上有哪些差异?对企业/用户而言,如何才能选出真正能做事、真正好用的AI Agent?
一、 如何区分对话型AI和代理型AI?
其实区分这两者并不难。之所以觉得懵,是因为很多厂商在故意耍聪明、混淆视听。
Conversational AI(对话型AI)
主要能力是输入、理解、输出,在信息层闭环。
它的架构本质是一个响应系统——"输入-处理-输出"单次闭环,任务一次性终止。它的智能体现在模式识别和内容生成上,但缺乏持续的目标感和自主行动能力。你问它一个问题,它给你一个回答。回答完了,任务就结束了。它不会主动去做任何事。
典型产品包括:普通客服机器人、早期ChatGPT纯对话模式、Copilot类建议工具。

Agentic AI(代理型AI)
主要能力是感知环境、做出决策、调用工具、执行操作。
它的架构本质是一个目标驱动的自主系统——给它一个目标,它能自己拆解任务、规划步骤、自己调用工具、自己检查结果、发现错了自己回退。核心在于推理和行动能力。
典型产品包括:OpenAI Operator、企业级工作流Agent、AutoGPT。包括现在很火的WorkBuddy、Coze、豆包Work、OpenCalw、Dify、Manus AI、Claude,都是Agentic AI(代理型AI)。

简单来讲:对话型AI回答问题,代理型AI完成任务。
这里有个比较容易混淆的产品类型:Copilot类产品。
它能写代码、能改文档、能发邮件——但它不自主执行。它给你建议,你来点确认。本质上是"向人类建议"的模式,工具执行为零——所有操作都由人类完成。
所以Copilot是高级对话型AI,也不是真正的Agent AI。

我们通过一张表,来更清晰地看清对话型AI和代理型AI的差异:

"Agent Washing"——行业最大的包装术
定义很明确、区别也如此明显,为什么很多厂商能够硬把对话型AI包装成能做事的代理型AI呢?
这里要引入一个概念——Agent Washing。
给对话型AI加个API调用,就把自己wash成了代理型Agent,因为它确实能调用数据、执行下单、售后等操作。做最简单的调整、用最低的成本,就可以摇身一变,卖更贵的价格。而事实上,产品的本质并没有变。
二、同为Agent,为什么能力差距如此之大?
答案不在模型的参数量上,也不在训练数据的多寡上,而是在架构的完整度上。
具体来说,市面上的AI产品存在三种截然不同的构造:
第一种:对话型AI——有嘴没手。
能理解、能对话,不能操作系统、不能调用工具、不能执行任何动作。只能"说",不能"做"。
底层架构:没有打通操作系统和企业工具链。 没有权限、没有接口、没有执行环境,因此它的终点就是生成一段文本,而不是调用一个API、写入一条数据、触发一个流程。
绝大多数普通客服机器人都属于这一类。能对话,但不能做事。能回答,但不能负责。
就像企业里的实习生——有头脑、会思考,但没有处理实际事务的权限和经验,只能完成一些简单的输入输出型工作。
第二种:普通Agent AI——有手没脑。
能调用接口、能执行操作,但不会规划先做什么后做什么,也不会检查做完的结果对不对。
底层架构:有执行能力,但没有任务规划层和结果校验层。 它的架构是"接收指令→调用工具→返回结果"的单链逻辑,缺少目标拆解、步骤排序、异常捕获和结果自检。工具调得通,但不知道什么时候该调、调完该不该验证。
市面上大多数"AI Agent"都是这一种:只做了感知+执行——能听懂、能动手。但缺了规划和反思。
具体表现包括:
- 不确认就执行 ——客户说"帮我退掉上次那个订单",AI不确认是哪一笔,直接退了最近的一笔。
- 报错就卡住 ——退款流程5步跑到第3步报错,不知道回退也不知道暂停,就那么僵住了。
- 不会判断情绪升级 ——客户已经在骂人了,AI还在按标准流程念话术。
这就是"有手没脑"的代价——能操作,但不能判断该不该操作、操作对了没有、错了怎么补救。
就像入职不久的新员工,交代一步做一步,错了也不知道如何处理。
第三种:真正成熟的Agent AI——有手有脑,会干活。
能感知、能规划、能执行、能反思。遇到问题自己想办法,做完了自己检查,错了知道回退。
和前两种的架构区别: 它具备完整的"感知→规划→执行→校验→修正"闭环。能拆解目标、能并行调度多个工具、能在执行中判断异常并自主回退——不只是完成任务,而是可靠地完成任务。真正意义上的Agent应该有四层健全的体系:
- 给接口(系统对接层) ——打通CRM、ERP、计费系统、工单系统,AI才能操作真实业务数据。
- 给权限(可控授权层) ——不是放开所有操作,而是按角色、按场景、按金额分层授权。客服能查订单,但不能批超过500元的退款。能做什么、不能做什么、做到什么程度,都有边界。
- 给脑子(规划+反思层) ——能分解任务、排序执行、校验结果、错误回退。遇到问题能自己想办法,而不是卡住等人工。
- 给安全网(治理+兜底层) ——操作审计,每步有记录,出了问题能追溯。异常熔断,检测到连续失败或客户情绪升级,自动停止、转人工。渐进授权,先从低风险操作开始验证,可靠后再放开高风险操作。
这样的AI就像成熟独立的老员工。事情交代给他,他自己知道该先做什么、后做什么、做完了怎么检查、检查出问题怎么回退。
这是一个AI Agent成熟度的快速评估表:
事实上,市面上绝大多数产品,要么还只是L1级别的对话型AI,要么也只是打通了一些接口,在L2到L3之间挣扎。而L4级别以上的AI,才真正能产生业务价值。

三、从"能用"到"好用",到底难在哪?
既然AgentAI的标准已经很清楚,为什么还有这么多企业只做对话型AI或者"假的"代理型AI?
原因在于真正想做到好用、做到真正的代理型AI,有四个绕不开的挑战。
挑战1:意图理解的容错率骤降
客户说"我要退货"——是退了重新买?还是退款?还是换货?
对话型AI理解错了,用户纠正就行,成本为零。
做事型AI理解错了,可能已经改了订单、退了款、触发了物流。
所以做事型AI需要的不是"能理解",是"在高风险场景下稳定理解对"。
挑战2:多步规划的可靠性
办一件事往往不是一步。
比如"退货退款":查订单→确认原因→计算退款金额→发起退款→更新状态→通知客户。
任何一步出错,整个链条就断。
需要AI具备"规划能力"——知道先做什么后做什么,中间出错了怎么回退。
大多数所谓"Agent"产品在这一步是缺失的——它能调API,但不会规划调用顺序,也不会处理中途异常。
挑战3:系统打通的工程量
AI要查订单得接订单系统,要改地址得接地址系统,要提工单得接工单系统。
每家企业的系统不一样、接口不一样、数据格式不一样。这是"脏活累活"。需要逐个系统对接、逐个场景调试。
一个CRM系统的API改了字段格式,Agent就可能完全无法工作。多租户场景下,A客户的数据不能泄漏到B客户的Agent会话中。
这些工程问题,比模型选型更消耗团队精力。
挑战4:信任的工程化
企业不敢给AI权限,核心原因不是"AI不够聪明",是"不知道AI会不会搞砸,搞砸了怎么办"。
这背后需要建一张套治理体系:
- 权限分层:不同角色不同权限,按场景按金额分级授权
- 操作审计:每步操作有记录,可追溯,出了问题能查到是哪一步
- 异常熔断:检测到异常自动停止、转人工
- 渐进授权:先从低风险操作开始验证,可靠后再放开高风险操作
这四层叠加起来,企业才"敢"让AI做事。
四、 写在最后
三种AI,三个层级。
对应的不是模型能力的差异,是工程体系成熟度的差异。
同一个大语言模型,放在不同的架构里,可以是只能聊天的实习生,可以是能操作但不会反思的新员工,也可以是能规划、能执行、能反思、能兜底的好员工。
差距不在模型,在体系。
接口层决定AI能碰什么
权限层决定AI能做什么
规划层决定AI怎么做
安全层决定AI做错了怎么办
四层齐了,才是真正能产生业务价值的Agent。
这也是ChatDoing正在做的事——帮企业从L2/L3走到L4。用对话式训练降低接口对接门槛,用多Agent协作实现规划与执行的闭环,用渐进式授权和无缝转人工构成安全网。不是让AI更聪明,是让AI的做事体系更完整。
