上周,我让一个 Agent 帮我持续跟踪一个 AI 研究方向——每天整理新进展,碰到有价值的论文自动打标,顺便和我正在写的文章做关联。

前两天它做得不错。第三天,我打开一看,它开始给我推送完全不相关的内容:科技公司财报、某个创业公司的融资新闻……但它自己完全不知道出了问题,还在一本正经地继续工作。

说实话,我当时的第一反应不是愤怒,而是一种奇怪的恍然大悟:我们大多数人对 Agent 的理解,可能从一开始就不准确。

我们以为 Agent 是“更聪明的 ChatGPT”——加了搜索、能调工具、会自动执行。但这次经历让我去认真翻了今年 1 月发表的那篇 Agent 综述,以及 Nature 近期连续讨论 AI agents 对科研影响的几篇评论。

我发现,Agent 其实在解决一个和“回答问题”完全不同的问题。

今天这篇文章,我想把我想清楚的东西,用通俗的语言和你聊一聊。

一件事,两种能力

先说一个最关键的区别。

你去问 ChatGPT:“帮我分析一下这份财报。”它给你一个回答。任务完成。

但如果你说:“帮我持续关注这家公司,每周整理最新动态,当有重大变化时提醒我,并把结论和我正在写的研究报告同步。”

这是完全不同的两件事。

前者是回答问题。后者是在开放环境里,持续规划、调用工具、执行动作、根据反馈修正策略、在更长时间尺度上完成任务。

这就是 Agent 研究真正在解决的问题。

想象一下你雇了一个助理。你不是每次都要坐在旁边告诉他下一步做什么——你希望他早上来了知道今天的优先级,碰到问题会自己想办法,做完一件事知道接下来该做什么,而且三天后回来,他还记得你们上次说好的事。

这听起来是对助理最基本的要求。

但对 AI 来说,这是一道真正的难关。

Agent 现在真正卡在哪里

我梳理了当前这个方向最核心的五个难题,不是学术上的分类,而是真实系统里会遇到的坎。

第一个难题:任务一旦拉长,就开始崩

很多 Agent 在短任务上表现不错。但一旦任务超过 20 步、50 步,就开始出问题。

错误会积累,计划会漂移,工具调用会失控。更微妙的是,有些 Agent 看起来在“努力工作”,实际上是在兜圈子——它的行为在优化“看起来有进展”,而不是真正解决问题。

这在业内有个说法叫 demo 幻觉——演示的时候很好看,放进真实工作流就崩。

就像你雇了一个装修包工头,前三天每天早到,干劲十足。但第二周你去看,发现他这几天只是反复把同一堵墙刷了又刷,因为他不知道接下来该做什么,但又不想让你觉得他在偷懒。

现在很多 Agent 就是这个状态。

第二个难题:记忆会污染,也会消失

一个真正有用的 Agent,需要有稳定的记忆。今天做的事,明天还记得;这个项目学到的经验,下个项目能用上。

但记忆是一把双刃剑。

记得太少,每次都要重新交代背景,效率极低。记得太多、不加筛选,旧信息会污染新任务。比如,你之前让 Agent 用一种写作风格处理 A 项目,它把这个“规则”记下来了,结果做 B 项目时自动沿用,风格全跑偏了。

什么该存、何时该调、怎么遗忘——这是一个比“存下来”难得多的问题。

第三个难题:工具用得多,不如用得准

Agent 现在能调用的工具越来越多:搜索、代码执行、数据库查询、文件读写……

但工具多了,新问题来了:什么时候该用哪个工具?用完之后怎么判断结果是不是对的?

我见过一个很典型的失败模式:Agent 执行搜索,返回了一条信息,直接采信、继续往下走,但那条信息是错的。整个推理链从这里开始全面偏航,最后给出一个自信满满的错误结论。

这也是我认为最关键的一点:关键不是让 Agent 替代研究者,而是把它放进可监督、可纠错的工作流程。

工具调用与结果校验,不是一个加分项,是一个生死线。

第四个难题:多个 Agent 协作,比想象中难

很多复杂任务,天然适合拆分——一个 Agent 负责搜索,一个负责分析,一个负责写作,一个负责核查。

但多 Agent 协作有一个很麻烦的特性:错误会共振。

一个 Agent 的错误,传给下一个,不是减弱,而是放大。更糟的是,每个 Agent 自己觉得没问题,因为它的局部输入是合理的,但整个系统的输出是错的。责任链不清,纠错就变得极度困难。

这就像一个多部门协作的项目,没人觉得是自己的问题,但项目就是做砸了。

第五个难题:现在的评测,根本测不了真实能力

这个问题我认为是最被低估的。

现在大部分 Agent 评测,本质上还是“考试题”——设计好的任务,有标准答案,测完给个分数。

但真实世界里 Agent 面对的是:任务会变、工具会报错、信息会矛盾、用户的需求会在过程中调整。

一个在考试里满分的 Agent,在真实系统里可能一塌糊涂。而且更要命的是,你根本不知道它哪里会出问题,因为考试环境和真实环境差太远了。

真正需要的评测,是能测长期任务完成率、从错误中恢复的能力、过程是否可审计、成本效率——而不只是最终答案对不对。

那对我们来说,这意味着什么?

说了这么多研究层面的东西,我想聊聊更实际的部分。

你现在可能已经在用某个 Agent 工具了。如果你发现它在前几步表现挺好,但越往后越开始给你奇怪的结果——那不是你用法不对,那是它本来就还没解决长任务可靠性的问题。现阶段最务实的用法,是在关键节点保留自己的判断,把它当一个聪明但需要检查作业的助手,而不是一个可以完全放手的代理人。

如果你是在做产品或者想在这个方向创业,有一个判断我觉得值得认真考虑:现在 Agent 产品真正的护城河,不在于底层模型有多聪明,而在于有没有把上面五个难题中的某一个真正解决掉。会吹的产品不少,但你可以去问一个很直接的问题:它的长任务完成率是多少?失败了怎么恢复?过程可不可以审计?这几个问题的答案,比演示视频要诚实得多。

还有一个方向我个人觉得被严重低估——评测体系。现在最缺的不是“再来一套考试题”,而是能真实测出 Agent 在复杂任务中表现的测量框架。谁把这件事做扎实,谁就有机会定义下一轮 Agent 研究的标准。这个机会比想象中大。

未来两三年,我的判断

我想在最后分享一个我的预判。

Agent 很可能在未来两三年,从“通用聊天工具的附属功能”变成一个独立的平台层。

但跑出来的,不会是最会写长回答的系统。而是最会规划、最会使用工具、最能在长任务中保持可靠性的系统。

就像搜索引擎刚出来的时候,大家以为是“更快的图书馆”,结果它变成了信息入口。Agent 现在也处于类似的认知误区里——大多数人还在用“更好的聊天助手”来理解它,但它真正要变成的,是能在真实世界里独立行动的工作伙伴。

Nature 2025 年的一篇 AI agent 伦理评论说得很准:Agent 在科学中的目标不应该是“完全替代”,而应该是“负责任地扩展人类能力”。这句话,不只适用于科研,适用于所有领域。

我们现在站在一个临界点上——Agent 还没有真正成熟,但它成熟的方向已经清晰了。

下次你看到一个 Agent 产品的发布,不妨问自己一个问题:它解决了这五个难题里的哪一个?

有答案的,值得认真看。没答案的,先等等。


原载于创意妙计。原文标注为原创内容;版权及转载要求以微信原文为准。