从 2024 年底第一次认真评估 Agent,到 2025 年秋把几个 Agent 送进真实业务流程,整整一年。这一年的主线不是技术突破,而是反复踩坑、反复修补。把最典型的五个坑记下来。
坑一:高估自主性
Demo 里 Agent 一口气完成十步任务,非常惊艳。真实环境里,第 2 步就卡住了:接口变了、数据缺字段、权限没开。自主性越高,翻车越彻底。后来我们把任务拆小,每 3 步左右设一个检查点。
坑二:没有评测就上线
上线前我们只做了几十条用例的手工验证,信心满满。上线两周后各种怪问题冒出来:同一批数据两次执行结果不一样,没人能说清是变好还是变坏。没有自动化评测集,就等于蒙着眼睛开车。
坑三:权限给得太宽
一开始图省事,给 Agent 开了大范围权限。结果它在一次任务里把几十封草稿邮件群发了出去(还好收件人是内部)。从那以后,权限按「最小够用」原则配置,高风险动作一律人工确认。
坑四:上下文越长越蠢
任务做久了,Agent 会逐渐「忘记」任务最初的约束,开始自由发挥。我们被迫引入任务快照、阶段性总结,把关键约束重复注入每一步。
坑五:把 Agent 当黑盒交付
用户看不到 Agent 在干什么,出了问题只能干瞪眼。后来我们在界面上把执行过程、关键决策、失败原因全部展示出来,用户投诉率立刻降了三分之一。可解释性不是加分项,是及格线。
复盘
一年下来最深的体会:Agent 产品 80% 的工作量,发生在模型之外——任务拆解、评测、权限、可观测、人机协作。模型负责聪明,产品负责不闯祸。