2025 年春天,圈子里最热的话题从「对话」变成了「干活」。大模型开始学会调用工具:查数据库、发消息、操作网页。我决定做一轮实践,让 Agent 处理我的真实工作,而不是继续看 demo。
我让 Agent 做了什么
我选了三个边界清晰、出错可挽回的任务:
- 每周整理团队周报,提炼行动项
- 把会议录音转写成结构化纪要
- 从散落的邮件里汇总客户的待办事项
前两个效果不错,能省下我每周两三个小时。第三个翻车最多——邮件里语气含糊、信息不全,Agent 经常自作主张脑补结论。
实践中的真实发现
- 任务边界决定成败:越是结构化、可验证的任务,Agent 越靠谱;越开放的任务,越容易跑偏
- 工具调用要收敛:权限给得越多,闯祸的可能越大。我只开放了只读权限和低风险操作
- 上下文是硬约束:任务一长,模型就「忘记」前面的约定,需要把关键规则反复写进每一步
- 成本不便宜:多步推理调用次数多,一次任务的 token 开销是对话模式的几十倍
我的结论
这一轮实践让我对 Agent 的态度从「兴奋」变成了「谨慎乐观」。它确实能干活,但更像一个能力强、记性差、需要盯着的实习生。
接下来的几个月,我一边继续用,一边记录它到底在哪些环节不可靠。这些记录,后来成了我做 Agent 产品时的第一手素材——对 AI 的信任,只能从一次次的错误里长出来。