← Writing

从 Token 自由到 Token Efficiency

最近,Meta、美团公布的 Agent 实践都开始强调同一件事情:重点已经不只是让更多人使用更多 Token,而是 Agent 每消耗一次模型调用,究竟有没有完成实际工作。我把这种应用层的变化概括为,行业正在从所谓的 Token 自由,转向 Token Efficiency。

比如,Meta 建立了一套统一的 Capacity Efficiency Agent 平台,让 Agent 调用性能数据、代码搜索和内部文档,再利用沉淀下来的工程技能调查问题、生成修复方案。Meta 称,这套系统把部分原本约 10 小时的人工排查压缩到约 30 分钟。美团的 CatPaw 则已经在内部覆盖 9 万员工、搭建 3 万个 Agent,并开始提供模型调用量、消耗和运行过程的统一观察能力。当 Agent 开始长期运行、调用工具、拆分子任务并互相协作以后,Token 就不再只是聊天框里的使用额度,而会变成一项需要持续管理的生产成本。

其实,我觉得这代表着人们对使用 AI 的风向和共识产生了转变。首先,并不是在所有工作任务中,使用越智能、越贵的模型,就一定能够产生越高的实际价值。有时候更强的模型只是完成了同样的结果,却使用了更多 Token、等待时间和计算成本。

如果一个任务非常结构化,并且能够通过明确标准进行验收和回归,那么其实就非常适合交给轻量级、低成本的模型完成。比如分类、信息提取、格式转换和固定流程检查,这些任务的共同点不是“简单”,而是做对与做错能够被清楚判断。相反,一个任务即使经常重复,只要失败后果很大、错误又不容易被发现,就不应该仅仅因为它是例行工作而交给便宜模型。

在这种背景下,我们主要要解决的问题就是:如何让 AI 根据不同任务,判断应该使用什么样的模型?对于边界清楚、风险稳定的任务,可以由系统预先写死规则;对于输入变化较大、难度不确定的任务,可以使用 Router 或 Agent 动态判断;而对于高风险任务,则应该默认进入更强模型或人工确认。Agent 和系统并不是两个互斥的选择,它们更像是不同层级的判断机制。

同时,我们应该建立明确的质量和成本评估体系,在工程上稳定地看清楚 Token 成本和产生价值之间的关系。除了单次调用价格,还要记录任务成功率、升级比例、人工修改时间、响应延迟和失败后的返工成本。最终真正应该比较的,不是每百万 Token 多少钱,而是成功完成一个任务需要付出多少总成本。

就目前的情况来说,其实有两个真实的挑战:一是在真实环境中衡量 AI 的产出,二是评估它们的成本是否 OK。模型能力还在不断发展,今天需要前沿模型才能完成的任务,可能很快就能被小模型解决;与此同时,构建 Router、评测和监控系统本身也需要付出工程成本。是否值得在现在这个阶段构建这样的系统,并没有统一答案,它取决于任务规模是否足够大、质量标准是否足够清楚,以及节省下来的成本能否覆盖新增的复杂度。