过去我们谈大模型,最关心的是参数、能力、推理、工具调用和多轮对话。但当 LLM Agent 真正走出实验室,进入金融、法律、医疗、企业服务等真实业务场景后,一个过去常被忽略的问题开始变得越来越重要:Token 到底花在哪里?又该如何被管理?近日,浙江大学计算机学院、经济学院、区块链与数据安全国家重点实验室联合阿里云发布综述论文《Token Economics for LLM Agents: A Dual-View Study from Computing and Economics》。系统梳理了 LLM Agent 中 Token 消耗、成本优化、系统协作、安全治理与资源分配等关键问题,并提出了一个新的分析框架:Token Economics,Token 经济学。这篇论文最重要的价值,不是简单告诉我们要减少 Token 消耗,而是提出了一个更底层的判断:在 Agent 系统中,Token 已经不只是技术单位,而正在成为影响成本、延迟、安全性、可扩展性和商业化落地的核心资源。根据 OpenRouter 平台数据,周 Token 处理量从 2024 年 12 月的 0.4 万亿,增长到 2026 年 3 月的 27.0 万亿,15 个月增长近 68 倍。这意味着,随着 AI Agent 应用规模化,Token 成本优化、LLM Agent 成本控制、企业 AI Agent 降本增效、Agent Token 消耗管理,都会成为接下来企业部署智能体时绕不开的问题。论文提出的核心框架叫Dual-View 双视角框架。简单理解,就是把计算机科学里的 Agent 系统优化问题,和经济学里的成本、生产、交易、机制设计、外部性等理论结合起来。每生成一个 Token,背后都需要 GPU、显存、电力、时间和算力资源。因此,在 AI Agent 推理成本分析中,Token 就像企业生产中的原材料和能源。今天主流 AI 服务基本都按照 Token 计费,输入多少钱、输出多少钱,本质上 Token 已经成为 AI 服务的定价单位。任务复杂度、系统成本、推理效率、AI 生产力,都可以通过 Token 支出被量化。因此,未来企业评估 Agent 系统,不只会问效果好不好,还会问每完成一个任务需要多少 Token。这也是论文提出的核心优化目标:在保证输出质量达标的前提下,最小化系统总成本。换句话说,未来真正有竞争力的 AI Agent,不是无限调用模型、无限堆上下文、无限拉长推理链,而是在质量、成本、速度和安全之间找到最优解。论文进一步把 Token Economics 拆成四个层次:单 Agent、多 Agent、Agent 生态系统,以及安全维度。在单 Agent 层面,核心问题是:一个 Agent 如何更高效地使用 Token?一个 Agent 完成任务时,通常会产生两类 Token 成本。一类是模型内部推理 Token,例如思维链、规划步骤、中间推理;
另一类是外部工具调用 Token,例如检索、API 调用、数据库查询、工具返回结果。
这就带来一个关键权衡:到底是让模型多思考,还是让工具多干活?如果模型自己推理太多,Token 成本会上升;如果过度依赖工具,检索和调用也会产生额外开销。因此,Agent 推理效率优化、上下文压缩技术、AI Agent 记忆管理、RAG 检索增强优化、工具调用成本控制,都成为单 Agent 层面的关键研究方向。多 Agent 系统看起来很美好:不同 Agent 分工协作,一个负责规划,一个负责检索,一个负责执行,一个负责审核。但论文指出,Agent 越多,并不一定越高效。因为每多一个 Agent,就会增加通信 Token、协调成本、任务分配成本和调度摩擦。当 Agent 数量增加到一定程度后,内部沟通成本可能呈现超线性增长,甚至抵消专业化分工带来的收益。所以,多 Agent 协作成本分析、多智能体通信压缩、Agent 任务调度优化、跨 Agent 记忆共享、多 Agent 系统 Token 成本,都会成为未来 Agent 工程落地的重要命题。真正的问题不是要不要多 Agent,而是:在专业化收益和协作摩擦之间,如何找到最优组织结构?到了宏观层面,当大量 Agent 运行在多租户共享平台上,Token 就不再只是某个任务的成本,而变成整个 Agent 生态系统中的稀缺推理资源。这里有一个非常值得关注的观点:推理成本下降,不一定意味着总消耗下降。当单次调用更便宜,用户和企业可能会调用得更多,反而导致整体 Token 使用量继续上升。这类似经济学中的杰文斯悖论:效率提升可能带来更大规模的资源消耗。所以,未来 AI Agent 平台定价机制、实时 Token 市场、推理资源动态调度、AI Agent 平台治理机制,也会成为行业基础设施的一部分。论文还特别强调:安全不是外部附加模块,而是 Token 经济的一部分。从 Token 生命周期来看,风险可能来自输入 Token、外部 Token、内部 Token、跨 Agent Token,以及市场级 Token。比如恶意提示注入、工具返回污染、多 Agent 间错误传播、平台级滥用等问题,都会带来额外防御成本。这意味着,安全感知 Token 预算、AI Agent 安全治理、高风险行业 AI Agent 部署、Agent 系统合规成本,也必须被纳入统一成本模型。未来企业不能只追求更省 Token,还要考虑省下来的 Token 是否牺牲了安全性。最优方案不是无限增加防御,也不是忽略风险,而是在防御成本和潜在攻击损失之间找到平衡点。从商业角度看,这篇论文给所有正在研究或部署 AI Agent 的企业一个重要提醒:Agent 的竞争,不只是能力竞争,更是资源配置效率的竞争。谁能用更少的 Token 完成更高质量的任务,谁能在成本、延迟、安全和可扩展性之间找到更优平衡,谁就更可能在下一阶段 AI 应用竞争中胜出。Token Economics 的提出,意味着 AI Agent 研究正在从单纯追求能力,进入一个更加现实的新阶段:成本可控、效率可衡量、安全可治理、系统可扩展。这也许正是 AI Agent 从实验室走向产业落地的关键一步。