logo
首页
产品与服务
商务合作
党建相关
博客
关于我们
phone电话咨询
服务热线16625252556
phone微信咨询
微信扫一扫即刻开始对话shangwu
email联系邮箱
联系邮箱service@sohan.cn
feedback意见反馈
header

浙大×阿里云首发Token经济学综述:重估LLM Agent的Token世界

2026年06月13日

过去我们谈大模型,最关心的是参数、能力、推理、工具调用和多轮对话。
但当 LLM Agent 真正走出实验室,进入金融、法律、医疗、企业服务等真实业务场景后,一个过去常被忽略的问题开始变得越来越重要:Token 到底花在哪里?又该如何被管理?
近日,浙江大学计算机学院、经济学院、区块链与数据安全国家重点实验室联合阿里云发布综述论文《Token Economics for LLM Agents: A Dual-View Study from Computing and Economics》。
系统梳理了 LLM Agent 中 Token 消耗、成本优化、系统协作、安全治理与资源分配等关键问题,并提出了一个新的分析框架:Token Economics,Token 经济学。
这篇论文最重要的价值,不是简单告诉我们要减少 Token 消耗,而是提出了一个更底层的判断:
在 Agent 系统中,Token 已经不只是技术单位,而正在成为影响成本、延迟、安全性、可扩展性和商业化落地的核心资源。
根据 OpenRouter 平台数据,周 Token 处理量从 2024 年 12 月的 0.4 万亿,增长到 2026 年 3 月的 27.0 万亿,15 个月增长近 68 倍。
这意味着,随着 AI Agent 应用规模化,Token 成本优化、LLM Agent 成本控制、企业 AI Agent 降本增效、Agent Token 消耗管理,都会成为接下来企业部署智能体时绕不开的问题。
论文提出的核心框架叫Dual-View 双视角框架。
简单理解,就是把计算机科学里的 Agent 系统优化问题,和经济学里的成本、生产、交易、机制设计、外部性等理论结合起来。
在这个框架下,Token 有三重经济属性。
  • 第一,Token 是生产要素。
每生成一个 Token,背后都需要 GPU、显存、电力、时间和算力资源。因此,在 AI Agent 推理成本分析中,Token 就像企业生产中的原材料和能源。
  • 第二,Token 是交换媒介。
今天主流 AI 服务基本都按照 Token 计费,输入多少钱、输出多少钱,本质上 Token 已经成为 AI 服务的定价单位。
  • 第三,Token 是记账单位。
任务复杂度、系统成本、推理效率、AI 生产力,都可以通过 Token 支出被量化。因此,未来企业评估 Agent 系统,不只会问效果好不好,还会问每完成一个任务需要多少 Token。
这也是论文提出的核心优化目标:在保证输出质量达标的前提下,最小化系统总成本。
换句话说,未来真正有竞争力的 AI Agent,不是无限调用模型、无限堆上下文、无限拉长推理链,而是在质量、成本、速度和安全之间找到最优解。
论文进一步把 Token Economics 拆成四个层次:单 Agent、多 Agent、Agent 生态系统,以及安全维度。
在单 Agent 层面,核心问题是:一个 Agent 如何更高效地使用 Token?
一个 Agent 完成任务时,通常会产生两类 Token 成本。

一类是模型内部推理 Token,例如思维链、规划步骤、中间推理;


另一类是外部工具调用 Token,例如检索、API 调用、数据库查询、工具返回结果。

这就带来一个关键权衡:到底是让模型多思考,还是让工具多干活?
如果模型自己推理太多,Token 成本会上升;如果过度依赖工具,检索和调用也会产生额外开销。
因此,Agent 推理效率优化、上下文压缩技术、AI Agent 记忆管理、RAG 检索增强优化、工具调用成本控制,都成为单 Agent 层面的关键研究方向。
在多 Agent 层面,问题会更复杂。
多 Agent 系统看起来很美好:不同 Agent 分工协作,一个负责规划,一个负责检索,一个负责执行,一个负责审核。但论文指出,Agent 越多,并不一定越高效。
因为每多一个 Agent,就会增加通信 Token、协调成本、任务分配成本和调度摩擦。当 Agent 数量增加到一定程度后,内部沟通成本可能呈现超线性增长,甚至抵消专业化分工带来的收益。
所以,多 Agent 协作成本分析、多智能体通信压缩、Agent 任务调度优化、跨 Agent 记忆共享、多 Agent 系统 Token 成本,都会成为未来 Agent 工程落地的重要命题。
真正的问题不是要不要多 Agent,而是:在专业化收益和协作摩擦之间,如何找到最优组织结构?
到了宏观层面,当大量 Agent 运行在多租户共享平台上,Token 就不再只是某个任务的成本,而变成整个 Agent 生态系统中的稀缺推理资源。
这里有一个非常值得关注的观点:推理成本下降,不一定意味着总消耗下降。
当单次调用更便宜,用户和企业可能会调用得更多,反而导致整体 Token 使用量继续上升。这类似经济学中的杰文斯悖论:效率提升可能带来更大规模的资源消耗。
所以,未来 AI Agent 平台定价机制、实时 Token 市场、推理资源动态调度、AI Agent 平台治理机制,也会成为行业基础设施的一部分。
论文还特别强调:安全不是外部附加模块,而是 Token 经济的一部分。
从 Token 生命周期来看,风险可能来自输入 Token、外部 Token、内部 Token、跨 Agent Token,以及市场级 Token。
比如恶意提示注入、工具返回污染、多 Agent 间错误传播、平台级滥用等问题,都会带来额外防御成本。
这意味着,安全感知 Token 预算、AI Agent 安全治理、高风险行业 AI Agent 部署、Agent 系统合规成本,也必须被纳入统一成本模型。
未来企业不能只追求更省 Token,还要考虑省下来的 Token 是否牺牲了安全性。最优方案不是无限增加防御,也不是忽略风险,而是在防御成本和潜在攻击损失之间找到平衡点。
从商业角度看,这篇论文给所有正在研究或部署 AI Agent 的企业一个重要提醒:
Agent 的竞争,不只是能力竞争,更是资源配置效率的竞争。
谁能用更少的 Token 完成更高质量的任务,谁能在成本、延迟、安全和可扩展性之间找到更优平衡,谁就更可能在下一阶段 AI 应用竞争中胜出。
Token Economics 的提出,意味着 AI Agent 研究正在从单纯追求能力,进入一个更加现实的新阶段:成本可控、效率可衡量、安全可治理、系统可扩展。
这也许正是 AI Agent 从实验室走向产业落地的关键一步。