2026-07-01更新于 2026-07-01engineering

Token 经济学:AI 应用真正要经营的是能效比

token 不是免费耗材,而是 AI 应用的能源、预算和效率指标。真正成熟的 AI 应用,不只追求更强模型,而是让合适的 token 出现在合适的任务里,并稳定换回可衡量的结果。

# token 经济学# AI 应用成本# token 能效比# AI 可观测# AI 评测# 模型分层

订阅用户感知 token 成本,往往是在额度被迅速耗尽、排队变长、模型被降级的时候。AI 应用开发者和管理层感知得更直接,他们看到的是 API 账单、调用量曲线和上线之后突然放大的成本。

这两个场景指向同一个事实:AI 不是一个无限免费的能力池。它背后有一种新的资源单位,而且这个资源单位正在进入个人工作、产品功能和企业预算。

我认为应该把 token 看成 AI 时代的能源。更准确地说,它是 AI 应用进入真实工作流之后,最直接的成本单位、预算单位和效率指标。今天很多人热衷于讨论「哪个模型更强」,但更有价值的问题是:每一单位 token,到底换回了多少有效结果。

这就是我理解的 token 经济学。

它不是研究哪个模型最便宜,也不是鼓励大家少用先进模型。它真正关心的是,当 AI 从演示、尝鲜和个人效率工具,进入企业流程、产品功能和长期创作系统之后,我们如何优化它的投入产出比。

token 是能源

从技术上说,token 是模型处理信息时的计量单位。输入要消耗 token,输出也要消耗 token。上下文越长,推理越复杂,调用次数越多,消耗就越大。

但如果把它放到应用里看,它就不只是一个计量单位。

没有 token,大模型就没有输出。代码 agent 不能继续执行任务,客服系统不能继续响应用户,知识助手不能继续检索和生成,内容工作流也不能继续迭代。我们看到的是文字、代码和回答,背后其实是一次次计算行为,以及这些计算行为被稳定交付出来的能力。

当然,token 不是唯一生产要素。模型能力、数据质量、工作流设计、人工判断和责任边界同样重要。但 token 的特殊之处在于,它把这些因素压缩成了一个可以观察、计量和预算管理的入口。

所以 token 经济学的第一个判断是:token 不是普通用量,而是 AI 应用的能源刻度。

把 token 看作能源,会迫使我们切换到一个更精明的视角。一个组织不能只问「这个模型有多强」,还要问:

这些问题过去像工程细节。但 AI 应用一旦进入生产环境,它们就会变成业务问题。

粗放阶段会过去

过去一段时间,很多团队和个人都处在粗放式使用 token 的阶段。

能用最强模型就用最强模型;能塞更多上下文就塞更多上下文;一个任务做不好,就多跑几轮;agent 卡住了,就继续让它尝试。这个阶段可以理解。模型能力变化太快,大家首先关心的是「能不能做到」,不是「以什么成本做到」。

但这个阶段不会一直成立。

demo 阶段只需要证明一次效果,生产环境要承受重复调用、失败重试、用户增长、权限控制、质量评估和服务稳定性。一个功能在小范围试用时看起来很便宜,不代表它在真实规模下仍然便宜。

对大公司来说,模型账单短期内也许还能被预算吸收。但当 AI 调用从个人效率工具变成面向大量员工和用户的生产能力时,成本就会从边缘问题变成管理问题。

对创业团队来说,问题更直接。一个 AI 功能如果每次调用都依赖顶级模型,它在 demo 阶段可能很漂亮,一旦开始增长,毛利、定价和留存都会受到压力。很多 AI 产品不是不能做,而是做出来之后不知道如何持续供给智能。

对个人来说,这个约束来得更早。个人预算有限,高频、重度、无节制地使用先进模型,很快会遇到订阅上限、额度限制或真实账单。更隐蔽的问题是,一个人可能花了很多 token,却没有沉淀出更稳定的工作流、更清晰的方法论,或者更高质量的作品。

所以我不太认同炫耀 token 消耗这件事。

一个月烧了多少额度,跑了多少轮 agent,这些数字本身没有意义。重要的不是你消耗了多少 token,而是这些 token 产出了什么。消耗很多,却拿不出结果,这不是什么先进性,只是单纯的资源浪费。

不同使用者,账本不同

token 经济学不是要求所有人都省钱。不同体量的使用者,需要看的账本不一样。

个人最应该关注的是边际收益。一次模型调用是否真的替代了时间、降低了认知负担,还是只是制造了更多需要阅读、整理和二次判断的内容。个人使用 AI 最容易忽略的一种成本,是用 AI 制造更多伪工作。

创业团队最应该关注的是单位任务成本。一次有效任务需要多少钱,能否被产品定价覆盖,用户增长之后会不会把账单推到不可控的位置。这里的关键不是「模型贵不贵」,而是智能供给能不能和商业模型匹配。

大企业最应该关注的是组织采纳后的总成本。单次调用不贵,不代表全公司使用之后不贵。更麻烦的是,如果没有评测和可观测,企业甚至不知道哪些调用有效,哪些调用只是把预算变成了看似忙碌的生成结果。

还有一种相反的误判也很常见。一些组织因为隐私、合规或内部制度,不能直接使用外部先进模型,只能使用内部部署的较低能力模型。使用者体验不好,就很容易得出结论:大模型没有价值,AI 不适合生产环境。

这个判断太粗糙。

较低成本、较低能力的模型确实不能自动转化为生产力。但这不意味着它没有价值。真正的问题是,你有没有能力通过任务拆分、上下文设计、检索增强、评测和流程约束,让它完成合适的工作。

不是所有任务都应该交给最强模型,也不是所有任务都能交给便宜模型。成熟的 AI 应用,会根据任务价值、风险和质量要求来分配 token。

不是便宜账,是任务价值账

如果只谈省钱,token 经济学很容易变成一种面向小气的优化。

这不是我想讨论的问题。

token 经济学的核心是能效比。所谓 token 能效比,不是简单地用更少 token 生成更多文字,而是看每一单位 token 能否稳定换回有效结果。这个结果可以是代码质量、回答准确率、任务完成率、人工节省时间、流程稳定性,也可以是一次决策质量的提升。

这里有一个边界:便宜但不可靠的调用并不便宜。

如果为了降低 token 成本,导致结果质量下降、人工复核增加、用户信任降低,甚至引入错误决策,那么所谓优化只是把成本从账单转移到了别处。AI 应用的成本从来不只存在于模型账单里,也存在于返工、误判、等待、沟通和责任承担里。

所以更准确的表达是:让合适的 token 出现在合适的任务里。

高价值、高风险、需要复杂推理的任务,使用更强模型可能反而是最省钱的,因为它减少了失败和返工。低风险、结构化、高频重复的任务,则不应该长期依赖最贵的模型。

这就是 token 经济学里最重要的一张账本:不是便宜账,而是任务价值账。

先看见成本

具体应该怎么做?

我的判断是,顺序比技巧更重要。不要一开始就急着换模型、压 prompt、砍上下文。你首先要能看见 token 是怎么被消耗的。

第一步是可观测。

至少要知道每一次交互的输入 token、输出 token、缓存 token、调用模型、调用链路、失败次数和重试次数。对个人来说,这可以是简单记录;对团队来说,它应该进入日志、监控和成本面板。没有这个基础,所有优化都只能靠感觉。

第二步是评测。

切换模型之后,质量到底是上升还是下降;修改 prompt 之后,任务完成率有没有变化;加入 RAG 之后,幻觉是否减少,延迟和成本又增加了多少。这些问题不能只靠体感回答。没有评测,成本优化很容易变成自我安慰。

第三步才是具体优化。

缓存可以减少重复上下文消耗;模型分层可以让不同任务匹配不同能力;prompt engineering 和流程设计可以让能力不完美的模型更稳定地完成任务;任务拆分可以避免把所有问题都塞进一次昂贵调用里。

早期大家谈 prompt engineer,后来这个词有些过热。但它背后的真实问题没有消失:面对一个能力不完美的模型,如何通过输入结构、示例、约束、工具调用和结果校验,让它在生产环境中把事情做对、做好。

这件事不适合拿来做炫技演示,但它会决定一个 AI 应用能不能持续运行。

这本质上是供应链管理

过去大家习惯把 AI 应用的差异归结为模型能力。谁接入了更强的模型,谁就更先进。

这个判断在早期有道理。模型能力差距足够大时,直接使用更强模型,确实能带来明显体验差异。

但随着越来越多团队都能接入相近的模型,差异会转移到另一个层面:谁能用更合理的 token 成本,获得更稳定的任务结果。

这本质上是供应链管理。

一个成熟的 AI 应用不会只展示一次漂亮回答,而是能回答这些问题:

这些问题听起来不如新模型发布那么令人兴奋,但它们才是 AI 应用进入真实世界之后每天都会面对的问题。

我也相信,随着硬件能力提升、本地模型和私有化部署逐渐成熟,个人和组织会拥有更多相对低成本的 AI 能源。但低成本能源不会自动带来生产力。它必须被纳入一个好的系统,才会变成稳定产出。

所以这篇文章先停在这里。

关于 AI 应用的可观测、评测、模型分层和成本优化,后面值得单独展开。因为 token 经济学真正要回答的不是「怎样少花钱」,而是一个更实际的问题:当智能变成一种可以持续采购和调度的资源,我们该如何让它稳定地产生价值。

邮件回复

hi@roarkli.com
如果这篇文章对你有帮助,或其中有需要修正的地方,欢迎直接发邮件告诉我。