黄仁勋说 Token 是 "新货币",但企业的 AI 账单先失控了

一位开发团队的技术复盘在社区里流传甚广:他们内部上线了一个日均处理 2000 个工单的客服 Agent,三周下来账单接近 6000 美元 —— 而项目立项时的估算是每月 800 美元,差了近 8 倍。单次任务要价似乎不高:一个典型工单拆成 3 轮对话,输入输出合计约 1.67 万 Token,折算成本不足 1 角钱。但乘上每天 2000 个工单、每个智能体在多轮循环里反复重发上下文,账单就再也回不去了。

这不是孤例。行业里已经有共识性的判断:中国工程院院士、清华大学教授郑纬民指出,单智能体的 Token 消耗量可达传统对话应用的百倍至千倍级。一个客服 Agent 月消耗数百万乃至上千万 Token,已是常态。换言之,动辄千万 Token 的烧钱速度,是 Agent 时代每个落地企业都要面对的新算术题。

一边是 "新货币" 叙事,一边是失控的账单

就在企业被账单困扰的同时,Token 正在资本市场和科技圈享受前所未有的高光时刻。

2026 年 3 月的 GTC 大会上,英伟达 CEO 黄仁勋把数据中心重新定义为 "AI 工厂"—— 产品不是文件,而是 Token。他说:"Token 是新的商品,像所有大宗商品一样,一旦成熟,它就会分层。" 他当场给出了一张五级定价表:免费层、每百万 Token 3 美元、6 美元、45 美元,最高 150 美元。他还断言,到 2027 年市场对这座 "工厂" 产出的需求 "至少有 1 万亿美元"。

两个月后,他在台北GTC大会的言论就更加激进、:"Token 就是资产,已经成为获利的营收单位。"

他甚至预言,未来每位工程师都会拥有一份 "年度 Token 预算",金额约为年薪的一半 —— 硅谷最新的招聘筹码已经变成:"你的 offer 里带多少 Token?"

而在更早的深度访谈中,他放出的判断是:未来 AI 计算占全球 GDP 的比重将是今天的 100 倍,有人会愿意为每百万 Token 支付 1000 美元,"这不是会不会发生的问题,而是何时发生的问题"。

国内同样在起量。据国家数据局数据,截至 2026 年 3 月,我国日均 Token 调用量已突破 140 万亿,两年增长超千倍;2026 年 3 月,全国科学技术名词审定委员会正式将 Token 的中文名定为 "词元"。IDC 预测,2026 年中国企业级 Token 消耗量将同比增长约 20 倍,达到日均 110 万亿。

成本失控的根源:不是太贵,而是 "看不见"

为什么预算总在失控?Akamai 大中华区副总裁张珂给出的答案很直接:看不见。

Akamai 大中华区副总裁张珂

在 Akamai《2026 年 AI 推理现状报告》中,77% 的企业缺乏一致的推理成本单位经济效益指标 —— 即没有按 Token / 查询口径计量成本。

大多数团队在 PoC 阶段只评估模型效果,从未认真计算过 Agent 的 "数学题":Agent 是一个循环,每一轮都要把系统提示、工具定义、全部历史重新打包发送给模型,输入 Token 随轮次 "滚雪球" 式增长。

斯坦福数字经济实验室的研究显示,Agent 任务的 Token 消耗可比同类聊天任务高出约 1000 倍,同一任务的成本波动甚至可达 30 倍 —— 因为没人能预测 Agent 会走哪条路径。PickaxeAnthropic 的一份企业报告也显示,生产级 Agent 上线 3 个月后,日均 Token 消耗从 PoC 阶段的 5 万跃升至 250 万,增长 50 倍。GitHub

"Token 成本不仅是财务问题,更是安全问题。" 张珂在近期的分享中强调,企业普遍缺乏 Token 级别的可见性,这既导致 AI 投资回报率被隐性侵蚀,也让企业在面对新型攻击时缺乏预警能力。在他看来,Token 消耗的异常激增,是成本问题与安全事件发出的 "共同信号"。

账单异常激增,可能正有人在替你 "烧钱"

过去一年,针对 Token 的攻击已经从理论变成产业。张珂在分享中列举了三种正在发生的威胁:

其一是拒绝钱包攻击(Denial of Wallet,DoW)。攻击者不追求瘫痪服务,而是故意增加推理调用量 —— 构造长上下文、复杂推理请求,让模型在合法请求的伪装下持续烧钱,把企业的 Token 账单推到六位数。OWASP 已在 LLM Top 10 中将此类风险归入 "无边界消耗"(Unbounded Consumption);Sysdig 的研究显示,一次 "LLMjacking"(盗用他人 API 密钥调用大模型)攻击可造成每天超 4.6 万美元的损失,2026 年 3 月还出现过一把被盗的 Gemini API Key 在 48 小时内刷出 8.2 万美元账单的案例。

其二是 Token 算力盗用。典型场景是电商 AI 应用(如聊天客服)暴露的 API/Token 被黑客盗走,为攻击者 "打工"。Stripe 的数据印证了这一点:在 Stripe 上运行的 AI 服务中,免费试用滥用半年内翻了一倍多,开放 API 的 AI 初创企业遭受的滥用比传统 SaaS 企业高出 10 倍 —— 攻击者盯上的已经不是账户里的钱,而是昂贵的推理算力和 Token 额度。

其三是 AI 爬虫与传统爬虫的成本量级不对等。传统爬虫消耗的是流量和带宽,AI 爬虫消耗的是 Token 和算力 —— 后者的成本量级完全不在一个维度,一次批量抓取可能直接烧穿一个月的推理预算。

治理之道:把管控前置到架构层

面对 "看不见" 的成本,张珂给出的路线不是事后看账,而是架构层面前置管控,具体分四步:

第一步,可观测性先行。为每次推理请求打上模型 / Token 元数据标签,实时监控预算消耗 —— 先让每一笔 Token 花在哪、花给谁变得可见,才谈得上管理。

第二步,让 AI 网关成为管控枢纽。用量记录统一管理第三方模型、自建模型与 Token 平台;用语义缓存降低重复调用成本;设置员工使用上限,防止 "影子 AI" 绕过管控私自烧钱。

第三步,身份认证防盗用。用 Web Bot Auth 验证 AI Bot / 智能体的真实身份,防止仿冒者盗用 Token 通道 —— 把 "这是谁在调用" 变成每一次请求的必答题。

第四步,自建低成本推理能力。利用边缘 GPU 云降低对外部 Token 平台的依赖,把推理负载从 "按 API 牌价付费" 转向 "按自建成本付费"。

Akamai 的解决方案是近 30 年基础设施积累:覆盖 700 个城市、130 多个国家的分布式网络,4000 多个网络接入点,每秒 1000 Tbps 的内容交付能力。

在算力侧,Akamai Cloud 引入英伟达最新 Blackwell GPU,针对后训练场景选用 RTX PRO 6000;但张珂同时强调,GPU 并非唯一选择,许多场景下 CPU 同样可行且更省成本。

更关键的是,Akamai 与英伟达联合推出的 AI Grid 框架已率先落地,通过智能编排层动态判断模型运行位置、路由请求,把算力精准调度到最合适的节点,而非被动集中于远端数据中心。这套方案已在客户侧验证:专利检索服务商 GoVeda 先用 CPU 完成早期推理、后期切换 GPU 并逐步分布式部署,实现性能提升 30%、成本降低 20%;通信平台 SARV 将工作负载迁移至 Akamai 基础设施后,运营成本显著下降,同时保持了原有的响应速度与可靠性。

End

黄仁勋给行业画了一张很远的饼:Token 成本正以每年一个数量级的速度下降,未来会像水、电一样便宜。但对今天的企业而言,"便宜" 不等于 "可控"—— 当 Token 从训练时代的技术单位变成 Agent 时代的利润单位,竞争的焦点已经从 "谁用得多" 转向 "谁用得值"。

那些被烧掉的千万级 Token 里,藏着企业为 "看不见" 付出的效率税,也藏着攻击者虎视眈眈的新战场。Agent 时代的第一课,或许不是学会让 AI 干更多活,而是先学会看清、管住每一次调用花掉的每一分钱。

本文来源于DOIT传媒,文章内容仅供参考,不构成投资建议。

赞 ()

相关推荐

发表回复

评论列表

点击查看更多

    联系我们

    微信:百易小助手

    邮件:contact@doit.com.cn

    工作时间:周一至周五,9:30-18:30,节假日休息

    微信