AI 愈强却愈烧钱:代理式工作流是 Token 狂飙最大兇手,企业面临预算失控危机

AI 产业出现日益明显的矛盾:模型性能持续进步、单位成本不断下降,但企业 AI 帐单快速膨胀。最新观察,问题核心不仅模型推理本身,更在日益普及的代理式工作流(agentic workflows)。这种流程执行多步骤任务时,会反覆读取上下文、呼叫工具并重覆测试,导致 Token 消耗量呈倍数甚至数十倍增长。

简单问答可能仅需数百到数千个 Token,但看似平常的工作如串接 Excel、CRM 与网路搜寻製作报告,累积消耗量可能高达数十万甚至数百万个 Token。由于模型每次互动时都必须重新处理整段对话与档案,对话长度与步骤越多,成本与回应时间就越容易失控。如每 15 分钟执行一次的製作榜单,月费可能从数十美元迅速攀升至数千美元;更複杂的多阶段报告,单一任务成本甚至可能高达数万美元。

这股压力已迫使 Anthropic、OpenAI、微软等 4 月转向按用量计费,并收紧固定方案 Token 上限。对大型企业而言,AI 支出不再是技术部门议题,也成为财务部门必须严密监控的成本项目。Uber、微软、亚马逊、沃尔玛等都开始控制 AI 开支,因大量部署代理后,AI 支出甚至高过人事成本。

补充资料显示,这并非个案,而是企业现在普遍管理难题。麦肯锡(McKinsey)调查,93% 企业 AI 团队已超过预算,且代理式 AI 支出,60% 来自反覆修正与重写输出。另有研究提到,儘管 Token 价格两年中大幅下滑,但企业 AI 帐单仍持续升高,主因就是用量与工作流程複杂度成长速度更快。部分企业甚至几个月内就花光全年 AI 预算,被迫紧急重新协商合约或追加资金。

业界开始转向Tokenomics(Token 经济学)与成本管理,包括採 Prompt 快取(Prompt Caching)、模型路由(Model Routing)、批次处理(Batching)、语意快取(Semantic Caching)、缩短上下文窗口,以及将简单任务交给较小模型,大型模型留给高难度事项。专家认为,若企业缺乏可视化与成本归因机制,AI 规模化将不只提高效率,而是更难预测且更难控制的成本支出飙升。

  • The enduring paradox of the AI economy — models get better and more efficient, yet costs can still easily spiral out of control
  • Rising AI bills push Singapore companies to chase ROI over ‘tokenmaxxing’
  • AI Is Getting Cheaper. So Why Is Your AI Bill Going Up?
  • When AI budgets balloon: What enterprises are learning in 2026
  • Taming the Token Bill: Engineering Cost-Efficient Agentic AI
  • AI meter is running. India’s IT clients are rethinking their models

(首图来源:AI)

发布于 2026-07-21 14:48
收藏
1
上一篇:甲骨文资料中心电力部署延宕?Bloom Energy 重挫 下一篇:外资上修 CCL 目标价助攻多头!指数挑战 43,000 点反压,紧盯 AI 终端与抗跌业绩黑马