AI 推论支出首度超车训练,两招精算 Token 终结预算黑洞

人工智慧(AI)的成本结构正迎来重大转折。根据 Gartner 的最新观察,AI 的推论(Inference)支出正快速超越训练成本,成为企业 AI 预算的最大重担。主因在于 AI 应用正从单纯的聊天机器人,大举迈向执行複杂、多步骤任务的代理式工作流程(Agentic workflows)。这使得模型每次呼叫所消耗的 Token 数量急遽攀升,在按用量计费的模式下,直接冲击了企业的云端帐单。
数据显示了这波成本压力的规模:预计到 2028 年,基于代理式工作流程的 AI 推论成本将比目前暴增逾五倍;甚至连 AI 辅助写程式的开销,都可能超越一般软体开发者的年薪。Gartner 进一步预估,2026 年全球 AI 最佳化 IaaS 的支出中,推论费用将达到 233 亿美元,正式超车训练所需的 190 亿美元。未来推论支出的占比,更将从 2026 年的 55% 持续扩大至 2027 年的 59%。
面对庞大的开销,业界开始积极寻求突围之道。研究指出,代理式工作流程每执行一项任务,消耗的 Token 量是一般对话的 5 到 30 倍。更值得注意的是,高达 62% 的代理推论帐单,其实源自于重複传送的上下文──包含系统提示、工具定义与状态资讯。为此,技术圈开始高度聚焦于提示词快取(Prompt Caching)、提示词压缩,以及缩减重複背景资料等技术,力求大幅降低每次呼叫的 Token 浪费。

▲ AI 複杂度攀升速度大于 Token 成本的下降速度。(Source:Gartner)
除了依赖技术解方,企业在实务营运上也祭出多管齐下的控管策略。这包含:加强使用者的 AI 提示词精简训练、依据任务需求精準匹配合适的模型、以及设定用量上限与严密的追蹤机制。随着 AI 从一问一答的对话工具,进化为具备高度自主性的複杂代理系统,如何在强大效能与成本控制之间取得平衡,已成为所有企业导入 AI 时无法迴避的核心课题。
- [AI Costs②] Prompt Caching, Compression Emerge as Key to Cutting Token Costs
- Gartner: Worldwide AI Spending to Reach $2.67 Trillion in 2026
(首图来源:AI)