token告急,已成为当下ai创业者最紧迫的焦虑。
7月的上海世博展览馆,2026世界人工智能大会(以下简称WAIC 2026)现场,除了穿梭不息的智能机器人、整齐排列的高密度超节点机柜,记者听到频率最高的词,仍是“Token”。
一位来自杨浦的独立开发者站在展馆入口处,向《IT时报》记者细算成本账:他开发的AI短剧生成工具,每月在Seedance平台上的API调用支出就超过千元。“真正动手写代码的同行,极少选用低价方案。”他坦言,无论中外模型,只要效果稳定、响应可靠,创业者普遍选择硬着头皮买单。
就在开发者频频抱怨Token价格高企之际,展馆另一侧,厂商们正热烈探讨如何将Token打造为“工厂”——
规模化生产、标准化交付、像流水线一样高效输出Token。
当Token供给频频亮起红灯,“Token工厂”正加速驶入现实。
启明创投主管合伙人周志峰在WAIC“启明创投·创业与投资论坛——从算力原点到应用落地的进化征程”上直言,AI产业所展现的“速度、强度与烈度”,是人类历经数百年工业革命与信息革命都未曾见过的巅峰水准。他还援引全球最大AI聚合平台OpenRouter的最新数据指出:美国企业采用中国大模型构建AI应用的Token占比,已从2025年上半年的4.5%跃升至2026年年中的46%;自2026年2月8日起,美国公司每周调用中国AI模型的比例持续稳定在30%以上。“这意味着,近半数美国企业的Token运行在中国模型之上”。
Token,正是贯穿这一演进路径的核心“燃料”。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

展馆里的高频词
什么是Token工厂?简言之,就是把底层算力、模型能力与推理引擎整合封装为标准化的Token服务,按需计费、按量交付。它不再售卖硬件或原始算力,而是直接出售“可衡量的智能产出”——你付多少,就获得多少Token,用完即止。
“客户只关心结果,那我就把结果打包好交给他。”在WAIC 2026另一主会场——张江科学会堂,天津融科联创信息技术有限公司的一位工程师向记者介绍,公司正积极筹备向Token工厂模式转型,“既要卖服务器,也要卖Token,这是当前不可逆的趋势”。他解释,大量中小企业既不了解算力调度逻辑,也无意深究技术架构,“客户可能连GPU和CPU的区别都说不清,但一定清楚自己需要多少Token。”
于是,一种“开箱即用”的解决方案应运而生——一台预装模型、推理框架与计费系统的整机服务器,通电即可上线,全程按Token计费。“面向中小客户,一台起步,”他说,“最多配两三台足矣”。
不仅硬件厂商加速入场,“Token工厂”概念正全面渗透整个算力生态链。清华系企业清程极智在展区推出Token“前店后厂”架构:后厂为统一调度的算力集群,前店则是面向用户的Token零售终端;PPIO正式发布面向Agent时代的“智能Token工厂”;范式智能则将展台整体设计为“AI 2.0 Token工厂”全景沙盘,其创始人戴文渊在采访中透露,公司2026年一季度的Token营收已超越2025全年总和。
这种模式为何令人趋之若鹜?戴文渊在大会期间给出一组测算:若集群资源利用率接近极限,Token工厂的毛利率有望达到70%~80%。
周志峰也在演讲中作出更宏观的判断:未来12至24个月内,AI应用的商业模式将加速告别互联网时代的Freemium(免费+增值)范式,转向以实际成果与商业价值为锚点的定价逻辑。
与此同时,曾被业内喻为“AI水电煤”的Token计费方式,本身也正在发生深刻迁移——越来越多AI产品悄然将价签上的计量单位,由“Token”替换为“任务完成数”,甚至细化为“有效交付件”。衡量AI企业成败的核心指标,正从用户体量转向“单位智能成本所能撬动的真实商业回报”。
该趋势已在多个垂直领域落地:Zendesk于2025年初上线AI客服新定价体系,按“成功闭环的工单数量”收费,而非传统按座席席位计价;Intercom将AI助手Fin的资费标准绑定在“自动解决率”上;Salesforce的Agentforce平台直接以“单次AI对话”为计费单元;法律科技公司Harvey则按“高质量完成的法律研究任务”进行结算。
Token仍未实现统一定价
尽管“Token工厂”已成为行业热词,但至今尚无公认的行业标准。此处的“标准”,特指涵盖Token生产、交付、质量评估、计费规则及SLA保障在内的全链路规范体系。
并非所有Token等价。中国工程院院士郑纬民在商汤主办的“算创·无限——Agentic时代AI基础设施创新发展论坛”上强调,Token的实际商业价值,取决于首字延迟、生成吞吐、并发承载能力与服务稳定性四大核心维度。不同业务场景对服务质量要求各异,唯有高规格、高可靠性的Token,才能支撑复杂智能体的大规模商用。
“行业普遍存在模型参数虚标、算力质量不透明、计费方式粗放等问题——压缩模型沿用原型号报价、节点缓存命中率波动显著,致使同等算力调用成本差异巨大。”山海引擎COO彭璐向《IT时报》记者坦言,“各家套餐定价千差万别,目前确实无法达成统一标准”。
在张江科学会堂展区,博思芯宇展台醒目展示一张“Token成本拆解图”:单位Token成本 = Token总成本 ÷ 有效Token产出。其中,Token总成本由三部分构成——CAPEX(算力设备折旧)、OPEX(电费、散热、运维等日常开支)以及有效产出保障成本(含故障预警、容错调度等)。这套公式,意在帮算力服务商厘清每一笔投入的真实效益。

启明创投亦在论坛同步发布《2026 AI十大展望》,将“安全可信性”“产品实效性”与“Token成本”并列为影响企业AI规模化落地的三大决定性因素。在周志峰看来,AI基础设施的竞争已迈入系统级阶段——“芯片、互联架构、散热方案、供电系统等关键环节均纳入竞争维度,未来两年内,基于新型架构的算力芯片及超节点大集群有望涌现,目标直指低成本、高效率的Token量产能力”。
Token炼就“新石油”
Token工厂,并非凭空构想,而是被现实倒逼出的必然选择。
在H2算力展区,记者偶遇一位正咨询Token工厂解决方案的医疗AI创业者。他专注医学影像分析,日均处理海量CT影像,上月仅API调用费用就高达万元,“专程来大会找更优性价比的Token方案”,他坦言。
Token消耗量,早已膨胀至令人震惊的规模。
周志峰在论坛披露,中国大模型日均Token消耗量,自2024年1月起已飙升超千倍。数据显示,截至2026年3月,国内日均Token调用量已从2024年初约1000亿激增至140万亿。然而,阶跃星辰联合创始人兼CTO朱亦博在启明创投论坛上指出,在Token需求爆发式增长的同时,算力供给增幅却相对滞后,这进一步凸显AI基础设施创新的战略价值。面向Agent时代,行业不能仅依赖算力堆叠,更需通过模型、系统与芯片的深度协同设计,持续提升单位算力的智能产出效率与任务交付精度。“倘若Token消耗继续翻倍,叠加模型参数持续膨胀,对Infra的系统性压力将持续加剧。”

供需之间,仍横亘着结构性失衡:一边是创业者高呼“不够用、太贵”,另一边是算力厂商感叹“难盈利、难跑通”。这道鸿沟,恰是Token工厂试图弥合的关键缝隙。
一位深耕企业级智能体落地的创业者告诉《IT时报》记者,今年团队为客户部署智能体项目时,客户最关注的问题已从“能做什么”转变为“Token要花多少钱”,“过去谈AI,大家兴奋于能力边界;如今热潮退去,所有人开始精打细算”。
大模型领域的“杰文斯悖论”仍在延续——Token单价持续下探,但整体需求规模却呈指数级扩张,算力总支出仍在攀升。
WAIC 2026上,Token工厂正从概念演示迈向实体交付。谁能率先打通Token这条“新石油”的炼化全链条,谁就更有可能成为AI时代的最大赢家。
图片/ IT时报 采访对象
本文来自微信公众号 “IT时报”(ID:vittimes),作者:毛宇,36氪经授权发布。

















