记者在2026世界人工智能大会暨人工智能全球治理高级别会议(WAIC 2026)上采访发现 ,随着智能体让词元消耗大幅攀升,降本增效成为众多企业的发力点 。从芯片到算电协同,从大模型到智能模型路由 ,每个环节都在为降低词元成本而发力。

当前,国内算力芯片创业市场上,张量处理单元(TPU)是热门赛道。在大规模纯张量AI训练或推理的场景下 ,最新代际TPU的能效、单位词元成本优于主流GPU产品 。
TPU芯片企业中昊芯英创始人杨龚轶凡表示,百万词元成本降到最低是当前优化的方向,因为高额算力成本已经制约AI商业化落地。公司新一代芯片的目标就是大幅压低单位词元成本,比上一代成本直接减半 ,后续迭代有望降到原有的十分之一。只有成本下探,各类AI应用才能规模化普及 。
算力中心的成本从源头决定词元成本。2026年政府工作报告中首次提及“算电协同 ”,对此 ,中科类脑董事长刘海峰告诉记者,算力基础设施全生命周期成本中,电力支出占比超20% ,是决定算力产业核心竞争力的关键变量。以1000P标准算力集群为例,年度总耗电量约2000万度,依托平台优化可节约20%用电量 ,即每年减少400万度电力开支,节约成本直接转化为经营毛利,大幅提升价格竞争力。
对于算电协同降本增效的路径 ,刘海峰表示,目前算电协同更多依靠物理空间靠近,未来重点是实现算力 、电力双向柔性联动调度 。例如通过统筹风电、光伏、储能多类型供电来源,动态测算不同时段最优供电成本结构 ,最大化绿电使用比例;同时基于分时电价 、风光发电实时波动,灵活迁移算力任务负载,主动错峰使用低价清洁能源 ,从源头压缩算力用电成本。
不少国产大模型在追求性能的同时,也在着力改善词元性价比。腾讯副总裁林松涛表示,混元HY3大模型以相对小的参数实现了比肩更大尺寸旗舰模型的能力 ,使用成本只有顶尖模型的百分之几,为企业的规模化应用提供了更加经济的选择 。
美团LongCat-2.0(龙猫)大模型在业内首次提出输入命中缓存不收费的模式。对此,美团相关负责人透露 ,典型智能体使用场景中,用户输入和输出比例约为150比1。经测算,针对输入部分的缓存词元采用不计费规则 ,用户的综合成本有望降低一个数量级 。
刚上线即引发关注的万亿参数旗舰模型Kimi K3,虽然单价不菲,却表现出了颇为不错的性价比。
大模型评测机构SuperCLUE发现,通过测算完成同样任务的成本开支 ,Kimi K3在任务得分比第二名高出18%的前提下,任务平均成本却低约16%。这意味着,国产旗舰模型的性价比在持续优化 。
对此 ,SuperCLUE创始人徐亮认为,Kimi K3在处理多轮交互复杂任务时,依托更强底层能力减少迭代轮次 ,叠加优异的上下文缓存命中率,综合调用开销优于预期。
由于不同大模型的能力和价格差别较大,“智能模型路由”也成为WAIC的热点。
派欧云创始人姚欣介绍称 ,此前智能模型路线仅做简单“请求转发”,新的智能模型路由在处理高价值、高风险或结果不确定的关键步骤时,不是只问一个模型 ,而是将问题同时分发给多个擅长此道的专家模型,通过交叉验证和融合生成最终答案 。同时智能路由会根据任务类型进行选择,比如简单问答用轻量模型,复杂推理用强模型 ,并压缩冗余上下文,复用之前的计算结果,设置预算护栏和失败回退机制。最终目标是用更经济的词元成本 ,完成同样质量的任务。
派欧云综合测算发现,其智能模型网关可以将智能水平提升20%,同时将成本降低50%到60%。
(文章来源:经济参考报)