近日,2026世界人工智能大会(WAIC)圆满收官。去年,大都在聊模型应用落地昆明万能胶,不过,作为力消耗、成本计价与产业竞争核心标尺的Token还未站到台前,但今年的大会次将“Token经济”设为了核心议题,众多参展企业纷纷出“Token(词元)工厂”的相关标签。
比如,清程智造了Token“前店后厂”模式;摩尔线程提出了模型训练工厂、词元生产工厂、智能体生产工厂三大“AI工厂”模式;新华三集团发布了图灵Token工厂解决案......
Token话题热度飙升,和上半年以OpenClaw、Hermes为代表的“龙虾”智能体走红密切相关,随着智能体的逐步落地,Token调用量持续攀升。而在WAIC期间,南都记者也注意到了个行业共识——Token的主要消耗已经由人变为了Agent,需求的计式正在被改变。
随之受到关注的,则是Token的使用价比问题。各造“Token工厂”的终目的都指向降本提,其中有的厂商侧重模型层的优化,比如,PPIO派欧云通过调度和混模型实现降本,而有的厂商则耕力侧,例如问芯穹通过力集群的灵活利用达成降本。
Token调用量激增背后,使用者正由人转向Agent
在WAIC期间的媒体沟通会上,PPIO联创始人兼CEO姚欣拆解了Token爆发的双重核心驱动力,是模型智能大幅提升,使用成本大幅下降,二是Agent成为主要Token消耗。数据显示,以Hermes为代表的Agent应用已经过人类聊天成为Openrouter上大的Token消耗App,而在PPIO平台上,DeepSeek V4这样的Agent模型消耗远其他Coding模型。
摩尔线程创始人张建中同样在演讲时提到了Agent消耗Token这洞察,“在今天的Agentic AI时代,消耗Token的数量增长了10倍、100倍,甚至是上千倍、上万倍,根本原因在于已经不是我们在用AI,而是我们的Agent在用AI。换句话说,我们的代理,我们的分身在使用大模型,其速度远远出我们的想象”。
曦望Sunrise董事长徐冰也在论坛上提到,“Token的主人正在换人。过去三年,Token是人买的、人看的;从今年开始,越来越多的Token,人都不会看眼——那是Agent在规划、调用工具、写代码、自我检查时,机器给机器的”。
买单主体从人切换到Agent,改变了需求的计式。人消耗智能受注意力和工作时长的生理约束,而Agent实现了智能任务与人类时间的解耦——7×24小时在岗、可限并行复制,未来数量有望达到数百亿,远全球80亿人口。
不过,徐冰特别强调,“Agent数量过人类只是表象,真正的经济拐点昆明万能胶,是Agent的工作小时数过人类的工作小时数”。理需求由Agent数量、活跃时长、行动步骤、每步Token与验证重试倍数五个变量连乘决定,呈指数叠加式增长。
“2026年将是行业转型关键年,产业核心发力点是依托智能体放大AI能力、重构生产率。”姚欣预判,未来用户只需输出核心需求,多智能体即可自主完成策划、采编、审核、调研全流程工作,通过自主研讨、案迭代输出多版成果,而充足、的Token资源,将成为这模式落地的核心底座。
Token成本受关注,各从模型、力侧探索降本
伴随Token调用量指数激增,Token使用成本已然成为企业落地AI业务的核心痛点。清程智展台工作人员向南都记者表示,本届大会中,大多数参展客户关注的问题就是Token定价与使用成本,不过,普通用户尚未形成具象认知,难以直观衡量Token资费对应的实际生产价值。“比如说买5块钱的token能干多少事情,他们还不太能具像化理解。”
而为了实现降本,基础设施厂商正在积布局“Token工厂”。“力底座+开源模型,以此实现规模化Token生产,这是我们之前对‘Token工厂’的定义。但今年我们新增了关键环,不只是实现Token量产,要提升Token生产、使用全链路率,让同等数量的Token,可以承载难度的智能任务,能力提升后,才能承接价值需求,获取收益。”姚欣表示。
基于这思考,PPIO派欧云此次在WAIC上出了整套智能模型网关体系。据介绍,模型网关包含两款子,款核心能力在于帮企业节省不要的Token开销。“现在不同模型能力、定价差异很大,对应要处理的任务也分不同难度,如果所有任务都统调用端贵价模型,成本会严重浪费,所以我们把调度能力下沉到模型层,搭建属模型调度平台,根据任务难易程度匹配不同能力的模型,相当于套全自动任务-模型匹配系统,实现成本优化”。
另款子产品则负责拉整体能力上限。“单模型存在能力短板,万能胶厂家我们通过多模型混互补拉整体能。”而据综测,PPIO 智能模型网关可以将智能水平提升 20,将成本降低 50-60。
不同于PPIO在模型调度层面的优化,问芯穹造的“Token工厂”聚焦于力资源分配,在WAIC期间,问芯穹联创始人兼CEO夏立雪披露了问芯穹创的新代理系统优化成果——跨集群异构PD分离架构(Prefill-RelayDecode-MainDecode, PDD)。
据夏立雪介绍,智能体理需求的特征有“三”,即上下文长、交互轮次多、缓存命中率,对吞吐、时延、缓存复用的要求,远于传统对话场景。同时,从实测数据中能直观看到,不同芯片在Prefill(预填充)、Decode(解码)阶段的能差异大。而眼下,这些散落在不同地区的存量集群几乎都是同构的,且几乎每个集群都“偏科”。
问芯穹面通过让力强的集群做Prefill任务,让显存带宽的集群做Decode任务,换言之,让“偏科”的硬件只刷自己擅长的题,来提升大模型理系统率。据问芯穹面实测显示,该架构在实现了Token延迟(TTFT)降低 51.5 的同时,单Token成本可降低37.5。夏立雪判断,随着跨集群异构PD分离架构的规模化落地,理成本依然有10倍的下降空间。
端侧“拐点”到来,将二次引爆理需求提升
云端理之外,端侧理需求正在攀升。徐冰在演讲中指出,当前,云端AI正从“野蛮生长”进入“成本稳态”。全球云厂商投入数万亿美金Capex建 AI数据中心,Token账单已成为企业需要关注的成本项。与此同时,端侧正在迎来力跃升,内存扩容,智能密度提升三个关键拐点。
徐冰还提到,当前,清华大学“密度法则”揭示大模型能力密度每3.5个月翻番,如今还在提速,这预示两年内200-300B模型可比肩当前云端旗舰。这意味着,用户目前每月花费上千元订阅的云端模型能力,未来可直接部署到终端设备上。
“如果理成本能降低 90,很多历史上不赚钱的应用场景将转变为可盈利的商业模型,进而带动理需求和力需求的爆发增长”。徐冰强调。端侧AI的手应用场景将集中在“数据不出端”的需求上,尤其是隐私敏感型任务,其天花板由内存容量和内存价格决定,而LPDDR案正在持续这天花板。理成本的大幅下降,将让海量过去不经济的场景变为现实,这正是理需求二波爆发的引擎。
值得提的是,随着理需求转向端侧,CPU也正重回“聚光灯”下。此芯科技长期聚焦在边端应用场景,其现场相关负责人告诉南都记者,今年智能体火爆之后,对于端侧CPU的要求了,“之前可能大部分时间花在云端计上,但是智能体起来之后,80的时间会在端侧,通过CPU去调用各种工具,只有20在云端实际计”。南都记者注意到,近期英特尔、AMD股价直在上涨。
不过,AI需求爆发正带来持续的内存涨价,而谈及是否会对自身芯片价格有影响,此芯科技相关负责人表示,影响是会有的,之前云端力卡把端侧产能全都吸过去了,不过,当前价格还稳定。“我们的芯片支持的DDR(双倍速率同步动态随机存储器)种类比较宽泛,会验证很多类型的DDR,如果只支持种类型的DDR,那么厂商受供应链波动的影响会很大”。
姚欣在接受群访时也提到了力涨价的情况,其表示,今年和去年相比,Infra侧大的变化是力涨价,“年前,因为只有人在使用,我们愁‘不掉’,但今天因为智能体能解决生产率工作了,大量被消耗、使用,致上游力不够,力太贵了。所以我们在挤压所有其他能够挤压的空间,力调度做到致、东数西,去做多模型理加速优化,希望把模型变得智能,希望定价提得,客户能够接受”。
采写:南都N记者 朱可轩 相关词条:管道保温 塑料管材生产线 锚索 玻璃棉毡 PVC管道管件粘结胶
奥力斯 泡沫板橡塑板专用胶报价 联系人:王经理 手机:18232851235(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。




