Agent取代人类成Token消耗新主人,端侧AI迎拐点

南都N视频APP · 政商数据
原创2026-07-21 23:12

近日,2026世界人工智能大会(WAIC)圆满收官。去年,大家都在聊模型应用落地,不过,作为算力消耗、成本计价与产业竞争核心标尺的Token还未站到台前,但今年的大会首次将“Token经济”设为了核心议题,众多参展企业纷纷打出“Token(词元)工厂”的相关标签。

比如,清程极智打造了Token“前店后厂”模式;摩尔线程提出了模型训练工厂、词元生产工厂、智能体生产工厂三大“AI工厂”模式;新华三集团发布了图灵Token工厂解决方案......

Token话题热度飙升,和上半年以OpenClaw、Hermes为代表的“龙虾”智能体走红密切相关,随着智能体的逐步落地,Token调用量持续攀升。而在WAIC期间,南都记者也注意到了一个行业共识——Token的主要消耗方已经由人变为了Agent,需求的计算方式正在被改变。

随之受到关注的,则是Token的使用性价比问题。各家打造“Token工厂”的最终目的都指向降本提效,其中有的厂商更侧重模型层的优化,比如,PPIO派欧云通过调度和混合模型实现降本,而有的厂商则深耕算力侧,例如无问芯穹通过算力集群的灵活利用达成降本。

 

Token调用量激增背后,使用者正由人转向Agent

在WAIC期间的媒体沟通会上,PPIO联合创始人兼CEO姚欣拆解了Token爆发的双重核心驱动力,一是模型智能大幅提升,使用成本大幅下降,二是Agent成为主要Token消耗方。数据显示,以Hermes为代表的Agent应用已经超过人类聊天成为Openrouter上最大的Token消耗App,而在PPIO平台上,DeepSeek V4这样的Agent模型消耗远超其他Coding模型。

图片

摩尔线程创始人张建中同样在演讲时提到了Agent消耗Token这一洞察,“在今天的Agentic AI时代,消耗Token的数量增长了10倍、100倍,甚至是上千倍、上万倍,根本原因在于已经不是我们在用AI,而是我们的Agent在用AI。换句话说,我们的代理,我们的分身在使用大模型,其速度远远超出我们的想象”。

图片

曦望Sunrise董事长徐冰也在论坛上提到,“Token的主人正在换人。过去三年,Token是人买的、人看的;从今年开始,越来越多的Token,人都不会看一眼——那是Agent在规划、调用工具、写代码、自我检查时,机器烧给机器的”。

买单主体从人切换到Agent,改变了需求的计算方式。人消耗智能受注意力和工作时长的生理约束,而Agent实现了智能任务与人类时间的完全解耦——7×24小时在岗、可无限并行复制,未来数量有望达到数百亿,远超全球80亿人口。

不过,徐冰特别强调,“Agent数量超过人类只是表象,真正的经济拐点,是Agent的工作小时数超过人类的工作小时数”。推理需求由Agent数量、活跃时长、行动步骤、每步Token与验证重试倍数五个变量连乘决定,呈指数叠加式增长。

“2026年将是行业转型关键年,产业核心发力点是依托智能体放大AI能力、重构生产效率。”姚欣预判,未来用户只需输出核心需求,多智能体即可自主完成策划、采编、审核、调研全流程工作,通过自主研讨、方案迭代输出多版成果,而充足、高效的Token资源,将成为这一模式落地的核心底座。

 

Token成本受关注,各家从模型、算力侧探索降本

伴随Token调用量指数级激增,Token使用成本已然成为企业落地AI业务的核心痛点。清程极智展台工作人员向南都记者表示,本届大会中,绝大多数参展客户最关注的问题就是Token定价与使用成本,不过,普通用户尚未形成具象认知,难以直观衡量Token资费对应的实际生产价值。“比如说买5块钱的token能干多少事情,他们还不太能具像化理解。”

而为了实现降本,基础设施厂商正在积极布局Token工厂”。“算力底座+开源模型,以此实现规模化Token生产,这是我们之前对‘Token工厂’的定义。但今年我们新增了关键一环,不只是实现Token量产,更要提升Token生产、使用全链路效率,让同等数量的Token,可以承载更高难度的智能任务,能力提升后,才能承接更高价值需求,获取更高收益。”姚欣表示。

基于这一思考,PPIO派欧云此次在WAIC上推出了整套智能模型网关体系。据介绍,模型网关包含两款子功能,第一款核心能力在于帮企业节省不必要的Token开销。“现在不同模型能力、定价差异很大,对应要处理的任务也分不同难度,如果所有任务都统一调用高端贵价模型,成本会严重浪费,所以我们把调度能力下沉到模型层,搭建专属模型调度平台,根据任务难易程度匹配不同能力的模型,相当于一套全自动任务-模型匹配系统,实现成本优化”。

另一款子产品则负责拉高整体能力上限。“单一模型存在能力短板,我们通过多模型混合互补拉高整体性能。”而据综合测算,PPIO 智能模型网关可以将智能水平提升 20%,将成本降低 50%-60%。

图片

不同于PPIO在模型调度层面的优化,无问芯穹打造的“Token工厂”聚焦于算力资源分配,在WAIC期间,无问芯穹联合创始人CEO夏立雪披露了无问芯穹首创的新一代推理系统优化成果——跨集群异构PD分离架构(Prefill-RelayDecode-MainDecode, PDD)。

据夏立雪介绍,智能体推理需求的特征有“三极”,即上下文极长、交互轮次极多、缓存命中率极高,对吞吐、时延、缓存复用的要求,远高于传统对话场景。同时,从实测数据中能直观看到,不同芯片在Prefill(预填充)、Decode(解码)阶段的性能差异极大。而眼下,这些散落在不同地区的存量集群几乎都是同构的,且几乎每个集群都“偏科”。

无问芯穹方面通过让算力强的集群做Prefill任务,让显存带宽高的集群做Decode任务,换言之,让“偏科”的硬件只刷自己最擅长的题,来提升大模型推理系统效率。据无问芯穹方面实测显示,该架构在实现了首Token延迟(TTFT)降低 51.5% 的同时,单Token成本可降低37.5%。夏立雪判断,随着跨集群异构PD分离架构的规模化落地,推理成本依然有10倍的下降空间。

图片

端侧“拐点”到来,将二次引爆推理需求提升

云端推理之外,端侧推理需求正在攀升。徐冰在演讲中指出,当前,云端AI正从“野蛮生长”进入“高成本稳态”。全球云厂商投入数万亿美金Capex建 AI数据中心,Token账单已成为企业最需要关注的成本项。与此同时,端侧正在迎来算力跃升,内存扩容,智能密度提升三个关键拐点。

徐冰还提到,当前,清华大学“密度法则”揭示大模型能力密度每3.5个月翻番,如今还在提速,这预示一两年内200-300B模型可比肩当前云端旗舰。这意味着,用户目前每月花费上千元订阅的云端模型能力,未来可直接部署到终端设备上。

“如果推理成本能降低 90%,很多历史上不赚钱的应用场景将转变为可盈利的商业模型,进而带动推理需求和算力需求的爆发性增长”。徐冰强调。端侧AI的杀手级应用场景将集中在“数据不出端”的需求上,尤其是隐私敏感型任务,其天花板由内存容量和内存价格决定,而LPDDR方案正在持续推高这一天花板。推理成本的大幅下降,将让海量过去不经济的场景变为现实,这正是推理需求第二波爆发的引擎。 

值得一提的是,随着推理需求转向端侧,CPU也正重回“聚光灯”下。此芯科技长期聚焦在边端应用场景,其现场相关负责人告诉南都记者,今年智能体火爆之后,对于端侧CPU的要求更高了,“之前可能大部分时间花在云端计算上,但是智能体起来之后,80%的时间会在端侧,通过CPU去调用各种工具,只有20%在云端实际计算”。南都记者注意到,近期英特尔、AMD股价一直在上涨。

不过,AI需求爆发正带来持续的内存涨价,而谈及是否会对自身芯片价格有影响,此芯科技相关负责人表示,影响是会有的,之前云端算力卡把端侧产能全都吸过去了,不过,当前价格还算稳定。“我们的芯片支持的DDR(双倍速率同步动态随机存储器)种类比较宽泛,会验证很多类型的DDR,如果只支持一种类型的DDR,那么厂商受供应链波动的影响会很大”。

姚欣在接受群访时也提到了算力涨价的情况,其表示,今年和去年相比,Infra侧最大的变化是算力涨价,“一年前,因为只有人在使用,我们愁‘卖不掉’,但今天因为智能体能解决生产效率工作了,大量被消耗、使用,导致上游算力完全不够,算力太贵了。所以我们在挤压所有其他能够挤压的空间,算力调度做到极致、东数西算,去做更多模型推理加速优化,希望把模型变得更智能,希望定价提得更高,客户能够接受”。 


采写:南都N视频记者 朱可轩

编辑:甄芹

南都N视频,未经授权不得转载、授权联系方式
banquan@nandu.cc. 020-87006626