7月17日至20日,世界人工智能大会(WAIC)在上海举行。高温与阵雨没有阻挡观众的热情,记者两度收到“世博展览馆人流集中,排队入场耗时较长”的短信。展览馆内,AI与机器人行业的从业者、投资人,乃至创业者、求职者四天时间内被高密度“压缩”在一起,记者看到有创业者拉着行李箱站在熙熙攘攘的人群旁,用老旧的笔记本亮出“寻找一起创业的小伙伴”的标语。

过去一年里,经历了Claude崛起、龙虾OpenClaw“破圈”后对市场的教育,智能体概念已深入人心,伴随而来的热词则是因智能体“烧钱”而引发关注的付费计量单位Token(词元)。这是AI大模型转向智能体,切实代替人类工作,同时Token消耗暴增的一年。这给参展的企业、机构带来了哪些影响?

这一篇观察,新京报AI研究院将主要围绕AI与智能体、算力展开。



7月18日,世博展览馆H1展厅门外拥挤的人群。 新京报贝壳财经记者 罗亦丹 摄

性能参数的人变少了,智能体能不能干活最重要

走进WAIC展馆,一个直观的变化是:以AI大模型为主题的H1展厅里,很少还有展商以“我们的模型有多少参数”作为卖点,取而代之的是一个更务实的问题——AI Agent能不能在具体场景中真正代替人类完成任务?

本次展会出现了不少外国面孔,百度展台上,来自巴基斯坦,在中国求学14年的外贸公司经理阿里告诉记者,自己对本次WAIC展会印象最深的特点是“有用”,“中国的AI和机器人不是放那里为了好看,还能帮人类。一楼展厅有许多AI产品,比如这个百度搭子,我有一些工作在电脑上没有完成,在手机上告诉它要做什么,它能给你做得很清楚。而二楼展厅的机器狗,一些人过不去的地方它们却可以过去。”

展台工作人员告诉记者,“那些看起来不大,但在真实工作里高频、琐碎、耗时的任务,最适合智能体接手。所以在应用中,百度搭子覆盖的场景不只是做PPT这种标准化办公任务,还包括工作流里大量细小但真实的环节,比如检查开会材料里哪些链接无法访问。”

在B端,智能体要真正进入企业的工作流,远比在展台演示复杂。容联云产研中心副总经理唐兴才告诉贝壳财经记者,早先他认为智能体要适应企业内部的固有流程,但在推进的过程中,他发现人需要适应现在智能体的工作方式才能发挥最大效率。

容联云从四年前就开始进行AI客服落地的探索,“之前该场景需要座席自己思考、关注客户内容,而现在用户进线的时候,我们的智能体可以进行洞察,乃至于给出回答建议。过去,座席大量背话术是很重要的工作,这其实就是背企业的知识库。现在智能体把所有的企业的知识库和信息全都掌握,座席的作用更偏向于审判智能体给出建议是不是合适,然后进行使用、确认。座席变得更像小模型时代的训练师,确认审核这个动作正在调教模型变得越来越聪明。”

那么,同样一个工作,使用智能体和人工的成本对比到底是多少?

唐兴才给出了明确答案——人工座席每天工作8小时,需要培训,并且面临流失风险,每天电话大约在150到300就已经饱和了,成本约为5000-8000元。而智能体处理方案可以24小时工作,每天处理话务量和任务量1万以上,并且它的服务标准非常统一,不会有情绪问题和个人差异化,成本约为2000-3000元。能力上,智能体达不到优秀人员的水平,但可以达到合格水平,“这使得它的边际成本非常低。”

AI智能体的“落地”与“实用性”在世博展览馆的H4展馆得到了更好的体现,这个区域里70%的企业成立不足3年,有很多是“AI native(AI原生)”企业,从创业伊始就以AI能力为核心,也正因如此,这些企业更看重AI实际解决问题的能力,是科研成果转化的最佳实践者,对成本与落地也更加敏感。

一个典型的例子来自百型智能,记者走到这家公司的展位前,发现创始人韩美正在和看上去颇为年轻的公司员工们自拍。韩美此前在阿里巴巴做出海业务,有着20多年的B2B跨境经验,而公司主力AI研发人员此前研究的领域是“图论”,行业经验与技术结合后,百型智能在2024年已是国内第一批做单智能体Agent的公司,拥有中国首个备案的外贸垂类大模型,在“用AI帮助国内企业出海找客户”这一痛点上得到了落地。


百型智能创始人韩美。 受访者供图

韩美对贝壳财经记者直言,目前公司的现金流一直很稳定,且客户多为中小企业,“我们选择做难而正确的事,对中小企业收费也不太贵,按结果收费,目前我们的智能体已经服务了1000多家企业出海。新推出的企业本体OntoZ,让群智能体覆盖客户更多Lead2Cash工作流同时成为数据入口,主动沉淀数据资产,实现高频反馈下的交付自优化。”当被问及服务的企业里“哪个行业出海最多”时,韩美坦言机器人、3C数码等中国产品最受海外欢迎,“带电带智能带软件的出海势头最好。”

客户从人转向智能体,如何节省Token?

另一方面,智能体的流行也让Token消耗量剧增,这一趋势从年初的龙虾OpenClaw热潮开始被人所重视,之后几乎成为了行业共识。

那么问题来了:当你确定Token消耗将巨量增加时,如何才能抓住这一机遇?WAIC现场,多家芯片以及AI基础设施厂商给出了答案,并且解决方案“八仙过海各显神通”。

在H2算力主题展区,记者看到了多家芯片公司展示的黑色集装箱一般的巨型机柜,展馆里不少算力厂商推出了卡数各异的“超节点”产品。


WAIC展馆内展示的磐久AL128超节点服务器。 新京报贝壳财经记者 罗亦丹 摄

壁仞科技AI框架架构副总裁丁云帆告诉记者,当前AI发展面临三大核心挑战:模型参数从千亿迈向数万亿(超大参数)、Agent等应用场景要求百万级上下文长度(超长文本)、推理和训练都需要成千上万张GPU协同工作(超大集群)。仅凭单张 GPU 的算力性能,已难以独立承载上述复杂任务。在此背景下,如何实现海量GPU高效协同运行,使之如同一台一体化超级计算机开展工作,正是超节点架构着力破解的核心难题。

不过,当前主流的电互连超节点方案正面临规模扩展的物理极限。随着GPU算力持续增长,互连带宽需求将超过1TB/s,端口速率将达到224Gbps,而铜缆电信号在3米内就会严重衰减。光互连成为突破这一瓶颈的必然选择。因此,壁仞科技在WAIC期间推出了下一代NPO光互连、分布式解耦架构超节点方案。

“异构”也是关键词之一。

从前“AI四小龙”时代一直坚挺至今,并在上海“主场作战”的商汤此次带来了商汤大装置实现多项关键技术突破的消息,如依托异构混合推理,商汤大装置实现主流国产芯片MFU(Model FLOPs Utilization)提升85%到152%,整体推理性价比达到英伟达H系列的1.25倍。

商汤科技董事长兼CEO徐立表示,谁能以更低的成本,更高的效率,更稳定的供给,供给高质量的Token资源,谁就能够推动AI时代的新的繁荣。


无问芯穹联合创始人兼CEO夏立雪发表演讲。 受访者供图

无问芯穹联合创始人兼CEO夏立雪在WAIC现场披露了无问芯穹首创的跨集群异构PD分离架构,他认为“计算需求在指数级攀升,今天,仅依靠产能的线性增长去堆叠算力,已经远远无法弥合供需之间持续扩大的缺口。”

夏立雪对此解释称,智能体推理上下文极长、交互轮次极多、缓存命中率极高,对吞吐、时延、缓存复用的要求,远高于传统对话场景,不同芯片在预填充(Prefill)和解码(Decode)两个阶段,性能表现差异很大,而目前各地已有的存量算力集群基本都是同构设计,普遍各有侧重、存在“偏科”,而新架构可以让“偏科”的硬件只刷自己最擅长的题,可以极大提升大模型推理系统效率。

相比架构的改变,PPIO创始人姚欣则更强调客户的变化,他认为“智能体时代最重要的变化,就是云的第一客户从人变成了智能体”。

基于此,他在WAIC上宣布打造“面向智能体时代”的Token智能工厂,以及打造“智能体为第一客户”的Agentic Cloud。其中前者旨在帮助企业避免Token浪费,后者则是一个为智能体打造的云服务体系。

在Token生产商眼中,智能体已经逐步取代人类成为了Token的“第一大用户”,这带来了商业上的改变,对AI基础设施提出了更高要求,也给国产算力发展创造了全新的机遇。

可以预见,随着智能体应用进一步普及,Token的供需与效率还将持续重塑算力产业的格局。而所有技术迭代的最终指向,都是让AI以更低的成本、更稳的姿态,真正成为千行百业的生产工具。这趟由技术驱动的产业列车,刚刚驶入最具想象力的区段。


记者联系邮箱:luoyidan@xjbnews.com

新京报AI研究院 罗亦丹

编辑 杨娟娟

校对 柳宝庆