![]()
文 / 梁添
来源 / 节点财经
过去几年,AI行业的主流叙事是一场基于Scaling Law的狂热竞赛。
数据中心的GPU堆积如山,模型参数轻松越过万亿大关,玩家们在算力、数据和算法的牌桌上疯狂加码。
一个极其现实的问题浮出水面,这些庞然大物,只能运行在数据中心,然而现实生活中,各种终端设备才是最贴近消费者的产品。
可惜,算力与应用之间,隔着一道物理鸿沟。
好在,一股去中心化的力量蓄势待发。
搭配了终端小模型的AI手机、AI PC、智能汽车、机器人乃至AI眼镜迎来了集体井喷。面壁智能CEO李大海将2026年定义为端侧AI商业化元年。Gartner预计,2026年全球AI PC出货量将占PC市场的半壁江山;Counterpoint也预测,具备生成式AI能力的智能手机将在同年拿下45%的全球份额。
新的产品分野正在成型,最顶尖的超级大脑依旧坐镇云端,而那些高频、低延迟、与个人隐私深度绑定的任务,正下沉到终端。
为什么模型开始离开云端?
![]()
云端AI与端侧AI的区别,简单概括为外包和内置。
大众熟知的DeepSeek、kimi、ChatGPT,大多发布的是参数量动辄数千亿、上万亿大模型。我们需要付费调用API key,哪怕免费的Chatbot也是模厂把模型封装为聊天机器人。推理过程并不是在本地完成,而是设备将需求发送至云端,数据中心的GPU集群完成计算后,再将结果传回。
而端侧AI,则小得多,参数量级通常只有几B,推理过程直接在终端本地离线完成,相当于设备有了一个本地部署的大脑。
端侧模型虽然没有云端大模型聪明,但轻量级+本地部署的特点,让端侧AI在成本、延迟与隐私上具备独有优势。
想象一个长期运行的AI Agent,它能帮你规划行程、整理会议记录、甚至回复邮件。方便是方便,但一次任务可能包含几十个步骤,若每一步都要在云端往返,累积的延迟将影响用户体验,持续燃烧的Token也会堆积为天文的算力成本。
更致命的是隐私。
当Agent真正进入PC和手机后,它触及的不再是互联网上的公共语料,而是用户的私人照片、账号权限、聊天内容。这些信息高度敏感。
数据到底要不要离开设备?这个大众广为关注的隐私问题,成为悬在云端模型厂商头上的达摩克利斯之剑。
或许你会说大模型都开源,直接本地部署不就可以了?这里要说明,大模型哪怕本地部署对算力有极高要求,是企业级玩家的专属,对C端消费者来说,本地小模型与云端大模型协同,才是兼顾能力、隐私与成本的现实方案。
这时候问题来了,都知道端侧ai方便,可为什么大模型兴起几年后,端侧ai的声量才起来呢,因为落地并不简单。
为什么偏偏现在挤进终端设备?
![]()
要把小模型塞进小小的智能设备并非易事。
模型都需要芯片支持计算、存储与通信,虽然现如今的数块GPU的算力能支持千亿万亿大模型推理运行,但要让芯片跑在狭小逼仄的C端设备上,给小模型做推理依然是个难题。
若芯片昂贵,虽能承载的模型聪明,但成本往往过高且功耗过大,物理空间逼仄的pc和手机难以承载,若芯片功耗达标,往往可能无法保障智能。
总体来看,端侧AI想要落地并且实现商业化,通常面临性能、功耗、成本的不可能三角。
好在过去几年底层硬件与算法的迭代,可以在不可能三角之间寻找到平衡点。
首先是算力结构的升级。
在端侧,跑得快还不够,如何降低数据读写带来的巨大功耗,是芯片厂商比拼的内功。NPU技术成熟,正成为消费电子的标配。比如,针对终端模型,高通、瑞芯微、华为等厂商已经开始针对推理场景进行极致优化,通过共享内存减少数据搬运,甚至专门为长上下文和MoE模型调整芯片架构,通过软硬一体,服务更多模厂。
其次是模型能力密度的跃升。
早期的小模型往往是人工智障的代名词,但现在,端侧模型也可以小身材大能量。厂商通过蒸馏提升小模型能力,量化降低模型存储与计算开销,稀疏注意力等技术进一步压缩长上下文推理成本。
清华大学与开源社区OpenBMB提出的密度定律指出,大模型的能力密度随时间呈指数增长,约每3.3至3.5个月翻一番,即每隔约一百天,只需一半参数量的模型即可达到当前最优性能。
以面壁智能开源的MiniCPM5-2B为例,仅2B参数便能在评测中领跑小模型赛道,甚至具备了调用工具和代码生成的能力。
最后是操作系统的底层重构。
如果端侧AI只停留在一个对话框里,它永远只是个玩具。Agent要真正发挥价值,必须拥有读取系统上下文、接管摄像头以及调用第三方APP的权限。
阶跃星辰的Step AOS、vivo的蓝心大模型,都在试图打通这层壁垒,将成千上万的操作系统的原子能力转化为AI可调用的工具。
芯片提供算力底座,模型拔高能力上限,操作系统开放执行权限,端侧AI的技术闭环,终于在当下正式合拢。
谁能吃到端侧AI的红利?
![]()
端侧AI不是单一产品,而是分布在芯片、模型、infra、终端。当AI能力从云端向终端下沉之后,中国端侧AI市场也开始出现不同的路线分化。
在《节点财经》看来,谁控制其中关键层,就能获得不同的议价权和分发权。表面上看,厂商们都在押注端侧AI。仔细瞧,它们并不是孤军奋战,只不过策略并不相同。
第一类是模型供应商。
这类公司的核心逻辑,是把模型做到足够小、足够强,并适配尽可能多的硬件平台。
面壁智能早在2023年就放弃千亿级云端基座模型,全面转向端侧,并提出“能力密度”概念。其MiniCPM系列持续沿着小参数、高能力方向迭代。9月7日开源的MiniCPM5-2B参数规模仅2B,主要面向手机、PC等终端本地部署,同时强化了Agent能力。
与手机或汽车厂商不同,面壁本身并不掌握终端,它希望扮演独立第三方模型供应商的角色,将同一套端侧模型能力部署到手机、汽车和机器人等不同设备。
目前,MiniCPM已经进入三星Galaxy AI相关端侧能力,汽车端智能座舱助手cpmGO也随长安马自达MAZDA EZ-60量产;在具身智能方向,MiniCPM-Robot则进入展厅导览、园区巡检等场景。
这类企业竞争力并不只是模型Benchmark,而在于能力密度、量化压缩、跨芯片适配和模型生态。它们要证明的是,一家独立模型公司也可以成为不同硬件厂商共同使用的AI能力供应商。
科大讯飞同样在推动小模型端侧化,但路径有所不同。
9月1日,科大讯飞开源星火X2.5-4B/1.7B两款端侧模型,支持最长100万Token上下文,并将重点放在AI办公等已有优势场景。
相比面壁试图成为横向模型供应商,讯飞更接近于用端侧模型强化自身在语音、办公和企业生产力领域的既有产品。
第二类是芯片玩家。
瑞芯微这类厂商主要提供 SoC、NPU 和配套工具链,服务手机、机器人等不同终端,其核心价值是把模型以可接受的功耗、成本和性能部署到硬件中。
与这种相对通用的芯片供应模式相比,地平线进一步向软件和场景纵深延伸。它不仅提供征程系列芯片,还拥有辅助驾驶系统、模型和软件栈,因此更接近软硬一体的计算平台。其竞争力不只来自芯片本身,而来自芯片、模型和算法的协同优化。
![]()
第三类是Agent入口型玩家。
比如,时下大热的豆包手机。
传统智能手机中,用户先打开APP,再完成打车、点餐、支付等任务;Agent时代,用户可能只需要一个自然语言指令,就能让AI在不同应用之间完成任务调用。
这也是豆包联合中兴努比亚持续推进AI手机的重要背景。在首代豆包手机努比亚M153之后,双方将方案从跨App操作进一步转向端侧MCP,希望让Agent更加深入地调用手机能力。第二代豆包手机NaviX Ultra试图通过语音Agent完成打车、点餐等任务,并增加视觉感知能力。
虽然现阶段可调用的第三方服务仍然有限,支付等高权限场景也受到安全约束,但其战略方向已经比较明确:手机只是载体,把模型装进手机,是字节争夺的Agent时代的C端入口的策略。
第四类是以阶跃星辰为代表的纵向整合玩家。
与面壁主要提供模型、豆包主要争夺入口不同,阶跃星辰希望进一步打通基座模型、Agent系统和硬件终端。
7月13日,阶跃星辰发布终端品牌STEPX及Agentic Phone STEPX Neo。与此同时,公司与千里科技、吉利在汽车领域展开合作,并推动Step AOS进入车端。
这意味着阶跃的目标并不只是把模型卖给设备厂商,而是希望从底层模型开始,一直延伸至Agent操作系统和终端产品。
它代表的是另一种端侧AI路线:通过纵向整合,尽量控制模型如何感知环境、如何调用工具,以及最终如何与手机、汽车等硬件结合。
以上路线都有一定技术门槛,让企业应接不暇,自己的业务用哪些芯片、用哪些模型,怎么和企业生态结合成为难题。因此市场上,衍生出交付型玩家。客户提需求,他们负责把这些东西组合成一套可交付的方案。
比如,在汽车这种对安全要求极高的场景,德赛西威可以根据车型价格、芯片算力和客户需求,决定哪些功能放在本地,哪些任务交给云端,并提供不同规格的模型和计算方案。
相比起大模型追求智能的上限,端侧AI这些问题更偏向工程优化,这决定了端侧产品到底是一个用来在发布会上炫技的Demo,还是真正能走进生活的产品。
过去三年,云端证明了AI能有多聪明,但最聪明未必与生活场景最接近,接下来端侧要证明的,是如何在智能、成本、功耗上把握一个平衡点,让AI真正成为设备的一部分。

发表评论 取消回复