最近看到一则新闻,“国行iPhone即将牵手阿里千问大模型,上线端侧原生AI能力”,点进去一看,网信部公布的消息显示,国内主流手机厂商基本都做了端侧大模型备案:

也就是说,以后移动设备(手机、平板甚至笔记本电脑)都会内置一个轻量级大模型(可能10B以内?),为系统、或APP提供原生AI能力支持,大部分时候可能不需要你设备联网就能获得这种能力,也就是大模型会直接运行在你设备芯片上。
半年前我在一个微信群里跟人讨论时,猜测未来轻量级大模型在端侧部署应用是大模型一个比较好的发展方向。原因有以下几点:
- 现在大模型服务提供商(OpenAI、Google、Claude、kimi、阿里等)提供的在线访问方式存在一些问题无法避免:一是网络访问延时高,尤其对于多模态模型,输入数据量太大,对于有些场合实时性达不到;二是数据隐私问题,需要联网,小白都知道存在的问题,虽然国内用户可能不太在意;三是Token费用,每调用一次就要给人家付费,现在很多智能APP比如豆包要开始收费,否则找不到盈利来源。
- 现在大模型进步速度非常快,一年前我们团队在测评Qwen2-vl 2B这个参数量的模型效果时,得出的结论是无法用于实际项目。但是今年在测试Qwen3-vl 2B的效果时,结果出乎我们意料。行业有个观点:每过100天,模型单位参数量具备的“智力”翻一倍,今天10B参数量的模型能力,100天后,5B的模型就可以达到类似效果,这个观点现阶段来看,还是成立的。你要知道,对于2B这个参数规模的大模型来讲,完全可以跑在5~10T算力的移动设备上,而这种设备成本可能也就千把块钱。
- 轻量级大模型微调、二次训练的可操作性更高。对于某些小场景/垂类领域任务,大参数模型效果反而没有微调后的小参数模型效果好,很多时候,在端侧设备上不需要满血版大模型的功能。反而自己弄一些数据,微调1~2B这种轻量级大模型更能解决实际问题。
未来不久,大模型可能会像手机上的GPS、陀螺仪一样,成为移动设备的必备组件资源,系统或者APP可以申请访问这种资源,为APP功能提供原生AI能力。就像你在使用有些APP的时候,它弹出“是否允许APP访问位置”的对话框一样,来申请访问本设备的AI资源。

除了手机这种ToC消费级市场之外,对于一些ToB市场,端侧轻量级大模型同样是未来发展趋势,AI原生能力下沉到前端/边缘侧,解决大模型推理实时性、推理成本等问题,同时结合使用“端/云”协同方案可以弥补部分场景中端侧算力不足缺陷(端侧轻量级大模型+云端重量级模型)。