什么是端侧模型?
端侧模型(On-Device Model)指直接部署在手机、PC、汽车座舱、智能眼镜等终端设备上、并在本地芯片完成计算的 AI 模型。与我们常用的 DeepSeek、豆包、Kimi 这类云端大模型不同,端侧模型的推理过程不需要把数据发往服务器,而是完全在设备的 CPU、GPU 或专用 NPU(神经网络处理单元)上完成。
一句话理解:端侧模型 = 把大模型“瘦身”后装进手机、汽车等设备,让 AI 在本地离线工作。
它通常由大模型经过“小型化”改造而来:参数量从千亿级压缩到几十亿甚至几亿级,再针对终端芯片深度优化,是这两年手机 AI 功能爆发式落地的技术底座。
端侧模型是怎么运作的?
把大模型“装进”手机的三板斧
云端旗舰大模型动辄数千亿参数、需要数百 GB 显存,普通设备根本装不下。端侧方案的核心思路是“把模型做小”,主流手段有三类:
- 模型量化:把模型中的高精度数值(如 32 位浮点数)压缩成 8 位甚至 4 位整数,体积缩小数倍、速度更快,能力损失通常很小;
- 知识蒸馏:用一个大模型当“老师”带出“学生”小模型,让小模型学到老师的主要能力,参数量却小几个数量级;
- 剪枝与稀疏化:删掉网络中不重要的连接,只保留对结果贡献最大的“主干”部分。
| 对比维度 | 端侧模型 | 云端大模型 |
|---|---|---|
| 部署位置 | 手机、PC、汽车等本地终端 | 数据中心服务器 |
| 参数规模 | 通常 1B—10B | 数百亿至上万亿 |
| 响应延迟 | 毫秒级,离线也可用 | 依赖网络质量 |
| 隐私安全 | 数据不出设备 | 数据需上传云端 |
| 能力上限 | 受设备算力限制 | 更强、知识更全 |
| 典型代表 | MiniCPM、GLM-Edge | DeepSeek-V3、Kimi |
端云协同:单打不如组队
实际产品大多采用端云协同架构:简单高频的任务(相册搜索、通话摘要、实时字幕)由端侧模型在本地毫秒级完成,断网也能用;复杂任务(长文写作、深度推理)再无缝交给云端大模型,兼顾速度、隐私与能力上限。
代表产品与工具
- 面壁智能 MiniCPM:开源“小钢炮”系列,仅几 B 参数即可在手机端对标更大模型,是国产端侧模型的代表之作;
- 智谱 GLM 系列:推出面向手机与 PC 的 GLM-Edge 端侧模型,与云端 GLM 形成端云一体方案;
- 阿里通义 Qwen:开源生态完善,0.5B—3B 的小尺寸版本可在笔记本和安卓手机上流畅运行,是本地部署的热门选择;
- 手机厂商自研模型:vivo 蓝心大模型、小米 MiLM,以及华为、荣耀、OPPO 的端侧模型,支撑通话摘要、图片消除、智慧搜图等本地 AI 功能;
- 本地运行工具:Ollama、llama.cpp、MLC Chat 等开源工具,可把上述开源小模型一键跑在自己的电脑或手机上,适合动手体验。
应用场景
- 手机本地功能:相册语义搜索(输入“海边的日落”直接定位照片)、离线翻译、通话纪要、一键消除路人,全程数据不出设备;
- 汽车智能座舱:语音助手在隧道、地库等弱网环境依然秒回,本地完成导航、空调、车窗控制;
- 办公与输入:笔记本离线生成摘要、续写文案;讯飞输入法等借助端侧模型提升联想与纠错的响应速度;
- 可穿戴与家居:AI 眼镜的实时问答与字幕、耳机同声翻译、音箱的离线唤醒与语音识别。
常见问题
端侧模型能取代云端大模型吗?
不能完全取代。端侧模型胜在低延迟、省流量、隐私好,适合高频轻量任务;但受算力和存储限制,在复杂推理、长文本、专业创作上仍依赖云端。主流方向是“端云协同”,两者互补而非替代。
我的手机能跑多大的模型?
搭载近两年旗舰芯片(如骁龙 8 Gen 3、天玑 9300、苹果 A17 Pro 及以上)的手机,普遍可流畅运行 1B—4B 参数的 4-bit 量化模型;中端机型建议从 1B 级别试起。安卓用户可安装 MLC Chat,电脑用户可用 Ollama 一行命令跑通 Qwen 小尺寸模型。
端侧模型会让手机发热耗电吗?
短时间推理影响不大——端侧模型专为 NPU 优化,功耗通常低于联网调用云端时的射频模块;但连续长时间生成仍可能发热。这也是厂商把端侧模型参数控制在几 B 级别、并用端云协同分流重任务的原因。
©️版权声明:若无特殊声明,本站所有文章版权均归AI智库原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。
辽公网安备21021102001760号