手机离线跑大模型
坐飞机、挤地铁、流量告急——想让 AI 对话不依赖网络,就得把模型文件直接装进手机。这篇讲在安卓上离线跑大模型的思路:选多大的模型、怎么导入、日常使用注意什么。
离线对话靠什么实现
Agora 内置了 llama.cpp 推理引擎,这是开源社区里跑 GGUF 格式模型的通用方案。GGUF 是目前开源大模型最常见的分发格式,Hugging Face、GitHub 上的开源模型基本都提供 GGUF 版本。模型文件放进手机后,推理全部由 CPU 在本地完成——不联网、不经过任何服务器,这也是「数据留本机」的极致形态。
模型怎么选
按手机运存挑,经验值如下(以实测为准):
| 手机运存 | 建议模型规模 | 文件大小 |
|---|---|---|
| 6 GB 以下 | 3B 以下 + 4bit 量化(Q4_0、Q4_K_M) | 1~2 GB |
| 8 GB | 4B~7B + 4bit 量化可以一试 | 2~4 GB |
两点提醒:
- 量化等级:Q4 是质量与体积的平衡点;体积明显小于同参数正常值的要留意,极端量化常表现为答非所问、输出乱码。
- 下载完整性:模型文件大,建议 WiFi 一次下完;文件不完整是「导入失败」的头号原因。
导入三步
- 把
.gguf文件放到手机存储里任意能访问的位置(下载目录就行); - 打开应用,进设置里的「本地模型」入口,点导入并选中该文件;
- 等复制与加载完成,回到底部栏选中它即可开聊——之后断网也照常对话。
首次使用记得授予存储权限,否则选文件时可能看不到你放的位置。
日常使用的四个预期
- 速度看硬件:本地推理吃 CPU,模型越大越慢;关掉后台大应用、插电使用会更稳。
- 知识有截止:本地模型不知道今天的新闻,要实时信息得靠云端配置或配合浏览器。
- 耗电是常态:高负载推理本来就费电,这不是故障。
- 闪退先查内存:加载即崩多半是运存不够,换更小或量化更高的模型再试。
入口与延伸
安装包与配置思路都在Agora 安卓客户端说明站,先装好再玩离线模型;不依赖网络的对话玩顺了,回头看看树状分支对话怎么用,把长对话管理也一起上手。