手机离线跑大模型,这条路怎么走
这篇整理在安卓手机上不联网运行开源大模型的实操思路:模型文件怎么挑、量化等级怎么选、运存够不够,以及断网使用前要留意的事。文中以开源客户端 Agora 为例,它的完整介绍见 Agora 介绍站。
在手机上离线跑大模型,本质是「把推理从云端搬回本机」:模型文件放在本地存储,计算由手机 CPU 完成,全程不需要把问题发给任何服务器。这在通勤、飞行模式或者单纯不想联网的场景里都好用。
第一步:挑一个 GGUF 格式的模型文件
GGUF 是 llama.cpp 生态的通用格式,开源模型社区基本都有对应的 GGUF 版本。挑选时两个维度最关键:参数量决定能力上限,量化等级决定体积与速度。
- 参数量:3B 的小模型答日常问题够用,7B 以上开始有明显的能力提升,但对手机压力也直线上升;
- 量化:Q4 一档(Q4_0、Q4_K_M 这类)是质量与体积的平衡点,体积明显小于同参数正常值的要警惕极端量化——答非所问、输出乱码多是它的典型表现。
第二步:按运存对号入座
- 运存 6GB 以下:选 3B 以下 + 4bit 量化,模型文件通常 1~2GB;
- 运存 8GB:4B~7B 的 4bit 量化可以一试,再大容易卡顿;
- 后台应用尽量关一关,边充电边聊稳定性更好。
模型文件建议在 WiFi 下一次下完,文件不完整会导致导入失败。
第三步:导入与断网使用
以 Agora 为例,把 .gguf 文件放进手机存储的任意可访问位置(下载目录即可),在设置的本地模型入口导入,等复制与加载完成,模型会以文件名自动命名,回到聊天底栏选中即可开聊。首次使用记得给应用存储权限,否则选文件时看不到你放的模型。
模型加载完成之后断网也能继续对话——这正是本地模型的意义。不过有两点要心里有数:
- 本地推理对 CPU 负载高,耗电快属正常现象,手机发烫不是故障;
- 本地模型不知道今天发生了什么新闻,要实时信息还是得配合联网搜索工具,或者切换到云端模型配置。
延伸阅读
- 密钥配置那条路怎么走,见 BYOK密钥配置思路.md;
- 为什么要把对话数据留在本机,见 对话数据留在本机意味着什么.md。