夯爆了!一款开源 App,让旧手机 24 小时跑本地大模型

每个人的抽屉里,大概都躺着一两部旧手机,卖二手不值几个钱,留着又不知道干嘛。我之前也折腾过几轮,装监控、当下载机、挂网盘,折腾完还是回抽屉吃灰。
前几天在 GitHub 上翻到一个叫 OlliteRT 的项目,看完介绍我觉得有点意思,旧手机好像能派上新用场了。
它能把安卓手机变成一个本地大模型服务器,在局域网里开一个和 OpenAI 一样的 API 接口。电脑、NAS、智能家居系统,只要能填 API 地址,都能连上手机里的模型。不碰云服务,也不要什么 API Key,数据不用出家门。

OlliteRT 是什么
可以把它理解成安卓版的 Ollama。用过 Ollama 的都知道,电脑上敲一行命令就能把模型跑起来,OlliteRT 干的是同一件事,只是跑的地方换成了手机。它基于谷歌的 LiteRT-LM 运行时,前身是谷歌官方的 AI Edge Gallery 演示应用,作者 NightMean 在这个基础上把它做成了一个正经的服务器应用。
项目用 Apache 2.0 协议开源,Kotlin 写的,开源时间不长。

用起来也不复杂,装好 APK,挑个模型下载,点一下 Start Server,手机就开始监听 8000 端口了。状态页会显示 API 地址,类似 http://192.168.1.176:8000/v1 这样,把地址填到任何支持 OpenAI 接口的客户端里,就接上了。
都能干什么
App 里内置了模型列表,点一下就能下载,也支持自己导入 .litertlm 格式的模型文件,想加自己的模型源也行,给个 JSON 文件或者链接就成。列表里官方推荐 Gemma 4 E2B,2.4GB 大小,8GB 内存的手机就能跑,文字、图片、语音输入都支持,还有思考模式。想跑小一点的,也有 Qwen 2.5 1.5B 和 DeepSeek-R1 1.5B 可以选。

拿不准手机跑得动哪个模型,可以先用自带的 Benchmark 跑个分,速度快慢心里就有数了,省得下完才发现带不动。
Gemma 4 系列还能看图、听语音,工具调用也做了,不过目前还是实验性质,时灵时不灵。
配置给得很细,细到每个模型可以单独调温度、最大输出长度,可以选用 GPU 还是 CPU 跑,闲下来多久自动卸载模型也能设。安全方面也不马虎,监听范围、客户端 IP 白名单、Bearer token 验证都有,丢在局域网里用够了。

我平时折腾这类服务,最怕的就是它跑成黑盒,出了问题两眼一抹黑。OlliteRT 这点做得不错,状态页上运行时长、请求数、tokens 吞吐、解码速度、成功率全是实时刷新的。
官方截图里 Gemma 4 E2B 的解码速度跑到了 29.9 tokens/s,模型加载只要 4 秒。玩 Grafana 的还能把它的 Prometheus 指标接进监控大盘,一共 29 个。家里用 Home Assistant 的话,它也留了 REST API,可以远程查看状态、控制模型加载。

日志也全,每个请求的请求体和响应体都记下来,支持搜索、过滤、JSON 高亮。哪个客户端发了什么、模型回了什么,翻一遍日志就清楚了。

兼容性也做得很好,标准 OpenAI 兼容接口,Open WebUI、Home Assistant、Python 脚本、curl,能填 OpenAI 地址的地方基本都能接上。它还顺带兼容了 Anthropic 的 Messages 接口,做这类小工具的项目里,愿意把两套接口都兼容的不多。
可选型号
App 里目前内置了七款模型,我把官方的型号、体积和配置要求整理成了表,大家按自己手机的内存对号入座就行:

官方的建议是普通手机选 Gemma 4 E2B,旗舰机可以上 E4B。上下文这一列也值得看一眼,Gemma 4 系列给到了 32K,Gemma 3n 和几款小模型只有 4K,日常聊天够用,要是想塞长文档进去就吃力了。
另外,这个列表不是死的,前面说过,可以自己导入模型文件,也能加自定义模型源。
快速上手
整个过程没什么门槛,真正花时间的其实只有等模型下载这一步。
1、先去 GitHub 的 Releases 页面下 APK 装上。 手机要求安卓 12 以上、arm64 架构,2017 年以后的机器基本都满足,内存至少 6GB,想跑多模态模型建议 8GB 往上。
2、装好打开,在模型列表里挑一个点下载。 官方推荐 Gemma 4 E2B,2.4GB,大部分手机都跑得动。不想在 App 里下也行,自己准备 .litertlm 模型文件导进去就好。
下完在模型卡片上点 Start Server,等几秒模型加载完,服务就起来了,默认监听 8000 端口,端口在设置里可以改。
3、接着把客户端接上。 状态页会显示 API 地址,点一下就能复制。不管接什么客户端,要填的就三样东西:地址(http://手机IP:8000/v1)、API Key(没开验证的话随便填一个占位就行)、模型名(从模型页上抄,比如 Gemma-4-E2B-it)。
我自己拿 Open WebUI 试的,在它的 Settings → Connections 里加一条 OpenAI 连接,填上地址,刷新一下,模型就出来了。有一点要注意,Open WebUI 默认不开工具调用,我把 Function Calling 改成 Native 之后才正常。
接 Home Assistant 稍微多一步,要通过 HACS 装个自定义集成,作者测试下来最省心的是 Custom Conversation,填的还是上面那三样。接好之后除了对话,还能拿它做语音转文字。
Claude Code 也能直连手机,设两个环境变量指过去就行。不过作者自己在文档里提醒过,手机上的模型上下文窗口小,跑不动它那套重型工具调用,建议只当兼容性测试玩玩,别指望真拿它干活。
有几个地方得说清楚
它一次只能加载一个模型,请求也是排队处理的,没法并发,所以当个家庭小助手行,替代正经的在线服务就别想了。
格式上只支持 .litertlm,不支持 GGUF,手里囤的 GGUF 模型派不上用场。工具调用前面说了,实验功能,效果看运气。
还有发热问题,手机长时间跑模型肯定会热,作者自己在 README 里写了句挺逗的话,别把跑着模型的手机塞枕头底下,电池鼓包了他不负责。玩笑归玩笑,旧手机电池老化的居多,打算常开的话还是留个心眼。
最后
不用买显卡,也不用租服务器,一部闲置手机加几瓦电,就多了一个 24 小时在线、数据完全留在自己家里的 AI 接口。手机跑起来功耗大概 5 到 10 瓦,显卡服务器动不动就 300 瓦往上,这么一比,手机那点电费也算不上什么。
当然,它替代不了云端的大模型服务,速度和模型规模都在那摆着。但接进智能家居当个本地语音助手,或者纯粹折腾着玩,是够的,家里有旧手机的,可以翻出来试试。
这个项目,我能想到的作用就是把废旧手机当个语音助手,类似小度同学这种。推荐它,主要是足够酷,一个搭建在旧手机上的本地模型,可以自己微调,放到电脑桌上,随时唤醒轻度使用,不管用处大不大吧,这个X要装!