雨晴 LLM 是一款专为 Android 设备打造的本地离线大语言模型推理服务器,无需联网即可运行。支持 CPU 与 GPU 后端自由切换,内置实时性能监控仪表盘,配备可拖拽悬浮控制窗,并具备持久化后台服务能力。用户需自行下载并导入模型文件,灵活适配各类参数量级的开源权重。

雨晴 LLM软件内容
1、支持 CPU、GPU两种推理后端自由切换,可根据手机硬件配置、功耗需求自主选择,兼顾老旧设备兼容性与高性能机型加速推理的使用场景。
2、内置 NanoHTTPd网络服务,在本机开放兼容 OpenAI规范的 API端点,各类聊天前端、自动化工具、脚本程序均可直接接入,轻松对接成熟的 AI软件生态。
3、配备实时统计仪表板,可视化展示推理速度、内存占用、负载状态等运行数据,方便用户监控模型运行状态,及时调整参数优化推理表现。
雨晴 LLM软件特色
支持持久后台服务模式,启动推理服务后可切至后台持续运行,不会因页面退出中断推理任务,稳定为外部客户端持续提供 AI接口服务。
模型采用独立下载机制,用户按需获取对应量化规格的 Gemma权重文件导入,不强制捆绑内置模型,灵活平衡存储空间与推理效果。
完整兼容标准 OpenAI对话接口格式,支持多轮对话上下文、参数自定义,几乎无需修改代码,即可将原有云端 AI程序迁移至手机本地离线运行。
提供可拖动悬浮窗口,无需常驻应用主界面,在任意界面快速启停服务、切换模型、查看运行日志,多任务并行操作更加便捷高效。
雨晴 LLM怎么使用
1、安装 APK,授予存储、后台悬浮窗、后台运行权限;

2、进入模型管理页面,下载对应 Gemma量化模型文件;
3、选择 CPU/GPU推理后端,启动本地 API服务;

4、使用任意兼容 OpenAI API的客户端,填写本地地址 `http://127.0.0.1:8080`即可调用;
5、悬浮窗可随时查看生成进度、切换模型、关闭服务。

雨晴 LLM软件亮点
提供基础推理参数自定义选项,可调整温度、上下文长度、最大生成长度等配置,适配创意写作、逻辑推理、代码生成等不同任务需求。
优化移动端资源调度策略,后台推理时管控功耗与内存占用,减少长时间运行出现卡顿、闪退问题,延长离线推理任务持续运行时长。
支持多客户端同时接入本地 API服务,局域网内其他设备也可访问推理接口,实现手机作为家庭离线 AI中枢,供多终端调用大模型能力。
雨晴 LLM更新日志
v1.0.0版本
新增账号登录记住密码独立开关按需开启关闭
新增云端数据同步支持多设备互通本地记录
修复内容置顶操作刷新页面后置顶状态取消
优化弹窗弹出逻辑屏蔽重复无关推送弹窗
新增云端文件离线标记提前缓存所需内容