Google AI Edge Gallery 端侧推理实战指南:从模型选型到企业落地的完整路径
【免费下载链接】galleryA gallery that showcases on-device ML/GenAI use cases and allows people to try and use models locally.项目地址: https://gitcode.com/GitHub_Trending/gallery44/gallery
Google AI Edge Gallery 是谷歌推出的端侧生成式 AI(本地 AI)平台,在 Android 与 iOS 设备本地离线运行开源大模型。本文拆解它的能力边界、部署要求与 Skill/MCP 扩展方式,读完后可以完成环境搭建、模型选型,并接入自定义技能与外部工具。
🏢 为什么需要本地/离线推理
- 客服记录、合规文档等敏感数据经第三方 API 出网 → 隐私合规审查成本高,且依赖外部服务可用性。
- 门店、工厂、外勤等弱网或无网场景 → 云端 API 不可用或延迟不可控,业务体验直接受损。
- 云端推理按 token 计费 → 调用频次越高,成本线性增长,规模化部署预算难以封顶。
本地 AI 推理将模型放到终端,模型加载完成后推理不依赖外网。它不是宣称云端一定不安全,而是为"数据不出设备"这一诉求提供了可选的工程路径。
🚀 环境与快速启动
系统要求:
- Android 12 及以上,或 iOS 17 及以上;另有 macOS 版本(DMG)
- 无法使用 Google Play 时,从官方 release 获取 APK 安装
- 设备内存需覆盖模型白名单中标注的
estimatedPeakMemoryInBytes(部分 4B 级模型约需 7GB) - 使用 MCP 扩展需可访问的 StreamableHTTP MCP 服务器(实验特性)
- 自行编译 App 需配置 HuggingFace Developer App(模型下载功能依赖)
安装步骤:
- 确认系统版本,选择安装渠道(Google Play / App Store / release APK)
- 安装并打开 App,进入 Agent Chat
- 从内置列表选择模型并下载(模型来自 Hugging Face)
- 发送一条消息,观察输出
首次验证:模型加载成功、在 Agent Chat 收到正常回复 → 环境正常。
🧩 核心能力拆解
AI Chat 与 Thinking Mode
多轮对话是所有能力的入口,可随时切换模型。
- 开启 Thinking Mode 可查看模型逐步推理过程(Gemma 4 系列起步支持)
- 采样参数(temperature、top-k、top-p)在 Prompt Lab 中可调
- 模型库管理与下载逻辑见 ui/modelmanager/
Ask Image 多模态识别
用相机或相册图片向视觉模型提问,识别物体、解视觉谜题、生成描述,推理全程在设备端完成。
Audio Scribe 实时转录与翻译
对语音录音做实时转写与翻译,基于本地高效语言模型,适合离线会议纪要、内容转写。
Agent Skills 模块化扩展
通过SKILL.md+ 脚本为模型注入新能力,意图匹配时模型自动调用,无需重复写提示词。
- 三类技能:纯文本角色/知识、JS 技能(隐藏 webview 沙箱执行,可返回图片与交互视图)、原生 intent(发邮件等系统动作)
- 三种加载渠道:Featured 列表、URL、本地目录导入(
adb push后选择) - 技能需要 API key 时走原生对话框输入,密钥不经过模型 prompt
- 技能规范与示例见 skills/
Mobile Actions 与 Tiny Garden
由 FunctionGemma 270m 微调模型驱动的离线设备控制与交互式任务,展示小模型 Function Calling 在端侧的落地形态,任务扩展点见 customtasks/。
模型管理与 MCP 集成
- 内置列表下载模型或加载自定义模型,Benchmark 模块测试各模型在本机的实际表现
- MCP 客户端连接 StreamableHTTP 服务器,将工具 schema 注入 prompt,调用路由到对应服务器,支持逐次授权提示与"总是允许"开关
- 实验阶段:Gemma-4-E4B 工具调用最稳定;上下文仅 4k~10k token,建议只启用必要工具
- 接入步骤与限制见 mcp/
🏗️ 技术架构一览
协作链路:用户输入 → LiteRT/AICore 运行时本地推理 → 模型决策调用工具 → Skill(JS webview / 原生 intent)或 MCP 服务器执行 → 结果回写对话。
- Google AI Edge API:端侧机器学习核心能力层
- LiteRT 运行时:承担模型执行,含 LiteRT-LM 与 AICore 两类运行时(见 ModelEnums.kt)
- 指标体系:每轮推理采集 TTFT、prefill/decode 速度并采样内存与电量
- MCP 客户端:统一对接外部工具与数据源
- 指标实现见 common/metrics/
🏭 行业场景映射
金融与合规敏感客服
客户身份信息、交易明细不宜出终端,用本地 AI Chat 完成咨询应答与记录摘要,对应能力:端侧 LLM 多轮对话(离线可用)。
零售与外勤弱网场景
门店、仓库终端无稳定网络,现场语音转写与翻译靠 Audio Scribe,商品/单据图像识别靠 Ask Image,对应能力:离线多模态推理。
办公自动化
高频低复杂度的邮件草稿、日程类动作由本地小模型触发,Mobile Actions 直接驱动run_intent发送邮件等系统动作,减少对外部 API 的依赖。
🔒 安全与合规
- 推理在设备端完成,prompt 与图片不经过网络(模型下载、MCP 连接、技能 URL 加载除外)
- 提供模型白名单管理:model_allowlist.json 与 model_allowlists/ 下的版本化文件约束可用模型集合
- MCP 工具调用提供逐次授权提示与可关闭的"总是允许"规则,远程动作对用户可见
- JS 技能在沙箱 webview 中执行,所需密钥由用户经原生对话框输入,不进入模型上下文
- 提供 ADB 日志输出推理指标(common/metrics/),具体覆盖范围以代码为准(待确认)
📈 性能观测与调优
内置指标体系按推理轮次记录TTFT(首 token 延迟)、prefill 速度、decode 速度(tokens/s),并周期性采样进程内存与电池消耗,结果可通过 Benchmark 模块查看。
调优建议:
- 内存紧张时优先选 int4 等低比特量化、参数更小的模型,用 Benchmark 模块在本机实测后再定选型,不要跨设备套用经验值
- 接入 MCP 时只启用当前任务必需的工具,减少工具 schema 对 4k~10k 上下文窗口的占用;GPU 加速下个别计算密集工具可能出现数值偏差,关键数值场景需回归验证
❓ 常见问题
Q:使用必须联网吗?A:不必须。模型下载完成后推理全程离线;仅模型下载、MCP 服务器连接、从 URL 加载技能需要网络。
Q:支持哪些模型格式?A:LiteRT(litertlm)格式与 AICore 模型,内置白名单提供 Gemma、Qwen 等即用版本,也可加载自定义模型文件。
Q:能否自定义模型白名单?A:白名单是仓库内的 JSON 文件(根级 + 版本化目录),自编译构建时可调整(待确认)。
Q:MCP 工具调用哪个模型最稳?A:官方建议 Gemma-4-E4B;更小模型可能无法正确解析工具 schema,且应只开启必要工具。
Q:如何添加自定义 Skill?A:编写含 frontmatter 的SKILL.md,按类型放入scripts/(JS)或声明原生 intent,经 Featured 列表、URL 或adb push本地导入后即可被模型自动调用。
【免费下载链接】galleryA gallery that showcases on-device ML/GenAI use cases and allows people to try and use models locally.项目地址: https://gitcode.com/GitHub_Trending/gallery44/gallery
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考