☰
Google AI Edge Gallery 端侧推理实战指南:从模型选型到企业落地的完整路径
2026/9/26 2:57:55 网站建设 项目流程

Google AI Edge Gallery 端侧推理实战指南:从模型选型到企业落地的完整路径

【免费下载链接】galleryA gallery that showcases on-device ML/GenAI use cases and allows people to try and use models locally.项目地址: https://gitcode.com/GitHub_Trending/gallery44/gallery

Google AI Edge Gallery 是谷歌推出的端侧生成式 AI(本地 AI)平台,在 Android 与 iOS 设备本地离线运行开源大模型。本文拆解它的能力边界、部署要求与 Skill/MCP 扩展方式,读完后可以完成环境搭建、模型选型,并接入自定义技能与外部工具。

🏢 为什么需要本地/离线推理

  • 客服记录、合规文档等敏感数据经第三方 API 出网 → 隐私合规审查成本高,且依赖外部服务可用性。
  • 门店、工厂、外勤等弱网或无网场景 → 云端 API 不可用或延迟不可控,业务体验直接受损。
  • 云端推理按 token 计费 → 调用频次越高,成本线性增长,规模化部署预算难以封顶。

本地 AI 推理将模型放到终端,模型加载完成后推理不依赖外网。它不是宣称云端一定不安全,而是为"数据不出设备"这一诉求提供了可选的工程路径。

🚀 环境与快速启动

系统要求:

  • Android 12 及以上,或 iOS 17 及以上;另有 macOS 版本(DMG)
  • 无法使用 Google Play 时,从官方 release 获取 APK 安装
  • 设备内存需覆盖模型白名单中标注的estimatedPeakMemoryInBytes(部分 4B 级模型约需 7GB)
  • 使用 MCP 扩展需可访问的 StreamableHTTP MCP 服务器(实验特性)
  • 自行编译 App 需配置 HuggingFace Developer App(模型下载功能依赖)

安装步骤:

  1. 确认系统版本,选择安装渠道(Google Play / App Store / release APK)
  2. 安装并打开 App,进入 Agent Chat
  3. 从内置列表选择模型并下载(模型来自 Hugging Face)
  4. 发送一条消息,观察输出

首次验证:模型加载成功、在 Agent Chat 收到正常回复 → 环境正常。

🧩 核心能力拆解

AI Chat 与 Thinking Mode

多轮对话是所有能力的入口,可随时切换模型。

  • 开启 Thinking Mode 可查看模型逐步推理过程(Gemma 4 系列起步支持)
  • 采样参数(temperature、top-k、top-p)在 Prompt Lab 中可调
  • 模型库管理与下载逻辑见 ui/modelmanager/

Ask Image 多模态识别

用相机或相册图片向视觉模型提问,识别物体、解视觉谜题、生成描述,推理全程在设备端完成。

Audio Scribe 实时转录与翻译

对语音录音做实时转写与翻译,基于本地高效语言模型,适合离线会议纪要、内容转写。

Agent Skills 模块化扩展

通过SKILL.md+ 脚本为模型注入新能力,意图匹配时模型自动调用,无需重复写提示词。

  • 三类技能:纯文本角色/知识、JS 技能(隐藏 webview 沙箱执行,可返回图片与交互视图)、原生 intent(发邮件等系统动作)
  • 三种加载渠道:Featured 列表、URL、本地目录导入(adb push后选择)
  • 技能需要 API key 时走原生对话框输入,密钥不经过模型 prompt
  • 技能规范与示例见 skills/

Mobile Actions 与 Tiny Garden

由 FunctionGemma 270m 微调模型驱动的离线设备控制与交互式任务,展示小模型 Function Calling 在端侧的落地形态,任务扩展点见 customtasks/。

模型管理与 MCP 集成

  • 内置列表下载模型或加载自定义模型,Benchmark 模块测试各模型在本机的实际表现
  • MCP 客户端连接 StreamableHTTP 服务器,将工具 schema 注入 prompt,调用路由到对应服务器,支持逐次授权提示与"总是允许"开关
  • 实验阶段:Gemma-4-E4B 工具调用最稳定;上下文仅 4k~10k token,建议只启用必要工具
  • 接入步骤与限制见 mcp/

🏗️ 技术架构一览

协作链路:用户输入 → LiteRT/AICore 运行时本地推理 → 模型决策调用工具 → Skill(JS webview / 原生 intent)或 MCP 服务器执行 → 结果回写对话。

  • Google AI Edge API:端侧机器学习核心能力层
  • LiteRT 运行时:承担模型执行,含 LiteRT-LM 与 AICore 两类运行时(见 ModelEnums.kt)
  • 指标体系:每轮推理采集 TTFT、prefill/decode 速度并采样内存与电量
  • MCP 客户端:统一对接外部工具与数据源
  • 指标实现见 common/metrics/

🏭 行业场景映射

金融与合规敏感客服

客户身份信息、交易明细不宜出终端,用本地 AI Chat 完成咨询应答与记录摘要,对应能力:端侧 LLM 多轮对话(离线可用)。

零售与外勤弱网场景

门店、仓库终端无稳定网络,现场语音转写与翻译靠 Audio Scribe,商品/单据图像识别靠 Ask Image,对应能力:离线多模态推理。

办公自动化

高频低复杂度的邮件草稿、日程类动作由本地小模型触发,Mobile Actions 直接驱动run_intent发送邮件等系统动作,减少对外部 API 的依赖。

🔒 安全与合规

  • 推理在设备端完成,prompt 与图片不经过网络(模型下载、MCP 连接、技能 URL 加载除外)
  • 提供模型白名单管理:model_allowlist.json 与 model_allowlists/ 下的版本化文件约束可用模型集合
  • MCP 工具调用提供逐次授权提示与可关闭的"总是允许"规则,远程动作对用户可见
  • JS 技能在沙箱 webview 中执行,所需密钥由用户经原生对话框输入,不进入模型上下文
  • 提供 ADB 日志输出推理指标(common/metrics/),具体覆盖范围以代码为准(待确认)

📈 性能观测与调优

内置指标体系按推理轮次记录TTFT(首 token 延迟)、prefill 速度、decode 速度(tokens/s),并周期性采样进程内存与电池消耗,结果可通过 Benchmark 模块查看。

调优建议:

  • 内存紧张时优先选 int4 等低比特量化、参数更小的模型,用 Benchmark 模块在本机实测后再定选型,不要跨设备套用经验值
  • 接入 MCP 时只启用当前任务必需的工具,减少工具 schema 对 4k~10k 上下文窗口的占用;GPU 加速下个别计算密集工具可能出现数值偏差,关键数值场景需回归验证

❓ 常见问题

Q:使用必须联网吗?A:不必须。模型下载完成后推理全程离线;仅模型下载、MCP 服务器连接、从 URL 加载技能需要网络。

Q:支持哪些模型格式?A:LiteRT(litertlm)格式与 AICore 模型,内置白名单提供 Gemma、Qwen 等即用版本,也可加载自定义模型文件。

Q:能否自定义模型白名单?A:白名单是仓库内的 JSON 文件(根级 + 版本化目录),自编译构建时可调整(待确认)。

Q:MCP 工具调用哪个模型最稳?A:官方建议 Gemma-4-E4B;更小模型可能无法正确解析工具 schema,且应只开启必要工具。

Q:如何添加自定义 Skill?A:编写含 frontmatter 的SKILL.md,按类型放入scripts/(JS)或声明原生 intent,经 Featured 列表、URL 或adb push本地导入后即可被模型自动调用。

【免费下载链接】galleryA gallery that showcases on-device ML/GenAI use cases and allows people to try and use models locally.项目地址: https://gitcode.com/GitHub_Trending/gallery44/gallery

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询