ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Google AI Edge Gallery 端侧推理实战指南:从模型选型到企业落地的完整路径

Google AI Edge Gallery 端侧推理实战指南:从模型选型到企业落地的完整路径 Google AI Edge Gallery 端侧推理实战指南从模型选型到企业落地的完整路径【免费下载链接】galleryA gallery that showcases on-device ML/GenAI use cases and allows people to try and use models locally.项目地址: https://gitcode.com/GitHub_Trending/gallery44/galleryGoogle AI Edge Gallery 是谷歌推出的端侧生成式 AI本地 AI平台在 Android 与 iOS 设备本地离线运行开源大模型。本文拆解它的能力边界、部署要求与 Skill/MCP 扩展方式读完后可以完成环境搭建、模型选型并接入自定义技能与外部工具。 为什么需要本地/离线推理客服记录、合规文档等敏感数据经第三方 API 出网 → 隐私合规审查成本高且依赖外部服务可用性。门店、工厂、外勤等弱网或无网场景 → 云端 API 不可用或延迟不可控业务体验直接受损。云端推理按 token 计费 → 调用频次越高成本线性增长规模化部署预算难以封顶。本地 AI 推理将模型放到终端模型加载完成后推理不依赖外网。它不是宣称云端一定不安全而是为数据不出设备这一诉求提供了可选的工程路径。 环境与快速启动系统要求Android 12 及以上或 iOS 17 及以上另有 macOS 版本DMG无法使用 Google Play 时从官方 release 获取 APK 安装设备内存需覆盖模型白名单中标注的estimatedPeakMemoryInBytes部分 4B 级模型约需 7GB使用 MCP 扩展需可访问的 StreamableHTTP MCP 服务器实验特性自行编译 App 需配置 HuggingFace Developer App模型下载功能依赖安装步骤确认系统版本选择安装渠道Google Play / App Store / release APK安装并打开 App进入 Agent Chat从内置列表选择模型并下载模型来自 Hugging Face发送一条消息观察输出首次验证模型加载成功、在 Agent Chat 收到正常回复 → 环境正常。 核心能力拆解AI Chat 与 Thinking Mode多轮对话是所有能力的入口可随时切换模型。开启 Thinking Mode 可查看模型逐步推理过程Gemma 4 系列起步支持采样参数temperature、top-k、top-p在 Prompt Lab 中可调模型库管理与下载逻辑见 ui/modelmanager/Ask Image 多模态识别用相机或相册图片向视觉模型提问识别物体、解视觉谜题、生成描述推理全程在设备端完成。Audio Scribe 实时转录与翻译对语音录音做实时转写与翻译基于本地高效语言模型适合离线会议纪要、内容转写。Agent Skills 模块化扩展通过SKILL.md 脚本为模型注入新能力意图匹配时模型自动调用无需重复写提示词。三类技能纯文本角色/知识、JS 技能隐藏 webview 沙箱执行可返回图片与交互视图、原生 intent发邮件等系统动作三种加载渠道Featured 列表、URL、本地目录导入adb push后选择技能需要 API key 时走原生对话框输入密钥不经过模型 prompt技能规范与示例见 skills/Mobile Actions 与 Tiny Garden由 FunctionGemma 270m 微调模型驱动的离线设备控制与交互式任务展示小模型 Function Calling 在端侧的落地形态任务扩展点见 customtasks/。模型管理与 MCP 集成内置列表下载模型或加载自定义模型Benchmark 模块测试各模型在本机的实际表现MCP 客户端连接 StreamableHTTP 服务器将工具 schema 注入 prompt调用路由到对应服务器支持逐次授权提示与总是允许开关实验阶段Gemma-4-E4B 工具调用最稳定上下文仅 4k10k token建议只启用必要工具接入步骤与限制见 mcp/️ 技术架构一览协作链路用户输入 → LiteRT/AICore 运行时本地推理 → 模型决策调用工具 → SkillJS webview / 原生 intent或 MCP 服务器执行 → 结果回写对话。Google AI Edge API端侧机器学习核心能力层LiteRT 运行时承担模型执行含 LiteRT-LM 与 AICore 两类运行时见 ModelEnums.kt指标体系每轮推理采集 TTFT、prefill/decode 速度并采样内存与电量MCP 客户端统一对接外部工具与数据源指标实现见 common/metrics/ 行业场景映射金融与合规敏感客服客户身份信息、交易明细不宜出终端用本地 AI Chat 完成咨询应答与记录摘要对应能力端侧 LLM 多轮对话离线可用。零售与外勤弱网场景门店、仓库终端无稳定网络现场语音转写与翻译靠 Audio Scribe商品/单据图像识别靠 Ask Image对应能力离线多模态推理。办公自动化高频低复杂度的邮件草稿、日程类动作由本地小模型触发Mobile Actions 直接驱动run_intent发送邮件等系统动作减少对外部 API 的依赖。 安全与合规推理在设备端完成prompt 与图片不经过网络模型下载、MCP 连接、技能 URL 加载除外提供模型白名单管理model_allowlist.json 与 model_allowlists/ 下的版本化文件约束可用模型集合MCP 工具调用提供逐次授权提示与可关闭的总是允许规则远程动作对用户可见JS 技能在沙箱 webview 中执行所需密钥由用户经原生对话框输入不进入模型上下文提供 ADB 日志输出推理指标common/metrics/具体覆盖范围以代码为准待确认 性能观测与调优内置指标体系按推理轮次记录TTFT首 token 延迟、prefill 速度、decode 速度tokens/s并周期性采样进程内存与电池消耗结果可通过 Benchmark 模块查看。调优建议内存紧张时优先选 int4 等低比特量化、参数更小的模型用 Benchmark 模块在本机实测后再定选型不要跨设备套用经验值接入 MCP 时只启用当前任务必需的工具减少工具 schema 对 4k10k 上下文窗口的占用GPU 加速下个别计算密集工具可能出现数值偏差关键数值场景需回归验证❓ 常见问题Q使用必须联网吗A不必须。模型下载完成后推理全程离线仅模型下载、MCP 服务器连接、从 URL 加载技能需要网络。Q支持哪些模型格式ALiteRTlitertlm格式与 AICore 模型内置白名单提供 Gemma、Qwen 等即用版本也可加载自定义模型文件。Q能否自定义模型白名单A白名单是仓库内的 JSON 文件根级 版本化目录自编译构建时可调整待确认。QMCP 工具调用哪个模型最稳A官方建议 Gemma-4-E4B更小模型可能无法正确解析工具 schema且应只开启必要工具。Q如何添加自定义 SkillA编写含 frontmatter 的SKILL.md按类型放入scripts/JS或声明原生 intent经 Featured 列表、URL 或adb push本地导入后即可被模型自动调用。【免费下载链接】galleryA gallery that showcases on-device ML/GenAI use cases and allows people to try and use models locally.项目地址: https://gitcode.com/GitHub_Trending/gallery44/gallery创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表