ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

用OpenGlass把普通眼镜改造成AI智能眼镜:从零到能用的完整路线图

用OpenGlass把普通眼镜改造成AI智能眼镜:从零到能用的完整路线图 用OpenGlass把普通眼镜改造成AI智能眼镜从零到能用的完整路线图【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlass25美元硬件 半小时配置让一副普通眼镜看懂世界、听懂提问、开口回答你有没有想过掏出手机拍照再打开翻译App这件事其实完全可以交给一副眼镜想象一下站在异国街头你只要对着路牌按一下镜腿上的按钮几秒后手机里就跳出中文释义开会时记不清刚见过的合作方名字随口问一句眼镜帮你回忆起这位是上周在展会上交换过名片的王工。这不是科幻电影里的概念产品而是 OpenGlass 这个开源项目正在兑现的承诺。它用不到25美元的标准零件把任意一副普通眼镜变成具备图像识别、语音交互能力的 AI 智能眼镜——所有代码完全开源新手也能照着搭出第一台。一句话讲清OpenGlass能做什么OpenGlass 的核心逻辑只有一句话眼镜负责看和听手机负责想再把答案传回来。它不做复杂的本地推理而是把摄像头拍到的画面、麦克风收进的声音通过蓝牙送到运行在电脑或手机上的 AI 模型让模型理解场景后给出回答。三个让人心动的亮点成本低到离谱核心硬件只需一块 Seeed Studio XIAO ESP32 S3 Sense集成摄像头和麦克风的开发板、一块250mAh锂电池和一套3D打印镜架外壳总价不到25美元一杯咖啡钱换一副AI眼镜。上手门槛友好固件用 Arduino IDE 上传界面是 Expo 写的网页应用全程不需要焊接跟着文档一步步点就行。模型自由替换图像识别支持 Ollama 本地模型和云端 API 双通道sources/modules/ollama.ts里定义了从moondream到llava:34b等一串可选模型换模型就像改一行配置。一副AI眼镜的看到→理解→回答之旅别急着动手先花两分钟搞懂数据是怎么流动的后面遇到问题你就能自己定位了。第一步采集眼镜端。ESP32 S3 上的摄像头按设定的间隔抓拍画面麦克风持续采集声音固件firmware/firmware.ino负责把这些原始数据打包通过低功耗蓝牙BLE推送给手机端。固件里还预留了三种音频编码格式Opus、MuLaw、PCM的切换开关默认用的 PCM 与网页应用配合最好。第二步理解AI端。手机上的 Expo 应用收到图片后调用sources/agent/imageDescription.ts里的imageDescription()函数把图片交给视觉模型生成文字描述。sources/agent/Agent.ts里维护着一个照片描述的内存队列每张新照片进来都会先被翻译成文字再入队这样后续所有问题都能基于文字快速检索。第三步反馈问答端。当你对着眼镜问我刚才看到的那家餐厅叫什么Agent.ts会把队列里所有描述拼成上下文丢给 Groq 或 OpenAI 的大模型由它结合你看到过的画面给出精准回答再通过扬声器播报出来。这套先描述、后问答的设计相当巧妙视觉模型只负责把画面转成文字真正动脑子回答问题的活交给语言模型两者各司其职换任何一家模型供应商都不影响整体架构。三阶段上手路线从点亮屏幕到二次开发阶段一初体验一条命令跑通软件端即使你的3D打印件还在路上也不妨碍先体验 AI 部分。克隆仓库并安装依赖git clone https://gitcode.com/GitHub_Trending/op/OpenGlass cd OpenGlass yarn install # 用 npm install 也可以接着配置密钥。项目把密钥集中放在sources/keys.ts支持 Groq、OpenAI 和自建 Ollama 三种来源export const keys { groq: process.env.EXPO_PUBLIC_GROQ_API_KEY ?? , // 问答模型 ollama: process.env.EXPO_PUBLIC_OLLAMA_API_URL ?? , // 本地视觉模型 openai: process.env.EXPO_PUBLIC_OPENAI_API_KEY ?? , // 备用视觉通道 };想走纯本地方案先装 Ollama 再拉一个轻量视觉模型ollama pull moondream:1.8b-v2-fp16 # 约1GB笔记本也能跑 yarn start # 浏览器打开 localhost 链接 划重点keys.ts用的是环境变量读取方式别把密钥硬编码提交到 Git 仓库里。另外 Ollama 的地址要填成http://localhost:11434/api/chat少写/api/chat会连不上。阶段二调优让识别又快又准跑通之后你会发现识别效果和速度主要取决于模型选择。项目自带了一套模型评测脚本prompts/generate.ts它会批量读取prompts/series_1/里的57张测试图片依次用四种模型跑描述生成把结果写进同名.md文件——相当于给你做了一份谁更懂你的场景的对照实验。追求速度选moondream:1.8b-v2-fp16本地推理、延迟低日常场景够用。追求质量选llava:34b-v1.6描述更细腻但需要更强的硬件。追求细节转录llava-llama3对画面中的文字识别表现不错适合翻译场景。调完模型记得同步改imageDescription.ts里的默认参数它目前默认指向moondream:1.8b-v2-fp16。阶段三进阶改造动动固件和界面当你熟悉了套路就可以开始魔改了。几个容易上手的方向供你参考调整抓拍节奏firmware/firmware.ino里的captureInterval变量控制拍照间隔改大省电、改小更跟手。切换音频编码固件头部注释清楚标注了 Opus/MuLaw/PCM 三种模式的切换方法如果你对接的是第三方硬件而非网页应用按注释改宏定义即可。换交互方式sources/app/Main.tsx里只有一个连接设备按钮你可以加一个快捷键或语音触发让问答体验更顺滑。⚠️ 提醒往 ESP32 S3 上传固件前务必在 Arduino IDE 的工具菜单里把 PSRAM 设为 OPI PSRAM否则内存不够会直接崩溃。命令行烧录的用户则要在编译参数里带上PSRAMopi。到这里轮到你上场了OpenGlass 最迷人的地方是它把智能硬件这件事拆成了任何人都能触碰的积木硬件清单就三样固件一次上传AI 模型随意切换。你可以照着上面的路线先跑通软件端再慢慢补齐硬件也可以直接 fork 一份源码给 Agent 加上记忆功能、给界面加上历史记录。项目完全开源MIT 协议社区最缺的就是像你这样亲手跑过一遍的人——无论你是在firmware/firmware.ino里优化了功耗还是在prompts/generate.ts里贡献了新的评测场景都欢迎把发现的问题和想法提成 Issue或直接提交 Pull Request。每一个真实使用反馈都在帮这台25美元的AI眼镜离更多人更近一步。小贴士项目原仓库已归档到 Omi 仓库继续维护动手前先看一眼 README 顶部的迁移说明避免基于旧接口开发。【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlass创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表