会思考的眼镜离你有多远?OpenGlass开源智能眼镜体验手记
会思考的眼镜离你有多远?OpenGlass开源智能眼镜体验手记
【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlass
你有没有过这样的瞬间:明明和对方聊得很开心,转头却忘了对方叫什么;走进陌生的街道,想查点什么只能掏出手机;路过一块招牌,字太小看不清。如果这些"看见"能被一副眼镜悄悄记下来,再由AI替你翻译成文字、总结成答案,生活会轻松多少?这就是 OpenGlass——一个把普通眼镜变成 AI 智能眼镜的开源项目,而全部硬件成本,还不到 25 美元(约25元人民币)。
它到底解决了什么问题
简单说,OpenGlass 想做的事是:让任何一副眼镜都拥有"看见并理解"的能力。你戴上它,摄像头拍下眼前的画面,AI 模型在本地或云端分析图片,然后把结果告诉你——眼前是谁、招牌上写了什么、这个场景正在发生什么。
市面上不是没有智能眼镜,但动辄几千上万的售价,加上封闭的系统和厂商牢牢攥在手里的数据,让大多数人只能围观。OpenGlass 反着来:硬件用现成的开源组件,代码全部开源,AI 模型随你挑,隐私数据可以留在自己手里。它更像一个"眼镜改装套件",而不是一台被设计好的消费电子产品。你可以把它想成"给眼镜装上一台会认东西的小电脑",而不是"买一台戴在脸上的手机"。
三个最打动人的细节
25元的硬件,藏着认真的取舍
整套硬件清单极其朴素:一块 XIAO ESP32 S3 开发板(带摄像头和麦克风,十几元)、一块 250mAh 的小电池(三元上下)、一个 3D 打印的眼镜夹。总价控制在 25 美元以内,绝大多数零件电商平台都能买到。
这块 ESP32 S3 看起来"小",却集成了摄像头接口、蓝牙、Wi-Fi 和足够跑本地模型的算力。最妙的是固件设计——它通过蓝牙低功耗把拍到的照片和录到的声音传给手机 App,AI 计算在手机或服务器端完成,眼镜本体只需负责"看"和"听",功耗自然低,一天一充都嫌多。这不是"为了便宜而便宜",而是把每一分钱都花在刀刃上的务实做法:30万像素的摄像头对 AI 识别绰绰有余,高分辨率反而徒增功耗和延迟。
一个场景,四种 AI 任你选
项目作者在 prompts 目录里做了一件很"较真"的事:他们用同一批实拍照片,跑了四个不同的 AI 模型做描述对比。看同一个室内场景,Moondream 会老老实实说"一个人坐在桌前看手机";LLaVA-Llama3 会绘声绘色地补充"卷发青年穿着灰衬衫,房间里有一根白色管道";而 34B 参数的 LLava 甚至会推测"这里可能是火车站"。同一只眼睛,换上不同的"大脑",看到的世界细节完全不同。
这意味着你可以按场景换模型:想要快速响应就上轻量级的 Moondream,想要细致的场景理解就换 LLaVA,想在本地跑保护隐私就在自己电脑上部署 Ollama。OpenGlass 把 AI 的选择权完全交给了你,而不是替你决定。
上图为 OpenGlass 项目测试集的实拍画面之一,四个 AI 模型分别对它生成了不同详略度的场景描述。
不仅会看,还会"答"
OpenGlass 不止是拍照描述,它内置了一个 Agent 智能体:你拍的每一张照片都会被自动转成文字描述存档,然后你可以直接对它提问——"我刚才见到的那个人穿了什么颜色的衣服?""这个房间里有几个人?"它会翻遍你积累的视觉记忆,给出基于事实的回答,而不是凭空想象。换句话说,它给了你一副"有记忆的眼睛"。
5分钟快速上手,跟着走就行
整个上手过程比想象中简单,基本是"刷固件 + 装 App + 配模型"三步:
- 准备硬件:买一块 XIAO ESP32 S3(或任何带摄像头的 ESP32S3 板子),打印或找一个能夹在镜腿上的 3D 打印支架,接好电池。
- 刷固件:用 Arduino IDE 打开仓库里的 firmware/firmware.ino,装上 ESP32 开发板支持包,选择 XIAO_ESP32S3 板型,记得把 PSRAM 设为 "OPI PSRAM",然后一键上传。固件默认通过蓝牙把照片和音频推给手机,代码里还留了 Opus / Mu-law / PCM 三种音频编码的开关,按你的 App 需求切换即可。
- 跑软件:克隆仓库后用
npm install && npm start启动 Expo 应用,在 keys.ts 里填上你用的 AI 服务密钥(Groq / OpenAI 的 API Key,或自建 Ollama 的本地地址),再执行一次ollama pull moondream:1.8b-v2-fp16拉取默认模型,就能在浏览器里看到眼镜传回的实时画面和 AI 描述。
如果你不想碰代码,项目也开放了预组装套件的预订渠道,买来就能直接体验。
实测印象,以及它还没做好的地方
从项目自带的测试数据看,这套组合的真实表现相当可靠:57 张实拍测试图,每个模型都能稳定输出结构化的场景描述,即使画面里有遮挡、光线一般,描述也基本准确。作者甚至把"识别人物""翻译文字"做成了核心用例,Agent 的回答只基于真实拍摄内容,不会脑补不存在的细节。
不过也要说句公道话:它毕竟不是商业产品。没有屏幕,AI 结果需要靠手机查看;30 万像素的摄像头注定拍不清远处小字;本地跑 34B 大模型需要一台配置不错的电脑;蓝牙传输偶尔会有延迟。另外,任何"戴在脸上的摄像头"都牵涉隐私边界——拍别人之前,请先想想合不合适。这些是它目前的天花板,也是它继续进化的空间。
戴上它,你会看到另一种可能
OpenGlass 最迷人的地方,是它把"AI 眼镜"从奢侈品的货架上拿了下来,放进了每个人的 DIY 清单里。想象一下:学生用它实时翻译课堂板书,检修师傅用它识别设备型号,旅行者用它记录并搜索沿途所见——这些场景不需要等巨头发布新品,现在就能用开源组件拼出来。
如果你心动了,行动其实很轻:去克隆这个仓库看看源码,读一读 prompts 目录里那些实拍对比,或者干脆把 25 元的零件买齐,亲手拼一副。技术民主化从来不靠口号,靠的是把门槛降到每个人都能伸手够到。OpenGlass 已经把门槛放在了地上,接下来就看你愿不愿意弯腰捡起来。
【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlass
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
