一个基于Linux的开源智能眼镜平台,适用于医疗、工业、教育和消费应用
中文 | English
这是一个基于Linux的开源智能眼镜工程,目前处于早期阶段,文档完善度45%。
本仓库主要开源的是系统软件与应用开发栈,开发并不依赖我们提供的整机套件。你可以基于任意 RV1106B 开发板开展系统与软件开发,再按自己的硬件方案适配外设。
开发者交流群 | 联系作者: iam5tilllearning@foxmail.com
| 微信交流群 | Discord社区 |
|---|---|
![]() |
![]() |
| 扫码加入微信群 | 加入Discord |
你可以通过两种方式开展开发:
- 使用自己的 RV1106B 开发板,基于本项目开源的系统与软件栈继续开发(优势是便宜,但是上手问题会很多,你会有相当多的时间浪费在系统兼容/驱动等等问题上,如果你的目的是快速开发AI眼镜交互应用,建议直接购买我们精心调好的AI眼镜设备)。
- 如果希望更快进入 AI 眼镜整机联调,也可以选择我们已经做过深度封装的官方套件,减少硬件集成和外设适配工作量。
可选:购买官方 AI 眼镜套件 — 适合快速上手,但不是开发前提
备用购买链接 — 主购买页面不可用时可使用
Caution
官方硬件兼容性提示:v0.6.x 与 v0.7.x 参考固件仅适配 2026年1月1日之后生产的一体化硬件。如果您的官方套件或同参考设计硬件是在此日期之前购买/生产的,请使用 v0.6.0 或更早版本的固件。
- 适配固件版本:v0.7.0。兼容 2026年1月1日之后生产的新硬件。
- OSAIG 手机端:首次发布独立 Android 手机客户端,用于连接、管理和调试 OSAIG 眼镜。
- 设备管理:支持设备绑定、设备列表、在线状态、本地连接状态、设备详情页、状态趋势,以及电量、存储、内存、系统版本等基础信息展示。
- RTSP 实时视频流:眼镜可通过 RTSP 暴露摄像头实时画面,既可供手机端查看,也可供云端视频 AI 识别链路接入。参考主码流地址为
rtsp://<device_lan_ip>:554/live/0。 - BLE 文本交互:新增 BLE 文本通道和手机端 BLE 调试入口,可向眼镜发送预设命令和文本内容。
- 音频设备处理重构:优化录音与播放的底层资源协调,支持录音和声音播放同时工作。
- SDK 更新:SDK 文档已覆盖录音控制、AI-Core 物理动作控制/查询、媒体资源仲裁、显示提交、文本事件监听、BLE 文本收发和示例构建入口。
- 发布资产:
- 音频版:
Firmware_RV1106B_RK962_IMX219.AudioVersion.img - 显示版:
Firmware_RV1106B_RK962_IMX219.DisplayVersion.img - 手机端 APK:
osaig-0.3.0+7-release.apk
- 音频版:
- Release 详情:https://github.com/Iam5tillLearning/OpenSource-Ai-Glasses/releases/tag/v0.7.0
📜 版本历史概要
- 新增首个独立 OSAIG 手机端,支持设备绑定、设备管理、调试、更新引导、设备信息展示和状态趋势查看。
- 新增眼镜摄像头 RTSP 实时视频流能力;手机端可查看实时画面并显示端到端延迟、网络延迟、播放延迟,开发者也可以将 RTSP 流接入云端视频 AI 识别链路。
- 新增手机端 BLE 文本交互能力,支持预设调试命令,并预留拍照、录像、设备控制和更多调试命令结构。
- 重构音频设备处理逻辑,改善录音与播放共存能力,为语音交互、实时音频提示和音视频调试打基础。
- 补齐 SDK 文档中的 BLE 文本收发、录音控制、物理动作控制/查询、媒体资源仲裁、显示提交和文本事件监听说明。
- 发布资产包含 AudioVersion/DisplayVersion 两类固件镜像,以及 OSAIG Android APK
osaig-0.3.0+7-release.apk。
- 重点修复项目稳定性问题,特别是 AI Core 服务稳定性与可靠性。
- 增强异常与边界场景处理,进行内部优化与清理。
- 新增双固件发布形态:AudioVersion 与 DisplayVersion(按设备选择下载)。
- 显示能力版本功能升级,新增系统级
display-service。 - 与应用开发 SDK 集成,支持第三方应用图形渲染与显示。
- 新增实验性
launcher-app(图形启动与交互示例)。 display-service与launcher-app均开源,可用于学习、验证与二次开发。
- 适配固件版本:v0.6.3
- 新增蓝牙功能(蓝牙名称:OSAIG)
- 注意:小米手机存在兼容性问题
- 显示屏版本用户需自行处理显示问题
- 适配固件版本:v0.6.2
- SDK新增显示模块(UI/图片)及节能设置
- SDK新增ASR和LLM文本获取能力
- 优化30秒熄屏逻辑
- 升级GPIO Hub架构
- 优化3D模型结构
- 引入cJSON库,移除旧显示应用
- 适配固件版本:v0.6.1
- 兼容 2026年1月1日之后生产的新硬件
- 适配固件版本:v0.6.0
- 全新推出SDK
- 适配固件版本:v0.5.0
- 实现了完整的WiFi配网逻辑
- 详细的音频提示
- 基于核心server封装了一套SDK
- 开发者可以基于这套SDK实现拍照、GPIO、录音等功能
- 实现了系统哨兵
- 实现了核心server,负责拍照、GPIO、录音以及新版的AI对话
- 优化排线槽布局
- 修改眼镜前框模型,预留光机位置和波导片位置
- 修改镜腿模型,确定音腔和天线腔
- 第一版镜框3D打印成型
- 大量优化了AI对话的延迟,首包端到端延迟1s左右
- 实现了基础的AI对话
- 🖥️ 显示: 30°FOV 640×480单色单目显示(选配)
- 📸 摄像头: 1080P录像和 RTSP 实时视频流
- 🔊 音频: 麦克风 + 扬声器
- 📡 连接: WiFi 802.11b/g/n、蓝牙5.3、USB 2.0
- ⚡ 性能: 单Cortex-A7核,8GB存储
- 🔋 续航: 180mAh电池,听歌2小时,显示3小时,录像45分钟
- ⚖️ 重量: 仅43g
- 🧠 传感器: 选配地磁传感器、IMU
- 🐧 系统: 嵌入式Linux系统
💡 提示: 如果您购买的是上方链接中的官方 AI 眼镜套件,设备已预装固件,可直接使用;如果您使用自己的 RV1106B 开发板,请从下方主机开发环境和固件烧录流程开始。
推荐直接在 Ubuntu/Debian 主机,或 Windows 的 WSL2 Ubuntu/Debian 环境中完成固件开发和应用开发。
开发环境唯一获取方式:
https://github.com/makevary/AIGLASS_DEV_ENV
# 获取开发环境
git clone https://github.com/makevary/AIGLASS_DEV_ENV.git
cd AIGLASS_DEV_ENV
# 修复/安装编译依赖(支持 Debian/Ubuntu 与 WSL2 的 Ubuntu/Debian)
./setup_build_env.sh
# 编译固件(以下两条命令二选一)
./build.sh
./build.sh --without-display
# 固件输出
ls -lh output/image/update.img编译参数选择:
- 设备带显示能力:
./build.sh - 设备不带显示能力:
./build.sh --without-display
说明:
setup_build_env.sh使用apt-get安装依赖,仅支持 Debian/Ubuntu 系统(含 WSL2 中的 Ubuntu/Debian)。
详细说明请查看 开发环境搭建指南
固件烧录: 固件编译完成后,请参考 固件烧录指南 将固件烧录到设备。
应用开发: 主机环境提供完整开发链路,可用于开发用户级应用程序。详细说明请查看 应用开发指南。
- 自动进入:设备开机未连接网络时会自动进入配网模式。
- 手动进入:任何时刻连续短按按键10次,可主动进入配网模式。
- 当前配网方式:使用 Android 手机分享 Wi-Fi 二维码,眼镜扫描二维码后完成联网。
- 频段限制:仅支持 2.4GHz Wi-Fi,不支持 5GHz/5G Wi-Fi。
- App 状态:独立 OSAIG Android 手机端已随 v0.7.0 发布资产提供,当前重点覆盖设备绑定、管理、调试、更新引导、BLE 调试和实时视频查看。
- 主码流:
rtsp://<device_lan_ip>:554/live/0 - 子码流:
rtsp://<device_lan_ip>:554/live/1 - 典型用途:云端视频 AI 识别、远程巡检、视觉调试和手机端实时预览。
- 使用指南:RTSP 视频流指南
- 操作方式:配网完成后,长按左侧镜腿按键开始说话,松开结束,等待AI回复。
本项目提供了一套完整的C/C++ SDK,开发者可以基于此SDK轻松调用底层的硬件能力,开发自己的应用程序。
SDK核心功能:
- GPIO事件订阅:低延迟获取按键等GPIO事件
- 摄像头调用:通过共享内存零拷贝获取图像数据
- 音频控制:音频播放、TTS、录音开始/停止/状态查询,并改善录音与播放共存能力
- 物理动作控制:禁用、恢复和只读查询 AI-Core 物理按键业务动作,同时保留 GPIO 事件分发
- 媒体资源仲裁:请求 AI-Core 释放或回收相机/音频资源,方便外部应用接管
- 显示提交:共享内存帧缓冲提交和显示焦点管理
- 文本事件监听:订阅 ASR、LLM 和 System 文本事件
- BLE 文本通道:通过眼镜 BLE 网关收发 UTF-8 JSON 文本消息
- 进程间通信:基于Unix Domain Socket的可靠通信
v0.7.0 SDK 文档更新:
- 新增 BLE 文本客户端 API 文档和
ai_ble.h头文件入口。 - 新增录音控制 API:
ai_audio_record_start()、ai_audio_record_stop()、ai_audio_record_get_status()。 - 新增物理动作控制/查询 API:
ai_audio_set_disable_aicore_physical_actions()、ai_audio_get_disable_aicore_physical_actions()。 - 新增相机/音频资源释放、回收和状态查询的媒体资源仲裁 API。
- 新增只读查询物理动作状态示例,避免现场排查时误修改运行态。
- 示例程序统一改为链接预编译 SDK 库,并使用统一构建输出目录。
SDK位置:SDK/ai_glass_sdk
资源导航:
集成指南: 请参考 SDK README 中的"集成到自己的项目"章节,了解如何在您的应用中链接和使用SDK。
- 📖 用户使用手册 - 眼镜组装完毕之后读这个
- 🧰 开发环境搭建指南 | English
- 💻 应用开发指南 | English
- 📡 RTSP 视频流指南 | English
- ⚡ 固件烧录指南 | English
# 获取完整开发环境
git clone https://github.com/makevary/AIGLASS_DEV_ENV.git
cd AIGLASS_DEV_ENV
# 安装/修复编译依赖
./setup_build_env.sh
# 编译固件
./build.sh
# 固件产物
ls -lh output/image/update.img- IDE: VS Code with C/C++ extension
待完善医疗AI智能眼镜场景
医生或护士一进入病房,眼镜通过人脸识别或腕带扫描,瞬间在视野角落显示患者姓名、床号、主要诊断、过敏史和关键生命体征,无需反复查阅病历夹或电脑。
眼镜能实时读取并整合床旁监护仪、输液泵等设备数据。一旦患者心率、血氧、血压等指标出现异常波动,系统会立即在视野中高亮警示,并通过骨传导耳机发出轻柔但明确的预警声。
在执行输液、给药等操作时,眼镜的摄像头会自动扫描药品条码与患者腕带,核对"三查七对"信息。若发现药物剂量错误、患者不匹配或存在过敏风险,会立即以醒目方式弹出警告,杜绝医疗差错。
医生进行查房或操作时,可通过语音指令或手势,在空中虚拟调阅患者的电子病历、影像报告(如CT/MRI),并将口述的查房记录实时转为文字存入系统,实现"所见即所记",极大解放双手。
在复杂会诊或紧急抢救时,低年资医生可第一视角共享实时画面给远端专家。专家可在共享画面上进行标注、圈出重点,并通过语音通讯进行指导,如同专家亲临现场,提升基层医疗水平。
变电站应用场景
甭管是纸质的还是电子的操作票,眼镜一扫,它能自己把上面的关键信息(比如要操作哪个设备、是合上还是断开)给提取出来,不用我再去一个字一个字地手动输入核对。
戴着眼镜在变电站里走,它就像个老巡检员一样,能通过摄像头和AI实时认出眼前的是断路器、隔离开关还是接地刀闸。
系统内置了所有的电力安全规程和"五防"逻辑。能把我刚才识别的操作指令和现在眼前看到的真实设备状态进行比对,判断我下一步操作会不会出事。
一旦它发现我可能要走错间隔、或者要操作错误的设备,马上就会用声音警告,比如"错误!这是102开关,请核对!",阻止犯错。整个过程必须是实时的,不能有延迟。
所有的计算和判断都支持本地部署,确保在网络不稳定的急诊或ICU区域功能不受影响。
维修场景
现场维修人员通过眼镜摄像头,将故障设备的第一视角实时视频共享给后方的专家团队。专家无需亲临现场,即可如亲眼所见,精准把握现场状况。维修时解放双手。
专家可以在共享的视频画面上进行AR标注(如画圈、箭头指示、文字注释),直接"投射"到现场人员的视野中,精确指导其"拧这个螺丝"、"测量那个点的电压",极大提升沟通效率。
支持多位专家同时接入一个视频会话,进行"多方会诊",快速解决复杂难题。整个指导过程可录制存档,形成针对特定故障的维修案例库,用于后续培训。
现场人员可通过语音指令,请求专家远程推送图纸、手册或3D模型等文件。专家可将资料直接发送并显示在维修人员的眼镜视野一侧,边看边操作。
AR智能作业指导与流程确认
将复杂的SOP(标准作业程序)分解为一步步的AR指令,直接叠加显示在操作员视野中的真实设备上。当前需要执行的操作步骤会高亮提示,完成一步,自动进入下一步。
眼镜能识别操作员拿起的是否为当前步骤指定的工具或物料。若拿错,会立即发出警示,防止因使用错误工具导致的设备损坏或装配问题。
系统通过视觉识别自动判断某个步骤是否已完成(如"螺丝已拧紧"、"线缆已插接到位"),并自动记录完成时间和操作员信息,实现无纸化且防错的流程确认。
在操作员双手被占用时,可通过语音指令"下一步"、"上一步"、"重复"来控制指导流程的播放,完全解放双手,聚焦于操作本身。
新员工可依靠AR指导快速上岗,减少培训成本和出错率。老师傅的最佳实践和操作技巧也能通过AR流程固化下来,实现高效的知识传承和标准化作业。
我们欢迎各种形式的贡献!
Important
开发环境唯一获取方式:请从 https://github.com/makevary/AIGLASS_DEV_ENV 获取开发环境。
克隆目录要求:如果您需要编译 src 或 samples 目录下的代码,请在 AIGLASS_DEV_ENV 开发环境根目录中克隆本项目,以满足编译系统相对路径依赖。
正确的目录结构示例:
/path/to/AIGLASS_DEV_ENV/
├── OpenSource-Ai-Glasses/ # 本项目
├── luckfox-pico/ # 系统SDK
└── ...
- 🍴 Fork 本仓库
- 📥 克隆您的 Fork 到本地(在
AIGLASS_DEV_ENV根目录中执行),并初始化 submodulecd /path/to/AIGLASS_DEV_ENV # 进入开发环境根目录 git clone https://github.com/YOUR_USERNAME/OpenSource-Ai-Glasses.git cd OpenSource-Ai-Glasses git submodule update --init --recursive
- 🌿 创建功能分支 (
git checkout -b feature/AmazingFeature) - 💻 提交您的更改 (
git commit -m 'Add some AmazingFeature') - 📤 推送到分支 (
git push origin feature/AmazingFeature) - 🔃 创建 Pull Request
- 🐛 Bug修复: 报告和修复问题
- ✨ 新功能: 提出并实现新功能
- 📚 文档: 改进指南和API文档
- 🧪 测试: 添加测试并提高覆盖率
- 🌐 国际化: 添加语言支持
本项目采用 Apache License 2.0 许可证 - 查看 LICENSE 文件了解详情。
- Linux Foundation 提供Linux操作系统支持
- OpenCV 提供计算机视觉能力
- BlueZ 提供蓝牙协议栈
- 社区贡献者和测试者
- 项目维护者: Iam5tilllearning
- 问题反馈: GitHub Issues
- 讨论: GitHub Discussions
⭐ 如果这个项目对您有帮助,请给我们一个Star!
由开源社区用❤️制作
最后更新: 2026-05-18 | 版本: v0.7.0


