ArUco + MediaPipe 手部跟踪
视觉原型:标定后的 ArUco 位姿、MediaPipe 手部关键点,再用卡尔曼滤波合在一起,能实时看,也能把实验数据记下来。
角色
- 开发者
- 计算机视觉原型
技术栈
- Python
- OpenCV
- MediaPipe
- NumPy
- Pandas
- Kalman filtering
问题
有标记的位姿和没标记的手部跟踪各有长短。这个原型想在同一套标定流程里,把两条信号放在一起看、一起比。
约束
- ArUco 三维位姿要准,先得标定相机,标记尺寸也得知道。
- 标记一被挡住,ArUco 就不稳;MediaPipe 的腕部点只是图像空间估计。
- 同一套程序要能接实时相机、已录视频,也能不弹窗只采数据。
我做了什么
- 采集、检测、融合和工具都收进一个命令行入口。
- 加了相机标定、逐帧 CSV、原始/处理后视频,以及可选的真值对比。
- ArUco、MediaPipe 和融合可以分开看,也可以一起看。
怎么做的
- OpenCV ArUco 估标记位姿,MediaPipe Hands 接手部关键点。
- 按配置把标记 ID 对上左右手,再交给融合模块。
- 时间戳、处理阶段、检测结果和融合位置都会记下来,方便事后看。
怎么验
- 同一段视频或同一路相机,分别跑 ArUco、MediaPipe 和融合。
- 真值可以做成 CSV,按帧对齐比较。
- 看各阶段耗时和导出数据。公开材料里没有完整评估报告,所以不写精度数字。
结果
- 仓库里是一套能跑的原型,标定和采数流程可以重复做。
- 没有完整评估报告,就不写精度或速度提升。
依据和链接
公开仓库记录了 ArUco 位姿检测、MediaPipe 手部关键点、融合、标定以及 CSV/视频录制。
公开仓库 README (在新标签页打开)该仓库于 2026 年 6 月随初始提交公开。
公开 GitHub 提交历史 (在新标签页打开)