手势追踪失效场景模拟
手势识别不是"摄像头看得见就行":它要从 2D 图像里回归出 每只手 22 个关节点的 3D 坐标,靠的是模型,不是像素。
工程结论:手势适合轻量选择、滑动、捏合;手柄适合精细操作、长时间使用、需要力反馈的场景。生产级 VR 应用几乎都是"手柄为主 + 手势为辅"。
四类输入方式对比
| 方式 | 传感器 | 典型延迟 | 最强场景 | 致命弱点 |
| 手柄 | 6DoF 追踪(红外/摄像头)+ 按键 + 线性马达 | 10–30 ms | 游戏、建模、精细 UI、需要震动反馈 | 要握着,学习成本(按键布局) |
| 手势 | RGB/红外摄像头 + 手部关键点模型 | 30–60 ms | 轻量选择、演示、零学习成本 | 无物理反馈、举手易累("大猩猩臂")、受光照/背景影响 |
| 眼动 | 头显内红外摄像头(4 颗) | 10–20 ms | 凝视选择、注视点渲染省算力、无障碍交互 | "米达斯触碰"问题(看着就被选中)、需标定 |
| 语音 | 4 麦克风阵列 + ASR + 意图理解 | 300–800 ms(含云端) | 输入文字、下达指令、长列表导航 | 嘈杂环境、隐私顾虑、延迟高、需联网 |
| 数据手套 / 动捕 | 弯曲传感器 / IMU / 光学标记 / 体感追踪器 | 10–30 ms | 医疗康复、手语、全身动捕、影视 | 穿戴麻烦、标定耗时、成本高 |
没有最好的输入方式,只有最合适的场景。这就是本章的核心结论。
与本学期项目的关系:第6章密室逃脱以手柄抓取为主;第7章 LLM 导览 NPC 用语音 + 手柄菜单;第8章 AR 用触屏 + 手势。
PICO 体感追踪器(选配):27 g,IMU + 12 颗红外传感器,6DoF 追踪最高 200 Hz,全身 24 个骨骼点,延迟约 20 ms,步频识别准确率 ≥98%(官方口径)——这是"头显看不见的部位"如何被补齐的典型方案。