虚拟现实技术 · 第 2 次课

虚拟现实的关键技术

重点:立体显示技术 · 从“为什么能看见立体”到“头显的每一个参数意味着什么”

中华女子学院4 学时 · 180 分钟(理论 3 + 实验/演示 1)授课人:孙琪翔2026-09-09 · 第 2 周

本讲导览

Lesson Overview · 上一讲问“VR 是什么”,这一讲问“VR 凭什么能工作”

第 1 次课得出了一个结论:VR 靠沉浸性、交互性、构想性三个特征区别于普通媒体。这一讲回答更硬核的问题——这三个特征,到底靠哪些技术实现?课程以立体显示为主线讲透,其余四项关键技术各给一个清晰概览。

为什么选立体显示当主线?因为它是 VR 区别于普通屏幕的第一性差异,也是眩晕、清晰度、沉浸感争论最集中的地方。

课堂主线

五大关键技术总览(10 min)
   ↓
人如何感知深度:线索与双目视差(25 min)【演示 01—02】
   ↓
助视式立体显示:分色 / 分时 / 偏振(30 min)【演示 03—05】
   ↓
裸眼立体显示:视差屏障 / 柱状透镜(22 min)【演示 06—07】
   ↓
真三维显示:体三维 / 全息 / 光场(20 min)【演示 08—10】
   ↓
头戴式显示 HMD:光学、指标、VAC(30 min)【演示 11—13】
   ↓
其余四项技术概览 + AI 前沿(18 min)【演示 14—15】
   ↓
学生实操与小结(22 min)

本讲学习目标

学完能做什么

  • 说出 VR“为什么能工作”的五大关键技术;
  • 用“深度线索 + 双目视差 + 调节-辐辏”解释人为什么能感知立体;
  • 按“助视式 / 裸眼式 / 真三维”给主流立体显示技术分类,并说清各自的分光思路、优点与局限;
  • 解释 HMD 的 Pancake 光路与关键指标,会做 PPD 估算。

实践与前沿

  • 完成 5 个浏览器实操小实验,把“立体显示”落到可操作、可观察的图形参数;
  • 了解 2026 年前沿:光场显示、计算机全息(CGH)、视网膜投影、多焦面/变焦显示,以及 AI 在立体显示中的作用。

模块地图

五大关键技术总览

一张表建立全局

关键技术它回答的问题典型实现 / 载体对应第 1 章特征
立体显示为什么眼前是“有深度的世界”?HMD(Pancake / 菲涅尔)、偏振 / 快门 / 分色、裸眼光栅、体三维、全息、光场沉浸性
三维建模世界里有什么?物体长什么样、怎么动?几何建模、物理建模、运动建模;3ds Max / Maya / Blender沉浸性 + 构想性
三维虚拟声音世界为什么“听上去”也有方位?HRTF、双耳效应、声源定位、空间音频沉浸性
人机交互我如何操作、世界如何回应?跟踪定位(光学 / 惯性)、手势、眼动、语音、触觉交互性
VR 引擎谁来实时组织、渲染这一切?Unity、Unreal;渲染 / 物理 / 脚本 / 资源管理全部(技术底座)
一条判断口诀:沉浸 ← 立体显示 + 三维声音(“像真的”);交互 ← 人机交互(“能参与”);构想 ← 三维建模 + 引擎(“能造出来、跑起来”)。

人为什么能看见立体:深度线索与双目视差

Depth Cues & Binocular Disparity

先区分两个层面:物理上,真实世界是三维的,光从不同方向、不同距离进入眼睛;感知上,大脑“看到”深度靠的是一系列深度线索(depth cues)。立体显示的本质,就是用技术去“伪造”这些线索,让大脑误以为看到的是真实三维场景。

2.1 单眼线索(一只眼睛也能获得)

单眼线索说明在普通 2D 屏幕上能否实现
遮挡 occlusion近物挡住远物,是最强的线索之一
相对大小同样大小的物体,远的看起来小
线性透视平行线在远处汇聚
纹理梯度近处纹理粗、远处纹理密
相对高度通常位置越高看起来越远
空气透视 / 明暗远处更模糊、更偏蓝灰
运动视差头 / 身体移动时,近物移动快、远物移动慢能(交互后更强)
调节 accommodation睫状肌改变晶状体焦距不能(平面屏幕无法提供真实变化)

2.2 双眼线索(VR 立体显示的核心)

双眼视差(binocular disparity / parallax)

同一物体在左右眼视网膜上成像位置不同,位置差异量就是“视差”。因为两眼之间有约 6—6.5 cm 的瞳距(IPD),两眼看世界相当于两台错开 6.5 cm 的摄像机。

辐辏(convergence)

看近物时两眼向内转、看远物时两眼放松,眼球转动角度本身也提供深度信息。辐辏与下一节要讲的“调节”是 VAC 问题的两个主角。

视差与距离的关系:物体越近 → 左右眼图像里它“偏移”越大;物体越远 → 偏移越小,趋向于两图几乎重合;无限远 → 视差约为 0。
演示:02 双目视差——拖动“瞳距”和“物体距离”滑杆,观察左右两幅图中近球与远球的位置差,再切到“合像模式”体会大脑如何把视差融合成深度。

2.3 视差的两种符号:「出屏」与「入屏」

必须记住的结论:普通 2D 屏幕只有单眼线索,没有双眼视差;VR 头显的核心价值,就是补上双眼视差(以及随头部移动而更新的运动视差)——这也是 VR 能让人感到“在场(presence)”的原因。

立体显示技术的全景分类

先画地图,再逐个技术打勾

按“是否提供真实聚焦深度 / 连续视差”,立体显示分为两大阵营。这棵树是本节课的骨架,每讲完一个技术就在树上打一个勾。

立体显示技术
├── 双目视差式(本质:给左右眼各一张略不同的图)
│   ├── 助视式(要戴眼镜 / 头盔)
│   │   ├── 分色立体(红蓝 / 红青)      —— 颜色分光
│   │   ├── 分时立体(主动快门)         —— 时间分光
│   │   ├── 分光立体(偏振)             —— 偏振方向分光
│   │   └── 头戴式显示 HMD              —— 空间隔离(左眼一块屏、右眼一块屏)
│   └── 裸眼式(光栅式,不戴眼镜)
│       ├── 视差屏障
│       ├── 柱状透镜
│       └── 指向背光 / 时空复用等
└── 真三维式(试图重建真实光场 / 波前,含真实聚焦深度)
    ├── 体三维显示(Volumetric)
    ├── 全息显示(Holographic / CGH)
    └── 光场显示 / 集成成像(Light field / Integral imaging)
记住一句话就够了:所有双目视差式技术,目标都只有一个——把左眼该看的图只给左眼,右眼该看的图只给右眼。不同技术的差别,只是“用什么物理量把左右图分开”。

助视式立体显示

分色 · 分时(快门)· 分光(偏振)

4.1 分色立体(Anaglyph,红蓝 / 红青)

演示:03 分色立体(拖动“视差强度”体会出屏 / 入屏;配红青眼镜可见真实立体)。

4.2 分时立体(Active Shutter,主动快门)

演示:04 主动快门(调高频率看“闪烁融合”,调低看“左右图轮流出现”)。

快门模拟页有高频闪烁,投屏演示时用“标签页分享”,不要长时间直视全屏高频闪烁

4.3 分光立体(Polarization,偏振)

演示:05 偏振(切换“戴 / 不戴眼镜”,看左右眼各能收到哪束光)。

4.4 三种助视技术对比

技术分光依据眼镜成本色彩亮度是否需要供电 / 同步
分色(红蓝)颜色极低差(偏色)
分时(快门)时间中(被遮挡)
分光(偏振)偏振方向中—高否(但屏幕要保偏)
事实提醒:偏振与快门的真实效果不能在普通电脑屏上复现,课堂演示只是原理动画。分色(红青)是唯一能直接在屏幕上真实体验的例外,但需要红青 3D 眼镜。

裸眼立体显示

Autostereoscopy · 不用戴眼镜的代价是什么

裸眼的卖点是不用戴眼镜,主流思路是在屏幕前加一层光学结构,把不同子像素发出的光“定向”送到左右眼。

5.1 视差屏障(Parallax Barrier)

演示:06 视差屏障(拖动“屏障宽度 / 位置”观察串扰如何出现)。

5.2 柱状透镜(Lenticular Lens)

演示:07 柱状透镜(俯视图看微透镜折射分光,并与屏障做亮度对比)。

5.3 视差屏障 vs 柱状透镜

维度视差屏障柱状透镜
分光方式遮挡(狭缝)折射(微透镜)
亮度低(约减半)较高
结构 / 成本简单、便宜需要精密透镜
串扰风险存在存在(摩尔纹更明显)
共同局限分辨率 / 亮度 / 视角需要权衡,都存在“最佳观看点(sweet spot)”
为改善“只有固定位置才能看”的问题,出现了多视角(multi-view)超多视角(super multi-view)技术,用更多视点让移动时看到连续变化;再往前一步,就逼近下面的光场显示

真三维显示

体三维 · 全息 · 光场 / 集成成像

前两类都是“左右眼各一张图”的双目视差方案,它们没有真实聚焦深度——眼睛的焦距始终锁定在屏幕上。真三维显示试图在空间中重建真实的光分布,让眼睛能真正对焦到不同深度。

6.1 体三维显示(Volumetric 3D Display)

演示:08 体三维

6.2 全息显示(Holographic Display / CGH)

演示:09 全息(页面明确标注“原理示意,非真实全息”)

6.3 光场显示与集成成像(Light Field / Integral Imaging)

演示:10 光场

6.4 三类真三维显示速记

技术重建的是什么是否有真实聚焦深度现状
体三维空间中的发光体素部分有有产品,体积 / 遮挡受限
全息光的波前(振幅 + 相位)有(理想)多为 CGH + SLM 实验室方案
光场 / 集成成像多方向光线分布有(有限景深)已有消费级 / 专业级产品
难点辨析:全息记录的是“波前(振幅 + 相位)”,光场记录的是“光线方向分布(位置 + 方向)”——两者目标相似、物理实现不同。

头戴式显示(HMD):VR 的核心形态

光学方案 · 关键指标 · PPD 估算 · VAC

7.1 为什么 VR 用 HMD,而不是裸眼大屏?

  1. 视场角(FOV):把显示面板 + 光学系统贴在眼前,才能撑满人眼大部分视野,制造“包裹感”;
  2. 双眼隔离彻底:左右眼各一块屏 / 各一半屏,视差可控、串扰低;
  3. 头部运动视差:头显随头转动、画面随视角更新,强化立体与在场感。

7.2 光学方案:从传统透镜到 Pancake

方案原理体积 / 重量说明
传统球面 / 非球面透镜把近处屏幕成像到远处厚、重早期 HMD
菲涅尔透镜(Fresnel)用同心环槽“压扁”透镜常见于 HTC Vive、Quest 2 等;有“同心圆眩光”
Pancake 折叠光路偏振反射 + 部分反射,让光来回折返多次薄、轻PICO 4 Ultra、Quest 3 等一体机主流;亮度利用率较低,需高亮屏

演示:11 头显模拟器(可调瞳距、视场角、畸变,附 Pancake 折返光路示意图)

7.3 HMD 关键指标(重点)

分辨率与 PPD

分辨率只是“总像素”,真正决定清晰度的是 PPD(每度像素数)

PPD ≈ 单眼水平像素数 ÷ 单眼水平视场角

经验阈值(课堂口径,非绝对标准):约 20 PPD 明显改善“纱窗效应”;约 60 PPD 接近人眼正常分辨极限(常被引作“视网膜级”目标)。

刷新率与延迟

刷新率越高,动态越顺、闪烁越低,90Hz 是舒适体验的常用起步值(120 / 144Hz 更佳)。

延迟(MTP,Motion-to-Photon):从头动到画面更新的总延迟,应尽量控制在 20ms 以内,否则易晕。

余晖(persistence):像素持续发光时间,余晖高会带来拖影。

视场角(FOV)

人眼单眼水平约 90°+、双眼约 200°(含周边);常见一体机双眼 FOV 约 90°—110°,越大越沉浸

FOV 越大,同样像素数下的 PPD 越低——清晰度与沉浸感之间存在权衡。

7.4 PPD 估算练习

设备(示例)单眼分辨率单眼水平 FOV估算 PPD
PICO 4 Ultra2160×2160≈102°(双眼约 105°)2160 ÷ 102 ≈ 21(官方口径:平均约 20.6、中心约 22.5)
Quest 3(参考)2064×2208≈96°2064 ÷ 96 ≈ 22
Apple Vision Pro(参考)约 3686×3140(厂商口径“微 OLED”)单眼约 100°37(口径有争议,仅供趋势对比)
PPD 阈值属经验区间而非绝对标准;Vision Pro 的单眼分辨率与 PPD 不同来源口径不一,课堂上只做“明显高于一体机”的趋势对比,不给绝对精确值。用分辨率 ÷ 视场角估算出的数值(如 21)与厂商公布的“平均 / 中心 PPD”口径会略有差异,课堂以“约 20—22 PPD”这一量级为准。

演示:13 PPD 计算器 · 17 增强版(输入分辨率与视场角,自动与 20 / 60 两条阈值线比较)

7.5 调节-辐辏冲突(VAC)

冲突是怎么产生的

  • 辐辏(会聚):两眼向内转的角,取决于“大脑认为物体在哪”;
  • 调节(对焦):晶状体屈光度,取决于“光实际从哪个距离来”;
  • 普通 HMD 里屏幕固定在一个距离,所以调节距离固定;但视差图像不断暗示不同深度,辐辏不断变化 → 两者打架,产生视觉疲劳与眩晕。

缓解思路

  1. 变焦 / 多焦面显示:让屏幕焦距可变或堆叠多个焦面;
  2. 全息 / 光场显示:从源头提供真实聚焦深度;
  3. 深度融合显示(DFD):两个相邻焦面的亮度分配,近似连续深度;
  4. 软件缓解:控制景深、减少需要大幅辐辏的近距离内容、缩短单次使用时间。

演示:12 VAC · 18 增强版

工程权衡:完全消除 VAC 需要变焦 / 多焦面 / 全息 / 光场,成本与复杂度都很高——这正是立体显示仍是最活跃研究方向的证据。

其余四项关键技术概览

建模 · 虚拟声音 · 人机交互 · VR 引擎

三维建模技术

  • 几何建模:用顶点 / 网格 / 曲面描述物体形状(多边形网格、NURBS、体素);
  • 物理建模:赋予质量、碰撞与材质属性,让物体遵守物理规律;
  • 运动建模:描述物体如何运动(刚体运动、骨骼动画、粒子系统)。

三维虚拟声音技术

  • 双耳效应:两耳时间差(ITD)、声级差(ILD)、频谱线索;
  • HRTF(头相关传递函数):描述头、耳廓、躯干如何“调制”来自不同方向的声音,是实现 3D 音效的关键;
  • 空间音频:配合头部追踪,声源方位随转头实时更新。

演示:14 三维声音 HRTF(戴耳机点“播放”)

人机交互技术

  • 跟踪定位:光学(Inside-Out 的 SLAM、Outside-In 的基站)、惯性(IMU)、电磁、机械;
  • 手势 / 肢体:数据手套、手部追踪骨骼点;
  • 眼动追踪:注视点渲染(Foveated Rendering)的基础,也用于选择交互;
  • 语音:ASR → 语义 → TTS 链路。

演示:15 人机交互

虚拟现实引擎技术

  • 渲染:实时把三维场景画到双眼画面;
  • 物理:碰撞检测与刚体动力学;
  • 脚本:用代码驱动逻辑;
  • 资源管理:模型、贴图、音频、场景的加载与优化。

这四项技术与立体显示是配合关系:没有好的三维建模,立体显示就没有内容可显示;没有低延迟渲染,立体画面会撕裂、引发眩晕。

AI 与立体显示的前沿

2026 年的四条线索

  1. AI 生成 3D(Hunyuan3D、Meshy、TripoSR、TRELLIS 等)解决“内容从哪来”,让立体显示有足够的高质量场景可显示;
  2. 注视点渲染(Foveated Rendering):用眼动追踪只对视线中心做高清渲染,降低算力开销,间接支持更高 PPD 与更高刷新率;
  3. AI 显示优化:用神经网络做畸变校正、超分辨率、串扰补偿;
  4. 空间智能 / 世界模型:NeRF、3DGS 等把真实世界转为可显示、可交互的 3D 表示,是未来“生成式立体内容”的基础。

演示中心 · 实操任务 · 作业

把原理落到可观察、可操作的东西上

一页知识地图

为什么能看见立体?
   单眼线索(遮挡 / 透视 / 运动视差…)+ 双眼线索(视差 / 辐辏)
                ↓
立体显示怎么骗过眼睛?
   双目视差式:分色 / 分时 / 偏振 / HMD / 视差屏障 / 柱状透镜
   真三维式:体三维 / 全息 / 光场
                ↓
VR 里怎么落地?
   HMD + Pancake / Fresnel + 双目屏
   指标:分辨率、PPD、FOV、刷新率、延迟、余晖
   核心矛盾:VAC(调节-辐辏冲突)
一句话收束:立体显示不是“把图做漂亮”,而是精准控制进入两只眼睛的光——分色、分时、分光、分空间、重建波前,都是同一个目标的不同实现路径。

课堂演示中心(18 个演示,浏览器直接打开)

全部离线可用、无外部依赖,手机或电脑浏览器均可运行。除“03 分色立体”需红青眼镜才能真实体验立体外,其余均为原理示意 / 模拟

学生实操任务(5 个实验,只需浏览器)

实验演示文件关键观察点
实验 1 单眼线索还是双眼线索01 深度线索闭上一只眼后哪些线索仍然有效;运动视差中近物与远物谁移动得快
实验 2 瞳距与视差02 双目视差物体越近视差越大;瞳距越大视差越大;近物与远物偏移方向相反
实验 3 做一个“红青立体图”03 分色立体正视差对应入屏;最大缺点是颜色失真
实验 4 裸眼 3D 的最佳观看点06 视差屏障 · 07 柱状透镜偏离最佳位置出现串扰 / 重影;屏障的亮度损失更大
实验 5 算 PPD + 找 VAC 冲突13 PPD 计算器 · 12 VAC2160 ÷ 102 ≈ 21 PPD;物体越近,调节与辐辏差距越大、越容易疲劳

每组把 5 个实验的“记录 + 思考”整理成一页(手写拍照 / Word / Markdown 均可)提交。

随堂测验(抢答 + 判断改错)

抢答 4 题

  1. 立体显示技术最直接服务于 VR 三大特征中的哪一个?
    答:沉浸性
  2. “物体越近,左右眼视差越大”对吗?
    答:对(视差随距离减小而增大)
  3. 分色、分时、分光分别用什么物理量分开左右眼图像?
    答:颜色 / 时间 / 偏振方向
  4. PPD 怎么算?PICO 4 Ultra 约是多少?
    答:单眼水平像素 ÷ 单眼水平 FOV ≈ 2160÷102 ≈ 21

判断改错 4 题

  1. 视差屏障和柱状透镜都需要戴眼镜。
    错:裸眼式不需要眼镜
  2. 全息记录“波前(振幅 + 相位)”,比普通照片多了相位信息。
  3. 普通 VR 头显里眼睛的“调节距离”随物体远近改变。
    错:调节固定、辐辏变化,这才是 VAC
  4. 120Hz 分时立体,每只眼睛理论上约得到 60Hz。
    对(按常见简化口径)

课后作业与预习

  1. 提交 5 个实操实验的观察记录(以小组为单位);
  2. 整理一张“立体显示技术分类图”:用自己的话重画分类树(助视式 / 裸眼式 / 真三维),每类写 1 个代表技术 + 1 个优点 + 1 个缺点;
  3. PPD 计算题:单眼分辨率 2560×2560、单眼水平视场角 100°,计算 PPD 并判断是否达到“约 20 PPD”的经验门槛;
  4. 思考题(课程思政):立体显示与空间音频如何帮助视障 / 听障人群获得更好的信息获取体验?(100—200 字,结合深度线索或 HRTF 概念)
  5. 预习第 3 章“虚拟现实系统的硬件设备”(下次课 2026-09-16):浏览 PICO 4 Ultra、Meta Quest 3、Apple Vision Pro 的官方规格页,整理“分辨率 / PPD / 视场角 / 刷新率 / 光学方案 / 定位方式”对比草表。上课会亲手在 PICO 上查到这些参数(瞳距、透视、交互方式、录屏),并填《主流 XR 硬件参数对比表》。
  6. 下一课之后再动手:第 4 次课(2026-09-23)进入第 4 章开发常用软件,在机房用 Unity 完成第一个可运行的 VR 场景(案例 01);届时本课学到的立体显示与硬件指标会在软件里一一对上。
评分要点:观察记录完整(40%)+ 分类图逻辑清晰(30%)+ 计算正确(20%)+ 思考题有自己的分析(10%);提交时间为下次课前。
口径更新(2026-09-15):自第 3 次课起,课程改为“课内完成”模式,不另布置课后任务;课堂作业(30%)随课布置、课内完成。期末大作业(40%)是本学期 8 个课堂案例的合集,第 12 次课(2026-12-02)整体演示。本次课已布置的观察记录等作业仍按原要求提交。