2024年,AR眼镜突然成了科技圈最火的话题。

从Meta的Ray-Ban智能眼镜到Xreal的Air系列,从苹果的Vision Pro(虽然它更偏向MR)到各种创业公司的AR产品,似乎所有人都在讨论"空间计算"和"下一代计算平台"。但很多人可能并不清楚,一副看起来普普通通的眼镜,是怎么把虚拟图像叠加到真实世界中的。

这篇文章就来深入剖析一下AR眼镜的工作原理。我们不谈产品评测,也不聊市场前景,只聊技术本身:AR眼镜是怎么显示图像的,怎么知道你在哪里的,怎么和你交互的,以及它的计算架构是怎么设计的。

光学显示:虚拟图像从哪里来

AR眼镜最核心的技术是光学显示。这也是AR眼镜和普通眼镜最大的区别。

普通眼镜只是透明的镜片,光线直接穿过镜片进入你的眼睛。AR眼镜则需要在透明的镜片上显示虚拟图像,同时还要让真实世界的光线透过来,这样你才能看到虚拟图像叠加在真实世界上的效果。

这个问题听起来简单,实现起来却非常困难。因为你需要在一个透明的介质上,既能让外界光线透过,又能把微型显示器发出的光反射或折射到你的眼睛里。目前主流的解决方案有这么几种。

第一种是自由曲面棱镜方案。这种方案的原理比较简单,就是在眼镜腿里放一个微型显示器(通常是Micro OLED),显示器发出的光经过一个自由曲面棱镜的反射,进入你的眼睛。自由曲面棱镜的形状经过特殊设计,可以把光线准确地聚焦到你的视网膜上。这种方案的优点是结构简单、成本较低、显示效果不错,缺点是视场角比较小,一般在30到50度之间,而且镜片比较厚,看起来不太像普通眼镜。

第二种是光波导方案。这是目前高端AR眼镜最主流的方案。光波导的原理是:显示器发出的光进入一个薄薄的光波导镜片,在镜片内部通过全反射的方式传播,到达你眼前的位置后,再通过一组特殊的光学结构(比如衍射光栅或半透半反镜阵列)把光"提取"出来,反射到你的眼睛里。这种方案的优点是镜片可以做得很薄,看起来和普通眼镜差不多,视场角也可以做得比较大。缺点是技术难度高、成本贵,而且光波导会有一些光学瑕疵,比如色彩不均匀、亮度损失等。

光波导又分为几种不同的技术路线。几何光波导(也叫阵列光波导)用的是半透半反镜阵列,显示效果好但制造工艺复杂。衍射光波盗用的是表面浮雕光栅或体全息光栅,制造相对简单但光学效果稍差。还有一种叫偏振光波导的,用的是偏振相关的光学结构,是微软HoloLens采用的方案。

第三种是BirdBath方案。这种方案的原理是在你眼前放一个半透半反镜,显示器在侧面或下方,发出的光经过反射镜反射到半透半反镜上,一部分光反射进入你的眼睛,另一部分光透过,让你看到真实世界。这种方案的优点是显示效果好、视场角大、成本适中,缺点是眼镜比较大比较重,而且遮光性比较强,看起来更像VR眼镜而不是普通眼镜。

不同的方案有不同的优缺点,适用于不同的产品定位。入门级的AR眼镜可能用自由曲面或BirdBath,高端的消费级AR眼镜倾向于光波导方案。未来随着技术的进步,光波导方案的成本会逐渐降下来,显示效果也会越来越好。

空间感知:AR眼镜怎么知道你在哪里

AR眼镜要把虚拟图像准确地叠加到真实世界中,就必须知道你在哪里、你在看哪里、周围的环境是什么样的。这就是空间感知技术要解决的问题。

空间感知的核心是SLAM(同时定位与地图构建)技术。SLAM的原理是:AR眼镜通过摄像头不断拍摄周围的环境,从图像中提取特征点(比如墙角、桌子边缘、纹理丰富的区域),然后通过比较不同帧之间特征点的位置变化,来计算摄像头的运动轨迹,同时构建周围环境的三维地图。

这个过程听起来简单,实际上非常复杂。因为摄像头在运动,环境也可能在变化(比如有人走过、有物体移动),光照条件也可能在变化。SLAM算法需要在这些不确定的条件下,准确地估计摄像头的位置和姿态,同时构建一致的环境地图。

AR眼镜中的SLAM通常使用多个传感器融合的方式。除了摄像头之外,还会用到IMU(惯性测量单元,包括加速度计和陀螺仪)来测量头部的运动,用深度传感器(比如结构光或ToF)来获取环境的深度信息。这些传感器的数据融合在一起,可以得到更准确、更稳定的定位结果。

有了SLAM的结果,AR眼镜就知道了你在空间中的位置和朝向,也知道了周围环境的三维结构。这样它就可以把虚拟物体放在正确的位置上,比如把一个虚拟的花瓶放在真实的桌子上,当你走动的时候,花瓶会保持在桌子上不动,而不是跟着你的头移动。

除了SLAM之外,空间感知还包括环境理解。AR眼镜不仅要知道环境的几何结构,还要理解环境中的语义信息,比如识别出这是一张桌子、那是一面墙、前面有一个人。这样它才能做出更智能的交互,比如把虚拟信息贴在墙上,或者在人经过的时候自动隐藏虚拟物体。

环境理解通常依赖于深度学习模型。AR眼镜上的摄像头拍摄的图像会被送到一个神经网络中,进行物体检测、语义分割、场景识别等任务。这些计算量很大的任务,对AR眼镜的计算能力提出了很高的要求。

交互方式:你怎么和AR眼镜互动

AR眼镜的交互方式和传统的电脑、手机完全不同。你没有鼠标键盘,也没有触摸屏,你需要用一种更自然的方式和虚拟内容互动。

目前AR眼镜的交互方式主要有这么几种。

第一种是语音交互。这是目前最成熟、最常用的交互方式。你可以通过语音命令来控制AR眼镜,比如"打开导航""拍照""给某某发消息"。语音交互的优点是自然、方便、不需要动手,缺点是在公共场合使用会比较尴尬,而且语音识别的准确率受环境噪音影响较大。

第二种是手势交互。AR眼镜通过摄像头或深度传感器识别你的手部动作,你可以用手势来和虚拟内容互动,比如用手指点击虚拟按钮、用手抓取虚拟物体、用双手缩放虚拟画面。手势交互的优点是直观、自然,缺点是长时间抬手会很累,而且手势识别的准确率和稳定性还有待提高。

第三种是眼动追踪。AR眼镜通过红外摄像头追踪你的眼球运动,知道你在看哪里。眼动追踪可以用来做很多事情,比如你看哪里就把哪里的虚拟内容渲染得更清晰(注视点渲染,可以大幅降低计算量),比如你盯着一个虚拟按钮看几秒就可以触发点击,比如根据你的视线方向来调整虚拟内容的显示。眼动追踪的优点是非常自然、不需要额外的动作,缺点是技术难度高、成本贵,而且有些人可能会觉得被盯着眼睛不舒服。

第四种是头部姿态交互。通过IMU测量你的头部运动,你可以用点头、摇头、转头等动作来和AR眼镜互动。比如你转头看向一个虚拟物体,它就会自动显示更多信息;你点头就可以确认一个操作。这种交互方式比较简单,但能做的事情有限,通常作为辅助交互方式。

第五种是外接设备交互。比如用手机作为触控板、用蓝牙手柄、用智能戒指等。这种方式的优点是交互精度高、可靠性好,缺点是需要额外携带设备,不够便捷。

实际的AR眼镜产品通常会组合使用多种交互方式。比如用语音做主要的命令输入,用手势做精细的虚拟物体操作,用眼动追踪做注视点渲染和选择,用头部姿态做辅助控制。未来随着技术的进步,交互方式会越来越自然、越来越智能。

计算架构:AR眼镜的大脑在哪里

AR眼镜需要处理大量的计算任务:图像采集和处理、SLAM、环境理解、显示渲染、语音识别、手势识别、眼动追踪、网络通信等等。这些计算任务对处理器的性能要求非常高,同时又受到功耗和散热的严格限制(因为眼镜要戴在头上,不能太重太热)。

这就带来了一个矛盾:性能要求高,但功耗和体积限制严。为了解决这个矛盾,AR眼镜的计算架构通常有两种设计思路。

第一种是一体式架构,就是把所有的计算单元都放在眼镜本身。处理器、内存、存储、电池都集成在眼镜腿或镜框里。这种架构的优点是独立完整,不需要外接设备,使用方便。缺点是眼镜会比较重,续航时间短,散热压力大,性能也受到限制。目前大多数消费级AR眼镜采用的是这种架构,但通常会用性能和功耗比较平衡的处理器,而不是手机级别的旗舰处理器。

第二种是分体式架构,就是把主要的计算单元放在一个外接的计算盒里,眼镜本身只做显示和传感器数据采集,通过有线或无线的方式和计算盒连接。计算盒可以放在口袋里或者挂在腰上,里面可以放性能更强的处理器和更大的电池。这种架构的优点是眼镜可以做得很轻,性能和续航都更好,缺点是需要额外携带计算盒,不够便捷。微软的HoloLens和一些工业级AR眼镜采用的是这种架构。

除了这两种基本架构之外,还有一种思路是云端计算。就是把计算量最大的任务(比如复杂的3D渲染、大规模的环境理解)放到云端服务器上处理,眼镜本身只做数据采集和结果显示。这种方式可以大幅降低眼镜本身的计算需求,但对网络带宽和延迟要求很高,而且涉及隐私问题。目前这种方式还在探索阶段,没有大规模商用。

在处理器的选择上,AR眼镜通常会用专门的异构计算架构。除了通用的CPU之外,还会有GPU(负责图形渲染)、DSP(负责信号处理)、NPU(负责神经网络推理)、ISP(负责图像处理)等专门的处理单元。不同的计算任务分配给最合适的处理单元,可以在保证性能的同时降低功耗。

AR眼镜面临的技术挑战

虽然AR眼镜的发展很快,但目前还面临着很多技术挑战。

第一个挑战是显示技术。目前的AR眼镜在显示效果上和人们的期望还有很大差距。视场角不够大(大多数在40到60度之间,人眼的视场角超过180度),分辨率不够高,亮度不够(在户外强光下看不清),色彩不够鲜艳,光学瑕疵(比如彩虹效应、纱窗效应)还比较明显。要解决这些问题,需要在光学设计、显示面板、制造工艺等方面都有突破。

第二个挑战是续航和散热。AR眼镜需要持续运行高负载的计算任务,但电池容量受限于眼镜的重量和体积。目前大多数AR眼镜的续航时间在2到4小时之间,远远不够全天使用。同时高负载计算产生的热量需要散出去,但眼镜戴在头上,散热条件很差,温度高了会不舒服甚至烫伤。如何在有限的体积和重量下实现更长的续航和更好的散热,是一个很大的挑战。

第三个挑战是空间感知的精度和鲁棒性。虽然SLAM技术已经比较成熟了,但在一些复杂的环境中(比如纹理稀少的白墙、快速运动、光照剧烈变化、动态物体很多的场景),SLAM还是会出现漂移或丢失。空间感知的精度直接影响AR体验,如果虚拟物体在真实世界中"飘来飘去",用户体验会很差。

第四个挑战是交互的自然性和准确性。目前的交互方式都还不够完美。语音在公共场合不方便,手势长时间使用会累,眼动追踪成本高精度有限,头部姿态能做的事情少。如何找到一种真正自然、准确、舒适的交互方式,是AR眼镜普及的关键。

第五个挑战是内容生态。任何计算平台的成功都离不开丰富的内容和应用。目前AR眼镜的应用还比较少,主要集中在导航、翻译、视频观看、简单游戏等领域,缺乏真正的"杀手级应用"。如何吸引开发者为AR平台开发应用,如何创造出用户真正需要的AR体验,是整个行业需要思考的问题。

写在最后

AR眼镜被很多人看作是继智能手机之后的下一代计算平台。它的愿景很美好:把数字信息无缝地叠加到真实世界中,让你随时随地获取需要的信息,和虚拟内容自然地互动。

但要实现这个愿景,还有很多技术难题需要攻克。从光学显示到空间感知,从交互方式到计算架构,每一个环节都还有很大的提升空间。这也是为什么AR眼镜讨论了这么多年,直到最近才开始有比较成熟的消费级产品出现。

了解AR眼镜的工作原理,可以帮助我们更理性地看待这项技术。它不是魔法,而是建立在光学、计算机视觉、人机交互、芯片设计等多个学科基础上的复杂工程。每一个看似简单的功能背后,都有大量的技术积累和创新。

未来随着技术的不断进步,AR眼镜会越来越轻、越来越小、显示效果越来越好、续航越来越长、交互越来越自然。也许有一天,AR眼镜会像今天的智能手机一样普及,成为我们日常生活中不可或缺的一部分。

但在那一天到来之前,让我们先理解它背后的技术逻辑。知道它是怎么工作的,才能更好地判断它的价值和局限,也才能更理性地期待它的未来。