2024年,随着Apple Vision Pro的发布,"空间计算"(Spatial Computing)这个词火了起来。
苹果把Vision Pro定义为"空间计算设备",而不是VR头显或者AR眼镜。这个定义的背后,是一套全新的计算范式:计算机不再局限于二维的屏幕,而是进入到三维的空间中,和真实世界融合在一起。
很多人体验过Vision Pro之后,都会觉得很神奇:虚拟的物体怎么能像真实物体一样放在房间里?手怎么能直接和虚拟物体交互?眼睛怎么能控制光标?这篇文章,就来从技术原理的角度,剖析空间计算的底层机制。
什么是空间计算
先说说什么是空间计算。
空间计算,简单来说,就是让计算机理解和利用三维空间的一种计算方式。在传统的计算中,我们通过屏幕这个窗口和计算机交互,所有的内容都被限制在屏幕这个二维平面里。而在空间计算中,计算机能够感知周围的三维环境,并且把虚拟内容叠加到真实空间中,让用户可以在三维空间中和计算机交互。
空间计算和VR、AR、MR有什么区别呢?
VR(虚拟现实):完全沉浸在虚拟世界中,看不到真实世界。 AR(增强现实):在真实世界上叠加虚拟信息,比如手机上的AR应用。 MR(混合现实):虚拟物体和真实世界融合,虚拟物体可以和真实物体交互。 空间计算:是一个更宽泛的概念,它强调的是计算机对空间的感知和利用,VR、AR、MR都可以看作是空间计算的不同形态。
Apple Vision Pro代表的空间计算,有几个关键特征:
- 透视显示:通过外部摄像头把真实世界的画面实时传到头显内的屏幕上,实现"透视"效果
- 空间锚定:虚拟物体可以固定在真实空间的某个位置,用户走动时,虚拟物体会保持在原位
- 自然交互:用手、眼睛、语音来交互,不需要手柄
- 环境理解:设备能理解周围的环境,比如识别地面、墙壁、家具
这些特征,听起来很神奇,但背后都是扎实的技术。下面逐一剖析。
核心技术一:环境感知与空间映射
空间计算的基础,是设备能够感知和理解周围的环境。这主要靠各种传感器和计算机视觉算法来实现。
Vision Pro上有多个传感器:
- 外部摄像头:12个摄像头,包括广角、超广角、红外摄像头,用来捕捉真实世界的画面
- 激光雷达(LiDAR):用来测量深度,构建三维空间地图
- 红外传感器:用来检测手部和身体的位置
- IMU(惯性测量单元):用来追踪头部的运动和姿态
这些传感器协同工作,实时构建周围环境的三维地图。这个过程叫做"空间映射"(Spatial Mapping)。
空间映射的过程大致是这样的:
第一步,深度感知。激光雷达发射激光,测量到周围物体的距离,生成深度图。同时,摄像头捕捉彩色图像。深度图和彩色图像结合,就能生成带颜色的三维点云。
第二步,SLAM(同时定位与地图构建)。设备在移动的过程中,通过IMU和视觉信息,实时计算自己的位置和姿态,同时不断更新环境的三维地图。SLAM是空间计算的核心算法之一,它让设备知道"我在哪里"以及"周围是什么"。
第三步,场景理解。在三维点云的基础上,用AI算法识别场景中的物体:哪里是地面,哪里是墙壁,哪里是桌子,哪里是人。这样,虚拟物体才能正确地放在地面上,或者被真实的家具遮挡。
第四步,空间锚点。当用户把一个虚拟物体放在某个位置时,系统会在这个位置创建一个"空间锚点"。这个锚点和周围的环境特征绑定,即使用户走开再回来,虚拟物体依然会在原来的位置。
整个过程是实时进行的,延迟要控制在几毫秒以内,否则用户就会感觉到虚拟物体在"飘"。这对传感器的精度、算法的效率、芯片的性能,都有很高的要求。
核心技术二:透视显示
空间计算的另一个关键技术,是透视显示。
在VR头显中,用户看到的完全是虚拟画面。但在空间计算中,用户需要同时看到真实世界和虚拟物体。怎么实现呢?
有两种方案:光学透视和视频透视。
光学透视:用半透明的镜片,真实世界的光线直接透过镜片进入眼睛,虚拟画面由投影仪投射到镜片上。HoloLens用的就是这种方案。优点是真实感强,延迟低;缺点是视场角小,虚拟物体的亮度和对比度有限。
视频透视:用外部摄像头捕捉真实世界的画面,然后和虚拟画面合成,显示在头显内的屏幕上。Apple Vision Pro用的就是这种方案。优点是视场角大,虚拟物体的显示效果好;缺点是有一定的延迟,而且摄像头的画面和人眼直接看到的画面有差异。
Vision Pro的视频透视,做得非常精细。它用了两个高分辨率的显示屏(单眼3660x3200像素),显示效果非常清晰。外部摄像头的画面,经过实时处理后,和虚拟画面合成,延迟控制在很低的水平。
但视频透视也有挑战:
第一,深度匹配。人眼看真实世界是有立体视觉的,左右眼看到的画面有视差。视频透视需要用两个摄像头分别捕捉左右眼的画面,并且精确匹配视差,否则用户会觉得不舒服。
第二,色彩匹配。摄像头捕捉的画面,和人眼直接看到的画面,在色彩、亮度、动态范围上有差异。需要做实时的色彩校正,让画面尽可能接近人眼的真实感受。
第三,延迟控制。从摄像头捕捉画面,到显示在屏幕上,整个过程的延迟要足够低,否则用户头部转动时,会感觉到画面滞后,引起眩晕。
第四,遮挡处理。当真实物体在虚拟物体前面时,虚拟物体应该被遮挡。这需要实时的深度感知和遮挡计算,让虚拟物体和真实世界的融合更自然。
视频透视是目前空间计算的主流方案,随着摄像头和显示技术的进步,效果会越来越好。
核心技术三:手势追踪
空间计算的交互方式,和传统的电脑、手机完全不同。在Vision Pro中,用户不需要手柄,直接用手就能和虚拟物体交互。这靠的是手势追踪技术。
Vision Pro的手势追踪,主要靠底部的红外摄像头和可见光摄像头。这些摄像头能捕捉手部的动作,然后通过AI算法,识别出手指的位置、姿态和动作。
手势追踪的过程:
第一步,手部检测。摄像头捕捉画面后,AI算法先检测出手的位置,把人手从背景中分离出来。
第二步,关键点检测。检测手上的21个关键点,包括手腕、手掌、每个手指的关节和指尖。这些关键点构成了手的三维模型。
第三步,姿态估计。根据关键点的位置,计算出手的姿态:手掌的朝向、手指的弯曲程度、手的运动方向。
第四步,手势识别。根据手的姿态和运动轨迹,识别出具体的手势:捏合(点击)、张开(放大)、握拳、挥手等等。
第五步,交互映射。把识别出的手势映射成交互动作:捏合是点击,手指滑动是滚动,双手捏合拉伸是缩放。
Vision Pro的手势追踪,精度很高,能识别很细微的手指动作。用户可以用手指捏合来点击按钮,用手指滑动来滚动页面,用双手来缩放和旋转虚拟物体。
但手势追踪也有挑战:
第一,遮挡问题。当手被身体或者其他物体遮挡时,追踪会丢失。Vision Pro通过多个摄像头多角度捕捉,以及预测算法,来缓解这个问题。
第二,精度问题。手指的动作很细微,要精确识别每个手指的位置,需要高分辨率的摄像头和高效的AI算法。
第三,疲劳问题。长时间抬手交互,手臂会疲劳。Vision Pro支持把手放在腿上或者桌子上交互,缓解疲劳。
第四,学习成本。用户需要学习各种手势,不像鼠标键盘那样直观。不过Vision Pro的手势设计得比较自然,大多数人很快就能上手。
手势追踪是空间计算中最自然的交互方式,随着AI算法的进步,识别精度和响应速度会越来越好。
核心技术四:眼动追踪
除了手势,Vision Pro还支持眼动追踪。用户可以用眼睛来控制光标,看哪里就选中哪里,然后捏合手指确认。
眼动追踪的原理,是用红外摄像头照射眼睛,捕捉角膜上的反光点,然后根据反光点的位置,计算出眼球的朝向,也就是用户在看哪里。
Vision Pro的眼动追踪,用了多颗红外LED和红外摄像头,能精确追踪双眼的注视点。
眼动追踪的作用:
第一,交互控制。用户看哪里,光标就跟到哪里。配合捏合手势,就能完成点击操作。这种交互方式比用手移动光标更自然、更快速。
第二,注视点渲染。人眼只有中心凹区域(视野中心)的分辨率很高,周边区域的分辨率很低。利用这个特点,Vision Pro只在用户注视的区域渲染高分辨率画面,周边区域用低分辨率。这样可以大幅减少渲染的计算量,提高性能。这叫做"注视点渲染"(Foveated Rendering)。
第三,注意力感知。系统可以知道用户在看什么,从而做出更智能的响应。比如,用户看着一个虚拟物体时,这个物体可以高亮显示或者显示更多信息。
第四,虹膜识别。Vision Pro用虹膜识别来做用户认证,比Face ID更安全、更快速。用户戴上头显,看一眼就解锁了。
眼动追踪的挑战:
第一,精度要求高。人眼的转动很快,注视点的变化很细微,需要很高的采样率和精度。
第二,个体差异。每个人的眼睛形状、角膜曲率都不一样,需要做个性化校准。
第三,舒适度。红外光照射眼睛,要确保安全和舒适,不能让用户感觉到刺眼。
眼动追踪是空间计算中很有特色的交互方式,它让交互更自然、更高效。
核心技术五:空间音频
空间计算不仅是视觉的,也是听觉的。Vision Pro支持空间音频,虚拟物体发出的声音,会根据物体的位置和距离,呈现出立体感和距离感。
空间音频的原理,是用HRTF(头相关传输函数)来模拟声音到达人耳时的变化。人的耳朵在听到不同方向的声音时,因为头部、耳朵、肩膀的遮挡和反射,声音会有不同的频率响应和时间差。HRTF就是模拟这些变化,让大脑觉得声音是从某个方向传来的。
Vision Pro的空间音频,结合了头部追踪。当用户转动头部时,声音的方向会保持不变,就像真实世界中的声源一样。比如,一个虚拟的电视在你的左边,你向右转头,声音依然从左边传来。
空间音频的作用:
- 增强沉浸感,让虚拟物体更真实
- 帮助用户定位虚拟物体的位置,特别是在视野外的物体
- 提供更丰富的交互反馈,比如按钮点击的声音从按钮的位置传来
空间音频虽然不如视觉那么引人注目,但它对沉浸感的贡献很大。好的空间音频,能让虚拟物体的真实感提升一个档次。
核心技术六:渲染技术
空间计算对渲染技术的要求非常高。
首先是分辨率。Vision Pro的单眼分辨率是3660x3200,比4K还高。双眼就是两倍的像素量。而且,刷新率要达到90Hz甚至更高,否则会有卡顿感。这意味着,每秒要渲染数十亿个像素。
其次是延迟。从头部转动,到画面更新,整个过程的延迟要控制在20毫秒以内,否则用户会感觉到眩晕。这对渲染的速度要求极高。
第三是注视点渲染。前面提到过,利用眼动追踪,只在注视点区域渲染高分辨率,周边区域用低分辨率。这能减少50%以上的渲染量,但需要精确的眼动追踪和动态的分辨率调整。
第四是真实感渲染。为了让虚拟物体和真实世界融合,虚拟物体需要有正确的光照、阴影、反射。系统需要感知真实环境的光照条件,然后让虚拟物体的光照和真实环境匹配。比如,房间里的灯光是暖黄色的,虚拟物体也应该被暖黄色的光照亮。
第五是透视合成。视频透视模式下,真实画面和虚拟画面要实时合成,包括遮挡、阴影、光照的融合。这个合成过程要在几毫秒内完成。
为了满足这些要求,Vision Pro用了M2芯片来处理计算和渲染,还用了一颗专门的R1芯片来处理传感器数据和实时融合。两颗芯片协同工作,才能实现流畅的空间计算体验。
空间计算的挑战
虽然空间计算很神奇,但它还面临很多挑战。
第一个挑战,是佩戴舒适度。目前的空间计算设备还比较重,Vision Pro大约600多克,长时间佩戴会不舒服。而且,有些人会有眩晕感,特别是在快速移动的时候。
第二个挑战,是视场角。目前设备的视场角还不够大,用户能看到的虚拟内容范围有限。要实现像真实世界一样宽广的视野,还需要技术突破。
第三个挑战,是内容生态。空间计算需要专门的应用和内容,目前的应用还比较少。没有丰富的内容,硬件再好也没用。
第四个挑战,是价格。Vision Pro的售价高达3499美元,大多数人消费不起。空间计算要普及,价格必须降下来。
第五个挑战,是社交接受度。在公共场合戴着一个头显,看起来有点奇怪。很多人对这种设备有抵触心理。
第六个挑战,是隐私和安全。空间计算设备有很多摄像头和传感器,能收集大量的环境和用户数据。如何保护用户隐私,是一个重要问题。
这些挑战,决定了空间计算还需要时间才能成熟。但技术的发展速度很快,这些问题可能在未来几年内逐步解决。
空间计算的未来
空间计算被认为是继个人电脑、智能手机之后的下一代计算平台。虽然现在还处于早期阶段,但它的潜力是巨大的。
未来,空间计算可能会在这些领域产生深远影响:
第一,工作和生产力。虚拟屏幕可以无限大,用户可以在空间中布置多个显示器,工作效率大大提升。远程协作也会更自然,远方的同事可以像坐在你对面一样。
第二,教育和培训。学生可以在空间中观察三维的分子结构、人体器官、历史建筑。技术工人可以在空间中接受培训,模拟各种操作场景。
第三,娱乐和媒体。电影、游戏、演唱会,都会因为空间计算而变得更沉浸、更互动。
第四,医疗和设计。医生可以在空间中查看三维的医学影像,设计师可以在空间中创作三维的作品。
第五,日常生活。导航、购物、社交,都会因为空间计算而改变。人们可以在空间中获取信息、和虚拟助手交互、和远方的朋友"面对面"聊天。
当然,这些都需要时间。空间计算的普及,可能需要5年、10年,甚至更长。但方向是明确的:计算会从屏幕中走出来,进入到我们的生活空间中。
写在最后
空间计算,是一种全新的计算范式。它通过环境感知、透视显示、手势追踪、眼动追踪、空间音频、高性能渲染等技术,让计算机能够理解和利用三维空间,和真实世界融合在一起。
理解空间计算的原理,不仅能让我们知道这些神奇体验是怎么实现的,也能让我们更好地判断这项技术的潜力和局限。
空间计算还处于早期,还有很多挑战需要克服。但它代表了计算技术的一个重要方向:让技术更自然地融入生活,而不是让人适应技术。
也许在未来的某一天,空间计算设备会像今天的智能手机一样普及,成为我们生活中不可或缺的一部分。到那时候,我们回头看今天的Vision Pro,可能就像我们现在看最早的手机一样:笨重、简陋,但开启了一个新时代。
愿我们都能见证这个新时代的到来。
评论(0)
暂无评论,快来抢沙发~
评论功能仅对会员开放,请先登录
登录