事件相机专题(一):概念与成像原理
图1 比亚迪在2026/05/28发布的闪拍摄像头中使用了事件相机技术
前情提要
计算机视觉(Computer Vision),是近20年来计算机科学界与产业界高度关注的重要研究方向之一。从ImageNet到sa-1B,无数数据集从以”帧“为概念相机(如RGB相机,红外相机,深度相机等)出发,构建了庞大的计算机视觉技术基座,极大了推动了计算机视觉领域的发展。
这套以”帧”为核心的范式统治了视觉领域二十余年——我们不断提高帧率、提升分辨率、优化算法,试图让机器”看”得更清楚。但如果换一个角度审视,我们或许根本不需要”帧”这件事?事件相机给出了他的答案。 相比于研究其他的视觉传感器,研究它的人们可以说是微不足道——但是正是这样一帮人,把事件相机从概念走向落地。
2026年可谓工业界正式接纳事件相机的元年:索尼研发的”Ace”机器人战胜人类乒乓球选手[1],和比亚迪在2026年5月28发布会中展示的闪拍摄像头[2](图1),带来了事件相机从科研界走向工业界的新生。
接下来,我们将借用Event-based Vision: A Survey(TPAMI, 2020) [3] 这篇文章脉络,在本章中主要介绍一下事件相机的概念与成像原理,在后续的章节里,我们将主要从代码角度,来介绍他的事件表示(Representation)技术代码,以及分享一些关于事件相机的文章。同时,由于我并不擅长硬件设计,如果你对事件相机的设计感兴趣,可以阅读原文。
1 概述
1991年,《科学美国人》封面上一只猫的图像,由一种模仿眼睛神经结构的新型“硅视网膜”获取,展示了一种新的传感器技术,点燃了新兴的神经形态工程领域。现代意义上的事件相机是由瑞士苏黎世联邦理工学院(ETH Zurich) 的 Patrick Lichtsteiner 和 Tobi Delbruck 团队在2000年代中期正式发明的。他们在2005年研发出了世界上第一款商用/实用化的动态视觉传感器(DVS),开启了事件相机在机器人和计算机视觉领域的广泛应用。[4]
图2 《科学美国人》封面的事件相机拍摄的"猫"
事件相机是一种异步传感器,它引发了视觉信息获取方式的范式转变。这是因为它
们异步测量每个像素的亮度变化,而非依赖与观察场景无关的固定的时钟信号。其优势在于:高时间分辨率(微秒级)、高动态范围(140 dB vs 60 dB),以及低功耗。因此,事件相机在标准相机面临挑战的高速、高动态范围等场景中,对移动机器人、增强现实与虚拟现实(AR/VR)等方向具有巨大潜力。
应用方向: 事件相机用于目标跟踪,监控与监视,以及目标、手势识别。它们还可用于深度估计,结构光三维扫描,光流估计,高动态范围图像重建以及同时定位与地图构建(SLAM)。
2 事件相机的设计理念
2.1 事件相机的成像原理
事件相机成像原理十分有趣——它不像传统相机那样一次性输出一整帧图像,而是对场景中的亮度变化进行异步的,也就是每个像素独立的响应。
简言之,事件相机会监视视野范围(Field of View,FOV)内每一个像素坐标 的亮度变化:亮度增强程度超过阈值(threshold)记为正极性 ,亮度减弱程度超过阈值记为负极性 ,同时记录下该事件发生的时刻 (微秒级)。
因此事件相机的一个基本单位被称之为事件(event) 或 脉冲(spike)。定义为:
这里的 为上述的 event,、 为像素点横纵坐标(整数级), 为微秒级发生时刻, 为极性。对于多个事件组成的信息,我们一般称之为事件流(event stream)。
第一,感光二极管感知光强。
第二,模拟电路把光强变成对数亮度电压。
第三,比较器判断亮度变化是否超过阈值,超过就输出事件。
图3 事件相机事件产生示例
其中 是当前时刻, 是上一时刻。
由于事件相机的成像原理,我们能很清晰的得出一个理解:他就像“青蛙”的眼睛,能看得清飞速移动的物体,但是它看不到静止的物体。 因为飞速移动的物体会带来光线的变化,但是静止的却不行。这既是他的优势,也是他的缺陷。
2.2 事件相机vs普通相机的优势
事件相机和普通相机的成像方式有根本上的不同,如图4所示,有一个黑色小球匀速在圆盘旋转,事件相机输出该小球连续运动产生的事件流信息,普通相机的成像产生的是固定时间间隔的帧。由此,事件相机也带来了额外的优势:
- 高时间分辨率:事件相机不像普通相机那样按固定帧率(30/60 fps)采集,而是每个像素一旦检测到亮度对数变化 超过阈值,就异步触发事件。每个事件自带微秒级时间戳,以亚毫秒延迟输出。因此它能捕捉极快的亮度变化,等效时间采样密度远高于传统帧相机。
- 高动态范围:DVS 像素不直接记录线性亮度 ,而是监测对数亮度变化,对数将很大的亮度范围压缩到小范围——比如光强从 1 到 10000,线性空间差了 10000 倍,取 log 后仅差 4 个单位。因此传感器不容易像普通相机那样亮处过曝、暗处欠曝。普通帧相机靠积分曝光积累电荷,太亮则电荷装满饱和,太暗则信号淹没在噪声中,动态范围通常只有几十 dB。而事件相机的动态范围可达 140 dB,能同时看清极亮与极暗的场景细节。
- 低功耗: 普通相机不管画面有没有变化,都要按 30 fps、60 fps 读取整张图。即使画面完全静止,也要把所有像素读出来、传出去、处理掉。DVS 是变化驱动的。静止区域不输出事件,只有亮度变化超过阈值的像素才输出事件,所以它通常数据量更稀疏,读出次数更少,下游计算也更少。这就是低功耗的主要来源。
图4 事件相机与普通相机捕捉小球运动表现
2.3 面临问题
尽管事件相机优势明显,硬件读出链路仍存在两类典型瓶颈。
总线饱和(bus saturation):事件从像素阵列传输到外围,经共享数字输出总线送出相机(通常采用地址事件表示 AER 读出),将位置地址 、极性 ,乃至时间戳 编码后输出。当场景变化剧烈时——例如高速运动、闪光、纹理丰富的物体快速移动——大量像素可能几乎同时产生事件,共享总线来不及传输,就会发生总线饱和(bus saturation)。饱和后,事件无法按真实发生时间立即输出,只能排队等待,输出时序会被扰动。
图5 单个 DVS 像素对正弦 LED 刺激的响应
像素带宽限制:尽管 DVS 像素速度很快,前端光感受器电路的带宽仍有限:入射光强度变化过快时,电路会滤除这些变化。如图5所示,LED 在 100 Hz 闪烁时,DVS 像素能跟上,输出电压随之起伏,超过阈值后产生事件;但若 LED 以 10 kHz 闪烁,而像素带宽仅约 3 kHz,前端电路来不及响应,高频变化便无法被可靠记录。
2.4 总结一下
- 事件相机是异步的相机,具有高时间分辨率(微秒级)、高动态范围(140 dB vs 60 dB),以及低功耗 的特性。他的单位是一个事件,而不是帧。
- 事件相机能看得清飞速移动的物体,但是它看不到静止的物体,因此它的主攻方向是高速移动的场景,或者利用到高时间分辨率(微秒级)
读到这里,你也许会产生疑问:既然他不是以帧为单位的相机,那他应该怎么利用事件信息来进行深度学习训练呢? 接下来,我们将从近10年来的各个论文设计和源代码角度出发,来向大家介绍事件相机专题(二):事件处理以及事件表示。
在专题(二)后,我或许会尝试介绍几种比较有趣的且先进的事件相机方法,他们在自动驾驶、大模型、多模态等领域都做出了极大贡献。
3 参考文献或链接
[1] Dürr, P., El Gheche, M., Maeda, G.J. et al. Outplaying elite table tennis players with an autonomous robot. Nature 652, 886–891 (2026).
[2] https://www.byd.com/cn/livedetail150
[3] Gallego, G., Delbruck, T., Orchard, G., et al. Event-Based Vision: A Survey. IEEE Transactions on Pattern Analysis & Machine Intelligence(TPAMI) 44(01), 154–180 (2022).
[4] https://sensors.ini.ch/research/areas/event-sensors-eyes-and-ears