本发明涉及一种用于检测在借助具有注意力模型的变换器从点云数据探测和/或跟踪多个对象中的不可靠度(unsicherheiten)的方法。
背景技术:
1、现今,在成像传感器中执行对象探测。典型地,多个对象处于被记录的周围环境中,从而执行对多个对象的探测。例如,对象探测在用于车辆的传感器中被使用,以便检测其他车辆、其他交通参与者和基础设施。这些数据能够被用于(部分)自动化的或自主的驾驶。
2、近来,将变换器应用于对象探测的概念受到追捧。变换器在ashish vaswani等的论文《attention is all you need(你需要的是注意力)》,arxiv preprint arxiv:1706.03762,2017中被描述,最初在语言处理的上下文中。在对象探测的情况下,由针对每个对象的测量来求取边界框及其描述该对象的框参数(box-parameter),即例如其位置、尺寸、取向、速度和/或类别标识符。变换器还可以用于下游应用,例如对象跟踪、预测或(路径)规划。在使用变换器用于对象探测的情况下,可以忽略传统地在后处理中所应用的、重叠的探测的抑制。
3、不可靠度分为两个类别:认识论的(epistemische)不可靠度源于模型中的不可靠度,例如,当作出在训练数据中不存在的观察时。此外,非结构化的动态环境也可能导致这种不可靠度,因为这种多变性很难被训练数据集涵盖。与此相反,起因于传感器噪声和/或由于传感器的差视野和/或与传感器的大距离也可能产生不可靠度。
技术实现思路
1、本发明涉及一种用于检测在借助具有注意力模型的变换器从点云数据探测和/或跟踪多个对象中的不可靠度的方法。所述点云数据例如通过传感器,例如通过激光雷达,来检测。然而,该方法不限于激光雷达,而是也可以使用其他的传感器类型。优选地,所述传感器或者说传感器系统布置在车辆上,从而从该车辆记录点云数据。
2、该方法包括以下步骤:首先,从点云数据计算特征向量。这不是由变换器的编码器执行而是通过主干(backbone)来执行。主干是如下神经网络:该神经网络用于从测量的数据中提取特征,或者说将输入转换成某种特征表示,然后可以进一步处理该特征表示。因此能够省去变换器的编码器。主干将典型地三维的点云数据转换成空间结构。主干的输出优选被重新编制格式,以便获得具有预给定长度的特征向量的序列。通过将主干用于计算特征向量,输入序列的长度比使用变换器的编码器更少受限,而替代于此,在基于栅格的主干、如pointpillars的情况下,可以选择足够小的单元尺寸。然后,以此计算的特征向量被输送给变换器,并用作用于求取交叉注意力(cross-attention)的键向量(key-vektor)和值向量(value-vektor)。因此可以使被用作键向量和值向量的所输出的特征向量分别配属于空间中的一个地点。
3、一般地,注意力权重可以配属于空间中的任意的点。空间结构优选是栅格。主干将三维点云数据传输到栅格结构中。该主干将每个栅格单元的内容分别编码到特征向量中。可以使用不同的栅格类型,不仅二维的栅格而且三维的栅格。来自鸟瞰视角的栅格特别适合地胜任以表示场景。
4、此外,通过采样方法、例如最远点采样(farthest-point-sampling,fps)从所述点云数据计算针对变换器的第一层的第一锚位置。借助编码、例如傅里叶编码从所述第一锚位置求取特征向量。该编码特别是可以通过前馈网络来完成。因此所计算的特征向量用作针对变换器的解码器的第一层的对象查询。锚位置的对象查询用作用于寻找对象的出发点。然而,该寻找不限于这些锚位置,而是也探测在与这些锚位置有一定距离的对象。锚位置不相当于如在其他探测方法中所使用的那样的锚框(anchor-boxen)。因此,针对变换器的对象查询与数据相关,并且不是如通常那样通过学习获得。这尤其在稀疏填占的点云的情况下提供优点,因为否则浪费大量的计算资源在找出实际具有数据的位置上。这种稀疏填占的点云特别是出现在使用激光雷达的测量中。从锚位置所求取的对象查询用作用于针对可能的对象的槽(slots)。
5、为探测对象,变换器的解码器借助交叉注意力从所述对象查询、即上述特征向量,和键向量和值向量、即开篇所述的特征向量,来求取结果特征向量,所述结果特征向量也被称为解码器输出向量。从所述结果特征向量中,借助前馈网络计算描述对象的边界框的框参数(box-parameter),即该边界框的位置或者说相对于锚位置的位置差、尺寸、取向、速度和/或分类辨识符。为此,优选将与上述前馈网络不同的、通过权重来区分的前馈网络用于求取对象查询。
6、在转换器的解码器中,对象查询与从主干的输出所计算的键向量之间发生交叉注意力。值向量不被需要用于计算注意力权重。为此,成对地为来自对象查询和键向量的每个组合计算注意力权重。优选将终归在探测中求取的注意力权重用于检测在该探测中的不可靠度。
7、可以使与每个键向量相关的注意力权重在由主干所使用的空间结构中被解读。对于空间结构是栅格的情况,可以使与每个键向量相关的注意力权重在栅格单元中被解读,因为每个键向量配属于一个栅格单元。
8、优选针对解码器的每个层求取注意力权重。在所述计算之后,注意力权重优选呈注意力权重矩阵存在。二维的注意力权重矩阵可选地可以相应于主干的特征向量、特别是键向量变形成三维的矩阵。因此针对上述方式探测到的每个对象获得解码器的每个层的注意力权重矩阵。这给出见解:对应的查询(query)已访问哪些输入数据,以便识别对象。
9、对于每个对象查询,从计算的注意力权重中确定可预给定的数量k的最大注意力权重,通过集(set)sk来描述。可预给定的数量根据所期望的精度和待筹集的计算开销。因此,不必计算所有的注意力权重,而是仅较小数量的最大注意力权重就足够。一般地,可以从解码器的所有层计算最大注意力权重,以便获得提早的和/或准确的结果。优选仅从解码器的最后的层计算最大注意力权重,以便将计算开销最小化。然后,从最大注意力权重借助协方差矩阵ck计算注意力协方差:
10、
11、其中,而μk是针对每个层的最大注意力权重的经验性的预期值并且以以下方式来限定:
12、
13、在此,空间假定为在x和y方向上的二维的面,如其例如在鸟瞰视角中被表示的那样。可选地,可以在计算中添加第三维度(zi)。
14、也可以将稳健估计器、如胡伯损失函数lδ(huber loss function)用于所述计算:
15、
16、δ表示阈值。在针对与预期值μk偏差小的上述情况中,计算上述协方差矩阵。距离预期值μk的较大的、超过阈值的异常值在下述情况中来计算,并且仅对协方差矩阵线性地而非二次地作出贡献。
17、通过计算协方差矩阵ck的行列式,最后获得注意力扩散as,其作为值表示用于不可靠度的度量。
18、as=det ck
19、以下描述注意力扩散与在求取的边界框与根据基准真实(grundwahrheit)的最接近对象的边界框之间的iou(intersection-overunion,交并比)之间的关系。iou是求取的边界框be与根据基准真实的边界框bgt的交集、与求取的边界框be与根据基准真实的边界框bgt的并集的商:
20、
21、越大的iou值相应于越准确的对象探测。iou度量与认识论的不可靠度相关。已为该比较中去除iou值为零的情况,在这种情况下即不存在重叠。由该比较得知,注意力扩散随增加的iou值降低。因此,低注意力扩散低表明高iou值并且因此低认识论的不可靠度,反之亦然。因此,注意力扩散是认识论的不可靠度的指示器。
22、此外,研究了针对边界框与检测点云的传感器之间的不同距离的注意力扩散的表现。注意力扩散随着变大的距离而增加。因此,注意力扩散的行为与相应于偶然的(aleatorischen)不可靠度并且因此是偶然的不可靠度的指示器。
23、计算机程序设置为用于执行该方法的每个步骤,特别是当该计算机程序在计算设备或控制设备上执行时。该计算机程序使得能够实现该方法在传统的电子控制设备中的实现,而不必在该控制设备上进行结构上的改变。为进行实现,该计算机程序存储在机器可读的存储介质上。
24、通过在传统的电子控制设备上运行该计算机程序,获得如下电子控制设备,该控制设备设置为用于执行从点云数据探测和/或跟踪多个对象的不可靠度的检测。
1.一种用于检测在借助具有注意力模型的变换器从点云数据探测和/或跟踪多个对象(o1,o2,o3,o4,o5)中的不可靠度的方法,其中,被跟踪的对象(o1,o2,o3,o4,o5)的状态存储在特征空间中,所述方法具有以下步骤:
2.根据权利要求1所述的方法,其特征在于,在从所述对象查询(yt,j)和所述键向量(kt,i,kt+1,i)求取结果特征向量(y′t,j)期间借助所述变换器的解码器(6)计算所述注意力权重(wp,q,i)。
3.根据权利要求1或2所述的方法,其特征在于,针对所述解码器(6)的每个层(k)求取所述注意力权重(wp,q,i)。
4.根据权利要求1至3中任一项所述的方法,其特征在于,由所述主干(2)所使用的结构是栅格,并且每个注意力权重(wp,q,i)配属于一个栅格单元。
5.根据权利要求1至3中任一项所述的方法,其特征在于,每个注意力权重(wp,q,i)配属于空间中的一个任意点。
6.根据权利要求1至5中任一项所述的方法,其特征在于,将胡伯损失函数用于所述协方差矩阵的计算。
7.一种计算机程序,所述计算机程序设置为用于执行根据权利要求1至6中任一项所述的方法的每个步骤。
8.一种机器可读的存储介质,在所述存储介质上存储有根据权利要求7所述的计算机程序。
9.一种电子控制设备,所述电子控制设备设置为用于借助根据权利要求1至6中任一项所述的方法来执行在借助具有注意力模型的变换器从点云数据探测和/或跟踪多个对象(o1,o2,o3,o4,o5)中的不可靠度的检测。
