视觉 [40]

【论文阅读】Stereo Anything

Stereo Match 立体匹配是 3D 视觉的基石,目的是通过图像间的像素级对应关系来恢复深度信息。 在零样本和少样本的情况下,深度神经网络在部署阶段会出现明显的性能下降,因为我们不可能 Annotate Anything。 Stereo Anything:基于大规模混合数据的统一零样本立体匹配

【重读经典】YOLO的进化之路(下)

YOLOv9 和 YOLOv4/v7 一脉相承的作品,但是 Anchor-Free。 PGI 可编程梯度信息 全称 Programmable Gradient Information,这是一个辅助监督框架,目的是解决深度网络逐层传播的信息损失问题。 PGI 包含 3 个主要组件:主分支,辅助可逆分支

【重读经典】YOLO的进化之路(中)

没想到 YOLOv1 到 YOLOv4 就已经写了快 20000 字…… 编辑页面卡的不行,我不得不分几篇写完。YOLOv1 到 YOLO 26一共 12 篇,正好分上中下三篇。 YOLOv5 重量级来了,Ultralytics 闪亮登场了。第一个没有论文的 YOLO 正式版本,但它成为了工业界的事

【重读经典】YOLO的进化之路(上)

自 2016 年 YOLOv1 发布至今的十年里,YOLO 的核心版本已一路演进到了 v26——不过这其中包含了一次版本大跳跃:官方为了统一命名规范,直接跳过了 v13 到 v25。 回想起我使用 YOLO 的历程:从只会用官方的 COCO 数据集训练,到使用 MMLab 的各种训练框架,再到自己修

【重读经典】极坐标BEV方法

极坐标BEV的表示方法:在BEV空间按照角度和半径两个维度进行划分,而非笛卡尔坐标系下的均匀矩形网格。自车近处高分辨率,远处低分辨率,契合相机近大远小的成像特点。 核心优势 非均匀网格划分&分辨率优化 极坐标BEV以ego为中心,角度方向采用固定步长划分,径向长尾分布不均匀划分。 角度划分:θ ∈

3D稀疏卷积 3D Sparse Convolution

点云数据体素化后,有90%+的Voxel是空的,如果像VoxelNet那样直接使用3D Conv,计算量太大。 左图是稀疏的2D Tensor,深灰色像素都是0,浅灰色是non-zero点。 右图是稀疏的3D Tensor,只有红色的体素才是non-zero。 因此提出了3D稀疏卷积——3D Spa

【重读经典】BEVFusion: A Simple and Robust LiDAR-Camera Fusion Framework

BEVFusion有两篇论文: 一篇名为《BEVFusion: A Simple and Robust LiDAR-Camera Fusion Framework》,发表于2022年。 另一篇名为《BEVFusion: Multi-Task Multi-Sensor Fusion with Unif

【重读经典】BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird's-Eye View Representation

自动驾驶常见传感器包括 Camera,LiDAR,Radar 等传感器。 相机能提供丰富语义,LiDAR 提供准确的空间信息,雷达能进行速度估计。 对于多传感器方案,当时的传感器投影存在信息损失的问题: LiDAR->Cam:存在几何损失,像素坐标系中相邻的像素点,在 3D 空间中可能距离很远。设想

【重读经典】BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers

先看论文题目 Multi-Camera:多相机纯视觉方案,Camera-based的mAP天然比LiDAR-based和Fusion-based的要低 Spatiotemporal:时间空间 Transformer:用到了Transformer架构以及Attention机制 创新点 论文摆脱了之前L

【重读经典】Lift, Splat, Shoot: Encoding Images From Arbitrary Camera Rigs by Implicitly Unprojecting to 3D

LSS 是 NVIDIA 在 ECCV2020 上发表的文章。 关于论文标题中 Lift, Splat, Shoot 三个单词的理解,这三个单词对应模型中三个核心步骤。 Lift:提升。2D 图像特征提升到 3D 视锥空间特征。 Splat:泼溅。所有相机生成的 3D 视锥特征,泼洒到统一的 BEV

【重读经典】3D Bounding Box Estimation Using Deep Learning and Geometry

Deep3DBox 是一篇比较早的使用单目相机进行3D目标检测和姿态估计的方法。 Deep3DBox 先用 CNN 回归目标的方向和尺寸,因为这两类属性稳定性比较高。然后结合 2D BBOX 的几何约束求解平移量,以生成完整的 3D BBOX。 有些方法基于 PnP,通过 2D-3D 关键点对应关系

【重读经典】DeepDriving: Learning Affordance for Direct Perception in Autonomous Driving

标题中的 Affordance 一词,本意是”预设用途,功能特性“,最初在知觉心理学和设计学领域出现。 后来在人机交互领域,Affordance 的含义变成了:一个产品让用户自然领悟到用法的能力。 在机器人领域(自动驾驶和机器人的感知不分家),被引申为可以执行的潜在动作,即在特定情况下哪些动作是可执

多传感器融合——后融合

多传感器融合的方案可以分成前融合(Early Fusion)方案和后融合(Late Fusion)方案。 前融合也叫特征级融合,不同传感器的数据会在特征级别进行合并,也就是说,不同模态的数据经过处理和合并后会得到一个特征集合。一般来说,每个模态数据的特征会被分别提取,然后被提取到的特征会被合并为一个

GStreamer学习

GStreamer 在我看来更像是视频编解码领域的内容。 JPEG 和 MPEG 先区分一下这两个格式 [1]。 JPEG 全称 Joint Photographic Experts Group,文件拓展名一般为 .jpg 或者 .jpeg,是一种静态图像压缩标准,压缩比能达到 10:1。 MPEG

计算机视觉中的Affine和Perspective Transformation

Affine Transformation 仿射变换是在二维空间上对图像进行平移(Translation)、缩放(Scale)、旋转(Rotate)、错切(Shear)操作的组合。 四种变换的矩阵形式分别为: 平移:T_t = \begin{bmatrix} 1 & 0 & p_x \\ 0 & 1

图像的色彩空间

最近一个项目需要用到 x86 控制器+ GMSL 相机的组合,这种情况一般会用一张图像采集卡来获取 GMSL 相机的图像,也就是PCIe-GL26设备将GMSL相机图像发送至HOST端 - FunnyWii's Zone 中使用的方案,但是其成本很高。 于是采购了一个 GMSL 转 USB 的转换器

学习Transformer

Transformer 在谷歌 2017 年的论文 [\1706.03762] Attention Is All You Need 中首次被提出,主要用于 NLP(Natural Language Processing,自然语言处理)的各项任务。 后来在 CV 领域,研究者们基于 Transform

单目相机的相对速度估计

前言 单目相机的目标距离估计本身就已经充满了挑战,那么目标的相对速度估计也必然十分困难。 目前,基于单目相机的相对速度估计算法大致可以分成两类:传统方法和深度学习方法。没错,什么任务都可以深度学习。 传统方法中,最经典的是 Mobileye 在 2003 年一篇论文中提出的算法。这套算法同时包含目标

ROS不使用自带OpenCV以及替换cv_bridge

系统:Ubuntu20.04 平台:Jetson Orin NX ROS:ROS2 Foxy OpenCV:4.5.4 with CUDA 冲突 问题源自编译时警告: /usr/bin/ld: warning: libopencv_imgcodecs.so.4.2, needed by /opt/r

ROS2的消息发布和订阅&图像发布和订阅

ROS2 的编译 colcon 是 ROS2 的编译工具。ROS2 的工作空间与 ROS1 基本保持相同的目录结构: <workspace> ├── build # 编译时自动生成,包含编译中间文件 ├── install # 编译时自动生成,包含编译结果:可执行文件、库文件