Hana's Blog
Robotic Grasp Detection (6): 数据集与基准评测协议Blur image

先区分数据集、基准与评测协议(Dataset, Benchmark, and Protocol)#

在抓取检测(Grasp Detection)中,数据集(Dataset)不只是训练样本的集合。它还规定了机器人能看到什么、抓取如何表示、正负标签如何产生,以及“成功”究竟指什么。基准(Benchmark)是在数据集之上固定任务和测试划分;评测协议(Evaluation Protocol)则规定候选如何解码、排序、去重,以及最后使用哪个指标计算分数。

Cornell 的 2D 矩形准确率、GraspNet-1Billion 的离线平均精度(Average Precision, AP)和真实机器人的抬升成功率,分别对应图像标注、解析几何和物理执行三个层级。阅读结果时,先确认方法所处的层级,再看数字。

一个数据集可以用下面六个问题快速描述:

  1. 输入是什么:RGB 图像、深度图(Depth Image)、RGB-D 图像、点云、网格、语言还是触觉?
  2. 标签是什么:旋转矩形、SE(3)SE(3) 抓取姿态、连续质量、碰撞标签、目标身份还是实际执行结果?
  3. 标签如何得到:人工标注、解析计算(Analytic Computation)、物理仿真(Physics Simulation)还是机器人实验?
  4. 训练和测试如何分开:按图像、物体实例、物体类别、场景、视角、遮挡程度还是夹爪尺寸划分?
  5. 使用什么夹爪:固定的平行夹爪(Parallel-Jaw Gripper)几何、指尖长度、最大开口和碰撞模型是什么?
  6. 指标位于哪一层:二维匹配、姿态检测、几何有效、仿真执行、真实抓取还是完整任务?

数据集总览(Dataset Map)#

下表按照输入、标签、规模和指标概括这些基准。

数据集输入与场景抓取标签标签来源规模或划分主要指标主要回答的问题
Cornell真实 RGB-D,单物体桌面图像2D 旋转矩形人工标注885 张图像、240 个物体角度误差 + IoU图像中是否找到了一个合理的平面抓取
Jacquard合成 RGB-D / 深度图2D 旋转矩形渲染与几何生成约 54K 张图像、约 1.1M 个矩形角度误差 + IoU大规模平面抓取学习能否工作
Dex-Net 2.0合成局部深度图块平行夹爪姿态与鲁棒质量解析准静态模型1,500 个物体模型、约 6.7M 个样本质量预测、真实成功率解析抓取质量能否被深度网络学习
ACRONYM物体网格与仿真抓取物体坐标系中的 6-DoF 抓取物理仿真8,872 个物体、262 个类别、约 17.7M 个抓取仿真成功与覆盖率物体中心的 6-DoF 抓取分布能否泛化
GraspNet-1Billion两种真实 RGB-D 相机的杂乱场景场景坐标系中的 6-DoF 抓取力闭合、场景碰撞与坐标变换88 个物体、190 个场景、97,280 张图像、超过 11 亿标签APAP、AP0.4AP_{0.4}、AP0.8AP_{0.8}视觉模型能否在未见杂乱场景中生成高质量抓取
REGRAD关系化杂乱场景目标、关系和安全抓取生成式场景与解析标签约 111.8K 个场景,Seen / Unseen目标特定与关系相关指标抓取哪个对象以及如何避开关系约束
LangSHAPE视觉、语言与部件部件可供性和 6-DoF 抓取部件/对象级标注16 个物体类别、35 个部件类别,8:1:1 划分部件定位与抓取语言指定的部件是否真的可抓
TARGO目标驱动的遮挡场景目标对象条件下的 6-DoF 抓取真实场景筛选与标注TARGO-Real:21 个物体、1,000 个场景目标抓取与遮挡鲁棒性指定目标而不是任意抓取能否成功
Supermarket-6DoF真实超市物体姿态、抬升与稳定性标签机器人执行20 个物体、1,500 次尝试Lift / Stability检测姿态是否能在真实平台上抓住物体
GraspIT / GCA-Bench仿真与真实执行场景滑移、可达性、阶段和任务结果仿真验证与机器人实验GraspIT:约 316K 帧、1,035 个仿真场景、100 个真实场景;GCA-Bench:102 个任务场景Slip、Reachability、Task Success感知错误如何传递到规划和任务执行

这些数据集沿着不同方向扩展任务:Jacquard 增加平面图像的规模,ACRONYM 增加物体中心的 6-DoF 多样性,GraspNet 增加真实 RGB-D 杂乱场景,TARGO、LangSHAPE 与 GCA-Bench 则加入目标、语言和任务执行条件。

平面抓取基准(Planar Grasp Benchmarks)#

Cornell Grasp Dataset:人工矩形标注#

Cornell 是最常见的平面抓取基准。它提供真实桌面图像以及人工绘制的旋转抓取矩形。Redmon 等人使用的常见版本包含 885 张 RGB-D 图像、240 个物体和约 8,019 个矩形标注 [1]。

一个矩形抓取通常写成:

g=(x,y,w,l,θ),g=(x,y,w,l,\theta),

其中 (x,y)(x,y) 是图像像素中的中心,ww 和 ll 是矩形的像素宽度与长度,θ\theta 是图像平面内的旋转角。平行夹爪的两个指尖可以对应矩形的两条相对短边,因此这个表示隐含了“从图像上方沿相机光轴接近”的假设。

常用判据要求预测矩形与某个标注矩形之间的方向误差小于 30∘30^\circ,并且交并比(Intersection over Union, IoU)大于 0.250.25。IoU 定义为两个矩形区域交集与并集面积之比:

IoU⁡(g,g∗)=∣B(g)∩B(g∗)∣∣B(g)∪B(g∗)∣,\operatorname{IoU}(g, g^*) =\frac{|B(g)\cap B(g^*)|}{|B(g)\cup B(g^*)|},

其中 B(g)B(g) 是抓取矩形在图像中的区域,g∗g^* 是人工标注。这个指标衡量图像空间的几何接近,输入输出都位于平面抓取表示中。

还需要区分两种常见划分:

  • 图像划分(Image-Wise Split):同一物体的不同图像可能同时出现在训练和测试中,测试重点是视角和图像变化;
  • 物体划分(Object-Wise Split):测试物体实例不出现在训练集中,更接近未见物体泛化。

论文报告 Cornell accuracy 时,应同时写明使用的是 image-wise split 还是 object-wise split。

Jacquard:大规模合成矩形#

Jacquard 用三维物体模型和渲染器生成 RGB-D / 深度图,再为每张图像生成多个平面抓取矩形。常见统计为约 54K 张图像、约 11K 个物体和约 1.1M 个矩形标签 [2]。它沿用角度误差与 IoU 判据,适合训练和评测大规模平面抓取检测器。

它可以低成本改变物体形状、朝向和抓取数量;渲染域与真实相机之间的域差距(Rendering Domain Gap)则是后续 sim-to-real 实验需要处理的变量。

Cornell 与 Jacquard 上的代表性结果#

下表列出公开论文中常被引用的平面抓取结果。Cornell 的两列分别是 image-wise 和 object-wise accuracy;Jacquard 一列使用的是 GKNet 论文中的 Abridged Jacquard Dataset(AJD),不是完整 Jacquard 测试集。速度为论文报告的单模型推理速度。

方法Cornell image-wiseCornell object-wiseAJD accuracy速度
Lenz et al. [20]73.9%75.6%—0.07 fps
Redmon and Angelova [1]88.0%87.1%—3.31 fps
Kumra and Kanan [18]89.2%88.9%—16.03 fps
GKNet [19]96.9%95.7%98.39%41.67 / 23.26 fps

这个表展示的是平面基准内部的演进:表示从矩形回归逐步转向关键点热图和分组,速度与准确率同时成为比较维度。AJD 的 98.39% 对应 512×512 输入和 AJD 协议,不能当作完整 Jacquard 的统一 leaderboard 数字。

物体中心的解析与仿真数据(Object-Centric Analytic and Simulated Data)#

Dex-Net 2.0:从解析质量到局部深度图块#

Dex-Net 2.0 的训练样本来自三维物体模型,而不是机器人逐次尝试。它在物体表面采样平行夹爪候选,用鲁棒准静态抓取质量(Robust Quasi-Static Grasp Quality)给候选打标签,再从相机视角渲染深度图块,训练抓取质量卷积网络(Grasp Quality Convolutional Neural Network, GQ-CNN) [3]。论文报告约 1,500 个物体模型和约 6.7M 个合成深度样本,并在 ABB YuMi 上进行了验证。

一个 Dex-Net 样本可以理解为以下变量的组合:物体网格、稳定放置姿态、相机姿态、候选抓取、渲染深度和解析质量。生成逻辑是:

物体网格清理与缩放
    → 采样稳定放置姿态
    → 采样平行夹爪候选
    → 在摩擦与位姿扰动下计算鲁棒解析质量
    → 渲染带噪深度图
    → 裁剪候选附近的局部深度图块
    → 训练 GQ-CNN 预测质量
text

这里的“正样本”是接触模型在给定摩擦、力和扰动假设下计算出的质量。网格尺度、摩擦系数、指尖几何和扰动分布都会进入标签,Dex-Net 2.0 的研究对象是单物体局部深度图上的质量预测。

Dex-Net 的训练/测试划分在物体模型层完成;同一网格的不同渲染视角属于同一几何实例。

Dex-Net 2.0 同时给出了一个物理执行结果:GQ-CNN 在 8 个已知物体上达到 93% 的抓取成功率,在 10 个未见物体上达到 80%;在 40 个新家庭物体上,对被判为 robust 的抓取达到 99% precision [3]。这些结果把解析质量、网络排序和 YuMi 执行连接起来,是物体中心基准与真实机器人之间的早期桥梁。

ACRONYM:物体坐标系中的 6-DoF 抓取分布#

ACRONYM 面向物体中心的六自由度抓取,包含约 17.7M 个仿真平行夹爪抓取,覆盖 8,872 个物体和 262 个类别 [4]。与 Cornell/Jacquard 的矩形不同,它保存的是物体坐标系中的抓取姿态;加载物体时,可以把同一组姿态变换到任意场景位姿。

标签由物理仿真产生:夹爪被放置到候选预抓取姿态,随后闭合指尖,并依据碰撞、接触和物体是否被稳定持有判断结果。ACRONYM 的主要用途是提供大规模物体中心 6-DoF 抓取分布,用于生成式模型训练、候选覆盖率分析和 sim-to-real 预训练。

GraspNet-1Billion:场景级 6-DoF 基准(Scene-Level 6-DoF Benchmark)#

数据采集与规模#

GraspNet-1Billion 将真实 RGB-D 观测、杂乱场景、物体 6D 位姿和密集 6-DoF 抓取标签结合起来 [5]。它包含 88 个日常物体和 190 个杂乱场景;每个场景约有 512 个视角,总计 97,280 张 RGB-D 图像。数据由 Intel RealSense 435 和 Azure Kinect 两种深度相机同步采集,因此同一场景可以在不同传感器质量下被观察。

“1Billion”指自动生成的抓取标注数量超过 11 亿。每个场景的标注数量约为 3M 到 9M,密度来自多个采样和变换步骤的组合。

标签是如何生成的#

GraspNet 的标注流程分为两个阶段。

第一阶段在单物体网格上生成抓取:

  1. 在网格表面均匀采样抓取点;
  2. 为每个点采样球面上的接近方向(Approach Direction);
  3. 在夹爪深度集合 DD 与夹爪绕接近轴的平面内角集合 AA 上搜索候选;
  4. 根据物体几何确定夹爪宽度,删除空抓和物体自身碰撞的候选;
  5. 对候选进行力闭合(Force Closure)计算,并在一组摩擦系数下记录质量。

对某个候选抓取,若最小摩擦系数为 μ\mu 时仍满足力闭合,原论文使用:

s=1.1−μs=1.1-\mu

作为质量分数,其中 μ\mu 是无量纲的摩擦系数,ss 也是无量纲分数。这个分数来自接触模型,不是实测成功概率。

第二阶段把单物体抓取放入杂乱场景:

  1. 用物体在场景中的位姿把物体坐标系抓取变换到场景坐标系;
  2. 检查夹爪与桌面、背景和其他物体的碰撞;
  3. 使用相机标定与逐帧相机位姿,把场景标注表达到各个视角。

如果单物体抓取为 Gi(o)G_i^{(o)},物体坐标系到世界坐标系的变换为 wTOi{}^{w}T_{O_i},则场景坐标系中的抓取可以写成:

Gi(w)=wTOiGi(o).G_i^{(w)}={}^{w}T_{O_i}G_i^{(o)}.

这个过程同时产生物体姿态、掩码、边界框和场景抓取,构成 GraspNet 的场景级监督。

训练集与测试集如何划分#

GraspNet 使用 100 个训练场景和 90 个测试场景。官方测试集分为三个各含 30 个场景的分支:

划分测试对象相对于训练集主要考察的问题
Seen训练中出现过的对象场景杂乱、视角和遮挡变化
Similar未出现但外形或类别相近的对象中等程度的对象泛化
Novel与训练对象分布差异更大的未见对象更严格的几何泛化

早期论文有时把 Similar 写作 Unseen;表格中采用 GraspNet 官方常用的 Seen / Similar / Novel 命名。

官方 AP 如何计算#

模型通常从 RGB-D 图像或场景点云输出带分数的候选抓取:

g^j=(R^j,t^j,w^j,q^j),\hat g_j=(\hat R_j,\hat{\boldsymbol t}_j,\hat w_j,\hat q_j),

其中 R^j∈SO(3)\hat R_j\in SO(3) 是旋转矩阵,t^j∈R3\hat{\boldsymbol t}_j\in\mathbb R^3 是抓取中心,w^j∈R\hat w_j\in\mathbb R 是夹爪宽度,q^j∈R\hat q_j\in\mathbb R 是用于排序的置信分数。官方评测包含以下步骤:

  1. 按候选分数排序,并执行姿态非极大值抑制(Pose Non-Maximum Suppression, Pose-NMS),避免相同抓取模式重复占据候选名额;
  2. 每个场景只保留前 50 个候选;
  3. 根据夹爪内部的场景点确定候选关联的物体,并检查碰撞;
  4. 对每个摩擦系数 μ\mu 重新计算力闭合标签;
  5. 计算不同候选截断位置的前缀精度,再在场景和摩擦系数上汇总。

设经过 NMS 后的第 jj 个候选在摩擦系数 μ\mu 下的标签为 yj,μ∈{0,1}y_{j,\mu}\in\{0,1\}。前 kk 个候选的精度是:

Precision@⁡kμ=1k∑j=1kyj,μ,1≤k≤50.\operatorname{Precision@}k_{\mu} =\frac{1}{k}\sum_{j=1}^{k}y_{j,\mu}, \qquad 1\leq k\leq 50.

单个场景在该摩擦系数下的 AP 定义为:

AP⁡μ=150∑k=150Precision@⁡kμ.\operatorname{AP}_{\mu} =\frac{1}{50}\sum_{k=1}^{50} \operatorname{Precision@}k_{\mu}.

总 AP 通常对 μ∈{0.2,0.4,0.6,0.8,1.0}\mu\in\{0.2,0.4,0.6,0.8,1.0\} 的结果取平均:

AP⁡=15∑μ∈{0.2,0.4,0.6,0.8,1.0}AP⁡μ.\operatorname{AP} =\frac{1}{5}\sum_{\mu\in\{0.2,0.4,0.6,0.8,1.0\}} \operatorname{AP}_{\mu}.

因此,AP0.4AP_{0.4} 更强调低摩擦条件下仍然满足力闭合的候选,AP0.8AP_{0.8} 则更接近高摩擦条件下的结果。GraspNet AP 的核心是前 50 个候选的前缀精度平均,候选排序、Pose-NMS 和碰撞过滤都属于协议的一部分。

Algorithm 1 6-DoF 抓取检测基准评测流程
输入:
固定的测试 split、RGB-D 或点云输入、夹爪模型、候选解码器和官方评测参数
输出:
每个场景的 Top-50 候选、APμAP_\mu、平均 AP,以及独立记录的运行时间和执行指标
  1. require 固定相机分支、Seen / Similar / Novel split 与摩擦系数集合
  2. 读取 RGB-D 或点云,并执行工作空间裁剪、下采样和坐标变换
  3. 运行抓取检测器,将网络输出解码为 (R,t,w,q)(R,\boldsymbol t,w,q)
  4. 按 qq 排序,执行 Pose-NMS,并保留每个场景的 Top-50 候选
  5. for 对每个摩擦系数 μ\mu
  6. 关联候选与场景物体,检查夹爪碰撞并计算 yj,μy_{j,\mu}
  7. 计算 Precision@⁡kμ\operatorname{Precision@}k_\mu 与 APμAP_\mu
  8. end for 对所有 μ\mu 求平均得到 AP
  9. 分别记录候选覆盖率、推理时间、可达性和真实执行成功率
  10. return 按 split、相机和指标类型组织的结果表

GraspNet-1Billion 上的代表性高分结果(Representative Results)#

下面的表格整理了后续论文在 GraspNet-1Billion 上报告的代表性结果。每个单元格按照 RealSense / Kinect 的顺序书写;结果均采用论文报告的官方 split 和 AP 协议。

总体 AP 与泛化划分#

方法输入与主要表示平均 APSeen APSimilar APNovel AP
GraspNet baseline [5]场景点云,点级 6-DoF 抓取21.41 / 23.0827.56 / 29.8826.11 / 27.8410.55 / 11.51
TransGrasp [13]场景点云,多尺度点 Transformer,7-DoF27.65 / 25.7039.81 / 35.9729.32 / 29.7113.83 / 11.41
GSNet [14]场景点云,点级/视角级 Graspness47.92 / 42.5365.70 / 61.1953.75 / 47.3924.31 / 19.01
AnyGrasp w/ CD [15]场景点云,稠密生成 + 碰撞检测49.01 / —66.12 / —56.09 / —24.81 / —
RNGNet [16]RGB-D,归一化区域抓取空间58.06 / 52.2475.20 / 72.2366.62 / 58.4332.38 / 26.05
RNGNet w/ CD [16]RGB-D,区域预测 + 碰撞检测59.13 / 52.8176.28 / 72.8968.26 / 59.4232.84 / 26.12

这里的“平均 AP”是三个测试分支 AP 的平均。Novel split 的分数明显低于 Seen split,说明未见几何仍然是主要难点;CD 表示额外的碰撞检测后处理。

不同摩擦条件下的补充结果#

下面是 RNGNet 论文附录中几个方法的 AP0.8AP_{0.8} 和 AP0.4AP_{0.4} 结果,仍按 RealSense / Kinect 排列。

方法Seen AP0.8AP_{0.8}Novel AP0.8AP_{0.8}Seen AP0.4AP_{0.4}Novel AP0.4AP_{0.4}
GSNet [14]76.25 / 71.4629.93 / 23.7361.08 / 56.0414.05 / 10.60
AnyGrasp w/ CD [15]77.27 / —31.08 / —61.02 / —13.82 / —
RNGNet w/ CD [16]86.58 / 83.1041.07 / 32.4572.26 / 68.1119.68 / 15.92

低摩擦条件下的 AP 反映候选对接触和摩擦变化的余量,能够补充平均 AP 对质量分布的描述。

条件化与执行型基准(Conditional and Execution Benchmarks)#

REGRAD:对象关系与安全抓取#

REGRAD 在杂乱场景中加入对象关系、目标对象和碰撞安全等信息,约包含 111.8K 个生成场景,训练、验证和测试规模约为 46.9K、32.1K 和 32.8K,并区分 Seen 与 Unseen [7]。它把评测对象从“场景中生成一个抓取”扩展为“在指定目标和关系约束下生成安全抓取”,因此结果通常按目标选择、关系预测和抓取几何分别统计。

LangSHAPE:语言指定的部件可供性#

LangSHAPE 将语言条件(Language Conditioning)和部件可供性(Part Affordance)结合起来,包含 16 个物体类别、35 个部件类别,并使用对象级和部件级 8:1:1 划分 [8]。例如,“抓住杯子的把手”不仅要求输出一个合法姿态,还要求网络先把语言对应到正确部件。

LangSHAPE 的评测链条包括部件定位、语言—部件匹配和部件约束抓取三个层次。

TARGO:目标驱动的遮挡抓取#

TARGO 将目标身份和遮挡程度作为显式条件。TARGO-Real 使用 21 个物体和 1,000 个筛选后的真实场景,研究在遮挡变化下指定目标的 6-DoF 抓取 [9]。它把目标选择与几何生成放在同一个测试任务中。

执行感知数据:Supermarket-6DoF、GraspIT 与 GCA-Bench#

Supermarket-6DoF 记录 20 个超市物体上的 1,500 次真实抓取尝试,并区分物体是否被抬起以及抓取后是否保持稳定 [10]。它将 6-DoF 姿态、场景点云、初始成功和扰动后稳定性放在同一条数据记录中。

GraspIT 报告约 316K 组 RGB-D 帧、1,035 个仿真场景和 100 个真实场景,并提供约 2.3M 个经过滑移测试(Slip Test)验证的候选 [11]。它把几何候选、可达性和执行稳定性放在同一数据流程中。

GCA-Bench 将抓取检测、目标选择、运动规划和执行拆成阶段指标,定义 102 个复杂任务场景 [12]。它的重点是记录感知、规划和控制之间的错误传递。

Contact-GraspNet 使用 ACRONYM 的仿真抓取训练,从部分观测点云预测接触中心和 6-DoF 姿态,并在 Franka 与 RealSense L515 平台上进行结构化杂乱场景实验,论文报告超过 90% 的抓取成功率 [17]。

执行型基准的代表性结果#

数据集 / 方法任务与指标代表性结果评测设置
Dex-Net 2.0 / GQ-CNN [3]已知物体抓取成功率93%8 个物体,ABB YuMi
Dex-Net 2.0 / GQ-CNN [3]未见物体抓取成功率80%10 个物体,50 次尝试
Dex-Net 2.0 / GQ-CNN [3]robust grasp precision99%40 个新家庭物体,69 个被判为 robust 的抓取
Contact-GraspNet [17]结构化杂乱场景成功率>90%Franka,RealSense L515
Supermarket-6DoF / Gripper-as-Point-Cloud [10]初始抓取成功预测准确率77.2 ± 2.8%1,500 次真实尝试,5-fold cross-validation
Supermarket-6DoF / Gripper-as-Point-Cloud [10]稳定抓取预测准确率75.2 ± 1.0%抬升后进行腕部 ±90° 扰动

这组结果把“解析质量预测”“候选生成后的真实执行”和“执行结果预测”放在了同一个数据集章节中,但每一行仍保留自己的任务定义。

评测阶梯与可复现性(Evaluation Ladder and Reproducibility)#

同一个预测姿态可以在不同层级被称为“成功”。从低到高,可以这样理解:

层级典型指标能证明什么不能证明什么
图像矩形匹配角度 + IoU与二维标注在图像上接近完整三维碰撞与可达性
离线姿态检测AP、Recall@kk与解析姿态标签匹配真实抬升和稳定性
几何有效性Force Closure、Collision满足指定接触与碰撞模型传感器和执行误差下的成功
仿真执行Simulated Success、Coverage在指定仿真参数下成功真实材料和接触动力学
真实抓取Lift Success、Stability、Clearing Rate特定机器人完成一次或多次抓取更换硬件后的泛化
完整任务Task Success、Recovery感知—规划—控制闭环效果检测器单独贡献了多少

指标如何对应问题(Metrics and Questions)#

GraspNet AP 衡量前 50 个候选在解析标签下的排序质量;Cornell IoU 衡量图像矩形与人工标注的几何接近;Lift Success 和 Stability 则直接观察机器人执行结果。跨基准阅读时,保留数据集、split、夹爪和指标名称即可,不需要把它们压缩成一个总分。

复现实验时必须固定的参数#

复现实验时需要同时记录模型输出和评测 API 之间的处理参数:

环节需要记录的参数
工作空间桌面/箱体边界、深度范围、是否使用真值分割
点云处理体素下采样尺寸、输入点数、法线和颜色是否使用
姿态解码旋转表示、宽度范围、深度偏移和坐标系约定
候选预算每点方向数、总候选数、候选排序和 Top-kk
Pose-NMS平移阈值、旋转阈值、夹爪对称处理和是否按物体分组
碰撞检查指尖与手掌几何、体素尺寸、空抓和碰撞阈值
评测输入RealSense/Kinect 分支、Seen/Similar/Novel split、摩擦系数集合
执行设置机器人、相机位置、夹爪、轨迹规划器、成功判据和重试策略

表格中的方法结果应与这些参数一起阅读,尤其是输入相机、候选预算、Pose-NMS 和碰撞模型。

参考文献(References)#

  1. J. Redmon and A. Angelova, “Real-Time Grasp Detection Using Convolutional Neural Networks,” 2015 IEEE International Conference on Robotics and Automation, 2015. DOI ↗
  2. A. Depierre, E. Dellandrea, and L. Chen, “Jacquard: A Large Scale Dataset for Robotic Grasp Detection,” 2018 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2018. DOI ↗
  3. J. Mahler et al., “Dex-Net 2.0: Deep Learning to Plan Robust Grasps with Synthetic Point Clouds and Analytic Grasp Metrics,” Robotics: Science and Systems XIII, 2017. DOI ↗
  4. C. Eppner, A. Mousavian, and D. Fox, “ACRONYM: A Large-Scale Grasp Dataset Based on Simulation,” 2021 IEEE International Conference on Robotics and Automation, 2021. DOI ↗
  5. H.-S. Fang, C. Wang, M. Gou, and C. Lu, “GraspNet-1Billion: A Large-Scale Benchmark for General Object Grasping,” 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2020. DOI ↗
  6. H.-S. Fang, M. Gou, C. Wang, and C. Lu, “Robust Grasping across Diverse Sensor Qualities: The GraspNet-1Billion Dataset,” The International Journal of Robotics Research, 2023. DOI ↗
  7. H. Zhang et al., “REGRAD: A Large-Scale Relational Grasp Dataset for Safe and Object-Specific Robotic Grasping in Clutter,” IEEE Robotics and Automation Letters, 2022. DOI ↗
  8. Y. Song et al., “Learning 6-DoF Fine-Grained Grasp Detection Based on Part Affordance Grounding,” IEEE Transactions on Automation Science and Engineering, 2025. DOI ↗
  9. Y. Xia et al., “TARGO and TARGO-Net: Benchmarking Target-Driven Object Grasping under Occlusions,” International Journal of Computer Vision, 2026. DOI ↗
  10. J. Toskov and A. Cosgun, “Supermarket-6DoF: A Real-World Grasping Dataset and Grasp Pose Representation Analysis,” arXiv preprint arXiv:2502.16311, 2025. arXiv ↗
  11. P. Koch, A. Karakurt, and A. Sers, “GraspIT: A Dataset Bridging the Sim-to-Real Gap and Back for Validated Grasping SE(3) Pose Generation,” arXiv preprint arXiv:2607.05869, 2026. arXiv ↗
  12. H. Zhang et al., “Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution,” arXiv preprint arXiv:2607.14341, 2026. arXiv ↗
  13. Z. Liu, Z. Chen, S. Xie, and W.-S. Zheng, “TransGrasp: A Multi-Scale Hierarchical Point Transformer for 7-DoF Grasp Detection,” 2022 International Conference on Robotics and Automation, 2022. DOI ↗
  14. C. Wang, H.-S. Fang, M. Gou, H. Fang, J. Gao, and C. Lu, “Graspness Discovery in Clutters for Fast and Accurate Grasp Detection,” 2021 IEEE/CVF International Conference on Computer Vision, 2021. DOI ↗
  15. H.-S. Fang et al., “AnyGrasp: Robust and Efficient Grasp Perception in Spatial and Temporal Domains,” IEEE Transactions on Robotics, 39(5):3929–3945, 2023. DOI ↗
  16. S. Chen, P. Xie, W. Tang, D. Hu, Y. Dai, and G. Wang, “Region-aware Grasp Framework with Normalized Grasp Space for Efficient 6-DoF Grasping,” Proceedings of the 8th Conference on Robot Learning, PMLR 270:1834–1850, 2024. Paper ↗ · arXiv ↗
  17. M. Sundermeyer, A. Mousavian, R. Triebel, and D. Fox, “Contact-GraspNet: Efficient 6-DoF Grasp Generation in Cluttered Scenes,” 2021 IEEE International Conference on Robotics and Automation, 2021. DOI ↗
  18. S. Kumra and C. Kanan, “Robotic Grasp Detection Using Deep Convolutional Neural Networks,” 2017 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2017. DOI ↗
  19. R. Xu, F.-J. Chu, and P. A. Vela, “GKNet: Grasp Keypoint Network for Grasp Candidates Detection,” The International Journal of Robotics Research, 2022. DOI ↗
  20. I. Lenz, H. Lee, and A. Saxena, “Deep Learning for Detecting Robotic Grasps,” The International Journal of Robotics Research, 2015. DOI ↗
Robotic Grasp Detection (6): 数据集与基准评测协议
https://hana-blog.pages.dev/blog/robotic-grasp-detection-6
Author 菊花花
Published at August 14, 2026
Comment seems to stuck. Try to refresh?✨