Hana's Blog
Robotic Grasp Detection (9): 目标、任务、部件与语言条件抓取Blur image

“能抓”与“应该抓”是两个问题(Graspability vs. Compatibility)#

对象无关抓取(Object-Agnostic Grasping)寻找场景中任意稳定抓取;条件抓取(Conditional Grasping)还要回答抓哪个物体、抓哪个部件,以及该抓取是否适合后续任务。

设平行夹爪候选为 g=(R,t⃗,w)g=(R,\vec t,w),其中 R∈SO(3)R\in SO(3)、t⃗∈R3\vec t\in\mathbb R^3、w∈R≥0w\in\mathbb R_{\geq0};场景观测为 oo,条件为 cc。一个便于实现的候选分数可以分解为:

Q(g∣o,c)=Qphysical(g∣o)+λQsemantic(g∣o,c),Q(g\mid o,c) =Q_{\text{physical}}(g\mid o) +\lambda Q_{\text{semantic}}(g\mid o,c),

其中 cc 可以是目标身份、部件、自然语言或任务;QphysicalQ_{\text{physical}} 评价接触、碰撞与可达性,QsemanticQ_{\text{semantic}} 评价目标和任务兼容性,λ≥0\lambda\geq0 控制语义偏好在排序中的权重。

安全条件和排序偏好需要不同的接口。若“不要触碰刀刃”是安全条件,它直接进入可行集合;“更偏向把手中部”则作为候选排序项:

  • 硬约束(Hard Constraint):目标身份、禁止接触区、夹爪宽度和碰撞,直接形成可行集合 Fc\mathcal F_c;
  • 软偏好(Soft Preference):更喜欢把手中部、减少腕部旋转或保留放置余量,用于集合内部排序。

选择问题写成:

g∗=arg⁡max⁡g∈G∩Fc[Qphysical(g)+λQpreference(g,c)].g^*=\arg\max_{g\in\mathcal G\cap\mathcal F_c} \left[Q_{\text{physical}}(g)+\lambda Q_{\text{preference}}(g,c)\right].

如果语义模型输出场景点 x⃗i∈R3\vec x_i\in\mathbb R^3 属于目标或部件的概率 pi∈[0,1]p_i\in[0,1],可计算候选闭合区 C(g)\mathcal C(g) 的语义一致性:

Qtarget(g)=1∣C(g)∣∑xi∈C(g)pi.Q_{\text{target}}(g)= \frac{1}{|\mathcal C(g)|} \sum_{x_i\in\mathcal C(g)}p_i.

接触点概率与闭合区平均概率共同使用,可以区分“夹爪中心位于目标附近”和“两侧接触确实落在目标上”。

条件抓取的方法路线(Conditional Grasping Map)#

条件层级模型输出进入抓取检测器的方式代表方法
目标条件(Target-Conditioned)实例掩码或目标查询裁剪目标点云、调制点特征REGRAD、TARGO-Net
部件条件(Part-Conditioned)部件掩码或可供性场限制接触区域Fine-Grained Grasp Detection
任务条件(Task-Conditioned)任务兼容分数或姿态偏好与物理质量联合排序Task-Oriented Grasp Detection、GraspGPT
语言条件(Language-Conditioned)文本—几何相似度目标检索、交叉注意力或查询选择Language-Driven Grasp Detection、OVGNet
物理属性条件(Physical-Property-Conditioned)材料、质量、脆弱性和力限制禁区、安全余量与夹紧力约束PhyGrasp

条件层级(Conditioning Levels)#

目标条件(Target-Conditioned)#

目标条件抓取要求从杂乱场景中抓取指定对象,而不是任意清空。REGRAD 将对象关系、目标身份与安全抓取共同标注 [1]。目标分割、对象识别和姿态生成由此成为相互依赖的阶段。

部件条件(Part-Conditioned)#

任务经常要求抓把手、边缘、瓶身或工具末端。部件可供性(Part Affordance)表示某个部件支持何种动作。细粒度部件抓取方法将语言或部件标签映射到三维区域,再在区域内生成六自由度(Six Degrees of Freedom, 6-DoF)姿态 [5]。

任务条件(Task-Conditioned)#

同一物体的稳定抓取不一定适合所有任务。倒水要保留杯口与手腕旋转空间,递交工具要暴露功能端,放置任务可能约束物体最终朝向。Task-Oriented Grasp Detection 将视觉可供性与隐式质量结合,使“好抓取”随任务改变 [4]。

物理属性条件(Physical-Property-Conditioned)#

材料、质量、摩擦和脆弱性会改变接触位置与夹持力。PhyGrasp 使用三维几何、语言与物理属性描述选择部件级抓取 [12]。模型把这些属性转换为禁止接触区域、力限制或稳定性偏好,再参与候选过滤与排序。


自然语言如何进入抓取系统(How Language Enters a Grasping System)#

自然语言指令(Natural-Language Command)可以在不同阶段发挥作用:

  1. 目标检索(Target Retrieval):找到“红色杯子”;
  2. 部件定位(Part Grounding):找到“杯子的把手”;
  3. 可供性推理(Affordance Reasoning):判断“倒水时不要堵住杯口”;
  4. 约束生成(Constraint Generation):产生目标区域、禁区或姿态偏好;
  5. 场景策略(Scene Strategy):决定先移开哪个遮挡物。

早期联合语言抓取网络直接将命令与图像特征融合,预测语言条件的平面抓取 [2]。Language-Driven Grasp Detection 使用大规模语言与视觉先验进行开放词汇平面抓取 [3]。若系统最终执行 6-DoF 抓取,二维目标区域还需要通过深度反投影为三维点,并在三维场景中检查接近路径。

语言特征如何与几何对齐#

给定文本编码 ec∈Rdee_c\in\mathbb R^{d_e} 与像素或点特征 fi∈Rdff_i\in\mathbb R^{d_f},线性投影 We∈Rd×deW_e\in\mathbb R^{d\times d_e}、Wf∈Rd×dfW_f\in\mathbb R^{d\times d_f} 将二者映射到相同的 dd 维空间。目标注意力可以由归一化相似度产生:

αi=exp⁡(⟨Wffi,Weec⟩/τ)∑jexp⁡(⟨Wffj,Weec⟩/τ).\alpha_i=\frac{ \exp(\langle W_f f_i,W_e e_c\rangle/\tau) }{ \sum_j\exp(\langle W_f f_j,W_e e_c\rangle/\tau) }.

αi∈[0,1]\alpha_i\in[0,1] 是第 ii 个位置与指令的匹配权重,温度 τ>0\tau>0 控制分布尖锐程度。Transformer 方法让语言词元(Token)与图像或点云 Token 做交叉注意力(Cross-Attention),输出目标掩码、部件掩码或抓取查询。

若输入是像素掩码,对像素 (u,v)(u,v) 和深度 zz 使用相机内参 (fx,fy,cx,cy)(f_x,f_y,c_x,c_y) 反投影:

x⃗(u,v)=[(u−cx)z/fx(v−cy)z/fyz]∈R3.\vec x(u,v)= \begin{bmatrix} (u-c_x)z/f_x\\ (v-c_y)z/f_y\\ z \end{bmatrix} \in\mathbb R^3.

每个三维点同时保留掩码概率 pip_i,供后续硬裁剪或软特征调制使用。

语义掩码有两种进入检测器的方式。硬裁剪只把 pi>ηp_i>\eta 的点送入抓取网络,减少背景计算;软调制使用 fi′=pifif_i'=p_i f_i,或把 pip_i 作为额外通道,使边界不确定性保留到抓取头。给定真值掩码与使用预测掩码的两组结果,分别测量姿态检测上限和完整语义接口的性能。


交互式目标消歧(Interactive Grounding)#

指令可能含糊,例如“拿那个杯子”对应多个实例。INVIGORATE 将视觉指代消解(Visual Grounding)、遮挡关系、提问与抓取动作组织为部分可观测决策过程(Partially Observable Markov Decision Process, POMDP)[6]。

系统维护目标状态的信念分布(Belief State)bt(s)b_t(s)。得到回答或新视觉观测 ot+1o_{t+1} 后,按贝叶斯更新:

bt+1(s)∝p(ot+1∣s,at)∑s′p(s∣s′,at)bt(s′).b_{t+1}(s)\propto p(o_{t+1}\mid s,a_t) \sum_{s'}p(s\mid s',a_t)b_t(s').

“提问”与“抓取”都是动作:提问消耗时间但降低目标歧义,错误抓取具有更高代价。策略比较提问后的期望信息价值与直接执行效用,并记录目标后验、提问次数和错误对象抓取率。

系统可以在目标后验分散或错误抓取代价较高时先提问,在目标明确时直接生成抓取。目标识别、阻挡判断、提问次数和物理执行构成四个可分别统计的阶段。


从语言知识到任务抓取(From Language Knowledge to Task Grasps)#

GraspGPT 利用大语言模型(Large Language Model, LLM)的语义知识,为未见对象和任务产生抓取先验 [7]。FoundationGrasp 进一步结合基础模型(Foundation Model)的语义与几何先验,研究可泛化任务抓取 [10]。

这类系统通常包含两个层次:

  • 高层语义模型推断目标、部件和用途;
  • 低层几何模型生成接触稳定、无碰撞的平行夹爪姿态。

高层模型输出掩码(Mask)、目标点、部件概率、正负区域或候选偏好;几何生成器再据此产生平行夹爪姿态,运动规划器负责碰撞和可达性验证。这个接口把语言推理结果转换成可查询的三维约束。


对象中心多任务抓取(Object-Centric Multi-Task Grasping)#

多任务掩码 Transformer(Multi-Task Masked Transformer, M2T2)从杂乱点云中预测对象中心接触掩码、抓取与放置姿态,并可接受目标或语言条件 [8]。它把抓取与放置视为相关低层技能,而不是只输出单次抓取。

对象查询(Object Query)先与场景点特征交互,产生每个查询对应的对象/接触掩码;抓取头只在该查询聚合的点特征上解码姿态,放置头则预测物体在目标区域中的姿态。查询索引因此保持对象身份的一致性:目标条件从同一个查询读取掩码和抓取结果。训练时对预测查询与真值对象做二分图匹配(Bipartite Matching),再计算掩码、接触和姿态损失。

对象中心表示(Object-Centric Representation)有利于保持目标身份,但依赖点云分辨率、实例结构和对象边界。小目标或严重遮挡会同时影响语义选择与姿态预测。


开放词汇与三维语义场(Open-Vocabulary and 3D Semantic Fields)#

开放词汇抓取(Open-Vocabulary Grasping)要求识别训练标签之外的对象或部件。OVGNet 统一视觉语言特征与抓取预测 [9];GaussianGrasper 将语言语义写入三维高斯泼溅表示(3D Gaussian Splatting, 3DGS)[11]。

一个三维高斯由中心 μ⃗i∈R3\vec\mu_i\in\mathbb R^3、协方差 Σi∈R3×3\Sigma_i\in\mathbb R^{3\times3}、不透明度 αi∈[0,1]\alpha_i\in[0,1]、颜色与语义特征 fi∈Rdf_i\in\mathbb R^d 描述。多视角图像优化后,语言查询与 fif_i 的相似度形成三维目标概率场。抓取检测器可从高斯场提取深度或占据,也可以把语义概率投影到传感器点云,然后在该几何上生成接触与检查碰撞。

开放词汇能力通常来自大规模视觉语言预训练,三维抓取头则用深度、尺度、夹爪宽度和碰撞模型把“哪里是把手”转换成“哪些姿态可以夹住把手”。

Open-Vocabulary Part-Based Grasping 将对象—部件提示、分割与六自由度抓取串联起来 [13]。模块化结构可以分别评价开放词汇定位、部件分割和姿态生成。


场景策略与遮挡处理(Strategic Clearing under Occlusion)#

当目标不可见或不可达时,系统先规划清理动作。ThinkGrasp 使用视觉语言模型(Vision-Language Model, VLM)判断应抓取目标的哪个部件,或先移走哪个遮挡物,再调用低层六自由度生成器 [14]。

TARGO 则把目标遮挡程度变成可控基准变量,评价目标驱动抓取随可见性变化的性能 [15]。两者分别关注策略和测量:前者决定动作顺序,后者建立遮挡条件下的统一测试。

场景策略使“抓取检测”扩展为多步决策。此时最终成功率同时受到语义推理、遮挡估计、每一步姿态检测和执行误差影响,需要保留阶段指标。


语义到物理的接口(Semantic-to-Physical Interface)#

语言结果可以转换为以下物理约束:

语义要求低层物理表示
“抓杯子的把手”目标部件掩码与允许接触区域
“不要碰易碎表面”禁止接触区域与安全余量
“为了倒水”手腕朝向、杯口净空和后续轨迹
“拿最重的物体”目标身份、质心与夹紧力要求
“目标被挡住了”遮挡关系与清理动作序列

评测沿接口分解为:

  1. 目标/部件定位是否正确;
  2. 在正确定位条件下,可行姿态生成率是多少;
  3. 候选是否满足碰撞、宽度与可达性;
  4. 真实抓取是否稳定;
  5. 最终任务是否完成。

在候选级实现这些约束时,设预测接触点 c⃗1,c⃗2∈R3\vec c_1,\vec c_2\in\mathbb R^3,夹爪扫掠体积为 V(g)⊂R3V(g)\subset\mathbb R^3,允许接触区域和禁止接触区域分别为 Rallowed,Rforbidden⊂R3\mathcal R_{\text{allowed}},\mathcal R_{\text{forbidden}}\subset\mathbb R^3:

c⃗1,c⃗2∈Rallowed,dist⁡(c⃗1,Rforbidden)>m,V(g)∩Oscene=∅,\begin{aligned} \vec c_1,\vec c_2 &\in \mathcal R_{\text{allowed}},\\ \operatorname{dist}(\vec c_1,\mathcal R_{\text{forbidden}})&>m,\\ V(g)\cap\mathcal O_{\text{scene}}&=\varnothing, \end{aligned}

其中场景占据区域 Oscene⊂R3\mathcal O_{\text{scene}}\subset\mathbb R^3,安全余量 m∈R>0m\in\mathbb R_{>0}。概率掩码可以进一步计算候选与禁止区域的期望重叠。任务约束还可延伸到放置:把抓取后物体变换 GTO∈SE(3){}^{G}T_O\in SE(3) 与目标放置 WTOgoal∈SE(3){}^{W}T_O^{\text{goal}}\in SE(3) 组合,检查该抓取是否允许末端到达目标朝向。

Algorithm 1 语言条件的 6-DoF 抓取检测
输入:
RGB-D / 点云观测、自然语言指令、平行夹爪模型和机器人状态
输出:
满足目标、部件和任务条件的抓取姿态 g∗g^*
  1. require 编码文本与视觉/点云特征,并计算跨模态对应关系
  2. 预测目标实例、部件区域及其概率,反投影到统一三维坐标系
  3. 将语言条件解析为允许接触区、禁止接触区、姿态偏好和任务约束
  4. 在目标三维区域内生成平行夹爪候选集合 G\mathcal G
  5. for 对每个候选 g∈Gg\in\mathcal G
  6. 计算物理质量、接触语义一致性和任务兼容分数
  7. 检查夹爪宽度、扫掠碰撞、机器人可达性和后续任务姿态
  8. end for 完成候选评价
  9. 按硬约束过滤,再按软偏好排序和去重
  10. return 最高分可行抓取 g∗g^*,或清理/询问动作

参考文献(References)#

  1. H. Zhang et al., “REGRAD: A Large-Scale Relational Grasp Dataset for Safe and Object-Specific Robotic Grasping in Clutter,” IEEE Robotics and Automation Letters, 2022. DOI ↗
  2. Y. Chen, R. Xu, Y. Lin, and P. A. Vela, “A Joint Network for Grasp Detection Conditioned on Natural Language Commands,” 2021 IEEE International Conference on Robotics and Automation, 2021. DOI ↗
  3. A. D. Vuong et al., “Language-Driven Grasp Detection,” 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024. DOI ↗
  4. W. Chen et al., “Learning 6-DoF Task-Oriented Grasp Detection via Implicit Estimation and Visual Affordance,” 2022 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2022. DOI ↗
  5. Y. Song et al., “Learning 6-DoF Fine-Grained Grasp Detection Based on Part Affordance Grounding,” IEEE Transactions on Automation Science and Engineering, 2025. DOI ↗
  6. H. Zhang et al., “INVIGORATE: Interactive Visual Grounding and Grasping in Clutter,” Robotics: Science and Systems XVII, 2021. DOI ↗
  7. C. Tang et al., “GraspGPT: Leveraging Semantic Knowledge from a Large Language Model for Task-Oriented Grasping,” IEEE Robotics and Automation Letters, 2023. DOI ↗
  8. W. Yuan, A. Murali, A. Mousavian, and D. Fox, “M2T2: Multi-Task Masked Transformer for Object-Centric Pick and Place,” Proceedings of the 7th Conference on Robot Learning, 2023. PMLR ↗
  9. M. Li et al., “OVGNet: A Unified Visual-Linguistic Framework for Open-Vocabulary Robotic Grasping,” 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2024. DOI ↗
  10. C. Tang et al., “FoundationGrasp: Generalizable Task-Oriented Grasping with Foundation Models,” IEEE Transactions on Automation Science and Engineering, 2025. DOI ↗
  11. Y. Zheng et al., “GaussianGrasper: 3D Language Gaussian Splatting for Open-Vocabulary Robotic Grasping,” IEEE Robotics and Automation Letters, 2024. DOI ↗
  12. D. Guo et al., “PhyGrasp: Generalizing Robotic Grasping with Physics-Informed Large Multimodal Models,” 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems, 2025. DOI ↗
  13. T. van Oort et al., “Open-Vocabulary Part-Based Grasping,” arXiv preprint arXiv:2406.05951, 2024. arXiv ↗
  14. Y. Qian et al., “ThinkGrasp: A Vision-Language System for Strategic Part Grasping in Clutter,” Proceedings of the 8th Conference on Robot Learning, 2024. PMLR ↗
  15. Y. Xia et al., “TARGO and TARGO-Net: Benchmarking Target-Driven Object Grasping under Occlusions,” International Journal of Computer Vision, 2026. DOI ↗
Robotic Grasp Detection (9): 目标、任务、部件与语言条件抓取
https://hana-blog.pages.dev/blog/robotic-grasp-detection-9
Author 菊花花
Published at August 14, 2026
Comment seems to stuck. Try to refresh?✨