# 工业工件视觉抓取的实证研究设计 研究对象是工业机械臂的抓取前视觉感知、六自由度抓取生成与规划执行。第一阶段使用冻结的预训练模型及传统算法,在同一个 ABB RobotStudio 工位上评测;不训练新的控制策略,不在运动过程中做视觉微调。机器人品牌作为执行环境固定,不把 ABB 与 FANUC 的差异混入本轮方法比较。 ## RQ1:三维感知方法如何影响工业工件的抓取成功率? 比较现有 7 个双目深度方法和 8 个多相机重建方法。所有方法接同一个 GraspGen、同一夹爪、同一候选预算、规划器、运动参数和成功判定器。主结果为 ABB 几何抓取任务完成率;深度/表面误差、有效覆盖率和感知耗时用于解释差异。 同一场景的双目读取固定左右两幅,多目读取包含这两幅的全部四幅。跨组结果是“相机配置+算法”的系统比较,不能将额外视角收益都归因于算法。选定支持可变视角的方法做 2/4 视角消融,分辨率与每视图参数相同;在分组内比较同输入预算的方法。共同可见域和额外可见域的几何覆盖分别报告。 ## RQ2:抓取生成方法如何影响工业工件的抓取成功率? 比较 6-DOF GraspNet、Contact-GraspNet、GraspGen、GPD、GraspNet-Baseline。各模型读入同一份带哈希的场景和目标点云,使用相同的坐标、夹爪几何及下游规划约束。分别使用 FoundationStereo 的双目点云和一个预先登记的多目后端(首版建议 MVSFormer++),检查结论是否随输入点云变化。 多目后端在开发阶段按可运行性与协议确定,不能在测试集挑选最有利的点云。作者预测 score 只用于各模型内部排序,不比较 score 的绝对值。网络原始输出预算保留并单独计时,共同下游最多检查前 200 个候选,每任务最多执行一次闭合;不把候选数量直接作为性能指标。 GraspNet-Baseline 当前为严格加载通过的公开镜像权重,其与作者原文件一致性仍未确认,必须随实验报告标注;GPD 采用作者 CPU 分类器,并保留几何可见性估计造成的输入差异。ASGrasp 不进入主对照。 ## RQ3:工业场景复杂度如何影响抓取系统的稳健性? 使用配对场景:同一工件、同一位姿、同一光照/相机,分别处于单件、周围有其他工件、料框壁三种条件。记录成功率变化、规划失败、碰撞和空候选,分析小孔、薄壁、凹形及近似对称工件的失效。 首版并不是随机堆叠数据,也没有验证真实镜面金属材质。因此该 RQ 当前只涉及邻近干扰、料框几何约束和形状变化。真实反射、遮挡强度分级、相机标定噪声、随机落料堆叠均作为后续独立版本;不能在结果中把未生成的条件写成已覆盖。 ## RQ4:不同方法的抓取成功率与时间开销如何权衡? 复用 RQ1–RQ3 的全部有效任务,分别绘制成功率—感知决策时间、成功率—ABB 动作节拍的关系。报告中位数/P95、超时比例、峰值显存和 CPU/GPU 设备。可以报告 Pareto 前沿,不随意把成功率与秒数加权成一个总分。 ABB 动作时间采用仿真时钟;GPU 推理、规划、网络与虚拟机开销使用真实墙钟。另列整批基准的有效吞吐,不把仿真加速倍率冒充实际产线吞吐。速度、加速度、负载、夹爪闭合时间、初始关节姿态和路径规划预算对所有方法相同。 ## 数据划分与规模 首版为 24 件 × 3 个位姿 × 3 种环境条件,共 216 个场景,每场景 4 张 RGB。开发集为轴套和安装块的 8 件/72 场景;独立测试集为另外 4 个形状族的 16 件/144 场景。相同模板的尺寸变体不跨集合。这个规模用于工程预实验和初步方法比较;正式规模应根据开发集上的差异与置信区间宽度确定,先扩展独立工件数量,再增加重复视角。 测试物件可以用于检查文件可读性和相机投影,但不得查看模型测试结果来调参。正式评测前固定对象清单、seed、方法版本、checkpoint 哈希、阈值和停止规则。保存失败与空输出,绝不只展示抓取成功的录像。 ## 控制组合数量 不必把 15 个感知后端与 5 个抓取后端全部组合。RQ1 运行 15 条感知路线并固定 GraspGen;RQ2 运行预定 2 条感知路线 × 5 个抓取模型,与 RQ1 重合 2 条,共 **23 种不同组合**。RQ3 和 RQ4 使用相同记录按条件/时间分析,不再重复创建新的独立场景。 按 144 个测试场景计算,单个种子完整矩阵为 3312 个任务;随机方法再按预登记种子运行,确定性方法不无意义地重复。先在开发集做小批打通和耗时估算,再决定正式评测是否分阶段执行。这只是计划数量,当前并未启动这些 ABB 任务。 ## 执行顺序与当前状态 1. 生成并校验工业网格、四相机 RGB、标定、真值与开发/测试划分。 2. 核对 ABB 原生型号与 RobotWare,导入毫米 STL,配置相同两指夹爪及 TCP/世界变换;选择并记录几何或接触物理成功模式。 3. 完成评价器正负例和工位复位检查,把预测宽度接入规划,检查全场景轨迹碰撞;停留在接口候选层的方法不能直接登记为执行通过。 4. 仅在开发集接通各算法、测预算并冻结协议,随后运行独立测试集。 5. 对首版参数化数据以形状族为统计分组,给出探索性置信区间、配对差异和失败分类;网站分别显示数据生成、算法推理、ABB 执行三种状态。 2026-10-11 已完成第一步,并在华硕主机启动开发预实验:2 件工件 × 3 种配对条件,先接入 7 个双目方法与 MVSFormer++,按 RQ1 固定 GraspGen,按 RQ2 在 FoundationStereo/MVSFormer++ 点云上比较 5 个抓取模块。其余多目方法在后续开发批次接入。该批次用于接口、预算与失败诊断;ABB 原生执行与成功判定尚待校准,独立测试集未启动。三维感知结果只从 RGB 计算;`evaluation/` 的真值供判卷与复原环境,不能泄漏给候选生成或运动规划。