快速导读:提出首个百万级工业机械制图到可执行参数化CAD程序生成的基准OmniMech,系统评估了当前LMM在精确几何重建、尺寸标注理解和工程约束推理方面的严重不足。
工业设计领域,将二维机械制图重建为可编辑的三维CAD模型是一项核心但耗时的工作。近期视觉语言模型(LMM)在从图像生成CAD程序方面展现出潜力,然而现有数据集普遍缺乏真实的工程标注,导致模型只能追求视觉相似性,而忽略了毫米级公差和制造约束。OmniMech基准的提出,正是为了系统性地回答一个关键问题:当前最先进的大模型,到底能否真正理解一张工程图纸?
OmniMech构建了包含251K真实工业二维机械制图与对应原生SolidWorks参数化模型的超大规模数据集,每张图纸平均包含丰富的尺寸标注、多正交视图和剖视图。基于此,论文设计了四维评估协议,从参数化CAD程序合成、图到三维几何一致性、标注驱动的几何约束推理,到工具增强的智能体迭代重建,全面评测了商业与开源LMM的表现。结果令人警醒:即使最强的商业模型,其重建结果在表面面积和体积上仍存在显著误差,而开源模型在智能体设置下几乎完全失效。
英文题目:OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction
论文出处:arXiv 每日论文精选 · arXiv:2608.05539
原始论文:PDF / 论文页面
这篇论文解决什么问题?
CAD是工业设计的基石,从二维图纸到三维模型的转换传统上依赖经验丰富的工程师手工完成。近年来,随着VLM的快速发展,研究者开始尝试让模型直接从图纸图像生成CAD程序,如基于CadQuery的Python脚本。然而,这一方向面临两个根本性挑战。
首先,训练数据的缺失。现有最大的机械CAD数据集如ABC虽然提供了百万级B-Rep和网格模型,但完全没有对应的机械制图标注。CME-CAD是目前最接近的机械制图到CAD程序数据集,但仅包含17.3K模型,且每张图纸只有2-3个工程标注,远不足以支撑模型学习精确的尺寸推理。
其次,评估体系的错位。现有方法大多沿用通用物体重建的指标,如Chamfer Distance,却忽略了工程CAD的核心要求:程序必须可执行、尺寸必须精确、特征必须完整。一个视觉上相似的网格模型,如果缺少关键的倒角特征或孔径偏差超过公差,在工程上就是废品。OmniMech正是为了填补这一数据与评估的双重空白而诞生。
核心创新
- 首个百万级工业机械制图到可执行参数化CAD程序生成的基准OmniMech,包含251K实例及丰富工程标注。
- 提出涵盖程序合法性、三维模型质量、尺寸精度和智能体效率的四维系统评估协议。
- 设计压缩代码历史差异表示的多轮智能体框架,减少42.44%的上下文token开销。
方法概览
构建包含251K真实工业二维机械制图与对应原生SolidWorks参数化模型、B-Rep、网格、多视图渲染及语义标注的OmniMech基准。提出四维评估协议:(1)参数化CAD程序合成;(2)图到三维几何一致性;(3)标注驱动的几何约束推理;(4)基于球形视觉工具增强的智能体迭代重建框架,支持自适应视图选择和固定多视图观察。
- 数据集构建:从ABC数据集中筛选并生成了251K个机械零件的二维正交投影图,每张图纸包含多视图(平均4.2个视图)和丰富的尺寸标注(平均每图15.7个标注),同时保留原生SolidWorks参数化模型、B-Rep、网格和STEP格式,实现从图纸到可制造模型的完整链路覆盖。
- 四维评估协议设计:第一维评估参数化CAD程序合成的合法性,即生成的Python代码能否成功执行并产生有效几何体;第二维通过Chamfer Distance、SIoU、VIoU和F-Score评估三维几何质量;第三维专门衡量尺寸标注的还原精度,包括表面面积误差和体积误差;第四维评估智能体框架下的推理效率与迭代稳定性。
- 零样本程序合成设置:将二维图纸(单张拼接图)、图纸加8个固定视角渲染图、图纸加20个视角或视频输入,分别送入商业LMM(GPT-5.5、Gemini 3.5 Flash等)和开源模型,要求直接生成CadQuery程序,测试模型在无反馈条件下的端到端重建能力。
- 工具增强智能体框架:LMM作为智能体,通过调用渲染工具获取当前重建结果的视觉反馈,然后迭代修改CAD程序。框架支持两种观察模式:自适应视图选择(模型自主决定需要查看哪些视角)和固定8视图观察,每次迭代仅传递代码差异而非完整历史,以减少上下文开销。
- 专用模型基线对比:引入CAD-Coder作为程序化图像到CAD的专用基线,同时评估SAM-3D、TRELLIS、InstantMesh、Hunyuan3D-2等通用图像到三维模型方法,揭示外观驱动重建与工程约束重建之间的本质差异。
- 代码历史压缩策略:在多轮迭代中,仅将当前代码相对于上一轮的差异部分(diff)作为上下文传递给LMM,而非累积完整代码历史,实验证明该策略使token使用量减少42.44%,同时保持了迭代优化的有效性。
逐图理解论文
研究空白与OmniMech的回应

图2从四个维度统计了OmniMech的数据特性:应用词云显示了零件的工业领域分布,视图数量分布表明多数图纸包含3-6个正交视图,尺寸标注数量集中在10-25个,模型面数分布则反映了从简单到复杂零件的全覆盖。
如何评测:四维标尺与智能体框架

图4描绘了工具增强智能体框架的工作流程:LMM根据当前图纸和已生成程序,自主决定需要渲染哪些视角,获取视觉反馈后迭代修改代码,直至达到预设的迭代次数或满足质量要求。
核心发现:通过率上去了,精度没跟上

表2汇总了零样本实验的核心结果:商业LMM中GPT-5.5表现最佳但尺寸误差显著,专用模型CAD-Coder通过率极低,通用图像到三维模型几乎完全失效,揭示了当前技术的系统性不足。
实验如何设计?
- 零样本实验:从OmniMech中采样5000个测试实例,评估商业与开源LMM在仅图纸、图纸+8视图、图纸+20视图/视频三种输入条件下的CAD程序生成表现,记录通过率、CD、SIoU、VIoU、F-Score、表面面积误差和体积误差。
- 智能体实验:从测试集中采样2000个实例,LMM在工具增强框架下进行多轮迭代重建,每轮生成程序后调用渲染器获取多视角图像反馈,记录通过率变化、几何与尺寸指标的改善幅度,以及推理过程的token消耗。
- 专用模型对比:在相同测试子集上运行CAD-Coder和各类图像到三维模型方法,CAD-Coder评估程序通过率和几何指标,图像到三维模型仅评估网格质量,因为其输出无法转换为可编辑的参数化程序。
- 开源模型极限测试:特别关注Llama 4 Maverick和Ministral 3 14B等开源模型在智能体设置下的表现,验证迭代视觉反馈能否弥补基础几何推理能力的不足。
关键结果与论文证据
- 商业LMM中,GPT-5.5在零样本图纸输入下取得最佳综合表现(CD=3.34, SIoU=0.59, VIoU=0.80, F-Score=0.74),但表面面积误差高达12.5%,体积误差达41.6%,说明即使视觉上接近的模型,在关键尺寸上仍存在严重偏差(第6页,Table 2)。
- 智能体迭代反馈主要提升程序执行成功率而非几何精度:GPT-5.4 Mini的通过率从零样本的55.48%跃升至80.77%,但CD等几何指标改善有限,表明模型学会了生成语法正确的代码,却未能真正修正几何错误(第7页,Table 3)。
- 开源模型在智能体设置下几乎完全失效:Llama 4 Maverick和Ministral 3 14B的通过率接近0%,证明迭代视觉反馈无法弥补基础几何推理与代码生成能力的不足(第7页)。
- 专用模型CAD-Coder的零样本通过率仅28.9%,且CD高达16.3,远差于通用LMM,主要原因是其约4096 token的生成长度限制导致复杂零件程序被截断(第6页,Table 2)。
- 通用图像到三维模型(如SAM-3D、TRELLIS)在OmniMech上表现极差,因为它们将工程图视为单张自然图像,生成的是粗糙的视觉相似几何体,而非具有精确特征和尺寸的指定零件(第6页)。
- 压缩代码历史差异的策略使多轮CAD优化的token使用量减少42.44%,同时保持了迭代优化的有效性,验证了该设计在工程应用中的实用价值(第7页)。
- Gemini 3.5 Flash在智能体自适应渲染设置下取得最佳几何指标(CD=2.70, SIoU=0.63, VIoU=0.83, F-Score=0.77),但体积误差仍高达39.85%,说明即使最强模型也远未解决精确尺寸重建问题(第7页,Table 3)。
- 所有模型普遍存在尺寸标注接地弱、正交与剖视图整合不完整、复杂特征(如倒角、螺纹)重建差的问题,这些是当前LMM在工程CAD领域的共性短板(第7页)。
阅读时需要注意
- 评估指标中的通过率同时反映响应完整性和执行成功,未通过样本不计算几何与尺寸指标,可能导致幸存者偏差,即报告的几何精度仅反映“勉强可执行”的子集,实际整体表现更差。
- 智能体迭代反馈主要提升执行成功率,对几何精度改善有限,且严重依赖模型的基础能力,对于本身无法理解工程图的弱模型,增加视觉反馈几乎无济于事。
- CAD-Coder受限于约4096 token的生成长度,复杂零件的程序常被截断,导致通过率被人为压低,这更多是工程限制而非方法本身的根本缺陷。
- 当前基准主要覆盖单一零件重建,尚未扩展到装配体、运动约束和公差分析等更复杂的工程场景。
关联工作
- CME-CAD:最接近的机械制图到CAD程序生成数据集,但仅含17.3K模型和2-3个工程标注,OmniMech在规模(251K)和标注丰富度(平均15.7个标注)上实现了数量级的超越(第3页,Table 1)。
- CAD-Coder:基于VLM的CadQuery程序生成模型,作为程序化图像到CAD基线被评估,其低通过率和高CD值揭示了当前专用模型在工业图纸上的严重不足(第3页)。
- ABC数据集:百万级机械CAD模型数据集,提供了B-Rep和网格基础,但缺乏机械制图标注,OmniMech在其几何数据基础上补充了完整的图纸与工程语义,实现了从“有几何”到“有图纸”的关键跨越(第3页)。
- SAM-3D等通用重建模型:在OmniMech上的失败表现,深刻揭示了外观导向的三维重建与工程约束驱动的CAD重建之间的本质鸿沟——前者追求视觉相似,后者要求尺寸精确和特征完整(第6页)。