摘要精准且可编辑的3D CAD模型的高效创建在工程设计中至关重要,对产品创新的成本和上市时间有重大影响。目前的手动工作流程仍然耗时且需要广泛的用户专业知识。尽管最近在AI驱动的CAD生成方面有所进展,但现有模型受限于CAD操作的不完整表示,无法推广到真实世界图像,以及输出精度低。本文介绍了CAD-Coder,一种专门针对从视觉输入直接生成可编辑CAD代码(CadQuery Python)而微调的开源视觉语言模型(VLM)。通过我们创建的新数据集GenCAD-Code,包括超过163,000个CAD模型图像和代码对,CAD-Coder的性能优于GPT-4.5和Qwen2.5-VL-72B等最先进的VLM基准,达到100%的有效语法率,并在3D固体相似度上实现了最高准确率。值得注意的是,我们的VLM表现出一定的泛化能力,能够成功从真实世界图像生成CAD代码,并执行在微调过程中未见过的CAD操作。CAD-Coder的性能和适应性突显了在代码上微调的VLM在简化工程师和设计师CAD工作流程中的潜力。CAD-Coder可在公开获取: https://github.com/anniedoris/CAD-Coder。
Doris等(周四)研究了这个问题。