
text-to-cad 这个词最近在设计和制造圈子里讨论热度非常高。说人话就是你用自然语言描述一个零件、一块外壳或者某个机械结构AI 直接输出一个可用于建模、修改乃至 3D 打印的三维模型文件。这在过去几乎是科幻片里才有的操作现在已经有多个开源和商业项目能跑通完整流程。这篇文章我会从原理、工具、实操、排查到应用场景把我自己折腾这些工具的经验和踩过的坑全部摊开讲。不夸张地说text-to-cad 正在改变设计这个词的含义。过去我们说的设计是人脑里的想法通过鼠标键盘一步步画出来现在多了另一种可能把想法用语言说出来AI 帮你生成初稿。虽然远不到输入一句话工厂直接开模的程度但作为概念验证和效率工具它已经值得每个和三维模型打交道的人认真对待。接下来我会先聊清楚它到底解决了什么问题再带你走一遍完整的实操流程。1. 先搞清楚text-to-cad 到底在解决什么问题1.1 传统 CAD 建模的瓶颈如果你用过 SolidWorks 或 Fusion 360一定体会过那种脑子已经想明白了手还没画完的焦虑。我拿自己举例有一次要设计一个电机安装支架核心结构很简单一块底板、两块立板、几个安装孔、一圈倒角。放到软件里操作从新建草图、画中心线、镜像、加约束、拉伸出实体到最后的打孔和倒角整整折腾了半个多小时。中间还因为没做完全约束后期改一个尺寸导致全部特征乱掉又回去返工。这只是个支架换成带曲面的外壳工作量还得再翻几倍。更麻烦的是 CAD 软件的上手成本。一个完全约束草图的概念就足以让很多新手在入门阶段打退堂鼓。许多人并不是没有设计想法而是被软件操作的门槛劝退了。这种设计想法被工具卡住的困境恰恰是 text-to-cad 最想解决的事情。顺着这个思路往下想如果建模这件事不需要学会软件也能完成能把大脑里的画面直接变成屏幕上的三维实体那设计的参与门槛会降到什么程度1.2 本质是翻译不是凭空创造很多人第一次听到 text-to-cad 时会把它理解成AI 替你想出设计其实目前的主流方案更接近AI 替你把语言翻译成几何。它的工作方式像一位非常听话但有点机械的听写员你说我需要一个直径 40mm 的圆盘中间有个 10mm 的通孔边缘倒角 1mm它尝试输出对应的三维形状。这个翻译过程包含两层。第一层是语义理解模型得知道圆盘通孔倒角在工程上分别代表什么还要能处理数字和单位。第二层是几何生成把理解到的含义变成坐标、面片或者特征参数最终构成一个可显示、可导出的模型。这两层任何一层出问题结果都会跑偏。明白了这一点你也就明白了它的边界它擅长把描述得清的设计变成模型而不是替你从零发明一个自己都说不清楚的产品。能在提示词里写清楚的东西越多生成结果就越可靠连你自己都含糊其辞的设计AI 也只能靠随机发挥来凑。2. 技术原理与关键机制AI 是怎么画出 CAD 的2.1 从文本编码到三维生成早期研究其实把 text-to-3D 当作 text-to-image 的延伸。模型先用 CLIP 这类语义编码器把文字转换成向量然后在三维生成网络里用扩散或自回归的方式解码出点云或体素。这样做出来的东西像是一团3D 的图片能看但不太能制造。真正的 text-to-cad 要往前走一步。代表工作 Text2CAD 的处理方式非常有趣它不直接输出网格而是把 CAD 建模过程看作一连串指令序列。先画哪个草图、用什么约束、做多大的拉伸、切哪个特征……这些都被编码成序列交给语言模型式的网络去生成。你可以理解成模型学会了写一份建模操作日志。这也解释了一个现象为什么现在做 text-to-cad 的团队很多都在大语言模型和扩散模型的基础上改造而不是重新发明一套架构。因为 CAD 模型本身可以被表示成有顺序的操作日志而大语言模型最擅长的就是生成有顺序的内容。两个问题一拍即合。不过这里有个关键差异语言模型的 token 是文字CAD 模型的 token 是带几何参数的建模操作编码和解码的难度不在一个量级。2.2 几何表示之争网格、SDF 还是特征历史目前 text-to-cad 生成的结果主要有三种载体理解它们的区别能帮你判断一个工具到底适不适合你。第一种是三角网格也就是 STL/OBJ 格式。这是 3D 打印的默认格式因为它只描述表面切片软件拿过来就能用。缺点是没有工程拓扑你没法在 CAD 里改参数想调整某个孔的直径只能把整个网格推倒重来。像 OpenAI 的 Shap-E 这类工具输出的就是这种。第二种是隐式表示比如有符号距离场SDF、NeRF 或者 3D Gaussian Splatting。这类表示方法特别擅长表达自由曲面、水滴、雕塑这类有机形状视觉效果漂亮但工程软件完全不认离制造最远。第三种是参数化特征历史也就是 B-rep 模型。文件里存的是一棵特征树草图、拉伸、放样、倒角……每一步都可以回头修改。这是 CAD 软件的原生语言也是真正让工程师觉得有用的形式。Text2CAD 和 Autodesk 的 Project Bernini 都在往这个方向努力。用生活化类比网格像一张照片好看但改不了结构SDF 更像一团数据化的泥巴方便塑形但不易交到工匠手里特征历史是一份菜谱从备菜到装盘每一步都可调整。当前绝大多数开源工具给你的是照片和泥巴工程级的是菜谱。2.3 制约落地的几座大山第一是几何精度。图像生成允许看着像工程不允许。差 0.1mm放在精密装配里就是装不上。目前 AI 生成模型的尺寸经常是大概齐圆角半径、孔位公差都要人工修正这决定了它暂时替代不了精密设计。第二是拓扑正确性。一个可制造的实体模型必须保证表面封闭、没有自交、没有自由边。AI 直接吐出来的网格几乎没有一次是直接可用的后处理修复几乎是必备环节。我在第 3 章会详细演示这一步怎么做。第三是可编辑性。当前很多生成结果是一次性的。你无法在生成后轻松地把某个圆角从 1mm 改成 3mm更没法像传统 CAD 那样改一个草图就自动更新整棵树。对需要反复迭代的设计流程来说这是很大的痛点。第四是数据瓶颈。高质量的 CAD 数据不像图片那样取之不尽。许多模型训练用的是通用三维数据集工业零件占比不高用 Fusion 360 公开数据训练的模型又容易被特定软件的特征表达束缚。数据决定模型上限这也是手握海量图纸的大厂在布局这个赛道的原因。3. 一套可以直接上手的实操流程3.1 工具选型从开源到商用实际能玩的工具我按使用体验分成三类。开源档OpenAI 的 Shap-E 和 Point-E 虽然还够不上严格意义的 CAD但非常适合体验文本到三维的完整链路Text2CAD 是学术项目能在本地跑文本到特征序列生成还有一些社区项目比如把开源 CAD 内核和语言模型结合、生成特征树初稿的工具适合喜欢折腾的开发者。商业/半商业档Autodesk Project Bernini 是浏览器里直接生成、再进入 Fusion 360 编辑的思路目前部分开放内测一些垂直团队也在做基于大模型的 CAD 生成插件比如在 SolidWorks 里输入文字生成特征。整体还在快速变化我建议优先试用能直接在浏览器操作的工具先在低成本环境里验证你的使用习惯。方案输出形式可编辑性上手难度适合场景Shap-E三角网格低低有网页版概念演示、快速看形状Text2CAD特征序列中高需跑模型研究、实验、二次开发Project Bernini网格/特征中低浏览器产品概念、配合 Fusion 360自建 LLM内核方案特征树高高有开发能力的团队自用3.2 从一句话到可打印模型完整操作我用自己的一个实例来走完整流程。目标零件一个直径 60mm、厚度 10mm 的圆盘中心有直径 8mm 的通孔四周均匀分布 4 个直径 5mm 的安装孔孔距中心 25mm顶部边缘倒角 1mm。第一步写提示词。一开始不要写长句把关键信息拆开主体形状、关键尺寸、特征位置、表面处理。我实际用的提示词大致是一个圆形法兰盘外径 60mm厚度 10mm中心孔直径 8mm有 4 个直径 5mm 的安装孔均匀分布在直径 50mm 的圆周上顶部边缘倒角 1mm。注意均匀分布和圆周这类位置约束词对生成结果影响很大。第二步生成。我用开源文本生成模型先出一版网格再把生成结果导入 Fusion 360。这里有个经验AI 生成版本大概率尺寸不对所以导入后第一件事不是看形状而是用测量工具确认尺寸数量级。先看毫米数是否符合预期再看孔位是不是真的落在圆周上。第三步重构特征。最实用的后续动作不直接编辑 AI 生成的网格而是把它当作草图参考在 CAD 里对照轮廓重新描一遍再拉伸、打孔、倒角。听着很笨但这恰恰是用 AI 提效的正确姿势——它帮你省掉了想形状的时间而规范建模的部分仍然需要人来确认。如果你的目标是 3D 打印一个外观件也可以跳过这步直接用网格。第四步导出与打印前检查。导出 STL 后用 MeshLab 或 Windows 自带的 3D Builder 检查水密性看是否存在破面、翻转法线。确认没问题再进切片软件。这套流程走下来一个原本要花半小时以上的零件熟练后十分钟以内能完成初步可用版本。3.3 后处理这些操作尽量别偷懒第一个必须做的是单位统一。很多生成模型的默认单位是单位不是 mm。导入 CAD 或切片软件时容易差出 25.4 倍甚至 1000 倍。我踩过一次生成一个小零件导入后变成一座山那么大当时还以为是模型生成得太大后来才发现是单位问题。第二个必须做的是网格修复。常见操作包括合并重合顶点、删除零面积面、补洞、统一法线。我在 Blender 里用 3D-Print Toolbox 插件快速高亮这些问题该插件会列出非流形边、内侧面、薄壁等检查项一键选择问题区域并修复比手动找靠谱得多。第三个是实体化。如果 AI 输出的是单层曲面网格而你要做 CNC 加工或发给供应商需要先把它转换成有厚度的实体。在 CAD 里一般用加厚或偏移面完成。这些操作单独看都不难难的是形成每次生成后必做的肌肉记忆。别嫌麻烦漏掉一步后面可能整批零件报废。4. 提示词工程一句话的质量决定模型的成败4.1 好提示词的五个要素我总结了一套适合 text-to-cad 的提示词口诀形状优先、尺寸明确、位置清晰、语义单一、约束彻底。形状优先描述主体时用最基础的几何词打底矩形板圆柱圆环避免花哨的隐喻。AI 对像一片叶子的底座这种模糊描述很难稳定输出换成椭圆形的平板底座长轴 80、短轴 50、厚度 5就靠谱得多。尺寸明确凡是关键尺寸都直接写数字和单位。如果有半径和直径之分说清楚是直径 40还是半径 20。别看这个细节AI 经常在这上面犯迷糊。单位也要统一mm 还是 inch前后不要混用。位置清晰用中心四个角顶部均匀分布这类位置词。如果孔位有特殊角度最好写成每隔 90 度分布或在 X 轴正方向的位置。位置词越明确生成的布局越规整。语义单一一句话最好只承担一个设计意图别把十个特征塞进一句话。宁可把模型拆成多个子件分别生成再导入 CAD 后用装配功能组合。复杂模型分步生成每个子件质量都会更高。约束彻底写完提示词后自己在脑子里反向检查一遍它能确定唯一的形状吗如果不能补上约束。比如一个底座就有无数种理解一个 100x60x8mm 的长方体底座四角各有一个直径 6mm 的沉头孔才接近唯一。4.2 三个真实翻车案例案例一一个漂亮的手机支架。生成结果是一个完全不能用的艺术造型。原因很典型漂亮是主观词AI 只能随机发挥而支架的支撑角度、高度、卡槽宽度这些关键约束一个都没给。改成一个 L 形手机支架底座长 80mm 宽 60mm 高 10mm靠背高 120mm 厚 8mm底座与靠背夹角 75 度前方有一个深度 5mm 的凹槽用于放置手机之后生成结果直接变得可用。案例二一个直径 100mm 的齿轮厚度 20mm轴孔直径 20mm20 个齿。结果轮廓看着像齿轮但齿形不是标准渐开线轴孔位置也偏了。原因在于几何描述和工程语义有深度差异AI 知道齿轮大致长什么样但不知道渐开线方程也不知道齿根圆角这些细节。这种场景下生成初稿只能当参考最后还得用 CAD 里的齿轮工具重做。案例三金属外壳带散热孔。模型把散热孔做成了随机挖洞间距和大小毫无规律。原因还是约束不足孔的数量、规则性、孔径都没有指定AI 只能默认随机发挥。改成一个长方体金属外壳长 120mm 宽 80mm 高 30mm壁厚 2mm顶部均匀分布 3 行 5 列直径 4mm 的散热孔之后生成效果瞬间规则了很多。三个案例的共同点失败不是因为模型笨而是提示词里缺少足够的信息量。你把约束给全AI 才有机会输出合格结果。5. 常见问题与排查技巧实录5.1 高频问题速查表我把实际使用中会反复出现的坑整理成一个速查表遇到问题可以直接对照现象最可能原因处理办法生成模型表面大量破洞原始生成网格质量差用 MeshLab 补洞、重新网格化导入 CAD 后尺寸巨大或极小单位未转换1 单位不等于 1mm先查模型单位再统一缩放模型只有一张薄壳无实体体积输出是单层曲面在 CAD 里加厚 / 偏移面特征位置随机孔不在中心提示词缺少位置约束在提示词里明确中心对称均匀分布圆角、倒角完全变形网格阶段精度不足不强行修复网格在 CAD 里重新倒角无法转换为实体 B-rep网格不满足水密、流形要求补洞、合并自由边后再转换5.2 生成结果不对先改提示词别急着微调模型很多朋友第一次拿到畸形结果第一反应是这个模型不够好要不要换个权重或者自己训练一下。以我实际经验看99% 的情况不需要。先把提示词里所有模糊词删掉把数字和位置写全多半能明显改善。微调模型的工作量非常大需要准备数据集、设计训练流程而且对硬件要求不低日常使用里性价比很低。那什么时候才值得碰模型我自己的判断标准是固定一段提示词换多个随机种子生成十几次结果仍然集中在同一个系统性错误上。比如所有生成结果都把通孔理解成盲孔那可能是训练数据或解码策略的问题这时候再考虑调参或换方案而不是盲目微调。5.3 不知道哪里不对画一张草图做对比AI 生成了一个畸形件但我又说不出哪里不对——这也是很常见的状态。我的经验是把生成模型和一张你随手画的草图做对比哪怕草图非常潦草也能快速挑出 AI 在拓扑布局上的硬伤。比如该有孔的位置没孔、该对称的地方不对称、拉伸方向反了这类问题在对比中一目了然。很多人觉得画草图麻烦但你得知道一个事实AI 输出的东西你连判断对错的能力都没有那它就谈不上可用。这也是我为什么一直强调text-to-cad 不是让设计师省去思考而是把思考的重点从怎么画转移到画得对不对。对比草图这个动作本质上就是在训练你的设计判断力。6. 应用场景、影响范围与我的判断6.1 谁会先吃到红利第一波受益的是 3D 打印玩家和创客。他们需要的往往不是复杂装配而是快速验证一个想法。text-to-cad 正好能解决想法到实体预览这段链路有粗糙版本能打样就足够打印出来装上试试不满意再改提示词重新生成整个循环非常轻快。第二波是产品概念设计。工业设计师经常需要在短时间内给出多个形状方案供评审。用 text-to-cad 生成一批形状候选再在 CAD 里精修效率比从零拉曲面高得多。尤其在前期提案阶段AI 生成的多样性反而成了优势能带来一些意想不到的形态参考。第三波是教育领域。教学场景里学生想做一个简单零件但还没学会完整的草图约束text-to-cad 可以当建模教练AI 生成特征序列学生再照着改在改的过程中理解 CAD 的建模逻辑。这种先给结果再讲方法的教学路径学习曲线比从命令学起友好很多。6.2 设计师会不会被取代坦率说短期我看不到取代只看到工具重定义。一个设计师的核心竞争力从来不是会点拉伸命令而是判断什么形状合理、什么结构能加工、什么造型符合用户需求。text-to-cad 把重复的建模操作自动化反而让设计师的时间更多地花在判断和决策上。当然如果你的工作方式仅仅是照着图纸建模完全不理解设计意图那这类工具确实会带来压力。这就像自动翻译出现后普通翻译的价格被打了下来但高水平的本地化翻译反而更值钱。建模能力同理会用 AI 生成不是本事能审核、修正、落地才是。6.3 下一步值得关注的方向我比较关注三个方向。一是特征历史的生成质量。等 AI 能稳定输出可编辑的参数化特征树时设计工作流会被真正重构。那时改模型不再是改网格而是像改代码一样改参数版本管理、协同设计都会变得完全不一样。二是多模态输入。现在很多工具开始支持文字 参考图 手绘草图的混合输入。比如你画一个轮廓AI 根据文字补全厚度和孔位。这种混合方式会大幅降低提示词的书写难度也更容易表达那些说不清但能画出来的设计意图。三是与仿真和制造的打通。生成模型如果直接带上材料属性和制造约束比如考虑注塑脱模角度、CNC 加工余量text-to-cad 才真正进入生产环节。现在这些还停留在研究层面但方向已经很明确。最后分享一点个人体会。我在刚开始接触 text-to-cad 时也幻想过以后不用建模了后来发现自己想多了它改变的是建模的下半场而不是取消建模。真正有价值的流程是让 AI 帮你把模糊的想法变成看得见的三维形状然后由你把关、修正、赋予工程意义。在一次次我描述、AI 生成、我挑毛病的循环里设计思考反而越来越清晰。工具一直在变但知道自己要什么这件事永远是最值钱的能力。