返回

“Mythos.1” - 机械工程和 CAD 设计中的一流人工智能

基于 Claude Fable 5.1 和 MecAgent 的 AI 驱动 CAD 自动化、参数化设计与机械工程

Claude Fable 5.1 & MecAgent


引言

随着“神话”(Mythos)级语言模型的出现,机械工程正迎来一场重大的战略转变。我们正在超越简单的文本辅助时代,进入一个以直接操纵复杂 CAD 脚本、代理工作流自动化以及对参数化模型进行严格验证为特征的新时代。这一过渡使 AI 从一个纯粹的文档管理工具转变为一个设计合作伙伴,能够理解几何意图并控制渲染和模拟引擎。


这种高效率建立在协同的技术架构之上:

Claude Fable 5.1 & Mythos 5.1 (Anthropic):最先进的推理引擎,在大型上下文、软件工程和空间推理方面表现尤为强劲。


MecAgent:专门的行业集成层。它作为 AI 的认知能力与工业软件的专有 API 之间的抽象层。

我们的雄心非常明确:在保持关键人类监管的同时,在 SOLIDWORKS 或 Autodesk Inventor 等行业标准平台的核心部署自主自动化。这种方法确保了执行速度绝不会以牺牲设计物理安全为代价。


Claude Fable 5.1 与 Mythos 5.1:性能新边界


Claude Fable 5.1 & Mythos 5.1 是 Anthropic 为 2026 年 9 月发布周期推出的最新型号的新版本。从技术上讲,它们是同一个模型,但应用了不同级别的安全保护措施:Fable 5.1 是普遍可用的,而 Mythos 5.1 则专用于严格可信的项目,并专门针对生命科学和网络安全量身定制了过滤器。

到目前为止,工业集成要求企业管理三个战略风险,与上一代产品相比,5.1 版本直接解决了这些风险:

  • 成本超支风险:虽然 Fable 5 的价格为每百万 token $10/$50(是 Opus 4.8 价格的两倍),但由于降低了缓存输入定价,Fable 5.1 将标准工作负载的这些成本降低了约 25%。对于需要大上下文窗口的高度代理 CAD 工作负载,节省的费用接近 45%。

  • 知识产权机密性(数据保留):此前必须仔细审查数据保留政策并将其纳入公司的 IP 合规矩阵。新的企业前沿保障(EFS)系统现在通过将数据存储在客户专用的云基础设施中,提供了相当于零保留政策的完整机密性。

  • 安全性和误报:Fable 5.1 将网络安全误报减少了 60%,允许 AI 积极分析您的软件架构以查找漏洞,而不会不必要地阻止生成。

CAD 优化的编码能力

Fable 5.1 避免了随时间推移降低质量的走捷径行为。对于复杂脚本的开发,这种稳健性至关重要。来自软件工程负责人的反馈证实,Fable 5.1 解决了更复杂的编码问题,最重要的是,在极长的多步骤任务中保持了高度的可读性。

这对于参数化 CAD 装配体的迭代创建是一个重大优势,在这种情况下,AI 必须记住脚本开头定义的变量。

这些进步反映在 Anthropic 的新基准测试中:

  • 代理编码 (CursorBench 3.2.0):73.4%

  • 企业工作流 (AutomationBench):31.4%(相比之下,Fable 5 为 17.1%)

  • 代理科学研究 (Terminal-Bench-Science 0.1):52.6%(相比之下,Fable 5 仅为 24.7%)

  • 代理编码 (Terminal-Bench 4.0):55.8%(使用 Mythos 5.1 的调整过滤器后达到 60.9%)

与 Claude Opus 4.8 相比,该模型在代理编码、空间推理以及对复杂技术上下文的理解方面带来了显著的改进——这些领域与机械工程和 CAD 应用直接相关。

然而,它保留了相同的行为稳健性理念:该模型针对敏感主题(生物学、网络安全以及涉及语言模型的研发)融入了增强的安全措施,在这些主题中,它可能会采取更谨慎的行为,甚至牺牲一些原始性能,而不是冒险提供潜在危险的信息。

这一理念也反映在 Claude Code 等代理环境中,在该环境中,该模型通常倾向于谨慎、可验证的策略,而不是激进或难以追踪的修改。

关键已发布全球性能指标





从 Fable 5 到 Fable 5.1 的过渡显示出明显的进展,特别是在科学研究、复杂的企业工作流和代理编码方面,同时也伴随着更严格的基准测试。

直接性能演变(Fable 5 与 Fable 5.1):

  • 代理科学研究 (Terminal-Bench-Science 0.1):得分翻了一番多,从 24.7% 升至 52.6%。

  • 企业工作流 (AutomationBench):重大跨越,从 17.1% 升至 31.4%(相对增益 +83%)。

  • 终端编码 (Terminal-Bench 4.0):从 42.0% 提高到 55.8%(Mythos 5.1 高达 60.9%)。

  • 计算机使用 (OSWorld 2.0 – 严格):从 36.1% 增加到 41.7%(在部分评估下从 72.9% 增加到 77.9%)。

  • 知识工作 (GDPval-AA v2):从 1,723 分增加到 1,853 分。

  • 多学科推理 (Humanity's Last Exam):无工具时从 57.8% 略微增加到 60.9%,有工具时从 63.8% 增加到 65.0%。

  • 代理编码 (CursorBench 3.2.0):从 70.5% 提高到 73.4%

评估方法的演变:

  • 更严格的测试:多项指标已更新为更新且要求更高的版本(Terminal-Bench 从 v2.1 升级至 v4.0,OSWorld 升级至 v2.0,GDPval-AA 升级至 v2)。

  • 新焦点:Fable 5.1 评估更加强调代理编码(CursorBench)和科学研究(Terminal-Bench-Science),而第一张图片中展示的高度专业化基准测试(法律、医疗、生物)已被纳入其他评估框架或专用项目。

然而,工业部署需要管理三个战略风险:

  1. 成本管理和效率:由于降低了缓存读取定价,Fable 5.1 在典型任务上降低了 25% 的总成本,在迭代代理工作流上降低了高达 45% 的成本。由于安全过滤器的误报减少了 60%,回退中断也显著减少。

  2. 知识产权机密性(零保留):数据安全是通过企业前沿保障(EFS)系统解决的,该系统使企业能够通过将数据保留在自己的云基础设施中来保证绝对机密性(零保留)。

  3. 代理生态系统:Claude Code 环境仍然是大规模自动化和脚本维护的首选渠道,默认情况下,Fable 5.1 模型以最高努力级别(高努力)部署在此处,以解决复杂的几何问题。

迭代演化分析:OpenSCAD 案例研究

基准测试

基准测试 / 模型

Opus 4.6

Opus 4.7

Opus 4.8

Fable 5

Fable 5.1

OpenSCAD Nema 17 (/20)

7.5

12.5

14.5

16.5

18.75

OpenSCAD V8 发动机缸体 (/20)

5.5

9.0

12.5

14.5

17.5

平均响应时间

2分20秒

5分35秒

6分45秒

5分55秒

5分42秒

总分 (/40)

13.0

21.5

27.0

31.0

36.25


关于评分标准更新的说明:为了应对 Fable 5.1 等下一代模型的到来,我们收紧了基准测试中使用的标准。评分方法已从简单的美学验证转向更严格的工业审计,涵盖原生参数化建模、算法清洁度和自诊断模块。因此,我们使用这个新量表对先前版本的 Opus 进行了重新评估,以准确反映其技术性能,并为未来模型的改进保留合理的余地。



Opus 4.6:该模型在形式上表现得非常好,拥有无错误的代码,并且在首次启动时具有干净的视觉效果。然而,稳健性测试揭示了其几何逻辑的缺乏:孔是用固定坐标放置的。改变板的大小会破坏装配体,这限制了像 OpenSCAD 这样的参数化工具的价值。




虽然 4.7 模型在生成速度上稍慢,但生产的工程质量更高。在 4.6 模型产生刚性、脆弱的代码(需要人工干预)的地方,4.7 模型成功地融入了原生几何逻辑,使对象真正具有参数化和可重用性。




如果说 4.6 和 4.7 版本之间的提升是结构可靠性的问题,那么 4.7 和 4.8 之间的提升则是用户舒适度的问题。通过原生集成 OpenSCAD 的“Customizer”功能,4.8 模型不仅提供代码,还提供了一个开箱即用的用户界面。这里额外的缓慢只是对最终用户体验进行高级思考的代价。




Opus 4.8 跨越了舒适度门槛;Fable 实现了真正的工业成熟。在 Opus 4.8 发生设计错误,将框架锁定为简单的圆形钻孔的地方,Fable 通过 hull() 函数融入了真正的功能性长圆形槽。该代码放弃了视觉近似,转而采用干净的模块化结构和标准化的超程 (eps = 0.1)。最重要的是,其基于三角学的诊断模块可防止硬件与电机车身发生碰撞,从而保证零件无缺陷并能直接投入生产。




Fable 5.1 标志着向产品设计的明显转变。虽然版本 5 保留了未加工的粗糙形式,但 Fable 5.1 通过引入从 2D 轮廓挤出的圆角半径 (corner_radius) 消除了尖锐边缘。该部件获得了更好的美学成熟度,同时也减少了应力集中。


然而,这种视觉上的改进是有代价的:完全移除了诊断模块。通过牺牲基于控制台的自验证来换取更紧凑的代码,Fable 5.1 将物理对象的符合人体工程学置于算法可靠性之上。




如果说 4.6 模型因其生成复杂结构的能力在第一眼让人印象深刻,那么一旦需要严格的机械验证,它就会显露出其局限性。


我们期待流畅的运动学模拟,得到的却是“视觉样机”:代码可以编译,但几何结构不符合物理定律。活塞移出了气缸孔,连杆失去了锚固。对工程师来说,结果很明显:4.6 产生了正确的语法,但机械语义存在缺陷。它擅长构建程序的骨架,但仍无法模拟机器的内部工作。对于开发人员来说,这是一个极好的起点,但需要大量的手工干预才能成为可行的设计工具。




在 4.6 模型仅显示错误几何结构的地方,4.7 模型在我们的方法中引入了一项革命:自验证。通过集成 safety_check 模块,AI 不再只是生成形状,它还在模拟工程审查。


诚然,生成的发动机存在夹板高度错误(活塞从气缸体中突出),但 AI 在 OpenSCAD 控制台中明确通知了我们这一点。我们已经从一个“形状生成器”转变为一个“能够自我批判的设计助手”。正是这种从盲目生成到意识到物理约束的质的飞跃,使得 4.7 模型比其前身无比强大和专业。




在 4.7 模型以自诊断进行创新的基础上,4.8 迈出了决定性的一步:自适应设计。通过动态派生变量,AI 不再仅仅标记错误,它还通过自行校准发动机的几何形状来防止错误发生。我们从一个自我批判的助手转变为一个保证其结构有效性的真正设计工程师。




Fable 略过了连杆的视觉建模,但作为交换,它设计了详细的工业活塞,配有集成的密封圈和销孔。最重要的是,AI 采用了真正的发动机制造逻辑:其脚本包含一个点火顺序开关,管理气缸列偏移,并将控制台转换为计算台以显示精确的排量 (361.9 cc)。在 Opus 4.8 交付最精美的动画样机的地方,Fable 交付了在发动机基本原理上最严谨的脚本。




Fable 5.1 建立在与 Fable 5 完全相同的基本原理之上:它放弃了连杆的建模,转而采用高度详细的工业活塞,融入了参数化定位,并直接在控制台中计算发动机排量 (361.9 cc)。唯一的真正进化在于其生成速度显著加快。虽然 Opus 4.8 提供了最令人印象深刻的动画模型,但 Fable 5.1 在底层工程逻辑方面产生了最严谨且响应最快的脚本。


然而,我们应该保持清醒的认识:几何自我修正的质的飞跃并不能使 AI 成为物理权威。Fable 5.1 模型通过自动化繁琐的计算来增强工程师的能力,但它并不能取代他们。它产生了一个经过优化的方案,但这依然是软件模拟:只有现实世界的实验或有限元分析 (FEA) 才能验证项目的强度和可行性。AI 提出方案;工程师做出决定。


Claude Fable 5.1 在机械工程和 3D 中的应用


对于工程领域的 AI 助手来说,最前途广阔的领域之一是根据代码生成几何图形。


Claude Fable 5.1 能够生成旨在通过 Three.js、OpenSCAD 或某些可编写脚本的 CAD 环境等库创建三维对象的代码。这一能力尤其使生成简单的参数化形状、基本装配体或几何自动化脚本成为可能。


然而,需要强调的是,大型语言模型的空间推理能力在今天仍然有限。最近的学术工作表明,当重建或想象需要高级空间理解的复杂几何图形时,通用模型仍然会遇到困难。

几何类型

支持级别

简单参数化零件

标准机械零件

简单装配体

复杂多体几何图形

高级表面和有机形状

受限

需要强空间推理的几何图形

受限


今天,该模型的主要价值仍然在于加速前置设计工作(计算和项目准备),而不是在自主生成复杂的 CAD 模型。使用这个新模型,网格模型生成也有了轻微的改进。


Claude Fable 5.1 + MecAgent Copilot 1.2.3

1. CAD 宏生成

对于像 MecAgent 这样的副驾驶(Copilot),Claude Fable 5 的主要优势之一在于技术脚本的生成:

  • SolidWorks 宏;

  • Inventor 宏;

  • 理解 3D 空间;

  • 生成日益复杂的参数化零件与装配体。

该模型在理解现有代码库、提出修复建议以及记录所做更改方面特别有效。Claude Fable 5 为允许在 CAD 软件中生成宏的代理系统提供了更稳健的基础。因此,它既提高了宏代码的生成速度,又提高了其相关性。

其目标不是取代工程师,而是加速重复性、低附加值的 CAD 任务,以便将更多的时间用于发挥工程专业知识。

机械工程和 3D 建模能力

该分析基于 BenchCAD 基准测试(包含符合 ISO/DIN/ASME 标准的 17,900 个零件,106 个工业系列)。Claude Fable 5 以 0.384 的 IoU 评分树立了新标杆。

这一优势通过两个关键指标得到了确认:

  • 编程逻辑:在 FrontierCode 评估(钻石子集)上,Fable 5 达到 29.3%,比 Opus 4.8 的得分 (13.4%) 翻了一番还多。

  • 空间物理推理:在 9LLMWEBGL 基准测试中,Fable 5 和 Opus 4.8 是仅有的两个成功实施扩展基于位置的动力学(XPBD)的模型,而其他模型在简单的质量-弹簧网络中失败。

几何成熟度和支持矩阵

对通过代码(Three.js、OpenSCAD、CAD API)生成的几何体类型的评估突出了以下熟练程度:

几何体类型

支持级别 (Opus 4.8)

支持级别 (Fable 5.1)

技术观察

简单参数化零件

完美处理标准规范(紧固件)。

标准机械零件

出色地处理旋转/挤出特征。

简单装配体 / 多实体

特征树逻辑清晰,但运动学约束中仍存在错误。

多截面放样与曲率

中到低

Fable 5.1 相比 Opus 4.8 能够更好地处理复杂的过渡。

A 级曲面 / 有机形状

受限 / 低

受限

处理复杂的 NURBS 曲面仍有持久性困难。


应用于 CAD 的 AI 四大支柱

1. CAD 脚本生成与维护

AI 通过处理重复性任务的自动化来简化设计人员的日常工作。它可以即时生成设计宏并对其进行维护,从而将工程师从行行代码中解放出来,让他们专注于创新。

2. 从文本生成参数化 CAD 模型 (Text-to-CAD)

得益于 Text-to-CAD 的概念,3D 模型的创建正在进入一个新时代。通过依靠真正的 CAD Copilot,用户可以用自然语言描述他们的需求。在第二步中,AI 还使用“文本到宏到 CAD”(Text-to-macro-to-CAD)的方法:它将此文本描述翻译成可由 CAD 软件直接解释的宏,从而生成一个完整、动态且完全可编辑的参数化 3D 模型。

3. 从 3D 到 2D:通过 AI 生成参数化图纸

AI 集成也为工程图纸的创建和管理带来了巨大的价值。当前的视觉模型可以精确区分 2D 图纸中的不同尺寸。该技术为在 2D 空间中自动定位视图提供了增强的空间理解。此外,它极大地便利了几何元素的自选,允许 AI 与图纸进行交互,并以更加平滑和直观的方式修改尺寸。

4. 通过 AI 提供机械工程协助

超越了纯粹的 3D 几何,AI 现在将自己定位为机械工程领域的真正专家资源。得益于 MecAgent 生态系统内基础模型的特定重训,技术团队可以访问一个集成了公司几乎所有工程资源的专业代理。

这一先进的技术助手能够:

  • 解释和记录:澄清复杂的设计逻辑,并严格记录建模选择以确保可追溯性。

  • 生成和自动化:为参数化设计创建业务规则和指南。

  • 支持和验证:积极协助关键的设计评审,并帮助进行物理概念的早期阶段验证。

  • 优化采购:促进寻找并选择完美适合技术要求的标准工业组件。

主要目标是从前置设计阶段开始就为工程师提供支持,从最初的需求规范(CDC)构建一直到最初的初步设计计算。通过提供能够交付来源严格的技术结果和文档的 AI,MecAgent 大大降低了幻觉风险。这种提高的可靠性对于严格遵守要求以及在启动繁重的计算或原型设计阶段之前限制设计错误至关重要。

定量技术基准(宏与图纸生成)

测试案例 1:批量转换宏(简单宏)

生成的转换宏超越了简单的常规程序,它通过动态计算包围盒(GetBodyBox),从而推断钣金厚度并选择最大的平面。

评估标准

Opus 4.8 评分

Fable 5 评分

Fable 5.1 评分

已验证的关键点(工业级 - Fable 5.1)

API 集成

2.8 / 5

4.0 / 5

4.8 / 5

原生命令 (OpenDoc6) 的完美使用,具有动态回退处理和没有内存开销的优化执行。

代码稳健性

3.8 / 5

4.3 / 5

4.9 / 5

系统的 try/catch/finally 块,保证 CloseDoc 调用,并缓解资源泄漏。

CAD 逻辑

2.6 / 5

3.5 / 5

4.5 / 5

通过包围盒准确推断设计意图,几乎消除了多轴零件上的错误。

文档管理

3.5 / 5

4.0 / 5

4.8 / 5

具有标准化标头的完整遥测系统([START], [INFO], [SUCCESS]),随时可进行 CI/CD 集成。


测试案例 2:复杂装配体宏(文本生成 CAD 水杯)




在此次测试中,我们将 Fable 5.1 + MecAgent 的组合推向了极限:自始至终生成一个完整的实用型水杯装配体(杯身、杯盖和装配约束)。

所需投入:大约 7 个迭代提示和 57 分钟的引导就足以完善几何启发式算法并获得无冲突的生产结果,而在 Fable 5 中,这需要大约 10 个提示和 1 小时的引导。

标准

Opus 4.8 评分

Fable 5 评分

Fable 5.1 评分

必须验证的内容

Fable 5.1 结果

API 集成

4.0 / 5

4.5 / 5

4.9 / 5

原生 API 命令的使用(swAppFeatureManager)。

FeatureRevolve2swFmSweepThread 的原生调用,以及自动激活 swApp.CommandInProgress = true 以消除不必要的 UI 刷新。

代码稳健性

3.5 / 5

4.1 / 5

4.7 / 5

异常处理(try/catch)、变量持久化和系统清理。

对每个风险操作进行细粒度隔离。(_threadType, _threadSize) 的上下文存储,以及首次尝试显式指针释放,以减少幽灵进程的产生。

CAD 逻辑

3.8 / 5

4.3 / 5

4.8 / 5

符合特征树和几何选择。

通过启发式函数(FindNeckThreadEdge)搜索实体。按实体类型(RefPlane)遍历特征树,保证与界面语言完全无关。

文档管理

2.0 / 3

3.0 / 5

4.3 / 5

可读性、注释以及与集成管道 (CI/CD) 的兼容性。

严格划分为功能块,使用显式常量,并添加描述编译先决条件和输入参数的头部文档。


使用 Fable 5.1 优化 API 逻辑


与 Opus 4.8 和 Fable 5 相比,Claude Fable 5.1 细化了动态几何选择(边和面搜索)并保证了完全的语言独立性(RefPlane)。该模型通过保留螺纹属性(_threadType_threadSize)增强了零件间的一致性,并抑制了不必要的 UI 刷新(CommandInProgress = true)。结果:在 MecAgent Copilot 辅助下,集成工作量降至仅 5 个迭代提示和 25 分钟的引导。

在目标监督下的近自主自动化

与 Fable 5 相比,Fable 5.1 通过集成 try/catch/finally 块的严格清理以及显式指针释放尝试,在代码生命周期管理方面取得了重大飞跃。尽管由于幽灵 SolidWorks 进程导致内存饱和的风险大幅降低,但在部署到密集的生产环境之前,仍建议进行快速的人工验证。

软件架构成熟度的跨越

本次迭代表明,大型模型正在超越简单的几何解释。通过融入更多底层的执行环境约束,Fable 5.1 正在逐步缩小孤立脚本生成与大规模工业软件开发之间的差距。

测试案例 3:图纸生成哲学(2D 图纸)



用户在界面中选择一个零件,可以使用两种方法:

标准 / 技术要素

“快速”方法 (MecAgent & Fable 5.1)

“后台”方法(异步代理)

对设计人员和车间的影响

执行时间

约 8 秒(即时)

1 到 24 小时(后台任务)

快速:立即节省时间。后台:无感计算(工作站零卡顿)。

完整度得分

3 / 10(概念图)

9.1 / 10(生产就绪)

根据需求权衡:视觉验证还是实际机加工。

复杂剖视图

仅限于标准视图(前视图、俯视图、仰视图)。无角度。

自动:计算倾斜对齐并生成剖面(SECTION R-R, VIEW U-U)。

在渲染繁重几何体时,设计人员仍保持 100% 的工作效率。

规范 (GD&T)

缺失:仅有名义线性尺寸。

智能:自动提取用于标准化框架(基准 A、B、C)的 PMI/MBD 注释。

最大安全性:消除了疏忽关键公差的风险。

等轴测渲染

简单的线框,无纹理。

逼真:材质处理(铜外观)和剖面线。

操作员或客户能够立即了解最终外观。

注释和业务规则

应用了空白 / 通用模板。

上下文:注释注入(ASME Y14.5-2018 标准,去毛刺)。

标准化并自动符合质量宪章。

链式尺寸标注

手动:设计人员必须对齐尺寸(存在重叠风险)。

自动:基准线检测和标准化间距。

图面整洁、间距合理,测量部门可立即解读。


结论:迈向优化的人机协同

Claude Fable 5.1 在 MecAgent 生态系统中的到来,标志着与上一代产品相比取得了切实的进步:提示工作量减半、API 代码更稳健且记录更详尽,以及对界面约束具有更大的独立性。由于 EFS 系统和误报的大幅减少,安全和知识产权保护现在得到了绝对保障。

借助 MecAgent Copilot,AI 现在能够解释复杂的设计逻辑,严格记录建模选择以确保可追溯性,创建业务规则,并优化标准工业组件的采购。

然而,复杂的几何设计——A 级曲面、有机形状、高级空间推理——仍然是一个需要人类密切监管的领域。清理系统资源(COM 对象)的问题也说明了底层执行层持续存在的局限性。

因此,对于机械工程设计部门而言,Claude Fable 5.1 与 MecAgent Copilot 1.2 的结合应该被视为强大的工程加速器,而不是自主的设计师。它有助于确保和加速从 CAD 脚本编写到图纸生成的整个工作流程,同时保持工程师在决策中的核心地位。软件模拟无论多么严谨,都不能取代有限元分析 (FEA) 或实际物理测试的权威性:AI 提出方案,工程师做出决定。

MecAgent Logo

MecAgent公司