返回

通过组合式潜空间扩散 Transformer 进行结构化 3D 网格生成

从单张 RGB 图像进行语义分解的 3D 网格一次生成

将3D对象分割为多个彩色部分,以展示其结构化网格组成

PartCrafter:单张图像单次生成结构化 3D 网格

想象一下,上传单张 RGB 图像,就能立即获得一个被拆分为具有语义层面的独立部分的完整 3D 模型,随时可以进行编辑、打印或动画制作。这正是 PartCrafter 所实现的功能。


论文与代码库

研究论文
标题:《PartCrafter: Structured 3D Mesh Generation via Compositional Latent Diffusion Transformers》
作者:Yuchen Lin、Chenguo Lin、Panwang Pan、Honglei Yan、Yiqiang Feng、Yadong Mu、Katerina Fragkiadaki
发表情况:2025 年 6 月 5 日发表于 arXiv

官方 GitHub 代码库

  • 包含完整代码,采用 MIT 许可,并将于 7 月中旬发布模型权重和演示

项目页面

  • 由作者主持,总结了该方法并链接到论文和代码


核心亮点

单次多部件生成:仅通过单张 RGB 图像,该模型即可同时生成多个 3D 网格部件,无需先进行分割。

  • 组合潜空间:每个部件对应一组独特的潜变量 token,以及一个学习到的身份嵌入。

  • 分层注意力机制:双重/分层注意力机制既保持了部件内部的细节,又维持了整个物体的连贯性。

  • 预训练 3D 网格扩散 Transformer (DiT):利用预训练的 DiT 组件,实现更快的收敛和更高的保真度。


性能与数据集

数据集:从 Objaverse、ShapeNet、ABO 中提取了约 13 万个经过部件标注的物体,包含约 30 万个部件。

  • 速度:在 GPU 上约 30-34 秒即可生成完整的部件感知网格,性能优于传统的两阶段管线(约 18 分钟)。

  • 质量:与 HoloPart 和基线 DiT 方法相比,实现了更低的倒角距离(Chamfer distance)和更高的 F 分数(F ≈ 0.7472)。


应用场景

3D 打印:创建可直接用于 STL 打印的独立部件,便于组装(Tom’s Hardware 专题特写)。

  • CAD 与设计:支持部件级编辑和模块化资产创作。

  • AR/VR 与游戏:便于直接从参考图像生成可拆解的资产。

  • 机器人与模拟:为物体操作提供结构性的理解。


目前可用资源

代码与 Checkpoints:公开的 GitHub 代码库现已可用。模型权重和演示预计于 2025 年 7 月 15 日前发布。

  • 技术演示:实时演示和项目页面展示了从输入到网格的完整工作流。


资源

项目链接与资源:





MecAgent 徽标

MecAgent公司