# Gemini 图片转 3D 模型：不直接出 GLB/STL，实测三条路线

> 截至 2026 年 10 月 2 日，Gemini 不能直接导出 GLB 或 STL。要模型文件，出参考图后交给图转 3D 模型；要可打印零件，让它把几何写成代码并检查网格。

- URL: https://blog.laozhang.ai/zh/posts/gemini-image-to-3d
- Published: 2026-10-02
- Updated: 2026-10-02
- Author: LaoZhang AI Team (https://blog.laozhang.ai/zh/about)
- Category: AI 图像生成
- Tags: Gemini 图生 3D, 图片转 3D 模型, Nano Banana, Hunyuan3D-2, 3D 打印, GLB

---
Gemini 应用不能把一张图片直接变成可下载的 3D 文件。2026 年 10 月 2 日，在 Gemini 网页版用 3.6 Flash 让它把自己刚生成的图转成 GLB 或 STL，它的回答开头是：“I cannot directly generate or export 3D geometry files like .glb or .stl.” 想从一张 Gemini 图片走到 3D，有三条路线，选哪条取决于你要的是什么：

- 要带贴图、能放进 Blender 或游戏引擎的模型文件：Gemini 负责出一张干净的参考图，网格交给专门的图转 3D 模型去生成。
- 要有尺寸、能 3D 打印的零件：让 Gemini 把几何写成代码，由代码输出 STL，再检查网格是否封闭。
- 只想在浏览器里转着看：用 Pro 模型生成交互式可视化，它能旋转，但不是一个可以导出的模型文件。

下面的测试都在 2026 年 10 月 2 日完成，用的是一个没有订阅 Google AI 方案的个人账号，对象是同一个物体（一只咖啡杯造型的玩具机器人），每项只跑了一次：

| 测试 | 做到了哪一步 | 没有做的 |
| --- | --- | --- |
| 让 Gemini 直接给 GLB / STL | 得到文字答复和两种替代做法，没有文件 | 没有换模型或换说法再试 |
| 把 Gemini 的图交给腾讯混元的 Hunyuan3D-2 公开演示 | 生成了网格，页面给出面数、顶点数和耗时 | 没有下载网格，没有看到模型外形，没有生成贴图，没有在 Blender 里打开 |
| 让 Gemini 写一个输出 STL 的 Python 脚本 | 拼出可运行的脚本，得到 STL 文件并用脚本检查了网格 | 没有在切片软件或 Blender 里打开，没有打印 |
| 用 3.1 Pro 生成可旋转的 3D 可视化 | 组件生成了，点了“复制” | 测试浏览器里 3D 视口没有渲染出来，没有看到模型转动；没有点“下载” |

Gemini 3 Deep Think 的草图转 3D 打印文件、多视角输入、带贴图的输出、任何付费的图转 3D 服务、Gemini API，都没有测。

## 先分清你要的是哪一种 3D：四种交付物，四种做法

“把图片变成 3D”这句话可能指四样不同的东西，Gemini 在每一样里能做到的程度不一样。

| 你要的东西 | 实际是什么 | Gemini 自己能做到哪一步 |
| --- | --- | --- |
| 看起来立体的图片（3D 手办、公仔、盲盒风格） | 一张普通图片，没有几何数据 | 可以直接生成，这是图片生成 |
| 对话里能旋转的 3D | 嵌在回复里的交互组件，用来帮助理解 | Pro 模型可以生成，没有看到 3D 文件导出 |
| 带贴图的模型文件（GLB 等） | 网格加材质和贴图，可以导入建模软件和引擎 | 不能导出；能出参考图，网格要靠图转 3D 模型 |
| 能打印的零件（STL 等） | 封闭的网格，有实际尺寸 | 可以写出生成网格的代码；Deep Think 按 Google 的说法能生成文件，需要 Ultra |

![“把图片变成 3D”的四种交付物与 Gemini 各自能做到的程度：立体感图片可直接生成，可旋转的 3D 由 Pro 模型生成但没有文件导出，GLB 模型文件不能导出只能出参考图，可打印零件可以写出生成网格的代码](https://blog.laozhang.ai/posts/zh/gemini-image-to-3d/img/four-kinds-of-3d.webp)

第一种最容易和后面三种混在一起。手办风格的图片看上去像一个摆在桌上的实体模型，但它只有像素，转不了视角，也送不进切片软件。如果你要的就是这种图，提示词和修图方法在[Nano Banana 手办提示词指南：复制、改写并修复 3D 收藏手办图](https://blog.laozhang.ai/zh/posts/nano-banana-figurine-prompt-guide)里，下面的内容用不上。

另外要留意名字。名字里带 Gemini 的图转 3D 网站不是 Google 的产品，例如 gemini3d.net 在自己的介绍里写明“Gemini 3D 是独立工具”。这类站点做的事和下文第一条路线一样：图片来自 Gemini，网格由它们接入的 3D 模型生成。

## 问 Gemini 要 GLB 或 STL：它回答不能导出 3D 文件

先生成图片，再在同一个对话里提要求。生成图片用的提示词：

```text
Generate an image: a single small toy robot shaped like a coffee mug with two short arms and a round antenna, matte orange plastic, three-quarter front view, plain white background, soft even studio lighting, whole object in frame, no text.
```

得到一张白底的橙色杯形机器人图片后，接着发：

```text
Convert this image into a 3D model file (GLB or STL) that I can download and open in Blender.
```

回复的第一句就是上面那句“I cannot directly generate or export 3D geometry files like .glb or .stl.”，没有文件，也没有下载链接。它随后给了两种做法：一是把图片上传到图转 3D 的转换工具，得到模型后在 Blender 里通过 File → Import → glTF 2.0 导入，它点了 Tripo3D、Meshy、Rodin、CRM、CSM 几个名字；二是把图片当参考，在 Blender 里手工建模，它认为这样质量最好。

这是 3.6 Flash 在无订阅个人账号上的一次回答。换模型、换订阅或换说法，答复可能不同；那几个工具名是 Gemini 的建议，这次实际跑过的只有下一节的 Hunyuan3D-2。

Gemini API 这边情况一致：Nano Banana 系列图片模型返回的是图片和文字，[图片生成文档](https://ai.google.dev/gemini-api/docs/image-generation)里没有网格、GLB 或 STL 输出的记载。

## 要带贴图的模型文件：Gemini 出参考图，图转 3D 模型出网格

这条路线里 Gemini 只做它擅长的一半：把物体画清楚。把单张图片重建成网格是另一类模型的工作，开源的有腾讯混元的 Hunyuan3D-2、微软的 TRELLIS，商业服务有 Meshy 等。

### 参考图的三个条件：单个物体、纯色背景、整体入镜

上一节的生图提示词就是按这三个条件写的，每一句各管一件事：

- `a single small toy robot`：画面里只有一个物体，转换模型不用猜哪个才是主体。
- `three-quarter front view`：四分之三正面视角，同时露出正面和一个侧面。
- `plain white background, soft even studio lighting`：白底、均匀的柔光，没有投在物体上的硬阴影和杂乱背景。
- `whole object in frame, no text`：物体不被画面边缘裁掉，没有文字。

转换工具厂商给的建议大同小异，Image3D.io 的说明页列的就是白色背景、影棚光、四分之三视角、单个物体。手里是一张背景杂乱的照片时，先按[Gemini图片换背景：7种方法去除、替换和编辑背景完全指南（2026）](https://blog.laozhang.ai/zh/posts/gemini-image-background-change)把背景换成纯色，再拿去转换。生图入口和模型选择见[Gemini 图片生成教程：入口、模型、额度与 API 调用](https://blog.laozhang.ai/zh/posts/gemini-image-generation-complete-guide)，提示词的一般写法见[如何给 Nano Banana 写提示词：实用方法与 50 个可测试模板](https://blog.laozhang.ai/zh/posts/how-to-prompt-nano-banana)。

下载时用图片上的“下载完整尺寸”。按 Google 帮助页的说明，没有 Google AI 方案的账号下载的是 1K 图片，有方案的是 2K。这次测试图省事，喂给转换模型的是一张 934×720 的预览截图，不是完整尺寸的下载文件。

### Hunyuan3D-2 公开演示：不登录，7.67 秒生成 675,188 面的网格

Hunyuan3D-2 在 Hugging Face 上有官方的公开演示（Space 名称 `tencent/Hunyuan3D-2`），这次打开时没有登录 Hugging Face 账号。操作只有两步：上传那张 Gemini 图片，点“Gen Shape”。参数都是默认值，即 30 步、octree resolution 256、自动去背景开启。

运行结束后，页面的 Mesh Stats 面板显示：

| 项目 | 数值 |
| --- | --- |
| 面数 | 675,188 |
| 顶点数 | 184,456 |
| 去背景耗时 | 1.01 秒 |
| 形状生成耗时 | 6.56 秒 |
| 总耗时 | 7.67 秒 |

页面的 Export 标签里有文件类型下拉框（默认 glb）、“Simplify Mesh”选项和“Target Face Number”滑块（默认 10000）。默认参数下生成的网格有 67 万个面，嫌重的话导出时可以用这两项把面数减下来。

这个结果的含义要说窄一点：一张单视角的 Gemini 图片进去，不到 8 秒出来一个网格，全程没有账号。它不说明形状还原得准不准。网格没有下载，页面里的预览在测试浏览器中没有渲染出来，所以模型长什么样没有看到；“Gen Textured Shape”没有运行，贴图质量未知；文件也没有在 Blender 里打开过。

公开演示有排队和配额，也可能不可用，不能当作稳定的免费服务。同一时间，微软 TRELLIS 的官方演示返回的是 HTTP 503。

### 本地运行与付费服务：显存、积分和下载门槛

演示不可用或者需要批量处理时，有两个方向。

**本地运行开源模型**。按 [Hunyuan3D-2 仓库](https://github.com/Tencent-Hunyuan/Hunyuan3D-2)的说明，只生成形状需要 6 GB 显存，形状加贴图一共需要 16 GB，结果可以存成 glb、obj 等格式；它由形状模型 Hunyuan3D-DiT 和贴图模型 Hunyuan3D-Paint 两部分组成，另有一个接收多视角图片的版本。[TRELLIS 仓库](https://github.com/microsoft/TRELLIS)写的要求是至少 16 GB 显存的 NVIDIA 显卡，可以导出 GLB。商用前要自己读许可条款：TRELLIS 的模型和大部分代码是 MIT 许可，个别子模块例外；Hunyuan3D-2 的许可条款以仓库里的许可文件为准，不要默认它可以商用。

**用商业转换服务**。截至 2026 年 10 月 2 日，[Meshy 的价格页](https://www.meshy.ai/pricing)写的是免费档每月 100 积分，每月 1 日重置，生成的资产按 CC BY 4.0 授权（可以商用，但要署名），排队优先级较低；Pro 档每月 1,000 积分；下载格式有 fbx、obj、usdz、glb、stl 和 blend。一次图转 3D 消耗多少积分，价格页上没有看到。还有一类门槛是下载：Image3D.io 的页面写明登录后可以免费在浏览器里预览，下载模型需要付费方案。所以在付费之前，先确认免费档能不能把文件拿到手，以及授权条款是否符合你的用途。

### 拿到模型后先看这三处

单张图片只有一个视角，物体的背面、底部和被遮挡的部分，转换模型只能推测。拿到文件后先检查：

1. 把模型转一圈，看背面和底部是否合理，把手、天线这类细长的部件有没有断开或粘在一起。
2. 看面数。几十万个面的网格在引擎里很重，需要用工具自带的简化选项或建模软件减面。
3. 要贴图的话，确认导出的格式带贴图。GLB 把几何、材质和贴图装在一个文件里；STL 不带颜色和贴图。

背面不对时，可以先重新生成一张视角更合适的参考图再转一次，仍不行再到建模软件里修。Hunyuan3D-2 和 TRELLIS 都有接收多张图片的模式，这次没有测，效果未知。

## 要能打印的零件：让 Gemini 把几何写成 Python 脚本，输出 STL

Gemini 导不出网格，但它能写出生成网格的代码。这条路线不需要任何第三方工具，装了 Python 就行，适合形状规则、需要准确尺寸的零件。代价是：得到的是用圆柱、方块、球拼出来的几何体，不是对图片的还原，而且代码和文件都要检查。

接着上面的对话发的提示词：

```text
Then write the geometry as code instead. Give me one Python 3 script that uses only the standard library and writes robot_mug.stl (binary STL, millimetres, about 60 mm tall) approximating the robot in the image: mug-shaped cylindrical body, a handle, two short arms, two feet, and an antenna with a ball on top. The mesh must be made of closed solids so it can be 3D printed. Output only the script in one code block.
```

这段话里起作用的是几个约束：只用标准库（不用安装依赖）、二进制 STL、单位毫米和目标高度、逐个列出部件、要求实体封闭以便打印。

### 两次回复都不能直接运行，手工拼接后才得到 STL

实际过程不顺利：

1. 第一次回复是一个 13,885 字符的代码块，原样不能运行。里面先是一份没写完的草稿，接着在同一个代码块里又开始了第二份脚本，而第二份脚本里负责写文件的函数是乱的，记号的顺序错位。刷新页面后内容不变，说明存下来的回复就是这样，不是显示问题。
2. 要求它重新发一遍完整脚本后，第二次回复有 4,741 字符。写文件的函数这次是完整的，但脚本在把手函数的中间断了，回复末尾还有一段话说它不清楚这个脚本的上下文，反过来问要做什么物体、用什么语言。
3. 最后的可运行脚本是手工拼的：写文件的函数取自第二次回复，几何函数和主函数取自第一次回复，Gemini 写的函数一行没改。

在 Python 3.12.1 上运行后得到 `robot_mug.stl`：83,684 字节，1,672 个三角形。

这只是 3.6 Flash 在一个物体上的一串回复，不能推出 Gemini 写代码普遍如此。它说明的是：代码拿到手先通读一遍，确认是完整的一份脚本，再运行。

### 文件能解析，但有 5 处不符合要求

用一个自己写的检查脚本解析这个 STL：把三角形按连通关系分成若干个壳，统计不是恰好被两个三角形共用的边，再计算每个壳的有符号体积。结果如下。

| 检查项 | 提示词的要求 | 文件里的实际情况 |
| --- | --- | --- |
| 高度 | 约 60 mm | 70 mm；包围盒 54 × 40 × 70 mm |
| 脚 | 两只 | 三只，中间多出一只 |
| 杯身 | 杯子形状 | 实心圆柱，没有掏空 |
| 封闭性 | 全部是封闭实体 | 共 5 个壳；把手和天线球封闭且朝向正确；杯身、脚和天线杆连成一个壳，其中 2 条边不是恰好被两个三角形共用 |
| 面的朝向 | 可打印 | 两只手臂封闭，但有符号体积为负，即面朝向内侧 |

![robot_mug.stl 的检查结果与提示词要求对照：高度 70 mm 而不是约 60 mm，脚有三只，杯身是实心圆柱，共 5 个壳，两只手臂的面朝向内侧](https://blog.laozhang.ai/posts/zh/gemini-image-to-3d/img/stl-check-results.webp)

此外，各个部件只是互相重叠着摆在一起，没有合并成一个实体；图片里机器人的眼睛、嘴和表面细节一样都没有。

这些问题里，尺寸和脚的数量可以让 Gemini 改代码解决，这也是代码路线的好处：尺寸是写在脚本里的数字，改一处重新运行即可。面朝向和未合并的重叠部件则要在送去切片前处理。按 3D 打印的一般要求，用于打印的网格应当封闭，也就是每条边恰好被两个面共用，并且法线朝外。这个文件没有在切片软件或 Blender 里打开过，也没有打印，切片软件会不会接受它，没有验证。

如果你走这条路线，建议的顺序是：通读代码确认完整 → 运行 → 在切片软件或建模软件里查看尺寸、部件数量和网格错误 → 把发现的问题逐条告诉 Gemini 让它改代码 → 重新运行再查。STL 文件本身不记录单位，导入时要确认软件按毫米读取。

## Deep Think 草图转 3D 打印文件：需要 Google AI Ultra

Google 官方明确说“生成文件”的只有这一项。2026 年 2 月 12 日的 [Gemini 3 Deep Think 更新](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-deep-think/)写道：“With the updated Deep Think, you can turn a sketch into a 3D-printable reality.” 按 Google 的描述，Deep Think 会分析草图、为复杂形状建模，并生成用于 3D 打印的文件。它在 Gemini 应用里面向 Google AI Ultra 订阅用户开放。

Google 的原文没有说明文件格式。据 CGWORLD.jp 2026 年 2 月 24 日的报道，它的做法不是直接画网格，而是用 OpenSCAD 或 Python 这类语言写出定义形状的代码，再运行代码输出实体文件，这样可以避开孔洞和自相交面一类的缺陷。这个思路和上一节的代码路线相同，区别在于上一节是 3.6 Flash 加手工运行。

这项能力没有测过，测试账号没有 Ultra 订阅，输出的格式和质量都未知。已经有 Ultra 的话值得一试，但文件同样要按上一节的方法检查后再打印。

## 想在对话里转着看：3.1 Pro 的交互式可视化，复制得到的是 PNG

Google 在 2026 年 4 月 9 日[宣布](https://blog.google/innovation-and-ai/products/gemini-app/3d-models-charts/) Gemini 应用可以生成交互式可视化，官方的定位是帮助理解所问主题的“功能性模拟”，举的例子是拖动滑块调整速度和重力。用法是在输入框里选 Pro 模型，然后让 Gemini “show me”或“help me visualize”某个概念。Google 称该功能面向所有 Gemini 应用用户推出，教育版和 Workspace 账号暂不可用。公告里没有提到导出 3D 文件，也没有提到把上传的图片转成 3D。

测试账号没有订阅，模型选择器里可以选到 3.1 Pro。新开一个对话，发的是：

```text
Show me an interactive 3D model of a small toy robot shaped like a coffee mug, with two short arms, two feet and an antenna with a ball on top. I want to rotate it.
```

回复里出现了一个名为“MugBot 3D”的组件：一个 3D 视口、五个颜色色块、三个动作按钮和一个蒸汽开关，文字说明写着可以在视口里点击拖动来 360 度旋转、滚动缩放。

有两点要知道：

- **它依赖浏览器的 WebGL**。测试浏览器里视口显示的是“3D Viewport Unavailable — Unable to initialize WebGL rendering context.”，同一个标签页检测到 WebGL 1 可用、WebGL 2 不可用，所以没有看到模型转动。这是测试浏览器的问题，不代表正常表现；你遇到同样的提示时，换一个 WebGL 正常的浏览器或设备再试。
- **“复制”得到的是一张图片**。组件下方的菜单有“复制”和“下载”两项，“复制”放进剪贴板的是组件的 PNG 截图（1416×1366），不是代码，也不是 3D 文件。“下载”没有点，它保存的是什么没有验证。整个回复里没有看到导出 GLB、STL 或 OBJ 的选项。

这个组件是根据文字描述生成的。把上传的图片作为可视化的依据行不行，没有测。它适合用来讲解结构、向别人展示一个想法，不能当作获取模型文件的途径。

## GLB、STL、OBJ 怎么选：看文件要交给谁

- **GLB**：glTF 2.0 的单文件二进制形式，几何、材质和贴图都在一个文件里。交给 Blender、游戏引擎、网页或 AR 展示时用它。
- **STL**：只存三角形，没有颜色、贴图，也没有单位字段。交给切片软件做 3D 打印时用它。
- **OBJ**：存几何，材质和贴图放在配套的文件里。老牌建模软件之间交换时常见，传文件时要把配套文件一起带上。

Hunyuan3D-2 演示页的导出格式默认就是 glb；代码路线适合直接写 STL。要打印一个由图转 3D 模型生成的造型时，导出 STL 之前同样要检查网格是否封闭。

## Gemini 生成的 3D 手办图能直接拿去 3D 打印吗

不能直接打印。手办图是一张图片，没有几何数据，切片软件读不了。它可以作为参考图走图转 3D 模型的路线，得到网格后再检查封闭性、调整尺寸。单张图片转出的模型，背面和被遮挡的部分是推测出来的，按 1/6、1/7 这类比例做成实体之前，要预留在建模软件里修整的工夫。从手办图到成品打印的完整流程这次没有做过，其中每一步的效果都要你自己验证。

## 没有订阅能做到哪一步

上面的测试全部在没有 Google AI 方案的个人账号上完成：生成参考图、得到“不能导出 3D 文件”的答复、拿到 STL 脚本、用 3.1 Pro 生成交互式可视化，都不需要订阅。免费生图受用量限制，额度规则见[Gemini 免费生图次数限制：一天能出几张，用完怎么办](https://blog.laozhang.ai/zh/posts/gemini-image-generation-free-limit-2026)；无订阅账号用 Pro 模型的次数上限没有测。需要订阅的只有 Deep Think，它要求 Google AI Ultra。Gemini 应用的可用范围以 Google 支持的语言和国家、地区为准。
