Gemini 图片转 3D 模型:不直接出 GLB/STL,实测三条路线
截至 2026 年 10 月 2 日,Gemini 不能直接导出 GLB 或 STL。要模型文件,出参考图后交给图转 3D 模型;要可打印零件,让它把几何写成代码并检查网格。
文章目录

Gemini 应用不能把一张图片直接变成可下载的 3D 文件。2026 年 10 月 2 日,在 Gemini 网页版用 3.6 Flash 让它把自己刚生成的图转成 GLB 或 STL,它的回答开头是:“I cannot directly generate or export 3D geometry files like .glb or .stl.” 想从一张 Gemini 图片走到 3D,有三条路线,选哪条取决于你要的是什么:
- 要带贴图、能放进 Blender 或游戏引擎的模型文件:Gemini 负责出一张干净的参考图,网格交给专门的图转 3D 模型去生成。
- 要有尺寸、能 3D 打印的零件:让 Gemini 把几何写成代码,由代码输出 STL,再检查网格是否封闭。
- 只想在浏览器里转着看:用 Pro 模型生成交互式可视化,它能旋转,但不是一个可以导出的模型文件。
下面的测试都在 2026 年 10 月 2 日完成,用的是一个没有订阅 Google AI 方案的个人账号,对象是同一个物体(一只咖啡杯造型的玩具机器人),每项只跑了一次:
| 测试 | 做到了哪一步 | 没有做的 |
|---|---|---|
| 让 Gemini 直接给 GLB / STL | 得到文字答复和两种替代做法,没有文件 | 没有换模型或换说法再试 |
| 把 Gemini 的图交给腾讯混元的 Hunyuan3D-2 公开演示 | 生成了网格,页面给出面数、顶点数和耗时 | 没有下载网格,没有看到模型外形,没有生成贴图,没有在 Blender 里打开 |
| 让 Gemini 写一个输出 STL 的 Python 脚本 | 拼出可运行的脚本,得到 STL 文件并用脚本检查了网格 | 没有在切片软件或 Blender 里打开,没有打印 |
| 用 3.1 Pro 生成可旋转的 3D 可视化 | 组件生成了,点了“复制” | 测试浏览器里 3D 视口没有渲染出来,没有看到模型转动;没有点“下载” |
Gemini 3 Deep Think 的草图转 3D 打印文件、多视角输入、带贴图的输出、任何付费的图转 3D 服务、Gemini API,都没有测。
先分清你要的是哪一种 3D:四种交付物,四种做法
“把图片变成 3D”这句话可能指四样不同的东西,Gemini 在每一样里能做到的程度不一样。
| 你要的东西 | 实际是什么 | Gemini 自己能做到哪一步 |
|---|---|---|
| 看起来立体的图片(3D 手办、公仔、盲盒风格) | 一张普通图片,没有几何数据 | 可以直接生成,这是图片生成 |
| 对话里能旋转的 3D | 嵌在回复里的交互组件,用来帮助理解 | Pro 模型可以生成,没有看到 3D 文件导出 |
| 带贴图的模型文件(GLB 等) | 网格加材质和贴图,可以导入建模软件和引擎 | 不能导出;能出参考图,网格要靠图转 3D 模型 |
| 能打印的零件(STL 等) | 封闭的网格,有实际尺寸 | 可以写出生成网格的代码;Deep Think 按 Google 的说法能生成文件,需要 Ultra |

第一种最容易和后面三种混在一起。手办风格的图片看上去像一个摆在桌上的实体模型,但它只有像素,转不了视角,也送不进切片软件。如果你要的就是这种图,提示词和修图方法在Nano Banana 手办提示词指南:复制、改写并修复 3D 收藏手办图里,下面的内容用不上。
另外要留意名字。名字里带 Gemini 的图转 3D 网站不是 Google 的产品,例如 gemini3d.net 在自己的介绍里写明“Gemini 3D 是独立工具”。这类站点做的事和下文第一条路线一样:图片来自 Gemini,网格由它们接入的 3D 模型生成。
问 Gemini 要 GLB 或 STL:它回答不能导出 3D 文件
先生成图片,再在同一个对话里提要求。生成图片用的提示词:
Generate an image: a single small toy robot shaped like a coffee mug with two short arms and a round antenna, matte orange plastic, three-quarter front view, plain white background, soft even studio lighting, whole object in frame, no text.得到一张白底的橙色杯形机器人图片后,接着发:
Convert this image into a 3D model file (GLB or STL) that I can download and open in Blender.回复的第一句就是上面那句“I cannot directly generate or export 3D geometry files like .glb or .stl.”,没有文件,也没有下载链接。它随后给了两种做法:一是把图片上传到图转 3D 的转换工具,得到模型后在 Blender 里通过 File → Import → glTF 2.0 导入,它点了 Tripo3D、Meshy、Rodin、CRM、CSM 几个名字;二是把图片当参考,在 Blender 里手工建模,它认为这样质量最好。
这是 3.6 Flash 在无订阅个人账号上的一次回答。换模型、换订阅或换说法,答复可能不同;那几个工具名是 Gemini 的建议,这次实际跑过的只有下一节的 Hunyuan3D-2。
Gemini API 这边情况一致:Nano Banana 系列图片模型返回的是图片和文字,图片生成文档里没有网格、GLB 或 STL 输出的记载。
要带贴图的模型文件:Gemini 出参考图,图转 3D 模型出网格
这条路线里 Gemini 只做它擅长的一半:把物体画清楚。把单张图片重建成网格是另一类模型的工作,开源的有腾讯混元的 Hunyuan3D-2、微软的 TRELLIS,商业服务有 Meshy 等。
参考图的三个条件:单个物体、纯色背景、整体入镜
上一节的生图提示词就是按这三个条件写的,每一句各管一件事:
a single small toy robot:画面里只有一个物体,转换模型不用猜哪个才是主体。three-quarter front view:四分之三正面视角,同时露出正面和一个侧面。plain white background, soft even studio lighting:白底、均匀的柔光,没有投在物体上的硬阴影和杂乱背景。whole object in frame, no text:物体不被画面边缘裁掉,没有文字。
转换工具厂商给的建议大同小异,Image3D.io 的说明页列的就是白色背景、影棚光、四分之三视角、单个物体。手里是一张背景杂乱的照片时,先按Gemini图片换背景:7种方法去除、替换和编辑背景完全指南(2026)把背景换成纯色,再拿去转换。生图入口和模型选择见Gemini 图片生成教程:入口、模型、额度与 API 调用,提示词的一般写法见如何给 Nano Banana 写提示词:实用方法与 50 个可测试模板。
下载时用图片上的“下载完整尺寸”。按 Google 帮助页的说明,没有 Google AI 方案的账号下载的是 1K 图片,有方案的是 2K。这次测试图省事,喂给转换模型的是一张 934×720 的预览截图,不是完整尺寸的下载文件。
Hunyuan3D-2 公开演示:不登录,7.67 秒生成 675,188 面的网格
Hunyuan3D-2 在 Hugging Face 上有官方的公开演示(Space 名称 tencent/Hunyuan3D-2),这次打开时没有登录 Hugging Face 账号。操作只有两步:上传那张 Gemini 图片,点“Gen Shape”。参数都是默认值,即 30 步、octree resolution 256、自动去背景开启。
运行结束后,页面的 Mesh Stats 面板显示:
| 项目 | 数值 |
|---|---|
| 面数 | 675,188 |
| 顶点数 | 184,456 |
| 去背景耗时 | 1.01 秒 |
| 形状生成耗时 | 6.56 秒 |
| 总耗时 | 7.67 秒 |
页面的 Export 标签里有文件类型下拉框(默认 glb)、“Simplify Mesh”选项和“Target Face Number”滑块(默认 10000)。默认参数下生成的网格有 67 万个面,嫌重的话导出时可以用这两项把面数减下来。
这个结果的含义要说窄一点:一张单视角的 Gemini 图片进去,不到 8 秒出来一个网格,全程没有账号。它不说明形状还原得准不准。网格没有下载,页面里的预览在测试浏览器中没有渲染出来,所以模型长什么样没有看到;“Gen Textured Shape”没有运行,贴图质量未知;文件也没有在 Blender 里打开过。
公开演示有排队和配额,也可能不可用,不能当作稳定的免费服务。同一时间,微软 TRELLIS 的官方演示返回的是 HTTP 503。
本地运行与付费服务:显存、积分和下载门槛
演示不可用或者需要批量处理时,有两个方向。
本地运行开源模型。按 Hunyuan3D-2 仓库的说明,只生成形状需要 6 GB 显存,形状加贴图一共需要 16 GB,结果可以存成 glb、obj 等格式;它由形状模型 Hunyuan3D-DiT 和贴图模型 Hunyuan3D-Paint 两部分组成,另有一个接收多视角图片的版本。TRELLIS 仓库写的要求是至少 16 GB 显存的 NVIDIA 显卡,可以导出 GLB。商用前要自己读许可条款:TRELLIS 的模型和大部分代码是 MIT 许可,个别子模块例外;Hunyuan3D-2 的许可条款以仓库里的许可文件为准,不要默认它可以商用。
用商业转换服务。截至 2026 年 10 月 2 日,Meshy 的价格页写的是免费档每月 100 积分,每月 1 日重置,生成的资产按 CC BY 4.0 授权(可以商用,但要署名),排队优先级较低;Pro 档每月 1,000 积分;下载格式有 fbx、obj、usdz、glb、stl 和 blend。一次图转 3D 消耗多少积分,价格页上没有看到。还有一类门槛是下载:Image3D.io 的页面写明登录后可以免费在浏览器里预览,下载模型需要付费方案。所以在付费之前,先确认免费档能不能把文件拿到手,以及授权条款是否符合你的用途。
拿到模型后先看这三处
单张图片只有一个视角,物体的背面、底部和被遮挡的部分,转换模型只能推测。拿到文件后先检查:
- 把模型转一圈,看背面和底部是否合理,把手、天线这类细长的部件有没有断开或粘在一起。
- 看面数。几十万个面的网格在引擎里很重,需要用工具自带的简化选项或建模软件减面。
- 要贴图的话,确认导出的格式带贴图。GLB 把几何、材质和贴图装在一个文件里;STL 不带颜色和贴图。
背面不对时,可以先重新生成一张视角更合适的参考图再转一次,仍不行再到建模软件里修。Hunyuan3D-2 和 TRELLIS 都有接收多张图片的模式,这次没有测,效果未知。
要能打印的零件:让 Gemini 把几何写成 Python 脚本,输出 STL
Gemini 导不出网格,但它能写出生成网格的代码。这条路线不需要任何第三方工具,装了 Python 就行,适合形状规则、需要准确尺寸的零件。代价是:得到的是用圆柱、方块、球拼出来的几何体,不是对图片的还原,而且代码和文件都要检查。
接着上面的对话发的提示词:
Then write the geometry as code instead. Give me one Python 3 script that uses only the standard library and writes robot_mug.stl (binary STL, millimetres, about 60 mm tall) approximating the robot in the image: mug-shaped cylindrical body, a handle, two short arms, two feet, and an antenna with a ball on top. The mesh must be made of closed solids so it can be 3D printed. Output only the script in one code block.这段话里起作用的是几个约束:只用标准库(不用安装依赖)、二进制 STL、单位毫米和目标高度、逐个列出部件、要求实体封闭以便打印。
两次回复都不能直接运行,手工拼接后才得到 STL
实际过程不顺利:
- 第一次回复是一个 13,885 字符的代码块,原样不能运行。里面先是一份没写完的草稿,接着在同一个代码块里又开始了第二份脚本,而第二份脚本里负责写文件的函数是乱的,记号的顺序错位。刷新页面后内容不变,说明存下来的回复就是这样,不是显示问题。
- 要求它重新发一遍完整脚本后,第二次回复有 4,741 字符。写文件的函数这次是完整的,但脚本在把手函数的中间断了,回复末尾还有一段话说它不清楚这个脚本的上下文,反过来问要做什么物体、用什么语言。
- 最后的可运行脚本是手工拼的:写文件的函数取自第二次回复,几何函数和主函数取自第一次回复,Gemini 写的函数一行没改。
在 Python 3.12.1 上运行后得到 robot_mug.stl:83,684 字节,1,672 个三角形。
这只是 3.6 Flash 在一个物体上的一串回复,不能推出 Gemini 写代码普遍如此。它说明的是:代码拿到手先通读一遍,确认是完整的一份脚本,再运行。
文件能解析,但有 5 处不符合要求
用一个自己写的检查脚本解析这个 STL:把三角形按连通关系分成若干个壳,统计不是恰好被两个三角形共用的边,再计算每个壳的有符号体积。结果如下。
| 检查项 | 提示词的要求 | 文件里的实际情况 |
|---|---|---|
| 高度 | 约 60 mm | 70 mm;包围盒 54 × 40 × 70 mm |
| 脚 | 两只 | 三只,中间多出一只 |
| 杯身 | 杯子形状 | 实心圆柱,没有掏空 |
| 封闭性 | 全部是封闭实体 | 共 5 个壳;把手和天线球封闭且朝向正确;杯身、脚和天线杆连成一个壳,其中 2 条边不是恰好被两个三角形共用 |
| 面的朝向 | 可打印 | 两只手臂封闭,但有符号体积为负,即面朝向内侧 |

此外,各个部件只是互相重叠着摆在一起,没有合并成一个实体;图片里机器人的眼睛、嘴和表面细节一样都没有。
这些问题里,尺寸和脚的数量可以让 Gemini 改代码解决,这也是代码路线的好处:尺寸是写在脚本里的数字,改一处重新运行即可。面朝向和未合并的重叠部件则要在送去切片前处理。按 3D 打印的一般要求,用于打印的网格应当封闭,也就是每条边恰好被两个面共用,并且法线朝外。这个文件没有在切片软件或 Blender 里打开过,也没有打印,切片软件会不会接受它,没有验证。
如果你走这条路线,建议的顺序是:通读代码确认完整 → 运行 → 在切片软件或建模软件里查看尺寸、部件数量和网格错误 → 把发现的问题逐条告诉 Gemini 让它改代码 → 重新运行再查。STL 文件本身不记录单位,导入时要确认软件按毫米读取。
Deep Think 草图转 3D 打印文件:需要 Google AI Ultra
Google 官方明确说“生成文件”的只有这一项。2026 年 2 月 12 日的 Gemini 3 Deep Think 更新写道:“With the updated Deep Think, you can turn a sketch into a 3D-printable reality.” 按 Google 的描述,Deep Think 会分析草图、为复杂形状建模,并生成用于 3D 打印的文件。它在 Gemini 应用里面向 Google AI Ultra 订阅用户开放。
Google 的原文没有说明文件格式。据 CGWORLD.jp 2026 年 2 月 24 日的报道,它的做法不是直接画网格,而是用 OpenSCAD 或 Python 这类语言写出定义形状的代码,再运行代码输出实体文件,这样可以避开孔洞和自相交面一类的缺陷。这个思路和上一节的代码路线相同,区别在于上一节是 3.6 Flash 加手工运行。
这项能力没有测过,测试账号没有 Ultra 订阅,输出的格式和质量都未知。已经有 Ultra 的话值得一试,但文件同样要按上一节的方法检查后再打印。
想在对话里转着看:3.1 Pro 的交互式可视化,复制得到的是 PNG
Google 在 2026 年 4 月 9 日宣布 Gemini 应用可以生成交互式可视化,官方的定位是帮助理解所问主题的“功能性模拟”,举的例子是拖动滑块调整速度和重力。用法是在输入框里选 Pro 模型,然后让 Gemini “show me”或“help me visualize”某个概念。Google 称该功能面向所有 Gemini 应用用户推出,教育版和 Workspace 账号暂不可用。公告里没有提到导出 3D 文件,也没有提到把上传的图片转成 3D。
测试账号没有订阅,模型选择器里可以选到 3.1 Pro。新开一个对话,发的是:
Show me an interactive 3D model of a small toy robot shaped like a coffee mug, with two short arms, two feet and an antenna with a ball on top. I want to rotate it.回复里出现了一个名为“MugBot 3D”的组件:一个 3D 视口、五个颜色色块、三个动作按钮和一个蒸汽开关,文字说明写着可以在视口里点击拖动来 360 度旋转、滚动缩放。
有两点要知道:
- 它依赖浏览器的 WebGL。测试浏览器里视口显示的是“3D Viewport Unavailable — Unable to initialize WebGL rendering context.”,同一个标签页检测到 WebGL 1 可用、WebGL 2 不可用,所以没有看到模型转动。这是测试浏览器的问题,不代表正常表现;你遇到同样的提示时,换一个 WebGL 正常的浏览器或设备再试。
- “复制”得到的是一张图片。组件下方的菜单有“复制”和“下载”两项,“复制”放进剪贴板的是组件的 PNG 截图(1416×1366),不是代码,也不是 3D 文件。“下载”没有点,它保存的是什么没有验证。整个回复里没有看到导出 GLB、STL 或 OBJ 的选项。
这个组件是根据文字描述生成的。把上传的图片作为可视化的依据行不行,没有测。它适合用来讲解结构、向别人展示一个想法,不能当作获取模型文件的途径。
GLB、STL、OBJ 怎么选:看文件要交给谁
- GLB:glTF 2.0 的单文件二进制形式,几何、材质和贴图都在一个文件里。交给 Blender、游戏引擎、网页或 AR 展示时用它。
- STL:只存三角形,没有颜色、贴图,也没有单位字段。交给切片软件做 3D 打印时用它。
- OBJ:存几何,材质和贴图放在配套的文件里。老牌建模软件之间交换时常见,传文件时要把配套文件一起带上。
Hunyuan3D-2 演示页的导出格式默认就是 glb;代码路线适合直接写 STL。要打印一个由图转 3D 模型生成的造型时,导出 STL 之前同样要检查网格是否封闭。
Gemini 生成的 3D 手办图能直接拿去 3D 打印吗
不能直接打印。手办图是一张图片,没有几何数据,切片软件读不了。它可以作为参考图走图转 3D 模型的路线,得到网格后再检查封闭性、调整尺寸。单张图片转出的模型,背面和被遮挡的部分是推测出来的,按 1/6、1/7 这类比例做成实体之前,要预留在建模软件里修整的工夫。从手办图到成品打印的完整流程这次没有做过,其中每一步的效果都要你自己验证。
没有订阅能做到哪一步
上面的测试全部在没有 Google AI 方案的个人账号上完成:生成参考图、得到“不能导出 3D 文件”的答复、拿到 STL 脚本、用 3.1 Pro 生成交互式可视化,都不需要订阅。免费生图受用量限制,额度规则见Gemini 免费生图次数限制:一天能出几张,用完怎么办;无订阅账号用 Pro 模型的次数上限没有测。需要订阅的只有 Deep Think,它要求 Google AI Ultra。Gemini 应用的可用范围以 Google 支持的语言和国家、地区为准。





