# Convertir una imagen de Gemini a modelo 3D: qué vía da un archivo

> A 2 de octubre de 2026, Gemini 3.6 Flash no entrega un GLB ni un STL: su imagen sirve de referencia para un conversor, o la geometría se le pide como código.

- URL: https://blog.laozhang.ai/es/posts/gemini-image-to-3d
- Published: 2026-10-02
- Updated: 2026-10-02
- Author: LaoZhang AI Team (https://blog.laozhang.ai/es/about)
- Category: Generación de imágenes con IA
- Tags: Gemini, modelo 3D, imagen a 3D, Nano Banana, impresión 3D

---
Gemini no convierte una imagen en un archivo 3D descargable desde el chat normal. A 2 de octubre de 2026, al pedirle a Gemini 3.6 Flash un GLB o un STL de una imagen que él mismo acababa de generar, respondió que no puede generar ni exportar geometría. Lo que sí funciona es repartir el trabajo: Gemini hace una imagen de referencia limpia y un modelo de imagen a 3D saca la malla, o bien Gemini escribe un programa que construye la pieza con medidas. La vía correcta depende de qué entiendas por «3D».

| Lo que quieres | Vía | Qué pone Gemini | Qué obtienes |
|---|---|---|---|
| Una imagen con aspecto de figura o de render | Generación de imágenes | Todo | Una imagen plana (PNG), no un modelo |
| Girar un objeto en el navegador para entenderlo | Visualización interactiva del modelo Pro | Todo | Un widget dentro del chat, sin exportación visible a GLB, STL u OBJ |
| Un modelo con textura para Blender, un motor de juego o realidad aumentada | Imagen de Gemini + conversor de imagen a 3D | La imagen de referencia | Una malla exportable, normalmente en GLB |
| Una pieza con medidas para imprimir | Geometría como código, o Deep Think con Google AI Ultra | El programa que escribe el archivo | Un STL que hay que revisar antes de imprimir |

Si lo que buscas es la primera fila, no necesitas nada de lo que sigue: es un trabajo de generación de imágenes y el camino está en la guía del [prompt de figura Nano Banana](https://blog.laozhang.ai/es/posts/nano-banana-figurine-prompt-guide). El resto de la página trata de las otras tres.

![Cuatro formas de entender «3D» con Gemini y la vía de cada una: imagen PNG, widget en el chat, malla GLB con un conversor y STL mediante código o Deep Think](https://blog.laozhang.ai/posts/es/gemini-image-to-3d/img/vias-gemini-3d.webp)

## Qué se ejecutó el 2 de octubre de 2026 y qué quedó sin probar

Las cuatro pruebas se hicieron una sola vez, con un único objeto (un robot de juguete con forma de taza), en la app web de Gemini con una cuenta personal sin ningún plan de Google AI. No son una comparativa ni una medida de calidad.

Se ejecutó:

- La petición directa de un archivo GLB o STL a Gemini 3.6 Flash. Resultado: negativa y dos alternativas sugeridas, sin archivo.
- La petición de la geometría como código Python. Resultado: dos respuestas que no se podían ejecutar tal cual, un montaje manual y, después, un STL real de 83.684 bytes con defectos medidos.
- La visualización 3D interactiva con el modelo 3.1 Pro. Resultado: el widget se generó, pero el visor no arrancó en el navegador de la prueba por un fallo de WebGL, así que el modelo no llegó a verse girar.
- La imagen de Gemini como entrada de Hunyuan3D-2 en su demo pública. Resultado: una malla de 675.188 caras en 7,67 segundos, sin iniciar sesión.

No se hizo:

- Descargar la malla de Hunyuan3D-2, verla, generar su textura ni abrirla en Blender.
- Abrir el STL en un laminador (slicer) ni en Blender. No se imprimió nada.
- Probar Deep Think, que exige Google AI Ultra, ni ningún conversor de pago, ni la API de Gemini, ni entradas con varias vistas.
- Pulsar el botón de descarga del widget interactivo: qué guarda sigue sin saberse.

Por tanto, nada de lo que sigue demuestra que la forma obtenida se parezca a la imagen ni que una pieza salga bien de la impresora. Demuestra hasta dónde llega cada vía y dónde se rompió.

## ¿Puede Gemini crear un archivo 3D a partir de una imagen? No con 3.6 Flash

No. La petición fue esta, en la misma conversación en la que Gemini había generado la imagen:

```text
Convert this image into a 3D model file (GLB or STL) that I can download and open in Blender.
```

Es decir: convierte esta imagen en un archivo de modelo 3D que se pueda descargar y abrir en Blender. La respuesta empezó así: «I cannot directly generate or export 3D geometry files like .glb or .stl». A continuación propuso dos caminos. El primero, que llamó el más rápido, es subir la imagen a un conversor de imagen a 3D (nombró Tripo3D, Meshy, Rodin, CRM y CSM) e importar el resultado en Blender con File → Import → glTF 2.0. El segundo, que llamó el de mejor calidad, es modelar a mano en Blender con la imagen como referencia. No hubo archivo ni enlace de descarga.

Dos matices. Esos nombres son sugerencias de Gemini, no una selección probada: de esa lista no se ejecutó ninguno. Y la respuesta corresponde a un modelo, una cuenta y una redacción concretos; con Deep Think, Google afirma otra cosa, como se ve más abajo.

La API no cambia el panorama. Los modelos de imagen de Gemini (la familia Nano Banana) devuelven imágenes y texto, y la [documentación de generación de imágenes](https://ai.google.dev/gemini-api/docs/image-generation) no recoge ninguna salida en forma de malla, GLB o STL.

## Imagen de referencia para el conversor: un objeto, fondo liso, encuadre completo

La calidad de la malla empieza en la imagen, y aquí Gemini sí hace el trabajo entero. El prompt de la prueba fue:

```text
Generate an image: a single small toy robot shaped like a coffee mug with two short arms and a round antenna, matte orange plastic, three-quarter front view, plain white background, soft even studio lighting, whole object in frame, no text.
```

Cada parte tiene una función para el paso siguiente:

- **Un solo objeto** («a single small toy robot»): el conversor reconstruye lo que hay en la imagen; dos objetos se funden en una sola malla.
- **Material mate** («matte orange plastic»): pide una superficie sin brillos marcados.
- **Vista de tres cuartos** («three-quarter front view»): enseña a la vez el frente, un lateral y parte de la cara superior.
- **Fondo blanco y luz uniforme** («plain white background, soft even studio lighting»): el recorte del fondo es el primer paso del conversor y un fondo liso se lo pone fácil.
- **Objeto entero en el encuadre y sin texto** («whole object in frame, no text»): lo que queda fuera de la imagen no existe para el modelo.

Son las mismas recomendaciones que publica un conversor comercial, [Image3D.io](https://image3d.io/gemini-image-to-3d), para imágenes hechas con Gemini: fondo blanco, luz de estudio, vista de tres cuartos y un único objeto.

Si partes de una foto o de una imagen que ya tienes, limpia primero el fondo; los métodos están en la guía para [cambiar el fondo de una imagen con Gemini](https://blog.laozhang.ai/es/posts/gemini-image-background-change). Para dónde generar la imagen y cómo redactar la petición, sirven [cómo generar imágenes con Gemini](https://blog.laozhang.ai/es/posts/gemini-image-generation-complete-guide) y [cómo escribir prompts para Nano Banana](https://blog.laozhang.ai/es/posts/how-to-prompt-nano-banana).

Descarga la imagen a tamaño completo en lugar de capturar la pantalla. Según la ayuda de Google, la descarga es a 1K sin plan y a 2K con un plan de Google AI. En la prueba se usó un recorte de captura de 934 × 720 píxeles, una entrada peor que la que tendrás tú.

## De la imagen a la malla con Hunyuan3D-2: 675.188 caras en 7,67 s

Con una sola imagen de Gemini, la demo pública de Hunyuan3D-2 devolvió una malla en menos de ocho segundos y sin pedir cuenta. Hunyuan3D-2 es un modelo abierto de Tencent; su demo es el Space `tencent/Hunyuan3D-2` de [Hugging Face](https://huggingface.co/spaces/tencent/Hunyuan3D-2).

Los pasos de la prueba:

1. Abrir el Space. No hizo falta iniciar sesión en Hugging Face.
2. Subir la imagen del robot.
3. Dejar los valores por defecto (30 pasos, resolución de octree 256, eliminación de fondo activada) y pulsar «Gen Shape», que genera solo la forma.
4. Leer el panel «Mesh Stats».

El panel indicó 675.188 caras y 184.456 vértices, con 1,01 s para quitar el fondo y 6,56 s para generar la forma: 7,67 s en total. La pestaña de exportación ofrece un desplegable de tipo de archivo (glb por defecto), la casilla «Simplify Mesh» y un control «Target Face Number» con 10.000 como valor inicial. Reducir caras tiene sentido: una malla de 675.188 caras pesa demasiado para un motor de juego o para realidad aumentada.

Lo que esta ejecución no dice es lo importante para decidir. La malla no se descargó, el visor de la página no llegó a mostrarla en el navegador de la prueba y no se generó textura (eso es el otro botón, «Gen Textured Shape»). Queda acreditado que la vía funciona de extremo a extremo hasta una malla; no queda acreditado que la forma sea fiel al robot.

Que no pidiera cuenta ese día no es una garantía. Las demos públicas tienen colas y cuotas y pueden estar caídas: en ese mismo momento, la demo oficial de TRELLIS respondía con un error HTTP 503.

Para ejecutarlo en tu propio equipo, el [repositorio de Hunyuan3D-2](https://github.com/Tencent-Hunyuan/Hunyuan3D-2) indica 6 GB de VRAM para la forma y 16 GB en total para forma y textura, y que el resultado se guarda en GLB u OBJ, entre otros formatos. Antes de un uso comercial, lee la licencia del repositorio.

## TRELLIS, Meshy y los sitios con «Gemini» en el nombre

Ninguna de estas opciones se ejecutó; lo que sigue es lo que declaran sus propias páginas a 2 de octubre de 2026.

| Opción | Tipo | Lo que declara su página | Condición que conviene saber |
|---|---|---|---|
| [TRELLIS](https://github.com/microsoft/TRELLIS) (Microsoft) | Modelo abierto | Genera a partir de texto o imagen; exporta GLB con textura y PLY; admite varias imágenes | En local pide una GPU NVIDIA con al menos 16 GB; licencia MIT en la mayor parte del código |
| [Meshy](https://www.meshy.ai/pricing) | Servicio comercial | Plan gratuito con 100 créditos al mes que se renuevan el día 1; descarga en .fbx, .obj, .usdz, .glb, .stl y .blend | En el plan gratuito los modelos quedan bajo CC BY 4.0 (uso comercial con atribución) y la cola tiene menos prioridad |
| Image3D.io | Servicio comercial | Vista previa gratuita en el navegador tras registrarse; exporta GLB, OBJ, STL o PLY | La descarga exige un plan de pago |

El caso de Image3D.io ilustra algo frecuente en los conversores de pago: ver el modelo es gratis, llevárselo no. Compruébalo antes de invertir tiempo en afinar la imagen. En Meshy, cuántos créditos consume cada conversión se ve dentro de la herramienta, no en la tabla de planes.

Tripo, Rodin y CSM aparecen en la respuesta de Gemini, pero eso no dice nada de sus precios, su calidad ni su licencia: léelos en la página de cada uno antes de elegir.

Los sitios que llevan «Gemini» en el nombre y prometen convertir imágenes a 3D no son productos de Google. gemini3d.net, por ejemplo, se describe a sí mismo como una herramienta independiente. Lo que haya detrás es el modelo de otra empresa, con sus propias condiciones.

## Geometría como código: un STL de 1.672 triángulos tras dos respuestas rotas

Gemini sí puede llegar a un archivo si en vez de pedirle la malla le pides un programa que la escriba. Sirve para piezas de formas simples con medidas, no para reproducir una imagen. El prompt, en la misma conversación:

```text
Then write the geometry as code instead. Give me one Python 3 script that uses only the standard library and writes robot_mug.stl (binary STL, millimetres, about 60 mm tall) approximating the robot in the image: mug-shaped cylindrical body, a handle, two short arms, two feet, and an antenna with a ball on top. The mesh must be made of closed solids so it can be 3D printed. Output only the script in one code block.
```

En resumen: un único script de Python 3, solo con la biblioteca estándar, que escriba un STL binario en milímetros, de unos 60 mm de alto, con cuerpo cilíndrico, asa, dos brazos, dos pies y una antena con bola, todo en sólidos cerrados.

El recorrido real fue este:

1. **Primera respuesta: no ejecutable.** Un bloque de 13.885 caracteres con un borrador sin terminar, un segundo script dentro del mismo bloque y la función que escribe el archivo con los elementos desordenados. Recargar la página mostró el mismo texto.
2. **Segunda respuesta: incompleta.** Al pedir de nuevo el script final llegaron 4.741 caracteres: la función de escritura ya estaba bien, pero el código se cortaba a mitad de la función del asa y el mensaje terminaba diciendo que no tenía contexto y preguntando de qué objeto y lenguaje se trataba.
3. **Montaje a mano.** El script que funcionó junta la función de escritura de la segunda respuesta con las funciones de geometría y la función principal de la primera, sin modificar ninguna línea de esas funciones.
4. **Ejecución.** Con Python 3.12.1 escribió `robot_mug.stl`: 83.684 bytes y 1.672 triángulos.

![Recorrido de la prueba de geometría como código: dos respuestas de Gemini que no servían, un montaje a mano, un STL de 1.672 triángulos y los defectos medidos después](https://blog.laozhang.ai/posts/es/gemini-image-to-3d/img/stl-codigo-recorrido.webp)

Después, un segundo script de comprobación leyó el STL, agrupó los triángulos en piezas conectadas, contó las aristas que no comparten exactamente dos triángulos y calculó el volumen con signo de cada pieza. Lo que encontró:

| Comprobación | Lo pedido | Lo que hay en el archivo |
|---|---|---|
| Altura | Unos 60 mm | 70 mm (caja de 54 × 40 × 70 mm) |
| Pies | Dos | Tres: uno en el centro y uno a cada lado |
| Cuerpo | Forma de taza | Cilindro macizo, sin hueco |
| Sólidos cerrados | Todos | El asa y la bola de la antena, sí; cuerpo, pies y varilla forman una pieza con 2 aristas mal compartidas |
| Orientación de las caras | Hacia fuera | Los dos brazos tienen las caras hacia dentro (volumen con signo de −288 mm³ cada uno) |
| Una sola pieza | Implícito | 5 piezas que se solapan, sin unir entre sí |
| Detalle de la imagen | Aproximar el robot | Ningún rasgo de la cara ni de la superficie |

El balance: un STL real, legible y obtenido sin instalar nada, que es un boceto en bloques de la idea y no una reconstrucción de la imagen. Y llegó tras dos intentos, un montaje manual y una revisión que detectó tres defectos que un laminador podría interpretar mal. Esas dos respuestas rotas describen esta conversación, no lo que Gemini escribe siempre; lo que sí se sostiene es que no conviene dar por bueno el archivo sin revisarlo.

## Qué comprobar en un STL generado antes de llevarlo al laminador

Cuatro cosas, las mismas que fallaron arriba:

- **Malla cerrada (estanca, watertight).** Cada arista debe pertenecer exactamente a dos triángulos. Si no, el laminador no sabe qué es interior y qué es exterior.
- **Normales hacia fuera.** Una pieza con las caras invertidas, como los brazos del robot, puede tratarse como un hueco.
- **Un único sólido.** Varias piezas que se solapan sin estar unidas dependen de cómo las resuelva cada laminador. Pide en el prompt que las partes se unan, o únelas tú en Blender.
- **Medidas.** El STL no guarda unidades ni color: solo triángulos. Mide la caja del modelo al importarlo y compárala con lo que pediste; aquí salieron 70 mm en lugar de 60.

Ninguna de estas comprobaciones se hizo con un laminador ni con Blender en la prueba; se hicieron con un script que mide el archivo. La vista previa por capas del laminador sigue siendo el último control antes de imprimir.

## Deep Think con Google AI Ultra: del boceto al archivo imprimible, sin probar

Hay un modo de Gemini del que Google dice expresamente que genera un archivo para impresión 3D, y está ligado al plan más caro. En el [anuncio de la actualización de Gemini 3 Deep Think](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-deep-think/), del 12 de febrero de 2026, Google explica que Deep Think analiza un dibujo, modela la forma y genera un archivo para fabricar el objeto con una impresora 3D. Está disponible para suscriptores de Google AI Ultra en la app de Gemini.

Google no indica en ese texto el formato del archivo. Según la revista japonesa [CGWORLD](https://cgworld.jp/flashnews/01-202602-Gemini3.html), Deep Think no dibuja la malla directamente: escribe código que define la forma de manera matemática, en lenguajes como OpenSCAD o Python, y lo ejecuta para obtener el sólido. Es el mismo principio que la vía del código de arriba, con un modelo mucho más capaz que 3.6 Flash.

Esta función no se probó por falta del plan Ultra, así que no hay nada que decir sobre la calidad del resultado. Si ya pagas Ultra, es la primera opción que merece un intento para una pieza con medidas, y las cuatro comprobaciones del apartado anterior valen igual.

## Visualización 3D interactiva del modelo Pro: gira en el chat, no se exporta

La función que Google presentó el 9 de abril de 2026 sirve para entender un tema, no para fabricar modelos. Según [su anuncio](https://blog.google/innovation-and-ai/products/gemini-app/3d-models-charts/), la app genera visualizaciones interactivas, simulaciones funcionales para comprender mejor lo que preguntas: se elige el modelo Pro en la barra de escritura y se pide con un «muéstrame» o «ayúdame a visualizar». Se está desplegando para todas las cuentas personales y todavía no está en las cuentas de Education ni de Workspace. El anuncio no menciona exportar archivos 3D ni convertir una imagen subida.

En la prueba, la cuenta sin plan pudo elegir 3.1 Pro y este prompt generó el widget:

```text
Show me an interactive 3D model of a small toy robot shaped like a coffee mug, with two short arms, two feet and an antenna with a ball on top. I want to rotate it.
```

Apareció un panel titulado «MugBot 3D» con un visor, cinco muestras de color, tres botones de animación y un interruptor de vapor, además de un texto que explicaba que se puede arrastrar para girarlo 360 grados y usar la rueda para acercar. Tres observaciones que marcan el límite:

- **Depende del WebGL de tu navegador.** En el navegador de la prueba el visor mostró «3D Viewport Unavailable — Unable to initialize WebGL rendering context»: la pestaña tenía WebGL 1 pero no WebGL 2. El modelo no llegó a verse. Si te ocurre, prueba con otro navegador o revisa la aceleración por hardware.
- **Copiar da una imagen.** El menú bajo el widget tenía dos acciones, copiar y descargar. Copiar dejó en el portapapeles un PNG de 1416 × 1366 píxeles con la apariencia del widget: ni código ni modelo.
- **No hay exportación visible a GLB, STL u OBJ.** La descarga no se pulsó, así que su contenido es una incógnita.

El widget nació de una descripción en texto. Si acepta una foto subida como base de la visualización no está establecido.

## GLB, STL u OBJ: qué formato de archivo 3D pedir según el destino

Elige el formato por lo que vayas a hacer después:

- **GLB** es la forma binaria, en un solo archivo, de [glTF 2.0](https://www.khronos.org/gltf/). Lleva geometría, materiales y texturas juntos. Es lo que conviene para Blender, motores de juego, visores web y realidad aumentada.
- **STL** contiene únicamente triángulos, sin color, textura ni unidades. Es el formato habitual para pasar una pieza al laminador.
- **OBJ** guarda la geometría y deja materiales y texturas en archivos aparte, que deben viajar con él.

Si quieres conservar el color de la imagen, necesitas GLB y un conversor que genere textura. Si solo vas a imprimir en un color, basta un STL, pero entonces importa que la malla esté cerrada.

## Preguntas sobre pasar imágenes de Gemini a 3D

### ¿Lo que gira en el chat de Gemini se puede descargar como modelo 3D?

No se ha visto ninguna opción para ello. La visualización interactiva ofrece copiar, que entrega una imagen PNG del widget, y descargar, cuyo contenido no está comprobado. No aparece ningún botón de exportación a GLB, STL u OBJ.

### ¿Por qué la parte trasera del modelo 3D sale mal?

Porque una sola imagen no la contiene. El conversor ve el frente y un lateral y tiene que inventar el resto. Hunyuan3D-2 dispone de una variante que toma varias vistas como entrada y TRELLIS admite varias imágenes, de modo que la mejora razonable es generar con Gemini vistas adicionales del mismo objeto y dárselas a un modelo que las acepte. Esa combinación no se ha probado aquí.

### ¿Se puede imprimir en 3D la figura que genera Gemini?

No directamente: la figura que genera Gemini es una imagen, por muy tridimensional que parezca. Para imprimirla hace falta pasarla por un conversor de imagen a 3D, exportar un STL y revisar que la malla esté cerrada y tenga la escala que quieres. La fidelidad con la imagen original depende del conversor y no está medida aquí.

### ¿Qué IA convierte dibujos en modelos 3D?

Dentro de Gemini, la única función de la que Google dice que parte de un boceto y genera un archivo imprimible es Deep Think, reservada a Google AI Ultra. Fuera de Gemini, los modelos de imagen a 3D como Hunyuan3D-2 o TRELLIS aceptan una imagen como entrada, y un dibujo limpio sobre fondo liso es una imagen más.

### ¿Hace falta pagar un plan de Google para todo esto?

Para lo ejecutado aquí, no: la generación de la imagen, el código del STL y la visualización con 3.1 Pro funcionaron en una cuenta personal sin plan, dentro de unos límites de uso que no se midieron. Deep Think sí exige Google AI Ultra.
