Si la condición es comprar una GPU nueva con exactamente 16 GB, la GeForce RTX 5070 Ti es la opción más equilibrada para programar con un LLM local. Tiene 16 GB GDDR7, interfaz de 256 bits, 896 GB/s de ancho de banda publicado y un TGP de referencia de 300 W. Se acerca mucho a la ruta de memoria de la RTX 5080 sin subir a sus 360 W.
No siempre es la compra correcta. La RTX 5060 Ti 16GB consume menos y puede bastar para un único desarrollador. La RTX 5080 reduce esperas, pero sigue teniendo 16 GB. Si el modelo, la caché KV y los buffers no caben con el contexto que necesita tu repositorio, ninguna GPU más rápida de 16 GB arreglará el problema: toca comparar 24 GB o una solución alojada.
El resultado debe ser una decisión, no una tabla de TOPS
La comparativa oficial de NVIDIA permite acotar el hardware:
| GPU | Memoria publicada | Potencia de referencia | Cuándo entra en la lista final |
|---|---|---|---|
| RTX 5060 Ti 16GB | GDDR7, 128-bit, 448 GB/s | 180 W TGP | Precio, calor y ruido importan más que la espera |
| RTX 5070 Ti 16GB | GDDR7, 256-bit, 896 GB/s | 300 W TGP | Uso interactivo diario y equilibrio general |
| RTX 5080 16GB | GDDR7, 256-bit, 960 GB/s | 360 W TGP | Todo cabe y cada minuto ahorrado tiene valor alto |
| RTX 4070 Ti SUPER | GDDR6X, 256-bit | 285 W TGP | Hay una oferta o unidad usada verificable |
| RTX 4080 / 4080 SUPER | GDDR6X, 256-bit | 320 W TGP | Cuesta menos que la alternativa nueva cercana |
Estas cifras no son un benchmark de tu modelo. El ancho de banda puede cambiar mucho la generación ligada a memoria, pero el backend, la cuantización y la arquitectura deciden cuánto se aprovecha. Tampoco conviertas el TGP en consumo del PC: es una referencia de la tarjeta para dimensionar alimentación y refrigeración.
La diferencia conceptual es sencilla. Entre 5060 Ti y 5070 Ti compras un camino de memoria mucho más ancho. Entre 5070 Ti y 5080 pagas un incremento menor de 896 a 960 GB/s, más cómputo y más potencia, sin aumentar la capacidad.

La prueba de VRAM se hace con el contexto de trabajo
El fichero cuantizado no está solo en la GPU. Comparte los 16 GB con la caché KV, los buffers de cálculo, el runtime, la pantalla y otros procesos. El tamaño de esa caché cambia según el modelo, el contexto, el batch y las peticiones paralelas.
La documentación actual de longitud de contexto de Ollama fija 4K por defecto para sistemas con menos de 24 GiB de VRAM y avisa de que aumentar la ventana exige más memoria. Durante la tarea real ejecuta:
bashollama ps
Comprueba PROCESSOR y CONTEXT. Un chat corto al 100% GPU no demuestra que una sesión con varios ficheros, salida de herramientas y logs mantenga ese estado. El offload parcial a CPU, un OOM o un salto grande de latencia forman parte del resultado.
Sube el contexto con tres cargas distintas: una corrección acotada con su test cercano; un cambio normal de varios ficheros; y un caso de depuración con logs y reglas del proyecto. Registra pico de VRAM, offload, tiempo hasta la primera salida útil, tiempo total y aceptación final.
Si pasar de 16K a 32K no aumenta la tasa de éxito y solo consume memoria, no has ganado capacidad útil. Si a 16K se pierde un caller necesario y a 32K el parche pasa, la ventana mayor sí completa un trabajo observable. La FAQ de Ollama también explica que el paralelismo multiplica la asignación de contexto; repite el ensayo con la concurrencia que vaya a tener el equipo.
Mide velocidad con un baseline y calidad con el repositorio
llama-bench separa procesamiento del prompt y generación, permite repeticiones y ofrece salida JSON:
bashllama-bench -m model.gguf -p 2048 -n 256 -r 5 -o json
Fija el mismo fichero y checksum, cuantización, build de llama.cpp, contexto, offload, batch, sampling y concurrencia. La propia documentación indica que la medición no incluye tokenización ni sampling, así que sirve como baseline de hardware, no como tiempo total de una tarea de código.
Para medir trabajo aceptado, congela también el commit y define la salida antes de empezar. Un ejemplo útil: corregir un caso fallido del parser, tocar solo el módulo y su test, y ejecutar un unit test y el linter concretos.
Solo cuenta como accepted cuando se cumplen todas las condiciones:
- el comportamiento pedido está implementado;
- tests y comprobaciones estáticas terminan con código 0;
- el diff no sale de los ficheros autorizados;
- no aparecen dependencias, artefactos generados ni reescrituras sin justificar;
- una persona no tiene que rehacer la solución principal.
Usa la misma batería —al menos un cambio pequeño, uno multifichero y una depuración— en todas las tarjetas. Incluye intentos fallidos y reintentos en el tiempo total.
texttasa de aceptación = tareas aceptadas / tareas intentadas tareas aceptadas por hora = tareas aceptadas / horas totales
Una GPU puede mostrar muchos tokens por segundo y producir menos trabajo por hora si pierde contexto, devuelve diffs que no aplican o cae en offload.

La energía se integra hasta que acaban los tests
En NVIDIA puedes registrar una muestra por segundo de VRAM y potencia de la GPU:
bashnvidia-smi \ --query-gpu=timestamp,memory.used,memory.total,power.draw,utilization.gpu \ --format=csv -l 1
Empieza justo antes de la petición y termina cuando finalicen los tests. Si importan la factura, el calor o la fuente, añade un medidor de pared; incluye CPU, ventiladores, almacenamiento y pérdidas de la fuente, elementos que nvidia-smi no ve.
textenergía_kWh = vatios medios de pared × horas / 1000 tareas aceptadas por kWh = tareas aceptadas / energía_kWh
Usa tu tarifa eléctrica real. Comparar solo el pico de vatios penaliza a una tarjeta rápida que termina antes; comparar solo el TGP ignora el tiempo y el resto del sistema.
AMD es una ruta válida cuando el software ya está probado
AMD publica para la Radeon RX 9060 XT 16GB 16 GB GDDR6, hasta 320 GB/s y 160 W de typical board power. Es atractiva por capacidad y potencia, pero esos datos no garantizan que el editor, el modelo y el sistema operativo tengan el mismo recorrido que CUDA.
La página actual de GPU compatibles con Ollama incluye la RX 9060 XT en la lista ROCm de Linux; la lista de Windows nativo y los requisitos de driver son distintos. Las matrices Radeon ROCm también separan Linux, WSL y versiones de frameworks. Antes de comprar, completa una tarea de humo con el OS, driver, runtime build, formato de modelo, contexto e integración de editor exactos. Si el stack termina en CPU, el ahorro de la tarjeta puede desaparecer.
La regla de compra que evita pagar dos veces
NVIDIA publica la RTX 3090 con 24 GB y 350 W de potencia de tarjeta. Una unidad usada puede acercarse al precio de una 16GB rápida, pero añade riesgos de memoria, temperatura, fuente, estado y garantía. Solo es la comparación correcta cuando la capacidad bloquea.
- Si todo cabe y la 5060 Ti 16GB cumple el objetivo de tareas aceptadas por hora, compra la ruta más económica.
- Si cabe pero la espera reduce trabajo diario, compara el sobreprecio de la 5070 Ti con la mejora medida.
- Si cabe y el tiempo vale mucho, considera la 5080 como aceleración, no como ampliación de memoria.
- Si el contexto necesario hace offload u OOM en 16 GB, compara 24 GB o hosted coding.
Después de elegir la clase de hardware, separa la decisión del modelo y la cuantización. La guía vecina de LLM local para programar con 16 GB de VRAM se ocupa de ese paso. Así una tabla de modelos no decide tu memoria y una GPU rápida no disimula un problema de capacidad.



