Saltar al contenido principal

GPT-5.6 Sol vs Claude Fable 5: cuál probar primero para programar

23 min de lecturaComparación de modelos de IA

Sol es la primera prueba para coste ordinario, terminal y herramientas; Fable, para incidencias largas de repositorio. Decide con tres filtros y trabajo aceptado.

Mapa de decisión entre GPT-5.6 Sol y Claude Fable 5 mediante retención, coste real y parches aceptados

No hay un ganador universal entre GPT-5.6 Sol y Claude Fable 5. Prueba Sol en Codex primero si predominan el terminal, las herramientas, la ejecución por lotes o el coste API ordinario. Prueba Fable en Claude Code primero si tu carga se parece a incidencias largas de repositorio o si el equipo ya depende del flujo de Claude. Es un orden de prueba, no un veredicto.

Antes de mirar un benchmark, pasa tres filtros. Elegibilidad: Fable exige 30 días de retención; si eso incumple tu política, la ruta queda descartada. Economía: compara el coste completo de la solicitud y no solo la tarifa de entrada. Trabajo: ejecuta ambas rutas sobre el mismo commit y decide por parches aceptados, regresiones, reintentos y minutos de revisión.

Puerta tempranaPregunta que decide si avanzasConsecuencia
Retención y elegibilidad¿El repositorio puede entrar en una ruta Fable con 30 días de retención y el plan muestra el modelo correcto?Si no, Fable queda fuera antes de medir calidad.
Economía de contexto¿La entrada de Sol queda en ≤272k o supera 272k?Por encima del umbral, OpenAI cobra toda la solicitud a 2× entrada y 1,5× salida: $10/M y $45/M en la tabla estándar.
Forma del trabajo¿Predominan terminal/herramientas o una incidencia larga de repositorio?Empieza por Sol en el primer caso y por Fable en el segundo, pero exige trabajo aceptado para promover.

Estas cifras están en USD por millón de tokens y no son un precio final en euros con IVA para España. La factura real depende del contrato, la región de procesamiento, la caché, los reintentos, el arnés y la revisión.

Condición dominantePrimera hipótesisQué puede confirmarlaCuándo detenerse
Terminal, herramientas, CI o lotes de contexto ordinarioGPT-5.6 Sol en CodexMás parches aceptados con igual o menor revisión y coste totalSi solo mejora la velocidad o una cifra pública, no promociones
Incidencia larga de repositorio o diagnóstico transversalClaude Fable 5 en Claude CodeMejor diagnóstico y diff aceptado sin elevar regresionesSi falla la retención o no puedes atribuir el modelo efectivo, descarta
Tarea focalizada con tests clarosLas dos rutas desde el mismo commitMenos rondas hasta una aceptación conforme a la misma rúbricaCero parches aceptados detiene el piloto; no ocultes el cero en una media
Ventaja limitada a una clase de tareaLa ganadora como especialistaSeñal repetida dentro de esa clase, con rollback probadoConserva el predeterminado general fuera de ese ámbito

La atribución también es una puerta. GPT-5.6 Sol es el modelo y Codex es el entorno agente; Claude Fable 5 es el modelo y Claude Code es el entorno. Si una aplicación Claude redirige una solicitud señalada a Opus 4.8, el resultado pertenece a Opus 4.8. En la API de Anthropic solo existe fallback si el desarrollador lo configura. Un reintento de Codex sobre otro modelo también se registra como otra ejecución. No puntúes un nombre solicitado cuando respondió otro modelo.

La regla de producción es reversible: no cambies la ruta predeterminada hasta que una prueba controlada demuestre más trabajo aceptado sin trasladar el coste a la revisión, la seguridad o las regresiones.

Tres puertas antes de comparar calidad

¿Se pueden usar GPT-5.6 Sol o Claude Fable 5 gratis online?

Puedes probar la familia GPT-5.6 sin pagar, pero la ruta oficial actual es Terra, no Sol. OpenAI indica que Free y Go reciben Terra en ChatGPT Work y Codex, mientras Plus o superior puede elegir Sol, Terra y Luna. La API Sol cobra, en tarifa estándar, $5 por millón de tokens de entrada, $0,50 por entrada en caché, $6,25 por escritura de caché y $30 por salida. Es una API de pago, no un nivel oficial gratuito de Sol.

Anthropic enumera Pro, Max, Team y Enterprise para Fable, no Free. La API oficial claude-fable-5 cuesta $10 por millón de tokens de entrada y $50 por millón de salida. Un sitio que promete “Fable 5 gratis” puede ofrecer crédito de prueba, cuota patrocinada, playground compartido o una pasarela propia. Ese contrato pertenece al tercero hasta que Anthropic diga lo contrario.

Mapa oficial de planes gratuitos, planes de pago, API medidas y comprobaciones de terceros

RutaContrato oficial actualPróximo paso
OpenAI Free / GoGPT-5.6 Terra en ChatGPT Work y CodexNo atribuyas el resultado a Sol
OpenAI Plus o superiorSol, Terra y Luna seleccionablesRegistra modelo efectivo y límites del plan
API de OpenAISol estándar: $5/M entrada, $0,50/M entrada en caché, $6,25/M escritura de caché y $30/M salidaUsa tu proyecto y mide tokens, caché, reintentos y gasto
Claude FreeFable no apareceNo supongas que una pasarela crea un selector gratis
Claude Pro / Max / Team / EnterpriseFable disponibleRegistra el consumo de usage credits
API de ClaudeFable: $10/M entrada y $50/M salidaComprueba la retención obligatoria de 30 días antes de enviar código

Antes de usar una ruta “gratis” de terceros, exige seis campos: proveedor, propietario de la clave, cuota y caducidad, logs y retención, modelo efectivo y cobro tras la prueba. Para si faltan condiciones, si el servicio pide código sensible antes de mostrar su política o si no puede demostrar qué modelo respondió. Una prueba sin coste no crea automáticamente un derecho API gratuito y permanente.

La comparación correcta tiene cuatro capas

Un resultado de Codex frente a Claude Code no es una prueba pura entre dos modelos. Cada ejecución combina al menos cuatro capas, y cualquiera de ellas puede explicar la diferencia:

  1. Modelo solicitado. GPT-5.6 Sol o Claude Fable 5.
  2. Entorno agente. Codex o Claude Code decide cómo inspeccionar archivos, llamar herramientas, pedir permisos, mantener contexto y verificar el cambio.
  3. Ruta de facturación. Suscripción, créditos del plan o tokens de API. Estas unidades no se pueden comparar como si fueran equivalentes.
  4. Modelo efectivo. El modelo que realmente generó la respuesta después de una redirección de salvaguarda, un fallback configurado o un reintento.

Esta separación evita dos errores frecuentes. El primero es llamar “Codex” al modelo GPT-5.6 Sol: Codex es el entorno de programación donde Sol puede ejecutarse, no el nombre del modelo. El segundo es tratar “Claude Code Fable 5” como un solo producto: el nombre oficial es Claude Fable 5, y puede usarse dentro de Claude Code.

También cambia la forma de leer una victoria. Si Sol produce un parche mejor dentro de Codex, la explicación puede estar en el modelo, en la selección de herramientas, en los permisos, en la estrategia de verificación o en la combinación. Si Fable resuelve una incidencia dentro de Claude Code, registra de la misma manera el arnés, el plan, los comandos y el modelo efectivo. Sin esas cuatro columnas, el resultado sirve como anécdota, no como decisión de producción.

Cuando la pregunta sea sobre planes, límites, velocidad, permisos y trabajo de equipo de los productos completos, la comparación más amplia está en Claude Code vs Codex. Aquí el alcance es más estrecho: elegir entre la ruta Sol-en-Codex y la ruta Fable-en-Claude-Code para un lote concreto.

De la forma del trabajo al primer piloto

Los benchmarks pueden sugerir dónde empezar, pero el router debe describir el trabajo real. Antes de ejecutar nada, clasifica el lote por su cuello de botella principal.

Carga de trabajoHipótesis inicialLote representativoSeñal que puede cambiar la decisión
Comandos de terminal, migraciones, herramientas encadenadas y CISol en CodexTres cambios que exijan inspección, edición, ejecución y correcciónMás parches aceptados con igual o menor revisión y coste
Diagnóstico de repositorio grande, historia extensa o dependencias cruzadasFable en Claude CodeDos incidencias que obliguen a reunir contexto antes de editarDiagnóstico correcto con diff pequeño y sin omisiones
Bug focalizado con tests clarosPrueba ambas rutasMisma incidencia, mismo commit y misma prueba de aceptaciónMenos rondas hasta un parche aprobado
Refactor por lotes sensible al costeSol en Codex como primera hipótesisEntre ocho y doce cambios comparablesMenor coste por cambio aceptado, no solo menor precio por token
Revisión arquitectónica prolongadaFable en Claude Code como primera hipótesisSesión con mapa de módulos, riesgos y plan ejecutableMenos correcciones humanas y mejor cobertura de dependencias
Ciberseguridad o biología con señales sensiblesAislar del lote normalCaso separado con registro de salvaguardasModelo efectivo, motivo de redirección y resultado de la ruta alternativa

“Primera hipótesis” no significa “ganador”. Significa que el coste de obtener evidencia útil es menor si empiezas por esa ruta. La ventaja provisional de Sol en tareas terminales no garantiza un mejor diseño de repositorio; la amplitud de contexto de Fable no garantiza un parche aceptable.

No uses una tarea espectacular y única. Un modelo puede destacar en una migración grande y fallar en correcciones rutinarias, o al revés. El lote mínimo debe incluir trabajo fácil, medio y difícil, además de una tarea que normalmente produzca reintentos. Así se ve si la ruta mejora el flujo habitual o solo un caso llamativo.

Contrato oficial vigente: acceso, precio y salvaguardas

Los datos siguientes se comprobaron el 21 de julio de 2026. Son volátiles: acceso, créditos, precio, disponibilidad, configuración de razonamiento y comportamiento de salvaguardas deben volver a comprobarse antes de una migración futura.

ElementoGPT-5.6 SolClaude Fable 5Consecuencia operativa
EstadoLa familia GPT-5.6 está disponible en los productos indicados por OpenAI y en la APIAnthropic presenta Fable 5 para sus planes de pago indicados y para la plataforma APIComprueba plan, región, workspace y permisos de administración antes del piloto
Identificador APIgpt-5.6-solclaude-fable-5Registra el identificador solicitado y el modelo efectivo
Precio API de entrada$5 por millón; $0,50 en caché y $6,25 por escritura de caché en tarifa estándar$10 por millónSol parte con menor precio unitario ordinario, pero la caché y el tokenizer cambian la factura real
Precio API de salida$30 por millón de tokens$50 por millón de tokensEl ahorro teórico importa solo si el cambio termina aceptado
Entrada extensaPor encima de 272.000 tokens de entrada, la documentación aplica 2× a la entrada y 1,5× a la salida de toda la solicitudTarifa base documentada dentro de su ventana de 1 millónRecalcula la solicitud completa al cruzar el umbral; no extrapoles la tarifa corta
Contexto y salidaVerifica los límites de la ruta y las funciones usadas en la documentación actual de OpenAI1 millón de tokens de contexto y hasta 128.000 de salidaEl contexto nominal no garantiza que el parche sea aceptable
RetenciónDepende del contrato y superficie de OpenAI usadosRetención obligatoria de 30 días; no hay opción de cero retenciónRevisa requisitos de datos antes de copiar un repositorio sensible
PlanesFree y Go usan Terra; Plus, Pro, Business y Enterprise pueden seleccionar Sol, Terra y LunaFable figura para Pro, Max, Team y EnterpriseNo conviertas cuotas o créditos de producto en un precio API inventado
SalvaguardasLa política conservadora de Sol puede causar fricción benigna; ChatGPT y Codex pueden ofrecer un reintento en un modelo de menor capacidadSolicitudes marcadas de ciberseguridad o biología en aplicaciones Claude, incluido Claude Code, pueden pasar a Opus 4.8; el usuario puede desactivar el cambio automáticoAtribuye y puntúa cada ruta según el modelo efectivo
Fallback APIUn reintento de menor capacidad se cuenta como otra rutaLa API solo cambia si el desarrollador configura Fallback API explícitamenteNo supongas que una llamada API a Fable se convirtió sola en Opus

Los propietarios factuales son las páginas oficiales: el lanzamiento de GPT-5.6 de OpenAI, la documentación de modelos de Codex, la ficha de GPT-5.6 Sol con el umbral de 272k, la tabla de precios de OpenAI, la página oficial de Claude Fable 5 y la documentación de modelos de Anthropic.

El precio API no es el coste total del agente. Debes sumar tokens de todos los intentos, herramientas externas, CI y revisión humana. Tampoco conviertas una cuota de suscripción en un precio por token inventado: son contratos distintos, con límites y rutas de cobro diferentes.

Hay además una advertencia de migración que puede distorsionar cualquier hoja de cálculo histórica. Fable 5 usa el tokenizer introducido con Opus 4.7; Anthropic estima aproximadamente un 30% más de tokens que los modelos anteriores a Opus 4.7 para el mismo texto, aunque el aumento real depende del contenido. No multipliques por 1,3 como si fuera una garantía: cuenta el payload real con claude-fable-5, incluida la parte que el arnés añade por ti.

Los benchmarks dividen el resultado, no el trabajo

La tabla de lanzamiento de OpenAI ofrece cuatro señales direccionales. No constituye una competición controlada entre Codex y Claude Code, y sus cifras siguen perteneciendo al proveedor que las publicó.

Benchmark publicado por OpenAIGPT-5.6 SolClaude Fable 5Qué sugiereLímite metodológico
Artificial Analysis Coding Agent Index v1.180,077,2Sol puede ser una buena primera prueba para trabajo agente generalOpenAI etiqueta el resultado de Sol con razonamiento max
SWE-Bench Pro64,6%80,0%Fable merece el primer piloto para incidencias de repositorio tipo SWENo se publica suficiente detalle de arnés y razonamiento idéntico
DeepSWE v1.172,7%69,7%Sol parte con una ligera ventaja en ese conjuntoNo demuestra el comportamiento dentro de tu repositorio ni de tu agente
Terminal-Bench 2.188,8%83,1%Sol es la hipótesis natural para terminal y herramientasUna ventaja de benchmark no mide revisión, permisos ni coste aceptado

La reversión de filas es el dato importante. Fable lidera SWE-Bench Pro, mientras Sol lidera Artificial Analysis, DeepSWE y Terminal-Bench. Si alguien resume la tabla con una sola palabra —“gana”— elimina precisamente la información que sirve para diseñar el piloto.

La configuración también importa. OpenAI identifica max como el nivel de razonamiento para el resultado de Sol en Artificial Analysis. Las otras filas no exponen una configuración cruzada suficientemente idéntica para afirmar que la diferencia procede solo del modelo. Además, las estimaciones de latencia y coste API de la página de lanzamiento son simulaciones basadas en comportamiento de producción; el resultado real puede variar.

Usa cada fila para elegir tareas, no para evitar la prueba. Terminal-Bench justifica incluir comandos, herramientas y validación en el lote de Sol. SWE-Bench Pro justifica incluir incidencias de repositorio en el lote de Fable. DeepSWE y Artificial Analysis añaden hipótesis, pero ninguna sustituye la evidencia del mismo commit.

Diseña una prueba controlada en el mismo repositorio

Una comparación útil empieza con una carpeta de evidencia, no con dos sesiones improvisadas. Congela primero los insumos:

  • el mismo repositorio y el mismo commit;
  • el mismo enunciado, archivos de contexto y criterios de aceptación;
  • las mismas herramientas disponibles y las mismas versiones;
  • los mismos permisos de lectura, escritura, red y ejecución;
  • los mismos tests, lint, build y comandos de verificación;
  • el mismo orden de tareas para evitar que una ruta reciba casos más fáciles;
  • la misma rúbrica de revisión;
  • un presupuesto, límite de tiempo y política de reintentos;
  • una ruta de rollback ya ensayada.

Kit para fijar repositorio, prompt, herramientas, permisos y pruebas, y medir parches aceptados, reintentos, tokens, latencia y revisión

Después construye un lote representativo. Un ejemplo compacto para un equipo de producto:

  1. corregir un bug focalizado con test que primero falla;
  2. localizar una regresión que cruza dos módulos;
  3. actualizar una dependencia y resolver incompatibilidades;
  4. refactorizar una API interna sin cambiar comportamiento;
  5. añadir una validación con casos límite;
  6. ejecutar una migración mediante terminal y comprobar el resultado;
  7. explicar un fallo sin editar, para medir calidad diagnóstica;
  8. producir un parche pequeño a partir de una base de código extensa.

Alterna la ruta que empieza cada pareja de tareas. Si Sol siempre va primero, puede revelar información que después beneficia a Fable; si Fable siempre va primero, ocurre lo contrario. Usa ramas limpias desde el mismo commit y no compartas entre rutas un diagnóstico generado por la otra.

Ficha de evidencia para cada ejecución

No basta con guardar el diff. Rellena la misma ficha para Sol y Fable antes de mirar cuál “parece” mejor:

CampoQué registrarPor qué cambia la decisión
Ruta y atribuciónModelo solicitado, modelo efectivo, versión de Codex o Claude Code, razonamiento, fallback y vía de facturaciónEvita atribuir al modelo un resultado producido por otro modelo o por el arnés
ControlesCommit inicial, prompt, archivos de contexto, herramientas, permisos, tests y límite de reintentosPermite comparar rutas completas sin que la segunda herede pistas de la primera
ConsumoTokens de entrada, caché y salida; herramientas, CI, latencia y todos los reintentosConvierte la tarifa publicada en gasto observado
RevisiónMinutos humanos, archivos fuera de alcance, defectos y regresionesExpone el coste que una factura API baja puede trasladar al equipo
ResultadoAceptado o rechazado, motivo, reversión ejecutada y resultado del rollbackSolo el trabajo aceptado y reversible entra en el denominador

Un parche que compila pero viola una condición de aceptación no cuenta como aceptado. Guarda la transcripción y los comandos como evidencia auxiliar, pero no confundas volumen de log con calidad.

La verificación termina en el repositorio:

  1. inspecciona el diff y archivos no previstos;
  2. ejecuta tests de aceptación y regresión;
  3. revisa seguridad, dependencias y cambios de configuración;
  4. comprueba que los logs identifican la ruta efectiva;
  5. mide el tiempo humano necesario para entender y aprobar el cambio;
  6. revierte la rama de prueba para demostrar que el rollback funciona.

Calcula coste por trabajo aceptado

El precio por millón de tokens sirve para presupuestar llamadas, pero puede premiar una ruta que genera mucho código barato y poco código aprobable. La unidad de decisión debe ser el cambio aceptado.

Coste por cambio aceptado = (gasto medido de todos los primeros intentos y reintentos + comisiones externas de herramientas o CI + coste del tiempo de revisión) ÷ número de parches aceptados

Cuenta cada consumo una sola vez. Si un primer intento cuesta $0,40 y el reintento cuesta $0,25, el numerador añade $0,65, no $0,40, $0,25 y una tercera cifra llamada “coste de retry”. Si una redirección ejecuta otro modelo, asigna ese consumo al modelo y ruta efectivos.

El tiempo de revisión necesita una tarifa interna consistente. No hace falta publicar el salario: basta con una unidad estable, como minutos de revisor o coste estándar por hora. Lo importante es no llamar “barata” a una ruta que ahorra tokens pero exige cuarenta minutos extra para reparar el diff.

Una regla de equilibrio hace visible ese intercambio. Si el coste cargado de una persona revisora es de $120 por hora, cada $1 adicional de modelo tiene que ahorrar al menos 30 segundos de revisión solo para empatar:

Segundos que debe ahorrar = (dólares adicionales del modelo ÷ coste horario del revisor) × 3.600

Sustituye $120 por tu coste interno y usa el gasto observado del lote, no una tarifa teórica. Esta cuenta no perdona una regresión, una violación de retención ni una tasa de aceptación inferior: esos son vetos separados, no variables que se compensan con segundos.

Un ejemplo:

RutaGasto medido y feesRevisiónParches aceptadosLectura correcta
Sol en Codex$1290 min8Calcula sobre ocho cambios, incluyendo todos los reintentos
Fable en Claude Code$1855 min9El mayor coste API puede compensarse si baja revisión y sube aceptación

No compares la columna de dólares sin asignar valor al tiempo humano. Tampoco concluyas con una media si una ruta produjo cero parches aceptados. En ese caso, detén el lote, márcalo como fallido e investiga la causa; dividir por cero u ocultarlo dentro de un promedio destruye la señal de riesgo.

Además del coste medio, observa dispersión y cola: una ruta que funciona nueve veces pero produce un décimo cambio peligrosamente grande puede ser peor predeterminado que una ruta ligeramente más lenta y predecible. Registra regresiones, archivos tocados fuera de alcance y necesidad de intervención manual.

Decide entre promover, mantener especialista, fallback o revertir

El final de un piloto no es una elección binaria. Hay cuatro rutas de producción, y solo una cambia el predeterminado.

Tablero de decisión para promover, mantener como especialista, conservar fallback o revertir, con la regla de no cambiar sin rollback

DecisiónCuándo aplicarlaAcciónCondición de salida
PromoverSube la tasa de parches aceptados, no empeoran regresiones ni revisión y baja o mantiene el coste aceptadoDespliegue gradual por equipo o tipo de tareaPausa si supera el presupuesto o rompe la rúbrica
Mantener especialistaGana con claridad solo terminal, contexto largo u otra clase concretaEnruta esa clase a la ruta ganadora; conserva el predeterminado generalRevisa la regla cuando cambien modelo, arnés o repositorio
Conservar fallback operativoLa ruta actual sigue siendo la más estable o necesitas continuidadMantén una ruta ya validada y documenta cómo activarlaPrueba periódicamente que sigue funcionando
RevertirEmpeoran calidad, seguridad, aceptación, revisión o costeVuelve al predeterminado anterior y conserva el paquete de evidenciaReabre el piloto solo con una hipótesis nueva

Aquí fallback operativo significa una ruta de producción elegida y validada por tu equipo. No es lo mismo que Fallback API de Anthropic, el cambio automático de una aplicación Claude o el reintento de salvaguarda que puede ofrecer Codex. Esas rutas automáticas modifican el modelo efectivo y deben aparecer como ejecuciones separadas.

Promueve de forma gradual. Empieza por una clase de tareas, un repositorio o un equipo pequeño. Mantén el predeterminado anterior accesible, registra qué versión del modelo y agente fue aprobada y define un umbral de rollback. Sin una ruta de vuelta probada, no hay cambio responsable del predeterminado.

Un buen resultado también puede ser “dos especialistas”. Sol en Codex puede quedar como ruta para terminal y lotes sensibles al coste, mientras Fable en Claude Code se reserva para diagnósticos largos. Esta división suele conservar más valor que forzar una única herramienta para todos los trabajos.

Errores que invalidan la comparación

La mayoría de las comparaciones débiles fallan antes de medir el primer parche. Evita estos patrones:

  • Confundir nombres. GPT-5.6 Sol no se llama Codex; Claude Fable 5 no se llama Claude Code.
  • Cambiar dos variables a la vez y atribuir todo al modelo. Si cambias modelo y agente, el resultado pertenece a la ruta completa.
  • Mezclar API con suscripciones. Los precios por token y las cuotas o créditos del producto no comparten unidad.
  • Omitir el modelo efectivo. Una respuesta de Opus 4.8 no es evidencia de Fable; un reintento de menor capacidad no es evidencia de Sol.
  • Comparar commits distintos. Un repositorio modificado por la primera ruta puede facilitar la segunda.
  • Contar código generado. Mide parches aceptados después de tests y revisión.
  • Ocultar reintentos. Cada gasto entra una sola vez en el numerador y cada intento queda asociado a su ruta.
  • Ignorar el cero. Cero cambios aceptados detiene el lote; no se suaviza con una media.
  • Usar una única tarea. Un caso llamativo no describe la distribución normal del equipo.
  • Cambiar sin rollback. Si no puedes volver, todavía no tienes un piloto de producción.

Otra señal de mala comparación es el resultado sin contexto. “Fable resolvió más issues” no basta si recibió más tiempo, herramientas distintas o una rúbrica más indulgente. “Sol costó menos” tampoco basta si el revisor tuvo que rehacer la mitad del cambio. Conserva los controles y la evidencia junto al veredicto.

Preguntas frecuentes

¿El nombre correcto es “Codex 5.6”?

No. GPT-5.6 Sol es el modelo y Codex es el entorno agente de programación. La forma precisa para esta ruta es “GPT-5.6 Sol en Codex”.

¿“Claude Code Fable 5” es un único producto?

No. El nombre oficial del modelo es Claude Fable 5, con identificador API claude-fable-5. Claude Code es el agente donde puede usarse. La forma precisa es “Claude Fable 5 en Claude Code”.

¿GPT-5.6 Sol y Claude Fable 5 están disponibles ahora?

Sí, en la comprobación del 21 de julio de 2026 ambas rutas estaban disponibles. OpenAI ofrece Sol en la API y como opción para Plus, Pro, Business y Enterprise; Free y Go reciben Terra. Anthropic enumera Fable para Pro, Max, Team y Enterprise y en Claude Platform. Plan, región, workspace, créditos y permisos pueden cambiar, así que vuelve a comprobarlos antes de contratar o migrar.

¿Cuál es más barato en la API?

Según los precios oficiales comprobados el 21 de julio, la tarifa estándar de Sol es $5 por millón de entrada, $0,50 de entrada en caché, $6,25 por escritura de caché y $30 de salida; Fable cuesta $10 de entrada y $50 de salida. Por encima de 272.000 tokens de entrada, recalcula la solicitud completa de Sol con su multiplicador documentado. Además, cuenta el payload real de Fable: su tokenizer puede producir aproximadamente un 30% más de tokens que los modelos anteriores a Opus 4.7. La decisión económica final sigue siendo coste por parche aceptado, con reintentos, herramientas, CI y revisión.

¿El contexto de un millón de tokens hace que Fable sea siempre mejor?

No. Fable ofrece un contexto de 1 millón de tokens y hasta 128.000 tokens de salida, lo que justifica probarlo primero en diagnóstico amplio. Aun así, más contexto no garantiza un diff pequeño, tests aprobados ni menor carga de revisión.

¿Qué modelo gana los benchmarks de programación?

No hay un barrido. En la tabla publicada por OpenAI, Fable lidera SWE-Bench Pro, mientras Sol lidera Artificial Analysis Coding Agent Index v1.1, DeepSWE v1.1 y Terminal-Bench 2.1. Son señales del proveedor con límites de arnés y razonamiento; sirven para elegir tareas del piloto, no para declarar que una ruta es superior para todos.

¿Claude Code puede cambiar Fable por Opus 4.8?

Sí. Anthropic explica que solicitudes marcadas de ciberseguridad o biología en aplicaciones Claude, incluido Claude Code, pueden cambiar automáticamente a Claude Opus 4.8, y el usuario puede desactivar ese cambio. Registra Opus 4.8 como modelo efectivo y atribuye el resultado y coste a esa ruta.

¿Una llamada API a Fable cambia automáticamente a Opus 4.8?

No por el simple hecho de seleccionar Fable. En la API, el cambio ocurre solo si el desarrollador configura explícitamente Fallback API. Si no existe esa configuración, no asumas una redirección de aplicación en la API.

¿Qué significa un reintento de menor capacidad en Codex?

OpenAI advierte que las salvaguardas conservadoras de Sol pueden crear fricción en usos benignos y que ChatGPT o Codex pueden ofrecer un reintento sobre un modelo de menor capacidad. Ese resultado se atribuye al modelo que realmente se ejecutó y se puntúa como ruta separada.

¿Cuánto debe durar la prueba con el mismo repositorio?

Hasta cubrir un lote representativo y obtener señal repetible. Para un equipo pequeño, entre ocho y doce tareas repartidas entre dificultad fácil, media y alta suele ser más informativo que una sola demo. Fija antes presupuesto, tiempo, política de reintentos y criterio de aceptación.

¿Cuándo debo cambiar la ruta predeterminada?

Solo cuando la nueva ruta aumenta los parches aceptados sin empeorar regresiones, seguridad, carga de revisión ni coste por trabajo aceptado. Promueve gradualmente y conserva una ruta de rollback. Si gana únicamente una clase de tarea, úsala como especialista.

¿Qué hago si ninguna ruta produce un parche aceptado?

Detén el lote y márcalo como fallido. No dividas por cero ni combines ese resultado con otras tareas para ocultarlo. Revisa permisos, prompt, herramientas, criterios de aceptación y posibles redirecciones antes de formular una nueva hipótesis.

Una decisión útil sigue siendo reversible

El primer movimiento razonable es pequeño: selecciona un lote de tareas representativas, congela los controles y prueba Sol en Codex para terminal o coste, y Fable en Claude Code para contexto largo o diagnóstico. Registra siempre modelo solicitado, agente, facturación y modelo efectivo.

Después decide con trabajo aceptado. Promueve solo la ruta que mejore calidad y economía sin trasladar el coste a revisores o seguridad; mantén especialistas donde aporten ventaja y conserva un fallback operativo validado. Si no existe un rollback comprobado, conserva el predeterminado actual.

#GPT-5.6 Sol#Claude Fable 5#Codex#Claude Code#agentes de programación
Share: