No hay un ganador universal entre GPT-5.6 Sol y Claude Fable 5. Prueba Sol en Codex primero si predominan el terminal, las herramientas, la ejecución por lotes o el coste API ordinario. Prueba Fable en Claude Code primero si tu carga se parece a incidencias largas de repositorio o si el equipo ya depende del flujo de Claude. Es un orden de prueba, no un veredicto.
Antes de mirar un benchmark, pasa tres filtros. Elegibilidad: Fable exige 30 días de retención; si eso incumple tu política, la ruta queda descartada. Economía: compara el coste completo de la solicitud y no solo la tarifa de entrada. Trabajo: ejecuta ambas rutas sobre el mismo commit y decide por parches aceptados, regresiones, reintentos y minutos de revisión.
| Puerta temprana | Pregunta que decide si avanzas | Consecuencia |
|---|---|---|
| Retención y elegibilidad | ¿El repositorio puede entrar en una ruta Fable con 30 días de retención y el plan muestra el modelo correcto? | Si no, Fable queda fuera antes de medir calidad. |
| Economía de contexto | ¿La entrada de Sol queda en ≤272k o supera 272k? | Por encima del umbral, OpenAI cobra toda la solicitud a 2× entrada y 1,5× salida: $10/M y $45/M en la tabla estándar. |
| Forma del trabajo | ¿Predominan terminal/herramientas o una incidencia larga de repositorio? | Empieza por Sol en el primer caso y por Fable en el segundo, pero exige trabajo aceptado para promover. |
Estas cifras están en USD por millón de tokens y no son un precio final en euros con IVA para España. La factura real depende del contrato, la región de procesamiento, la caché, los reintentos, el arnés y la revisión.
| Condición dominante | Primera hipótesis | Qué puede confirmarla | Cuándo detenerse |
|---|---|---|---|
| Terminal, herramientas, CI o lotes de contexto ordinario | GPT-5.6 Sol en Codex | Más parches aceptados con igual o menor revisión y coste total | Si solo mejora la velocidad o una cifra pública, no promociones |
| Incidencia larga de repositorio o diagnóstico transversal | Claude Fable 5 en Claude Code | Mejor diagnóstico y diff aceptado sin elevar regresiones | Si falla la retención o no puedes atribuir el modelo efectivo, descarta |
| Tarea focalizada con tests claros | Las dos rutas desde el mismo commit | Menos rondas hasta una aceptación conforme a la misma rúbrica | Cero parches aceptados detiene el piloto; no ocultes el cero en una media |
| Ventaja limitada a una clase de tarea | La ganadora como especialista | Señal repetida dentro de esa clase, con rollback probado | Conserva el predeterminado general fuera de ese ámbito |
La atribución también es una puerta. GPT-5.6 Sol es el modelo y Codex es el entorno agente; Claude Fable 5 es el modelo y Claude Code es el entorno. Si una aplicación Claude redirige una solicitud señalada a Opus 4.8, el resultado pertenece a Opus 4.8. En la API de Anthropic solo existe fallback si el desarrollador lo configura. Un reintento de Codex sobre otro modelo también se registra como otra ejecución. No puntúes un nombre solicitado cuando respondió otro modelo.
La regla de producción es reversible: no cambies la ruta predeterminada hasta que una prueba controlada demuestre más trabajo aceptado sin trasladar el coste a la revisión, la seguridad o las regresiones.
Tres puertas antes de comparar calidad
¿Se pueden usar GPT-5.6 Sol o Claude Fable 5 gratis online?
Puedes probar la familia GPT-5.6 sin pagar, pero la ruta oficial actual es Terra, no Sol. OpenAI indica que Free y Go reciben Terra en ChatGPT Work y Codex, mientras Plus o superior puede elegir Sol, Terra y Luna. La API Sol cobra, en tarifa estándar, $5 por millón de tokens de entrada, $0,50 por entrada en caché, $6,25 por escritura de caché y $30 por salida. Es una API de pago, no un nivel oficial gratuito de Sol.
Anthropic enumera Pro, Max, Team y Enterprise para Fable, no Free. La API oficial claude-fable-5 cuesta $10 por millón de tokens de entrada y $50 por millón de salida. Un sitio que promete “Fable 5 gratis” puede ofrecer crédito de prueba, cuota patrocinada, playground compartido o una pasarela propia. Ese contrato pertenece al tercero hasta que Anthropic diga lo contrario.

| Ruta | Contrato oficial actual | Próximo paso |
|---|---|---|
| OpenAI Free / Go | GPT-5.6 Terra en ChatGPT Work y Codex | No atribuyas el resultado a Sol |
| OpenAI Plus o superior | Sol, Terra y Luna seleccionables | Registra modelo efectivo y límites del plan |
| API de OpenAI | Sol estándar: $5/M entrada, $0,50/M entrada en caché, $6,25/M escritura de caché y $30/M salida | Usa tu proyecto y mide tokens, caché, reintentos y gasto |
| Claude Free | Fable no aparece | No supongas que una pasarela crea un selector gratis |
| Claude Pro / Max / Team / Enterprise | Fable disponible | Registra el consumo de usage credits |
| API de Claude | Fable: $10/M entrada y $50/M salida | Comprueba la retención obligatoria de 30 días antes de enviar código |
Antes de usar una ruta “gratis” de terceros, exige seis campos: proveedor, propietario de la clave, cuota y caducidad, logs y retención, modelo efectivo y cobro tras la prueba. Para si faltan condiciones, si el servicio pide código sensible antes de mostrar su política o si no puede demostrar qué modelo respondió. Una prueba sin coste no crea automáticamente un derecho API gratuito y permanente.
La comparación correcta tiene cuatro capas
Un resultado de Codex frente a Claude Code no es una prueba pura entre dos modelos. Cada ejecución combina al menos cuatro capas, y cualquiera de ellas puede explicar la diferencia:
- Modelo solicitado. GPT-5.6 Sol o Claude Fable 5.
- Entorno agente. Codex o Claude Code decide cómo inspeccionar archivos, llamar herramientas, pedir permisos, mantener contexto y verificar el cambio.
- Ruta de facturación. Suscripción, créditos del plan o tokens de API. Estas unidades no se pueden comparar como si fueran equivalentes.
- Modelo efectivo. El modelo que realmente generó la respuesta después de una redirección de salvaguarda, un fallback configurado o un reintento.
Esta separación evita dos errores frecuentes. El primero es llamar “Codex” al modelo GPT-5.6 Sol: Codex es el entorno de programación donde Sol puede ejecutarse, no el nombre del modelo. El segundo es tratar “Claude Code Fable 5” como un solo producto: el nombre oficial es Claude Fable 5, y puede usarse dentro de Claude Code.
También cambia la forma de leer una victoria. Si Sol produce un parche mejor dentro de Codex, la explicación puede estar en el modelo, en la selección de herramientas, en los permisos, en la estrategia de verificación o en la combinación. Si Fable resuelve una incidencia dentro de Claude Code, registra de la misma manera el arnés, el plan, los comandos y el modelo efectivo. Sin esas cuatro columnas, el resultado sirve como anécdota, no como decisión de producción.
Cuando la pregunta sea sobre planes, límites, velocidad, permisos y trabajo de equipo de los productos completos, la comparación más amplia está en Claude Code vs Codex. Aquí el alcance es más estrecho: elegir entre la ruta Sol-en-Codex y la ruta Fable-en-Claude-Code para un lote concreto.
De la forma del trabajo al primer piloto
Los benchmarks pueden sugerir dónde empezar, pero el router debe describir el trabajo real. Antes de ejecutar nada, clasifica el lote por su cuello de botella principal.
| Carga de trabajo | Hipótesis inicial | Lote representativo | Señal que puede cambiar la decisión |
|---|---|---|---|
| Comandos de terminal, migraciones, herramientas encadenadas y CI | Sol en Codex | Tres cambios que exijan inspección, edición, ejecución y corrección | Más parches aceptados con igual o menor revisión y coste |
| Diagnóstico de repositorio grande, historia extensa o dependencias cruzadas | Fable en Claude Code | Dos incidencias que obliguen a reunir contexto antes de editar | Diagnóstico correcto con diff pequeño y sin omisiones |
| Bug focalizado con tests claros | Prueba ambas rutas | Misma incidencia, mismo commit y misma prueba de aceptación | Menos rondas hasta un parche aprobado |
| Refactor por lotes sensible al coste | Sol en Codex como primera hipótesis | Entre ocho y doce cambios comparables | Menor coste por cambio aceptado, no solo menor precio por token |
| Revisión arquitectónica prolongada | Fable en Claude Code como primera hipótesis | Sesión con mapa de módulos, riesgos y plan ejecutable | Menos correcciones humanas y mejor cobertura de dependencias |
| Ciberseguridad o biología con señales sensibles | Aislar del lote normal | Caso separado con registro de salvaguardas | Modelo efectivo, motivo de redirección y resultado de la ruta alternativa |
“Primera hipótesis” no significa “ganador”. Significa que el coste de obtener evidencia útil es menor si empiezas por esa ruta. La ventaja provisional de Sol en tareas terminales no garantiza un mejor diseño de repositorio; la amplitud de contexto de Fable no garantiza un parche aceptable.
No uses una tarea espectacular y única. Un modelo puede destacar en una migración grande y fallar en correcciones rutinarias, o al revés. El lote mínimo debe incluir trabajo fácil, medio y difícil, además de una tarea que normalmente produzca reintentos. Así se ve si la ruta mejora el flujo habitual o solo un caso llamativo.
Contrato oficial vigente: acceso, precio y salvaguardas
Los datos siguientes se comprobaron el 21 de julio de 2026. Son volátiles: acceso, créditos, precio, disponibilidad, configuración de razonamiento y comportamiento de salvaguardas deben volver a comprobarse antes de una migración futura.
| Elemento | GPT-5.6 Sol | Claude Fable 5 | Consecuencia operativa |
|---|---|---|---|
| Estado | La familia GPT-5.6 está disponible en los productos indicados por OpenAI y en la API | Anthropic presenta Fable 5 para sus planes de pago indicados y para la plataforma API | Comprueba plan, región, workspace y permisos de administración antes del piloto |
| Identificador API | gpt-5.6-sol | claude-fable-5 | Registra el identificador solicitado y el modelo efectivo |
| Precio API de entrada | $5 por millón; $0,50 en caché y $6,25 por escritura de caché en tarifa estándar | $10 por millón | Sol parte con menor precio unitario ordinario, pero la caché y el tokenizer cambian la factura real |
| Precio API de salida | $30 por millón de tokens | $50 por millón de tokens | El ahorro teórico importa solo si el cambio termina aceptado |
| Entrada extensa | Por encima de 272.000 tokens de entrada, la documentación aplica 2× a la entrada y 1,5× a la salida de toda la solicitud | Tarifa base documentada dentro de su ventana de 1 millón | Recalcula la solicitud completa al cruzar el umbral; no extrapoles la tarifa corta |
| Contexto y salida | Verifica los límites de la ruta y las funciones usadas en la documentación actual de OpenAI | 1 millón de tokens de contexto y hasta 128.000 de salida | El contexto nominal no garantiza que el parche sea aceptable |
| Retención | Depende del contrato y superficie de OpenAI usados | Retención obligatoria de 30 días; no hay opción de cero retención | Revisa requisitos de datos antes de copiar un repositorio sensible |
| Planes | Free y Go usan Terra; Plus, Pro, Business y Enterprise pueden seleccionar Sol, Terra y Luna | Fable figura para Pro, Max, Team y Enterprise | No conviertas cuotas o créditos de producto en un precio API inventado |
| Salvaguardas | La política conservadora de Sol puede causar fricción benigna; ChatGPT y Codex pueden ofrecer un reintento en un modelo de menor capacidad | Solicitudes marcadas de ciberseguridad o biología en aplicaciones Claude, incluido Claude Code, pueden pasar a Opus 4.8; el usuario puede desactivar el cambio automático | Atribuye y puntúa cada ruta según el modelo efectivo |
| Fallback API | Un reintento de menor capacidad se cuenta como otra ruta | La API solo cambia si el desarrollador configura Fallback API explícitamente | No supongas que una llamada API a Fable se convirtió sola en Opus |
Los propietarios factuales son las páginas oficiales: el lanzamiento de GPT-5.6 de OpenAI, la documentación de modelos de Codex, la ficha de GPT-5.6 Sol con el umbral de 272k, la tabla de precios de OpenAI, la página oficial de Claude Fable 5 y la documentación de modelos de Anthropic.
El precio API no es el coste total del agente. Debes sumar tokens de todos los intentos, herramientas externas, CI y revisión humana. Tampoco conviertas una cuota de suscripción en un precio por token inventado: son contratos distintos, con límites y rutas de cobro diferentes.
Hay además una advertencia de migración que puede distorsionar cualquier hoja de cálculo histórica. Fable 5 usa el tokenizer introducido con Opus 4.7; Anthropic estima aproximadamente un 30% más de tokens que los modelos anteriores a Opus 4.7 para el mismo texto, aunque el aumento real depende del contenido. No multipliques por 1,3 como si fuera una garantía: cuenta el payload real con claude-fable-5, incluida la parte que el arnés añade por ti.
Los benchmarks dividen el resultado, no el trabajo
La tabla de lanzamiento de OpenAI ofrece cuatro señales direccionales. No constituye una competición controlada entre Codex y Claude Code, y sus cifras siguen perteneciendo al proveedor que las publicó.
| Benchmark publicado por OpenAI | GPT-5.6 Sol | Claude Fable 5 | Qué sugiere | Límite metodológico |
|---|---|---|---|---|
| Artificial Analysis Coding Agent Index v1.1 | 80,0 | 77,2 | Sol puede ser una buena primera prueba para trabajo agente general | OpenAI etiqueta el resultado de Sol con razonamiento max |
| SWE-Bench Pro | 64,6% | 80,0% | Fable merece el primer piloto para incidencias de repositorio tipo SWE | No se publica suficiente detalle de arnés y razonamiento idéntico |
| DeepSWE v1.1 | 72,7% | 69,7% | Sol parte con una ligera ventaja en ese conjunto | No demuestra el comportamiento dentro de tu repositorio ni de tu agente |
| Terminal-Bench 2.1 | 88,8% | 83,1% | Sol es la hipótesis natural para terminal y herramientas | Una ventaja de benchmark no mide revisión, permisos ni coste aceptado |
La reversión de filas es el dato importante. Fable lidera SWE-Bench Pro, mientras Sol lidera Artificial Analysis, DeepSWE y Terminal-Bench. Si alguien resume la tabla con una sola palabra —“gana”— elimina precisamente la información que sirve para diseñar el piloto.
La configuración también importa. OpenAI identifica max como el nivel de razonamiento para el resultado de Sol en Artificial Analysis. Las otras filas no exponen una configuración cruzada suficientemente idéntica para afirmar que la diferencia procede solo del modelo. Además, las estimaciones de latencia y coste API de la página de lanzamiento son simulaciones basadas en comportamiento de producción; el resultado real puede variar.
Usa cada fila para elegir tareas, no para evitar la prueba. Terminal-Bench justifica incluir comandos, herramientas y validación en el lote de Sol. SWE-Bench Pro justifica incluir incidencias de repositorio en el lote de Fable. DeepSWE y Artificial Analysis añaden hipótesis, pero ninguna sustituye la evidencia del mismo commit.
Diseña una prueba controlada en el mismo repositorio
Una comparación útil empieza con una carpeta de evidencia, no con dos sesiones improvisadas. Congela primero los insumos:
- el mismo repositorio y el mismo commit;
- el mismo enunciado, archivos de contexto y criterios de aceptación;
- las mismas herramientas disponibles y las mismas versiones;
- los mismos permisos de lectura, escritura, red y ejecución;
- los mismos tests, lint, build y comandos de verificación;
- el mismo orden de tareas para evitar que una ruta reciba casos más fáciles;
- la misma rúbrica de revisión;
- un presupuesto, límite de tiempo y política de reintentos;
- una ruta de rollback ya ensayada.

Después construye un lote representativo. Un ejemplo compacto para un equipo de producto:
- corregir un bug focalizado con test que primero falla;
- localizar una regresión que cruza dos módulos;
- actualizar una dependencia y resolver incompatibilidades;
- refactorizar una API interna sin cambiar comportamiento;
- añadir una validación con casos límite;
- ejecutar una migración mediante terminal y comprobar el resultado;
- explicar un fallo sin editar, para medir calidad diagnóstica;
- producir un parche pequeño a partir de una base de código extensa.
Alterna la ruta que empieza cada pareja de tareas. Si Sol siempre va primero, puede revelar información que después beneficia a Fable; si Fable siempre va primero, ocurre lo contrario. Usa ramas limpias desde el mismo commit y no compartas entre rutas un diagnóstico generado por la otra.
Ficha de evidencia para cada ejecución
No basta con guardar el diff. Rellena la misma ficha para Sol y Fable antes de mirar cuál “parece” mejor:
| Campo | Qué registrar | Por qué cambia la decisión |
|---|---|---|
| Ruta y atribución | Modelo solicitado, modelo efectivo, versión de Codex o Claude Code, razonamiento, fallback y vía de facturación | Evita atribuir al modelo un resultado producido por otro modelo o por el arnés |
| Controles | Commit inicial, prompt, archivos de contexto, herramientas, permisos, tests y límite de reintentos | Permite comparar rutas completas sin que la segunda herede pistas de la primera |
| Consumo | Tokens de entrada, caché y salida; herramientas, CI, latencia y todos los reintentos | Convierte la tarifa publicada en gasto observado |
| Revisión | Minutos humanos, archivos fuera de alcance, defectos y regresiones | Expone el coste que una factura API baja puede trasladar al equipo |
| Resultado | Aceptado o rechazado, motivo, reversión ejecutada y resultado del rollback | Solo el trabajo aceptado y reversible entra en el denominador |
Un parche que compila pero viola una condición de aceptación no cuenta como aceptado. Guarda la transcripción y los comandos como evidencia auxiliar, pero no confundas volumen de log con calidad.
La verificación termina en el repositorio:
- inspecciona el diff y archivos no previstos;
- ejecuta tests de aceptación y regresión;
- revisa seguridad, dependencias y cambios de configuración;
- comprueba que los logs identifican la ruta efectiva;
- mide el tiempo humano necesario para entender y aprobar el cambio;
- revierte la rama de prueba para demostrar que el rollback funciona.
Calcula coste por trabajo aceptado
El precio por millón de tokens sirve para presupuestar llamadas, pero puede premiar una ruta que genera mucho código barato y poco código aprobable. La unidad de decisión debe ser el cambio aceptado.
“Coste por cambio aceptado = (gasto medido de todos los primeros intentos y reintentos + comisiones externas de herramientas o CI + coste del tiempo de revisión) ÷ número de parches aceptados
Cuenta cada consumo una sola vez. Si un primer intento cuesta $0,40 y el reintento cuesta $0,25, el numerador añade $0,65, no $0,40, $0,25 y una tercera cifra llamada “coste de retry”. Si una redirección ejecuta otro modelo, asigna ese consumo al modelo y ruta efectivos.
El tiempo de revisión necesita una tarifa interna consistente. No hace falta publicar el salario: basta con una unidad estable, como minutos de revisor o coste estándar por hora. Lo importante es no llamar “barata” a una ruta que ahorra tokens pero exige cuarenta minutos extra para reparar el diff.
Una regla de equilibrio hace visible ese intercambio. Si el coste cargado de una persona revisora es de $120 por hora, cada $1 adicional de modelo tiene que ahorrar al menos 30 segundos de revisión solo para empatar:
“Segundos que debe ahorrar = (dólares adicionales del modelo ÷ coste horario del revisor) × 3.600
Sustituye $120 por tu coste interno y usa el gasto observado del lote, no una tarifa teórica. Esta cuenta no perdona una regresión, una violación de retención ni una tasa de aceptación inferior: esos son vetos separados, no variables que se compensan con segundos.
Un ejemplo:
| Ruta | Gasto medido y fees | Revisión | Parches aceptados | Lectura correcta |
|---|---|---|---|---|
| Sol en Codex | $12 | 90 min | 8 | Calcula sobre ocho cambios, incluyendo todos los reintentos |
| Fable en Claude Code | $18 | 55 min | 9 | El mayor coste API puede compensarse si baja revisión y sube aceptación |
No compares la columna de dólares sin asignar valor al tiempo humano. Tampoco concluyas con una media si una ruta produjo cero parches aceptados. En ese caso, detén el lote, márcalo como fallido e investiga la causa; dividir por cero u ocultarlo dentro de un promedio destruye la señal de riesgo.
Además del coste medio, observa dispersión y cola: una ruta que funciona nueve veces pero produce un décimo cambio peligrosamente grande puede ser peor predeterminado que una ruta ligeramente más lenta y predecible. Registra regresiones, archivos tocados fuera de alcance y necesidad de intervención manual.
Decide entre promover, mantener especialista, fallback o revertir
El final de un piloto no es una elección binaria. Hay cuatro rutas de producción, y solo una cambia el predeterminado.

| Decisión | Cuándo aplicarla | Acción | Condición de salida |
|---|---|---|---|
| Promover | Sube la tasa de parches aceptados, no empeoran regresiones ni revisión y baja o mantiene el coste aceptado | Despliegue gradual por equipo o tipo de tarea | Pausa si supera el presupuesto o rompe la rúbrica |
| Mantener especialista | Gana con claridad solo terminal, contexto largo u otra clase concreta | Enruta esa clase a la ruta ganadora; conserva el predeterminado general | Revisa la regla cuando cambien modelo, arnés o repositorio |
| Conservar fallback operativo | La ruta actual sigue siendo la más estable o necesitas continuidad | Mantén una ruta ya validada y documenta cómo activarla | Prueba periódicamente que sigue funcionando |
| Revertir | Empeoran calidad, seguridad, aceptación, revisión o coste | Vuelve al predeterminado anterior y conserva el paquete de evidencia | Reabre el piloto solo con una hipótesis nueva |
Aquí fallback operativo significa una ruta de producción elegida y validada por tu equipo. No es lo mismo que Fallback API de Anthropic, el cambio automático de una aplicación Claude o el reintento de salvaguarda que puede ofrecer Codex. Esas rutas automáticas modifican el modelo efectivo y deben aparecer como ejecuciones separadas.
Promueve de forma gradual. Empieza por una clase de tareas, un repositorio o un equipo pequeño. Mantén el predeterminado anterior accesible, registra qué versión del modelo y agente fue aprobada y define un umbral de rollback. Sin una ruta de vuelta probada, no hay cambio responsable del predeterminado.
Un buen resultado también puede ser “dos especialistas”. Sol en Codex puede quedar como ruta para terminal y lotes sensibles al coste, mientras Fable en Claude Code se reserva para diagnósticos largos. Esta división suele conservar más valor que forzar una única herramienta para todos los trabajos.
Errores que invalidan la comparación
La mayoría de las comparaciones débiles fallan antes de medir el primer parche. Evita estos patrones:
- Confundir nombres. GPT-5.6 Sol no se llama Codex; Claude Fable 5 no se llama Claude Code.
- Cambiar dos variables a la vez y atribuir todo al modelo. Si cambias modelo y agente, el resultado pertenece a la ruta completa.
- Mezclar API con suscripciones. Los precios por token y las cuotas o créditos del producto no comparten unidad.
- Omitir el modelo efectivo. Una respuesta de Opus 4.8 no es evidencia de Fable; un reintento de menor capacidad no es evidencia de Sol.
- Comparar commits distintos. Un repositorio modificado por la primera ruta puede facilitar la segunda.
- Contar código generado. Mide parches aceptados después de tests y revisión.
- Ocultar reintentos. Cada gasto entra una sola vez en el numerador y cada intento queda asociado a su ruta.
- Ignorar el cero. Cero cambios aceptados detiene el lote; no se suaviza con una media.
- Usar una única tarea. Un caso llamativo no describe la distribución normal del equipo.
- Cambiar sin rollback. Si no puedes volver, todavía no tienes un piloto de producción.
Otra señal de mala comparación es el resultado sin contexto. “Fable resolvió más issues” no basta si recibió más tiempo, herramientas distintas o una rúbrica más indulgente. “Sol costó menos” tampoco basta si el revisor tuvo que rehacer la mitad del cambio. Conserva los controles y la evidencia junto al veredicto.
Preguntas frecuentes
¿El nombre correcto es “Codex 5.6”?
No. GPT-5.6 Sol es el modelo y Codex es el entorno agente de programación. La forma precisa para esta ruta es “GPT-5.6 Sol en Codex”.
¿“Claude Code Fable 5” es un único producto?
No. El nombre oficial del modelo es Claude Fable 5, con identificador API claude-fable-5. Claude Code es el agente donde puede usarse. La forma precisa es “Claude Fable 5 en Claude Code”.
¿GPT-5.6 Sol y Claude Fable 5 están disponibles ahora?
Sí, en la comprobación del 21 de julio de 2026 ambas rutas estaban disponibles. OpenAI ofrece Sol en la API y como opción para Plus, Pro, Business y Enterprise; Free y Go reciben Terra. Anthropic enumera Fable para Pro, Max, Team y Enterprise y en Claude Platform. Plan, región, workspace, créditos y permisos pueden cambiar, así que vuelve a comprobarlos antes de contratar o migrar.
¿Cuál es más barato en la API?
Según los precios oficiales comprobados el 21 de julio, la tarifa estándar de Sol es $5 por millón de entrada, $0,50 de entrada en caché, $6,25 por escritura de caché y $30 de salida; Fable cuesta $10 de entrada y $50 de salida. Por encima de 272.000 tokens de entrada, recalcula la solicitud completa de Sol con su multiplicador documentado. Además, cuenta el payload real de Fable: su tokenizer puede producir aproximadamente un 30% más de tokens que los modelos anteriores a Opus 4.7. La decisión económica final sigue siendo coste por parche aceptado, con reintentos, herramientas, CI y revisión.
¿El contexto de un millón de tokens hace que Fable sea siempre mejor?
No. Fable ofrece un contexto de 1 millón de tokens y hasta 128.000 tokens de salida, lo que justifica probarlo primero en diagnóstico amplio. Aun así, más contexto no garantiza un diff pequeño, tests aprobados ni menor carga de revisión.
¿Qué modelo gana los benchmarks de programación?
No hay un barrido. En la tabla publicada por OpenAI, Fable lidera SWE-Bench Pro, mientras Sol lidera Artificial Analysis Coding Agent Index v1.1, DeepSWE v1.1 y Terminal-Bench 2.1. Son señales del proveedor con límites de arnés y razonamiento; sirven para elegir tareas del piloto, no para declarar que una ruta es superior para todos.
¿Claude Code puede cambiar Fable por Opus 4.8?
Sí. Anthropic explica que solicitudes marcadas de ciberseguridad o biología en aplicaciones Claude, incluido Claude Code, pueden cambiar automáticamente a Claude Opus 4.8, y el usuario puede desactivar ese cambio. Registra Opus 4.8 como modelo efectivo y atribuye el resultado y coste a esa ruta.
¿Una llamada API a Fable cambia automáticamente a Opus 4.8?
No por el simple hecho de seleccionar Fable. En la API, el cambio ocurre solo si el desarrollador configura explícitamente Fallback API. Si no existe esa configuración, no asumas una redirección de aplicación en la API.
¿Qué significa un reintento de menor capacidad en Codex?
OpenAI advierte que las salvaguardas conservadoras de Sol pueden crear fricción en usos benignos y que ChatGPT o Codex pueden ofrecer un reintento sobre un modelo de menor capacidad. Ese resultado se atribuye al modelo que realmente se ejecutó y se puntúa como ruta separada.
¿Cuánto debe durar la prueba con el mismo repositorio?
Hasta cubrir un lote representativo y obtener señal repetible. Para un equipo pequeño, entre ocho y doce tareas repartidas entre dificultad fácil, media y alta suele ser más informativo que una sola demo. Fija antes presupuesto, tiempo, política de reintentos y criterio de aceptación.
¿Cuándo debo cambiar la ruta predeterminada?
Solo cuando la nueva ruta aumenta los parches aceptados sin empeorar regresiones, seguridad, carga de revisión ni coste por trabajo aceptado. Promueve gradualmente y conserva una ruta de rollback. Si gana únicamente una clase de tarea, úsala como especialista.
¿Qué hago si ninguna ruta produce un parche aceptado?
Detén el lote y márcalo como fallido. No dividas por cero ni combines ese resultado con otras tareas para ocultarlo. Revisa permisos, prompt, herramientas, criterios de aceptación y posibles redirecciones antes de formular una nueva hipótesis.
Una decisión útil sigue siendo reversible
El primer movimiento razonable es pequeño: selecciona un lote de tareas representativas, congela los controles y prueba Sol en Codex para terminal o coste, y Fable en Claude Code para contexto largo o diagnóstico. Registra siempre modelo solicitado, agente, facturación y modelo efectivo.
Después decide con trabajo aceptado. Promueve solo la ruta que mejore calidad y economía sin trasladar el coste a revisores o seguridad; mantén especialistas donde aporten ventaja y conserva un fallback operativo validado. Si no existe un rollback comprobado, conserva el predeterminado actual.



