Investigación · 17 septiembre 2026

Fable 5.1 vs GPT-6 Astra

Dos modelos frontera lanzados con 48 horas de diferencia, al mismo precio de lista. Pero la historia real no está en cuál gana: está en que las tres mediciones independientes más citadas se contradicen entre sí, y una de ellas cambió de veredicto tres veces en una semana.

53
Fable 5.1
53
GPT-6 Astra
Índice de inteligencia de Artificial Analysis, versión v4.3, verificado en vivo el 17 de septiembre. Empate exacto. Hace dos semanas, el mismo evaluador daba a Fable una ventaja de 5 puntos.

1 · El instrumento cambió, no los modelos

Artificial Analysis es el árbitro más citado porque corre ambos modelos por el mismo arnés. Revisó su índice tres veces en unos siete días. Los modelos no se tocaron — el índice se recalcula entero en cada revisión, y el ganador se evaporó.

Fable 5.1 GPT-6 Astra
v4.1 · al lanzamiento (~3 sep)Fable +5
66
61
v4.2 · ~11 sepFable +2
57
55
v4.3 · actual, verificado 17 sepempate
53
53
Escala 0–100. Índice de inteligencia de Artificial Analysis, ejecución «max».
Si alguien te muestra «Fable gana por 5 puntos» está citando v4.1. Medios serios siguen reproduciendo el 66 vs 61, que ya no coincide con lo que Artificial Analysis publica hoy.

Entre v4.2 y v4.3 no solo cayó Fable: Opus 5 perdió 3 puntos y Muse Spark 1.3 perdió 5. El detonante fue la crítica de que el índice subestimaba a Astra — Epoch AI lo situó 1º entre 267 modelos con 169 puntos sobre más de 50 benchmarks. Artificial Analysis dice que adelantó elementos de su índice v5, en desarrollo desde hace ocho meses. Terceros lo leen como reacción a la presión.

2 · El 99,9 % de Astra depende del arnés, no del modelo

OpenAI abre su anuncio diciendo que Astra «satura ARC-AGI-3 con un 99,9 %». ARC Prize publicó ese número — y también el otro. Con el arnés estándar, el mismo modelo saca 62,7 %.

Arnés estándar Provider Adapter (OpenAI)
Razonamiento «max»+35,9 puntos
62,7 %
98,6 %
Razonamiento «high»+45,1 puntos
54,8 %
99,9 %
Razonamiento «none»+61,5 puntos
35,2 %
96,7 %
ARC-AGI-3 Semi-Private. Fuente: ARC Prize, 3 sep 2026.
El dato demoledor Astra sin razonamiento dentro del adaptador de OpenAI saca 96,7 % — treinta y cuatro puntos por encima del mismo modelo a máximo razonamiento en el arnés estándar. Lo que se está midiendo ahí es el andamiaje tanto como el modelo. Comparar ese 99,9 % contra cifras de rivales medidas con arnés estándar no es comparar.
Ver tabla completa con costes de ejecución
ARC-AGI-3 Semi-Private — GPT-6 Astra
EsfuerzoArnés estándarCosteProvider AdapterCoste
max62,7 %$26.09898,6 %$17.332
high54,8 %$40.70599,9 %$18.817
none35,2 %$49.79196,7 %$23.457

3 · Cifras que cambiaron después de publicarse

OpenAI publicó el anuncio, lo retiró sin explicar por qué, y lo volvió a publicar con métricas distintas. Fortune rastreó las instantáneas de archivo. Varias cifras siguen moviéndose.

Evolución de métricas en el anuncio oficial de GPT-6 Astra · fuente: Fortune, vía instantáneas de archive.ph
MétricaPrimera versiónTras republicarHoy
Alucinación — Astra4,2 %2,0 %4,2 %
Alucinación — GPT-5.6 Sol12,2 %9,4 %12,2 %
ExploitBench — Sol5,5 %11,5 %en revisión
FrontierMath T4 v2 — Fable 5.187,8 %78,0 %83,0 %
FrontierMath T4 v2 — Sol83,0 %80,5 %83,0 %
FrontierMath T4 v2 — Astra97,6 %97,6 %97,6 %
ARC-AGI-3 — Astra98,6 %
borrador embargado
99,9 %99,99 %
El patrón La cifra de Astra en FrontierMath no se movió. Las de sus dos rivales sí — y en la versión intermedia, ambas bajaron. Fable 5.1 perdió casi diez puntos y luego recuperó cinco.

Respuesta de OpenAI a Fortune: «Nos importa profundamente hacer bien las evaluaciones. La mayoría tiene ruido de unos pocos puntos porcentuales según el checkpoint, el andamiaje y la ejecución concretos.» Sobre el cambio de ExploitBench en Sol, dice estar investigando revertirlo porque el 11,5 % refleja un nivel de razonamiento que no está disponible comercialmente.

4 · Dónde sí hay diferencias claras

Empatan en capacidad medida. No empatan en cómo llegan al resultado: Astra gasta un tercio de los tokens, Fable responde más rápido.

Fable 5.1 GPT-6 Astra
Coste por tareaAstra cuesta ~43 %
$7,63
$3,26
Tokens de salida por tareaAstra usa ~⅓
78k
27k
Velocidad de salidaFable +26 %
67 t/s
53 t/s
Respuesta extremo a extremo (500 tok)Fable ~57 s antes
289 s
347 s
Artificial Analysis v4.3, ejecución «max», verificado en vivo el 17 sep 2026. Barras normalizadas al mayor de cada fila.

5 · Ficha técnica y precio

Datos de la documentación oficial de cada proveedor
 Fable 5.1GPT-6 Astra
ProveedorAnthropicOpenAI
Lanzamiento1 sep 20263 sep (limitado) · 4 sep (general)
Ventana de contexto1.000.0001.050.000
Salida máxima128.000128.000
Corte de conocimientono publicado30 abr 2026
Entrada · por millón$10,00$10,00
Lectura de caché · por millón$0,25$1,00
Salida · por millón$50,00$50,00
Batch−50 %−50 % (Batch y Flex)
Recargo contexto largoninguno en toda la ventana>272K: 2× entrada, 1,5× salida
La brecha de 4× en caché Anthropic aplica a Fable 5.1 un multiplicador de 0,025× sobre la entrada base para lecturas de caché; todos sus demás modelos usan 0,1×. En trabajo agéntico de alto volumen —donde el mismo contexto se relee una y otra vez— esa diferencia revierte parcialmente la ventaja de coste que Astra tiene por eficiencia de tokens. Anthropic estima un ahorro de ~25 % en cargas típicas y hasta ~45 % en las muy agénticas.

Advertencia de comparabilidad: el tokenizador introducido con Opus 4.7 produce ~30 % más tokens para el mismo texto que los modelos previos. Un precio por token idéntico no significa un coste por documento idéntico.

6 · Benchmarks reportados por OpenAI

Estas cifras vienen del anuncio de OpenAI y comparan contra rivales que OpenAI eligió y ejecutó. Se incluyen porque son parte del expediente, no porque sean neutrales.

⚑ Cifras del fabricante · no verificadas por terceros
Nota metodológica de OpenAI: «las puntuaciones son el máximo a cualquier nivel de esfuerzo»
BenchmarkGPT-6 AstraMejor rival citadoRival
Terminal-Bench 4.057,9 %55,8 %Fable 5.1
FrontierCode 1.1 Extended64,5 %64,9 %Fable 5
FrontierCode 1.1 Main53,3 %53,5 %Fable 5
AA Coding Agent Index v1.467,068,1Opus 5
DeepSWE v1.174,1 %73,8 %Gemini 3.8 Flash
OSWorld 2.072,6 %65,7 %GPT-5.6 Sol
ScreenSpot-Pro92,7 %76,9 %GPT-5.6 Sol
Agents' Last Exam59,3 %53,6 %GPT-5.6 Sol

Lo interesante es lo que OpenAI admite: en tres de ocho benchmarks de código, el rival gana — y en dos de ellos el rival es la generación anterior de Anthropic, Fable 5. La ventaja clara de Astra está en uso de computadora, no en programación pura.

Donde Astra sí marca distancia

En uso de computadora la mejora es de eficiencia, no solo de acierto: 72,6 % en OSWorld 2.0 con unos 40 minutos por tarea, frente a 65,7 % con unos 75 minutos de GPT-5.6 Sol — un 47 % menos de tiempo. Con el arnés de Codex actualizado, OpenAI reporta 1,9× más rapidez en Mind2Web. En una evaluación de alineación creada a raíz del incidente de Hugging Face, Astra se salió del objetivo autorizado en el 0 % de los casos, frente al 48 % de Sol sin salvaguardas de producción.

7 · Qué elegir

Si tu caso es…Inclínate porPorque
Automatizar tareas de escritorio y navegadorGPT-6 AstraEs su ventaja más sólida y menos discutida: mejor acierto en la mitad de tiempo.
Agentes de alto volumen con contexto repetidoFable 5.1Lectura de caché 4× más barata. Es el factor que domina esa factura.
Respuestas interactivas, cara al usuarioFable 5.167 t/s frente a 53, y ~57 s menos extremo a extremo.
Lotes grandes sin prisaGPT-6 AstraUn tercio de los tokens de salida por tarea; el coste medido cae a la mitad.
Programación puraIndistintoSe reparten los benchmarks, incluso en los que reporta OpenAI. Prueba con tu propio código.
Contextos por encima de 272KFable 5.1Sin recargo en toda la ventana; Astra duplica el precio de entrada pasado ese umbral.

Cómo leer esto

Ningún proveedor comparó contra el otro en sus materiales de lanzamiento. Las tres fuentes independientes principales —Artificial Analysis, ARC Prize y Epoch AI— no coinciden entre sí, y la primera cambió su propio veredicto tres veces en una semana.

La conclusión defendible no es «gana X». Es que en septiembre de 2026 la diferencia de capacidad entre estos dos modelos es menor que la varianza entre los instrumentos que la miden. Las decisiones que sí se sostienen son las de coste, latencia y consumo de tokens, porque se miden con relojes y facturas, no con índices que se recalculan.

Lo que esta investigación no cubre: LMArena y preferencia humana, evaluaciones en español, y comportamiento con herramientas en cargas reales de producción.

Fuentes

  1. OpenAI — GPT-6 Astra: A new generation of intelligence · 3 sep 2026
  2. OpenAI — Documentación de API, modelo gpt-6-astra
  3. Anthropic — Claude Fable 5.1 y Mythos 5.1 · 1 sep 2026
  4. Anthropic — Ficha del modelo Fable 5.1 y página de precios
  5. AWS — Model card de Bedrock, Fable 5.1
  6. ARC Prize — Evaluación independiente de GPT-6 Astra en ARC-AGI-3 · 3 sep 2026
  7. Artificial Analysis — Leaderboard de modelos (verificado en vivo, 17 sep 2026) y análisis de GPT-6 Astra
  8. Fortune — reportaje sobre cambios en las métricas publicadas de GPT-6 Astra
  9. The Decoder — Artificial Analysis revisa su índice tras el escepticismo
  10. CNBC — Cobertura del lanzamiento · 3 sep 2026
  11. Cursor — Documentación de Fable 5.1 como desplegador
  12. llm-stats.com — fichas de Fable 5.1 y GPT-6 Astra