Dos modelos frontera lanzados con 48 horas de diferencia, al mismo precio de lista. Pero la historia real no está en cuál gana: está en que las tres mediciones independientes más citadas se contradicen entre sí, y una de ellas cambió de veredicto tres veces en una semana.
Artificial Analysis es el árbitro más citado porque corre ambos modelos por el mismo arnés. Revisó su índice tres veces en unos siete días. Los modelos no se tocaron — el índice se recalcula entero en cada revisión, y el ganador se evaporó.
Entre v4.2 y v4.3 no solo cayó Fable: Opus 5 perdió 3 puntos y Muse Spark 1.3 perdió 5. El detonante fue la crítica de que el índice subestimaba a Astra — Epoch AI lo situó 1º entre 267 modelos con 169 puntos sobre más de 50 benchmarks. Artificial Analysis dice que adelantó elementos de su índice v5, en desarrollo desde hace ocho meses. Terceros lo leen como reacción a la presión.
OpenAI abre su anuncio diciendo que Astra «satura ARC-AGI-3 con un 99,9 %». ARC Prize publicó ese número — y también el otro. Con el arnés estándar, el mismo modelo saca 62,7 %.
| Esfuerzo | Arnés estándar | Coste | Provider Adapter | Coste |
|---|---|---|---|---|
| max | 62,7 % | $26.098 | 98,6 % | $17.332 |
| high | 54,8 % | $40.705 | 99,9 % | $18.817 |
| none | 35,2 % | $49.791 | 96,7 % | $23.457 |
OpenAI publicó el anuncio, lo retiró sin explicar por qué, y lo volvió a publicar con métricas distintas. Fortune rastreó las instantáneas de archivo. Varias cifras siguen moviéndose.
| Métrica | Primera versión | Tras republicar | Hoy |
|---|---|---|---|
| Alucinación — Astra | 4,2 % | 2,0 % | 4,2 % |
| Alucinación — GPT-5.6 Sol | 12,2 % | 9,4 % | 12,2 % |
| ExploitBench — Sol | 5,5 % | 11,5 % | en revisión |
| FrontierMath T4 v2 — Fable 5.1 | 87,8 % | 78,0 % | 83,0 % |
| FrontierMath T4 v2 — Sol | 83,0 % | 80,5 % | 83,0 % |
| FrontierMath T4 v2 — Astra | 97,6 % | 97,6 % | 97,6 % |
| ARC-AGI-3 — Astra | 98,6 % borrador embargado | 99,9 % | 99,99 % |
Respuesta de OpenAI a Fortune: «Nos importa profundamente hacer bien las evaluaciones. La mayoría tiene ruido de unos pocos puntos porcentuales según el checkpoint, el andamiaje y la ejecución concretos.» Sobre el cambio de ExploitBench en Sol, dice estar investigando revertirlo porque el 11,5 % refleja un nivel de razonamiento que no está disponible comercialmente.
Empatan en capacidad medida. No empatan en cómo llegan al resultado: Astra gasta un tercio de los tokens, Fable responde más rápido.
| Fable 5.1 | GPT-6 Astra | |
|---|---|---|
| Proveedor | Anthropic | OpenAI |
| Lanzamiento | 1 sep 2026 | 3 sep (limitado) · 4 sep (general) |
| Ventana de contexto | 1.000.000 | 1.050.000 |
| Salida máxima | 128.000 | 128.000 |
| Corte de conocimiento | no publicado | 30 abr 2026 |
| Entrada · por millón | $10,00 | $10,00 |
| Lectura de caché · por millón | $0,25 | $1,00 |
| Salida · por millón | $50,00 | $50,00 |
| Batch | −50 % | −50 % (Batch y Flex) |
| Recargo contexto largo | ninguno en toda la ventana | >272K: 2× entrada, 1,5× salida |
Advertencia de comparabilidad: el tokenizador introducido con Opus 4.7 produce ~30 % más tokens para el mismo texto que los modelos previos. Un precio por token idéntico no significa un coste por documento idéntico.
Estas cifras vienen del anuncio de OpenAI y comparan contra rivales que OpenAI eligió y ejecutó. Se incluyen porque son parte del expediente, no porque sean neutrales.
| Benchmark | GPT-6 Astra | Mejor rival citado | Rival |
|---|---|---|---|
| Terminal-Bench 4.0 | 57,9 % | 55,8 % | Fable 5.1 |
| FrontierCode 1.1 Extended | 64,5 % | 64,9 % | Fable 5 |
| FrontierCode 1.1 Main | 53,3 % | 53,5 % | Fable 5 |
| AA Coding Agent Index v1.4 | 67,0 | 68,1 | Opus 5 |
| DeepSWE v1.1 | 74,1 % | 73,8 % | Gemini 3.8 Flash |
| OSWorld 2.0 | 72,6 % | 65,7 % | GPT-5.6 Sol |
| ScreenSpot-Pro | 92,7 % | 76,9 % | GPT-5.6 Sol |
| Agents' Last Exam | 59,3 % | 53,6 % | GPT-5.6 Sol |
Lo interesante es lo que OpenAI admite: en tres de ocho benchmarks de código, el rival gana — y en dos de ellos el rival es la generación anterior de Anthropic, Fable 5. La ventaja clara de Astra está en uso de computadora, no en programación pura.
En uso de computadora la mejora es de eficiencia, no solo de acierto: 72,6 % en OSWorld 2.0 con unos 40 minutos por tarea, frente a 65,7 % con unos 75 minutos de GPT-5.6 Sol — un 47 % menos de tiempo. Con el arnés de Codex actualizado, OpenAI reporta 1,9× más rapidez en Mind2Web. En una evaluación de alineación creada a raíz del incidente de Hugging Face, Astra se salió del objetivo autorizado en el 0 % de los casos, frente al 48 % de Sol sin salvaguardas de producción.
| Si tu caso es… | Inclínate por | Porque |
|---|---|---|
| Automatizar tareas de escritorio y navegador | GPT-6 Astra | Es su ventaja más sólida y menos discutida: mejor acierto en la mitad de tiempo. |
| Agentes de alto volumen con contexto repetido | Fable 5.1 | Lectura de caché 4× más barata. Es el factor que domina esa factura. |
| Respuestas interactivas, cara al usuario | Fable 5.1 | 67 t/s frente a 53, y ~57 s menos extremo a extremo. |
| Lotes grandes sin prisa | GPT-6 Astra | Un tercio de los tokens de salida por tarea; el coste medido cae a la mitad. |
| Programación pura | Indistinto | Se reparten los benchmarks, incluso en los que reporta OpenAI. Prueba con tu propio código. |
| Contextos por encima de 272K | Fable 5.1 | Sin recargo en toda la ventana; Astra duplica el precio de entrada pasado ese umbral. |
Ningún proveedor comparó contra el otro en sus materiales de lanzamiento. Las tres fuentes independientes principales —Artificial Analysis, ARC Prize y Epoch AI— no coinciden entre sí, y la primera cambió su propio veredicto tres veces en una semana.
La conclusión defendible no es «gana X». Es que en septiembre de 2026 la diferencia de capacidad entre estos dos modelos es menor que la varianza entre los instrumentos que la miden. Las decisiones que sí se sostienen son las de coste, latencia y consumo de tokens, porque se miden con relojes y facturas, no con índices que se recalculan.
Lo que esta investigación no cubre: LMArena y preferencia humana, evaluaciones en español, y comportamiento con herramientas en cargas reales de producción.