Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

GPT-6 Astra: max cuesta 2.3x más que low con igual resultado

Contenido
  1. ¿Dónde queda GPT-6 Astra en los benchmarks?
  2. ¿Qué valores de reasoning_effort acepta GPT-6 Astra?
  3. ¿none desactiva el razonamiento? ¿Y disabled?
  4. ¿Qué aporta max frente a low?
  5. ¿Cuesta GPT-6 Astra 2.5x más que GPT-5.6 Sol por respuesta?
  6. ¿Un esquema JSON o una llamada a herramienta aumentan el coste de razonamiento?
  7. ¿Puedes leer el razonamiento que pagas?
  8. ¿Qué se mantiene respecto a GPT-5.6?
  9. Cómo lo gestiona Synthorai
  10. Preguntas frecuentes

En GPT-6 Astra, reasoning_effort: "max" cuesta 2.3x más que low y devuelve la misma respuesta en las 11 tareas verificadas. El único valor que afecta a la precisión es none, que falla en 17 de 33 ejecuciones (11 tareas, 3 ejecuciones por tarea). reasoning_effort es el parámetro de la petición que determina cuánto razonamiento interno realiza el modelo antes de responder. Ese trabajo se factura como reasoning tokens al precio de salida. Este artículo mide toda la escala ordenada de none a max. La escala real no coincide con la documentación: la validación de entrada de la propia API anuncia siete valores, pero uno de ellos (minimal) se rechaza en todos los modelos. Otro que nunca se menciona (disabled) se acepta en Astra y no desactiva nada. Esto cambia cómo deben interpretarse los benchmarks de lanzamiento de OpenAI, publicados como “el máximo con cualquier nivel de esfuerzo”: la cifra del ranking procede del nivel más caro de la escala.

TL;DR

  • GPT-6 Astra acepta siete valores de reasoning_effort, incluidos none y disabled; la documentación enumera cinco y afirma que none no es compatible.
  • none es el único valor que reduce a cero los reasoning tokens y falla en 17 de 33 tareas verificadas; todos los demás niveles obtienen 33 de 33.
  • disabled consume 243 reasoning tokens frente a los 151 de low y cuesta un 54% más por respuesta correcta, con la misma precisión.
  • A precio de catálogo, GPT-6 Astra cuesta 1.57x más que GPT-5.6 Sol por respuesta correcta con low y 2.57x más con max, en tareas que ambos modelos resuelven correctamente.

¿Dónde queda GPT-6 Astra en los benchmarks?

Supera a los demás en tareas de agentes (el modelo usa herramientas de forma iterativa, normalmente en un terminal), pero queda por detrás de Claude Fable 5.1 en Humanity’s Last Exam y en Artificial Analysis Intelligence Index (un agregado independiente de diez evaluaciones). Cada resultado se publicó con el nivel de esfuerzo que obtuvo la mayor puntuación. La siguiente tabla procede de la página de lanzamiento de OpenAI y conserva las columnas comparativas que eligió la empresa:

BenchmarkQué evalúaGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Opus 5
Terminal-Bench 4.0tareas de agentes en un terminal57.9%37.3%55.8%52.6%
Terminal-Bench Science 0.1flujos de investigación con código64.6%22.4%52.6%30.0%
FrontierMath Tier 4 (v2)matemáticas de nivel investigador97.6%83.0%87.8%73.2%
ARC-AGI-3resolución de entornos de acertijos nuevos99.9%7.8%no indicado30.2%
Humanity’s Last Exam, con herramientaspreguntas de expertos de distintas áreas57.2%no indicado65.0%63.6%
Artificial Analysis Intelligence Index v4.1.1agregado de diez evaluaciones61.260.965.763.1

Hay que contextualizar esos resultados con tres datos:

  • La fila de Humanity’s Last Exam, donde Astra queda 7.8 puntos por detrás de Fable 5.1, aparece en la tabla pero no se menciona en el texto.
  • En la fila de Artificial Analysis, Astra queda por detrás de Claude Fable 5.1, Claude Opus 5 y Claude Fable 5 dentro de la propia tabla de OpenAI; en el ranking v4.2 actual, Fable 5.1 tiene 57 puntos y Astra 55, en primera y tercera posición.
  • Según OpenAI, los resultados de ciberseguridad se obtuvieron “sin las protecciones de producción”; el modelo publicado “rechazará” tareas de exploits de prueba de concepto.

La frase que aparece debajo de las tablas conecta directamente los benchmarks con la factura: “Las puntuaciones de evaluación son el máximo con cualquier nivel de esfuerzo”. El ranking de Artificial Analysis muestra cada modelo una vez por cada nivel de esfuerzo, y Astra obtiene 54 con xhigh frente a 55 con max. El resto del artículo calcula el coste de ese punto.

¿Qué valores de reasoning_effort acepta GPT-6 Astra?

Siete, pero no son los mismos que anuncia la API. Uno de los valores anunciados se rechaza en todos los modelos y otro valor aceptado no aparece en ninguna parte. La página del modelo enumera low, medium, high, xhigh y max, y afirma que el modelo “no admite el nivel de razonamiento none”. La API contradice dos veces a la documentación y una vez a sí misma.

Al enviar un valor no válido, la primera validación, que comprueba la estructura de la petición antes de seleccionar un modelo, devuelve la misma lista de valores permitidos para GPT-6 Astra y GPT-5.6 Sol:

Invalid value: '__invalid__'. Supported values are: 'none', 'minimal', 'low', 'medium', 'high', 'xhigh', and 'max'.

Al probar cada valor, una segunda validación específica del modelo rechaza algunos de los que anunciaba la primera (200 significa que la petición se procesó y 400 que fue rechazada):

ValorIncluido en la lista anunciadaGPT-6 AstraGPT-5.6 Sol
none200200
minimal400, “not supported with the ‘gpt-6-astra-2026-09-03’ model”400, igual
disabledno200400
de low a max200200

Por tanto, none funciona aunque la documentación diga lo contrario, minimal se anuncia pero siempre se rechaza y disabled solo se acepta en Astra sin figurar en ninguna lista. Los mensajes de error también revelan la versión fechada a la que apunta actualmente el alias gpt-6-astra: gpt-6-astra-2026-09-03.

¿none desactiva el razonamiento? ¿Y disabled?

none sí, y es el único valor que lo hace. disabled es un nivel normal con un nombre engañoso. Primero calculamos por fuerza bruta y en nuestra propia máquina las respuestas de 11 tareas, de modo que la clave de respuestas no pudiera estar equivocada (una regla aplicada 40 veces seguidas, un problema de conteo con tres restricciones, una mochila, una conversión de base, 7 elevado a 222 módulo 1000 y otras seis tareas más cortas). Después enviamos las tareas con los siete niveles de esfuerzo (seis en Sol, que rechaza disabled), 3 ejecuciones por tarea y nivel, mediante un endpoint compatible con la API Chat Completions de OpenAI. Estos son los resultados de las cinco tareas más difíciles en GPT-6 Astra:

esfuerzoprecisiónmedia de reasoning tokenscoste por llamadacoste por respuesta correcta
none20% (3 de 15)0$0.00086$0.0043
disabled100%243$0.01311$0.0131
low100%151$0.00851$0.0085
medium100%159$0.00890$0.0089
high100%203$0.01110$0.0111
xhigh100%279$0.01491$0.0149
max100%370$0.01946$0.0195

El coste por respuesta correcta es el gasto de cada combinación de tarea y esfuerzo dividido entre el número de ejecuciones acertadas. Si un valor solo acierta el 20%, hacen falta cinco ejecuciones pagadas para obtener una respuesta correcta. La caída se concentra en un solo salto. Todos los niveles desde low obtuvieron 33 de 33 en las 11 tareas y en ambos modelos. none consiguió 16 de 33 en Astra y 21 de 33 en Sol. En la tarea del mapa iterado, Astra devolvió tres números incorrectos distintos en tres ejecuciones. No hay una degradación gradual que se pueda ajustar: o el razonamiento está activo o el modelo responde al azar.

disabled es la trampa. Consume más reasoning tokens que low, medium o high, y cuesta un 54% más por respuesta correcta que low con la misma precisión del 100%. Solo xhigh y max tienen un coste por respuesta correcta superior al del valor cuyo nombre indica que está desactivado.

Gráfico de barras de los reasoning tokens por llamada de GPT-6 Astra con siete valores de reasoning_effort en cinco tareas de varios pasos: none con 0 tokens y un 20% de aciertos, disabled con 243 tokens marcado como la trampa al costar un 54% más que low, low con 151 tokens marcado como el mínimo, medium con 159, high con 203, xhigh con 279 y max con 370, 2.3x el coste de low con las mismas respuestas; todos los niveles desde low obtienen un 100% de aciertos

¿Qué aporta max frente a low?

Nada en estas tareas, pero cuesta 2.3x más: $0.01946 por llamada frente a $0.00851, ambos con un 100% de aciertos. Los reasoning tokens suben de 151 con low a 370 con max, y todos se facturan a la tarifa de salida de $50 por millón.

Esta cifra debe leerse junto a la tabla de benchmarks. Publicar “el máximo con cualquier nivel de esfuerzo” significa que cada puntuación procede del nivel que mejor resultado obtuvo. En el ranking independiente, la mejor entrada de Astra es max, un punto por encima de xhigh; en nuestra medición, ese nivel cuesta 1.3x más que el inmediatamente inferior. En una carga de trabajo similar a los benchmarks de lanzamiento, el esfuerzo adicional puede compensar. En una carga similar a la nuestra, no. La forma de saberlo es empezar midiendo tus propias tareas con low.

¿Cuesta GPT-6 Astra 2.5x más que GPT-5.6 Sol por respuesta?

Con low, no: 1.57x. Con max, sí: 2.57x. El precio de catálogo es el precio por token publicado por el proveedor. Astra cuesta $10 por millón de tokens de entrada y $50 por millón de salida; Sol cuesta $4 y $20, respectivamente. Ambos precios proceden de las páginas de OpenAI para Astra y Sol, consultadas el 2026-09-07. La diferencia de catálogo es de 2.5x tanto para la entrada como para la salida. La [página de comparación entre GPT-5.6 Sol y GPT-6 Astra](/compare/models/gpt-5-6-sol-vs-gpt-6-astra/) muestra los precios actuales del catálogo. El coste por respuesta correcta se calculó a partir del número de tokens y esos precios de catálogo para las 11 tareas. Ambos modelos obtuvieron 33 de 33 desde low:

esfuerzoGPT-6 Astra por respuesta correctaGPT-5.6 Sol por respuesta correctaproporción
low$0.00560$0.003561.57x
medium$0.00618$0.003731.66x
high$0.00741$0.004001.85x
xhigh$0.01005$0.004432.27x
max$0.01349$0.005252.57x

Astra usa menos reasoning tokens que Sol para obtener la misma respuesta en los niveles bajos (91 frente a 158 por llamada en las 11 tareas con low), lo que reduce la diferencia de precio. Al subir por la escala, su consumo crece más deprisa (249 frente a 242 con max) y la diferencia por respuesta alcanza los 2.5x del precio de catálogo.

La conclusión tiene un alcance limitado: ambos modelos aciertan el 100% desde low, así que este conjunto no permite comparar sus capacidades. Solo mide el precio de una respuesta que ambos resuelven correctamente, que varía entre 1.6x y 2.6x según un único parámetro. La página de lanzamiento de OpenAI muestra la tendencia contraria en tareas de agentes. En Terminal-Bench 4.0 estima un coste de API por tarea “aproximadamente un 9% y un 63% menor” que Sol y Fable 5.1. Un modelo que resuelve más tareas con menos tokens puede ser más barato aunque cobre más por token. Son cargas de trabajo distintas, pero en ambas el nivel de esfuerzo determina la factura.

¿Un esquema JSON o una llamada a herramienta aumentan el coste de razonamiento?

Con low, no; con medium, sí. Enviamos una tarea de un solo paso (sumar 2 horas y 37 minutos a las 08:15) de tres formas: sin formato adicional, dentro de un esquema JSON estricto mediante response_format (la respuesta debe ser JSON y respetar la estructura proporcionada) y como llamada forzada a una herramienta (tool_choice fijado a una función para obligar al modelo a responder llamándola). Probamos cuatro niveles de esfuerzo y 3 ejecuciones por combinación. Esta tabla muestra la media de reasoning tokens de GPT-6 Astra, su porcentaje sobre todos los tokens de salida facturados y el coste por llamada:

formatononelowmediumhigh
sin formato0, $0.000850, $0.0008418 (67% de la salida), $0.0018524 (73%), $0.00217
esquema JSON0, $0.001414 (23%), $0.0016521 (57%), $0.0025726 (62%), $0.00282
llamada forzada a herramienta0, $0.001960, $0.001975 (18%), $0.0022320 (47%), $0.00307

Gráfico de barras agrupadas de los reasoning tokens de GPT-6 Astra en una tarea trivial enviada sin formato, dentro de un esquema JSON y como llamada forzada a una herramienta, con niveles none, low, medium y high: cero tokens con none y low en todos los formatos salvo los 4 tokens del esquema con low, y entre 18 y 26 tokens con medium y high, donde el razonamiento alcanza entre el 57% y el 73% de los tokens de salida

low puede bajar hasta cero: en una tarea sin pasos no usa reasoning tokens y cuesta lo mismo que none. En el conjunto de varios pasos consume entre 16 y 345 tokens por tarea y mantiene la precisión donde none se desploma, por lo que low es el mínimo práctico. El formato no es lo que encarece el razonamiento. Con low, un esquema o una llamada a herramienta añaden entre 0 y 4 reasoning tokens. Con medium, el razonamiento representa entre el 57% y el 67% de los tokens de salida en la petición sin formato y en el esquema, y el 18% en la llamada a herramienta, pese a que la tarea no requiere razonamiento. La misma extracción cuesta 1.6x más con medium que con low dentro del esquema, y 2.2x más sin formato. La guía de costes de GPT-5.6 publicada en julio encontró el mismo efecto en esa familia. Sol presenta menos variación: usa 0 reasoning tokens sin formato y con el esquema en todos los niveles, y entre 14 y 18 tokens en la llamada forzada a herramienta desde medium.

¿Puedes leer el razonamiento que pagas?

Solo en una de las dos interfaces de API de OpenAI. El endpoint antiguo de Chat Completions y el nuevo endpoint Responses aceptan el mismo modelo y facturan de la misma forma. Enviamos la misma pregunta con medium, 3 ejecuciones por interfaz:

Interfazreasoning tokens facturadostexto de razonamiento devuelto
/v1/chat/completions76, 75, 120ninguno; el mensaje solo contiene role y content
/v1/responses con reasoning.summary: "auto"62, 62, 116un elemento reasoning con un resumen de entre 277 y 352 caracteres

Las diferencias entre los recuentos de tokens entran dentro del ruido, así que la facturación es la misma. Lo único que cambia es si puedes ver aquello por lo que has pagado. A $50 por millón de tokens de salida, esa diferencia depende del endpoint. La documentación también dirige las llamadas a herramientas hacia Responses (“GPT-6 Astra admite Chat Completions, pero las llamadas a herramientas requieren Responses”), por lo que cualquier carga que use herramientas termina obligatoriamente en la interfaz que permite leer el resumen.

¿Qué se mantiene respecto a GPT-5.6?

La mayor parte del contrato. Estos son los resultados medidos:

  • Tokenizer. El mismo texto de 900 palabras produjo 1,017 prompt tokens en GPT-6 Astra, GPT-5.6 Sol, GPT-5.6 Luna, GPT-5.5, GPT-5.4 y GPT-5.2. Los tamaños de prompt medidos en la familia 5.x se mantienen en Astra; no hace falta volver a contarlos.
  • Parámetros. temperature devuelve 400 tanto en Astra como en Sol (“not supported with this model”), igual que top_p y logprobs; response_format con un esquema JSON estricto devuelve una respuesta válida según el esquema en ambos modelos; los dos rechazan valores de max_tokens inferiores a 16.
  • max en Sol. En julio, reasoning_effort: "max" devolvía 400 en GPT-5.6 Sol mediante Chat Completions. Ahora se acepta, y Sol obtuvo 33 de 33 con ese valor.

Según la documentación, sin mediciones propias en este caso: la ventana de contexto es de 1,050,000 tokens, con un máximo de entrada de 922,000 y un máximo de salida de 128,000; los prompts que superan los 272K tokens de entrada se facturan a 2x tanto para la entrada como para la caché, el mismo umbral que usa la familia GPT-5.6 y el mismo mecanismo que medimos entre distintos proveedores; las lecturas de caché cuestan $1 por millón y las escrituras $12.50, con un nuevo parámetro prompt_cache_options.ttl: "30m" que sustituye a prompt_cache_retention. Fast mode es una opción de pago que, según OpenAI, ofrece hasta 2x más velocidad y cuesta 2x el precio estándar.

Cómo lo gestiona Synthorai

El gateway reenvía reasoning_effort sin modificarlo, incluidos los valores que no aparecen en la documentación. El registro de uso de cada petición conserva reasoning_tokens como campo independiente junto a completion_tokens y al coste facturado. Todos los datos de las tablas anteriores proceden de ahí: el nivel de esfuerzo usado en cada petición, el razonamiento consumido y su coste. La información está disponible por petición y no hay que reconstruirla a partir de un total mensual.

Preguntas frecuentes

¿GPT-6 Astra admite reasoning_effort none?

Sí. La documentación afirma que no, pero la API lo acepta en GPT-6 Astra y en GPT-5.6 Sol. Es el único valor que devuelve cero reasoning tokens. También falló en 17 de 33 ejecuciones del conjunto de tareas verificadas, así que solo resulta adecuado para consultas y transformaciones, no para tareas con varios pasos.

¿Qué hace reasoning_effort disabled en GPT-6 Astra?

Activa el razonamiento. disabled se acepta en GPT-6 Astra y se rechaza en GPT-5.6 Sol. No figura en ninguna lista documentada ni anunciada. En nuestro conjunto difícil consumió 243 reasoning tokens por llamada frente a los 151 de low, con la misma precisión. Debe tratarse como un alias caro de un nivel intermedio, no como un interruptor para desactivar el razonamiento.

¿Qué reasoning_effort debería usar por defecto en GPT-6 Astra?

low. En GPT-6 Astra consumió cero reasoning tokens en una tarea de un solo paso y entre 16 y 345 tokens por tarea en las de varios pasos. Obtuvo 33 de 33 donde none consiguió 16, mientras que max costó 2.3x más para devolver las mismas respuestas. Solo conviene subir un call site concreto cuando una evaluación con tus propias tareas demuestre que un nivel superior cambia los resultados. Configúralo explícitamente en cada llamada y consulta después el recuento de razonamiento en el bloque de uso:

resp = client.chat.completions.create(
    model="gpt-6-astra",
    reasoning_effort="low",
    messages=[{"role": "user", "content": prompt}],
)
print(resp.usage.completion_tokens_details.reasoning_tokens)

Mediciones realizadas el 2026-09-07 mediante una interfaz Chat Completions compatible con OpenAI, además del endpoint Responses para comparar la visibilidad: 11 tareas con claves de respuesta calculadas localmente por fuerza bruta, 7 niveles de esfuerzo, 3 ejecuciones por combinación en ambos modelos, prompts con salt (un sufijo único por petición para evitar que la respuesta proceda de una caché) y costes obtenidos del registro de uso de cada petición. Las cifras de los benchmarks proceden de la tabla de lanzamiento de OpenAI y del ranking de Artificial Analysis, ambos consultados el mismo día. El coste por respuesta correcta frente a GPT-5.6 Sol se calcula a partir del número de tokens y el precio de catálogo documentado de cada modelo.

Relacionado: controles de razonamiento en 13 modelos, guía de costes de GPT-5.6, coste de Claude Opus 5, tramos de precios para contextos largos, coste de escritura en la caché de prompts.

← Volver al blog