Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

GPT-6.1 Sol vs Claude Sonnet 5.5: mismo $2/$10, mitad por tarea

Contenido
  1. ¿Qué es GPT-6.1 Sol y qué afirma OpenAI sobre el modelo?
  2. ¿Con qué modelo conviene compararlo: Opus 5.5, Sonnet 5.5 o GPT-6 Sol?
  3. ¿Cómo hicimos las pruebas?
  4. ¿Cuesta menos GPT-6.1 Sol que Sonnet 5.5 por tarea?
  5. ¿Cuál respeta «solo la respuesta» y cuál acierta?
  6. ¿Corrigió GPT-6.1 Sol las respuestas breves de GPT-6 Sol?
  7. ¿Es más lento GPT-6.1 Sol?
  8. ¿Qué ocurre en un bucle de herramientas?
  9. ¿Coinciden nuestros resultados con otras pruebas publicadas?
  10. ¿Qué observamos y cuál conviene usar?
  11. Preguntas frecuentes

GPT-6.1 Sol y Claude Sonnet 5.5 tienen el mismo precio de lista: $2 por millón de tokens de entrada y $10 por millón de salida. Pero el coste por tarea es muy distinto. Con el nivel de razonamiento predeterminado de cada API, GPT-6.1 Sol costó aproximadamente la mitad (0.49x); para una misma puntuación en un índice independiente, alrededor de una cuarta parte. Frente a Claude Opus 5.5, el rival que citó OpenAI, costó 0.29x. Por el coste adicional, Sonnet 5.5 ofrece una puntuación máxima entre 4 y 6 puntos superior en índices independientes, respuestas más rápidas y ninguna respuesta incorrecta en una tarea que GPT-6.1 Sol falló varias veces.

TL;DR

  • Con los ajustes predeterminados de las API, GPT-6.1 Sol costó 0.49x frente a Sonnet 5.5 y 0.29x frente a Opus 5.5 por tarea en 13 tareas.
  • Artificial Analysis da una puntuación de 52 tanto a GPT-6.1 Sol en max como a Sonnet 5.5 en xhigh, con costes de $0.72 y $2.74 por tarea.
  • GPT-6.1 Sol respondió solo con el valor solicitado en 234 de 234 prompts; Sonnet 5.5 lo hizo en 22 de 39 con su ajuste predeterminado.
  • Sonnet 5.5 acertó en 234 de 234 llamadas; GPT-6.1 Sol falló una tarea en 7 de 18 llamadas.

¿Qué es GPT-6.1 Sol y qué afirma OpenAI sobre el modelo?

GPT-6.1 Sol es la actualización del modelo de gama media de OpenAI. Salió el 2026-09-29, siete días después de GPT-6 Sol, al mismo precio. Durante esa semana, los desarrolladores criticaron las respuestas breves de GPT-6 Sol, Anthropic lanzó Sonnet 5.5 al mismo precio de $2 / $10 y OpenAI canceló el lanzamiento previsto de su modelo insignia GPT-6.1 Astra tras detectar engaños y acciones no autorizadas en pruebas internas, según informó CBC.

Los precios por token, la ventana de contexto de 1,050,000 tokens y el límite de salida de 128,000 tokens no cambian. La entrada en caché ahora cuesta $0.10 por millón de tokens, frente a los $0.20 anteriores. El cambio que puede romper código está en reasoning.effort, el parámetro de Responses API que determina cuánto razonamiento interno hace el modelo antes de responder y que se factura como salida. Ahora va de low a max, con medium como valor predeterminado, y none ha desaparecido. Las solicitudes que desactivaban el razonamiento en GPT-6 Sol deben usar low. Para las llamadas a herramientas, que Chat Completions solo permitía con none, ahora hay que usar Responses API.

OpenAI compara el modelo con dos modelos insignia: su propio GPT-6 Astra y Claude Opus 5.5 de Anthropic. Según sus pruebas, iguala a Astra en DeepSWE v1.1 (programación agéntica) por cerca de una quinta parte del coste; queda a 2.1 puntos en OSWorld 2.0 (uso del ordenador) por cerca de una séptima parte; supera a Opus 5.5 por 2.2 puntos en AutomationBench (flujos de trabajo empresariales) con medium; y cuesta $5.47 por tarea de Terminal-Bench Science con max, frente a $23.21 de Opus 5.5. Son pruebas de OpenAI y no incluyen a Sonnet 5.5. El lanzamiento también anunció el nivel Ultrafast, hasta 6x más rápido a 6x el precio.

¿Con qué modelo conviene compararlo: Opus 5.5, Sonnet 5.5 o GPT-6 Sol?

Sonnet 5.5 es la comparación más útil: tiene el mismo precio de lista y deja claro que compartir tarifa no implica el mismo coste por tarea. La tabla sitúa a los tres candidatos junto a GPT-6.1 Sol. Los resultados de benchmarks independientes proceden de las páginas de sus responsables.

GPT-6.1 SolOpus 5.5Sonnet 5.5GPT-6 Sol
Precio de lista, entrada / salida por 1M tokens$2 / $10$4 / $20$2 / $10$2 / $10
Lanzamiento2026-09-292026-09-222026-09-282026-09-22
Comparaciones en su lanzamientoGPT-6 Astra, Opus 5.5Fable 5.1, Opus 5, GPT-6 AstraOpus 5.5, GPT-6 SolGPT-6 Astra, Opus 5, Fable 5
Índice de inteligencia de Artificial Analysis en max (pruebas de razonamiento, conocimientos y programación)52585648
Coste por tarea del índice en max$0.72$5.98$7.60$1.04
Índice Vals (programación, derecho, fiscalidad, medicina y otras tareas profesionales)61.2%67.0%67.0%57.5%
Coste por prueba de Vals$3.24$32.14$21.34$7.58
Clasificación pública de AutomationBench 1.0.6 en max (flujos de trabajo empresariales entre aplicaciones)no figura42.47%, $1.44 por tarea44.75%, $1.14 por tareano figura
  • Opus 5.5 es el rival que citó OpenAI, pero su precio de lista es el doble y obtiene unos 6 puntos más en ambos índices.
  • GPT-6 Sol es el predecesor al mismo precio. GPT-6.1 Sol lo supera en ambos índices y cuesta menos por tarea. Esa comparación solo sirve para decidir si conviene actualizar.
  • Sonnet 5.5 tiene el mismo precio de lista, salió un día antes y también se presentó como alternativa a Opus 5.5. Queda a 2 puntos de Opus 5.5 y supera a GPT-6.1 Sol por entre 4 y 6 puntos.

El mismo precio de lista no los hace equivalentes. GPT-6.1 Sol ofrece su puntuación a menor coste que ambos modelos de Claude:

  • Con una puntuación equivalente, cuesta entre una quinta y una cuarta parte que Sonnet 5.5: Artificial Analysis da 52 puntos tanto a Sonnet 5.5 en xhigh como a GPT-6.1 Sol en max, con un coste de $2.74 frente a $0.72 por tarea. Un nivel por debajo, Sonnet 5.5 en high alcanza 47 puntos por $1.08 y GPT-6.1 Sol en medium, 48 por $0.21.
  • En los resultados principales de los índices, el coste por tarea de Sonnet 5.5 está en el rango de Opus 5.5 ($7.60 frente a $5.98 en Artificial Analysis con max, $21.34 frente a $32.14 en Vals). Cada uno cuesta entre 7 y 11 veces más que GPT-6.1 Sol.

A cambio, Sonnet 5.5 y Opus 5.5 llegan a 56 y 58 puntos en Artificial Analysis, puntuaciones que GPT-6.1 Sol no alcanza con ningún ajuste.

¿Cómo hicimos las pruebas?

Ejecutamos tres conjuntos de tareas, todos evaluados mediante código, en la API nativa de cada modelo (Responses para GPT y Messages para Claude):

PruebaContenidoQué medimos
Tareas de una sola respuesta13 tareas con respuesta conocida (por ejemplo, un problema de mochila con 10 elementos: encontrar la mejor combinación sin superar un límite de peso), todas terminadas en “Reply with a single integer, nothing else”; 3 repeticiones por nivel de razonamientorespuesta correcta, respuesta sin texto adicional (solo el valor), coste, tiempo
Documentos empresariales80 prompts que solo indican el objetivo (“Write the Q3 regional review”) y 80 que enumeran las partes obligatorias: informes trimestrales, análisis posteriores a incidentes, comparativas de proveedores, respuestas de soportepresencia de todas las partes previstas, palabras, coste
Bucle de herramientas4 preguntas sobre código en un repositorio sintético pequeño, 3 herramientas, 3 repeticionespreguntas resueltas, llamadas a herramientas, coste, tiempo

Cada prompt incluía una cadena aleatoria única para evitar respuestas procedentes de caché, y calculamos el coste con precios de lista. Las cifras de tareas de una sola respuesta y bucles de herramientas de Sonnet 5.5 y Opus 5.5 vienen de nuestras mediciones de Sonnet 5.5 del día anterior, hechas con las mismas tareas y evaluadores. Solo consideramos significativa una diferencia si supera la corrección de Holm, que eleva el umbral al probar varias comparaciones a la vez. Las comparaciones de respuestas sin texto adicional se cuentan por tarea, porque las repeticiones de una misma tarea no son independientes.

¿Cuesta menos GPT-6.1 Sol que Sonnet 5.5 por tarea?

GPT-6.1 Sol costó cerca de la mitad. Con los ajustes predeterminados de cada API, cada tarea de una sola respuesta costó $0.0020 con este modelo y $0.0042 con Sonnet 5.5: una proporción de 0.49 (intervalo del 95% de 0.40 a 0.59, calculado mediante remuestreo de las 13 tareas). Sonnet 5.5 generó entre 1.7 y 2.5 veces más tokens de salida en los niveles inferiores a max, y 3.1 veces más en max. Opus 5.5, con el doble de precio de lista, costó $0.0070 con su ajuste predeterminado. Por tanto, GPT-6.1 Sol costó 0.29x frente a Opus.

La proporción se mantuvo en todos los niveles de razonamiento: entre 0.33x y 0.58x del coste de Sonnet 5.5 y entre 0.20x y 0.31x del de Opus 5.5. Si no se especifica el nivel, GPT-6.1 Sol y Opus 5.5 usan medium, mientras que Sonnet 5.5 usa high. Las otras dos pruebas dieron la misma proporción frente a Sonnet 5.5, 0.46x: $0.0103 frente a $0.0223 por documento empresarial cuyo prompt solo indicaba el objetivo, y $0.0052 frente a $0.0112 por ejecución del bucle de herramientas.

Gráfico de barras agrupadas del coste por 1,000 tareas de una sola respuesta según el nivel de razonamiento para GPT-6.1 Sol, Claude Sonnet 5.5 y Claude Opus 5.5. Con los ajustes predeterminados: $2.0, $4.1 y $7.0. En max: $4.7, $14.6 y $23.4. GPT-6.1 Sol tiene el coste más bajo en todos los niveles. Las respuestas sin texto adicional son 39 de 39 en todos los niveles para GPT-6.1 Sol y Opus 5.5, y entre 12 y 39 de 39 para Sonnet 5.5

El nivel de razonamiento se configura con un campo de la solicitud; los tokens facturados aparecen en usage:

from openai import OpenAI

client = OpenAI()
resp = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "low"},  # low, medium (default), high, xhigh, max; "none" is not listed for 6.1
    input="Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else.",
)
print(resp.output_text)
u = resp.usage
print(u.output_tokens, u.output_tokens_details.reasoning_tokens, u.input_tokens_details.cached_tokens)

output_tokens incluye los tokens de razonamiento, y cached_tokens es la parte de la entrada que se factura a $0.10 por millón.

¿Cuál respeta «solo la respuesta» y cuál acierta?

GPT-6.1 Sol respetó el formato en todos los prompts. Sonnet 5.5 no cometió errores en la tarea que GPT-6.1 Sol falló varias veces. GPT-6.1 Sol respondió solo con el valor en los 234 prompts, igual que Opus 5.5. Sonnet 5.5 lo hizo en 22 de 39 con su ajuste predeterminado, 12 con low, 24 con medium y 30 con high. Por debajo de xhigh, a veces omite el bloque de pensamiento (la parte separada de razonamiento en una respuesta de Claude) y escribe el desarrollo en la respuesta, como explicamos en nuestro artículo sobre Sonnet 5.5. Contada por tarea, la diferencia supera la corrección con low (GPT-6.1 Sol fue mejor en 9 de 13 tareas y peor en ninguna), pero no con los ajustes predeterminados (6 y ninguna). El código que espera un único valor puede leer directamente la respuesta de GPT-6.1 Sol; con Sonnet 5.5, conviene tomar la última línea o usar xhigh.

Sonnet 5.5 acertó en las 234 llamadas y Opus 5.5 falló 2. GPT-6.1 Sol respondió 72 al problema de la mochila en 7 de sus 18 llamadas, cuando el valor correcto, comprobado probando todos los subconjuntos, es 62: tres de tres con low, una de tres con su ajuste predeterminado y con medium, dos de tres con xhigh, y ninguna con high ni max. Una tarea de 13 no basta para demostrar una diferencia de precisión, pero sí muestra que el error pasa inadvertido: la respuesta es un entero con el formato correcto y aumentar el nivel de razonamiento no lo evitó de forma fiable.

¿Corrigió GPT-6.1 Sol las respuestas breves de GPT-6 Sol?

GPT-6.1 Sol vuelve a dar respuestas extensas. En los prompts que solo indican qué documento hay que escribir, sin enumerar sus partes, produjo 565 palabras por documento frente a las 325 de GPT-6 Sol. Fue más largo en los 80 casos y quedó cerca de GPT-5.6 Sol, con 592. No pudimos reproducir la queja de que GPT-6 Sol omitía contenido: incluyó todo lo necesario (todas las regiones, todos los eventos de cada incidente y una respuesta a cada ticket) en 58 de 60 documentos evaluados, igual que GPT-5.6 Sol. Las 20 comparativas de proveedores no se evaluaron porque elegir al proveedor adecuado requiere un juicio subjetivo.

Cuando el prompt enumeraba las partes obligatorias, los tres modelos de OpenAI incluyeron todo en 80 de 80 casos. Sonnet 5.5 escribió los documentos más largos cuando solo se indicaba el objetivo (747 palabras) y también completó todos los documentos evaluados de ese grupo. En cambio, incumplió las condiciones en 12 de 80 prompts con partes especificadas: en cada caso, un memorando o una recomendación quedó entre 1 y 28 palabras por debajo del rango solicitado. La diferencia supera la corrección, pero 10 de los 12 casos son informes trimestrales, así que aporta poca información sobre otros tipos de documento.

Las respuestas más largas elevaron el coste por documento cuyo prompt solo indicaba el objetivo de $0.0078 con GPT-6 Sol a $0.0103. Aun así, sigue siendo un 59% inferior al de GPT-5.6 Sol, cuyo precio de lista es $4 / $20 (precio promocional hasta el 2026-11-21). Si se recalculan los tokens de GPT-5.6 Sol a $2 / $10, GPT-6.1 Sol sale un 19% más barato porque usa menos tokens para una extensión similar.

¿Es más lento GPT-6.1 Sol?

GPT-6.1 Sol es más lento que sus predecesores y que Sonnet 5.5, sobre todo con respuestas largas. En los documentos empresariales generó unos 43 tokens de salida por segundo de tiempo total de solicitud, frente a 100 de GPT-6 Sol, 80 de GPT-5.6 Sol y 127 de Sonnet 5.5. La mediana para un documento cuyo prompt solo indicaba el objetivo fue de 22.4 segundos, frente a 7.2, 13.9 y 17.2. En las tareas breves de una sola respuesta, la diferencia es menor: 5.7 segundos con los ajustes predeterminados, frente a 3.9 de Sonnet 5.5 y 5.5 de Opus 5.5. La velocidad absoluta depende del proveedor y de la hora. Artificial Analysis también sitúa a GPT-6.1 Sol por debajo de la mitad de la velocidad de Sonnet 5.5: 64 tokens por segundo frente a 139.

¿Qué ocurre en un bucle de herramientas?

GPT-6.1 Sol y Sonnet 5.5 resolvieron las 12 ejecuciones en todos los niveles. GPT-6.1 Sol lo hizo por menos de la mitad del coste, pero tardó casi el doble. En un bucle de herramientas, el modelo solicita una herramienta, el código que lo invoca la ejecuta y devuelve el resultado; el ciclo se repite hasta que el modelo responde. Nuestra prueba usa tres herramientas (listar archivos, leer un archivo y buscar) sobre un repositorio sintético pequeño. Con los ajustes predeterminados, cada ejecución costó $0.0052 con GPT-6.1 Sol, $0.0112 con Sonnet 5.5 y $0.0332 con Opus 5.5. Las medianas de tiempo fueron 12.2, 6.7 y 25.3 segundos. En max, GPT-6.1 Sol subió a $0.0086 y Sonnet 5.5 a $0.0422, con 6.4 y 14.7 llamadas a herramientas por ejecución.

¿Coinciden nuestros resultados con otras pruebas publicadas?

Nuestros resultados coinciden con las pruebas publicadas en la tendencia. Las magnitudes varían porque nuestras tareas son breves y se ejecutan principalmente con los ajustes predeterminados de las API, mientras que los índices públicos usan tareas largas en max.

PreguntaDatos publicados por otrosNuestra mediciónConclusión
Coste de GPT-6.1 Sol frente a Sonnet 5.5Artificial Analysis: $0.72 frente a $7.60 por tarea del índice en max, unas 11 veces menos0.49x con los ajustes predeterminados, 0.33x en maxMisma tendencia; en max, la diferencia crece en tareas más largas: 0.33x en tareas de una sola respuesta, 0.20x en nuestro bucle de herramientas y 0.09x en el índice
VelocidadArtificial Analysis: 64 frente a 139 tokens de salida por segundo; Vals AI: las tareas agénticas tardan entre 2 y 3 veces más que con GPT-6 Sol43 frente a 127 tokens por segundo; 22.4 s frente a los 7.2 s de GPT-6 Sol por documentoCoincide
Calidad frente a Sonnet 5.5Artificial Analysis: 52 frente a 56; Vals: 61.2% frente a 67.0%Sonnet 5.5 acertó en 234 de 234; GPT-6.1 Sol falló una tarea 7 de 18 vecesMisma tendencia; nuestro resultado depende de una sola tarea
Respuestas de GPT-6 Sol demasiado breves o con contenido ausenteQuejas de desarrolladores, por ejemplo en el hilo del lanzamiento en Hacker News325 palabras por documento frente a 592 de GPT-5.6 Sol; incluyó todo lo necesario en 58 de 60, igual que GPT-5.6 SolBrevedad confirmada; no se reprodujo la omisión de contenido
Sonnet 5.5 ignora «solo la respuesta»No encontramos informes publicados22 de 39 respuestas sin texto adicional con su ajuste predeterminado, 12 de 39 con lowSolo nuestras pruebas

¿Qué observamos y cuál conviene usar?

GPT-6.1 Sol ofrece mejor relación entre calidad y coste que Sonnet 5.5 y Opus 5.5. Sonnet 5.5 merece el coste adicional cuando importan la latencia o esos últimos 4 a 6 puntos de calidad. Cuatro observaciones sustentan esta conclusión:

  1. GPT-6.1 Sol ofrece la calidad obtenida a menor coste que ambos modelos de Claude. Frente a Sonnet 5.5 cuesta cerca de la mitad por tarea breve, cerca de una cuarta parte para una puntuación equivalente en el índice y entre una séptima y una décima parte en los resultados principales de los índices. Frente a Opus 5.5 cuesta 0.29x por tarea breve y entre una octava y una décima parte en los índices.
  2. Respeta mejor el formato de salida. Entregó lo solicitado en todos los prompts que pedían solo la respuesta y en todos los documentos con partes especificadas.
  3. Corregir las respuestas breves redujo la velocidad. Las respuestas vuelven a tener una extensión similar a las de GPT-5.6 Sol, pero cada documento tarda tres veces más que con GPT-6 Sol.
  4. Sus errores son difíciles de detectar. Las 7 respuestas incorrectas aparecieron con low, medium y xhigh, y todas eran enteros con el formato correcto.
Tipo de trabajoElecciónDatos
Salida procesada por código: extracción, clasificación, valores únicosGPT-6.1 Sol en medium o highrespuesta sin texto adicional en 234 / 234; $0.0021 por tarea en medium
Matemáticas o lógica de varios pasos donde un valor incorrecto sale caroSonnet 5.5, o GPT-6.1 Sol con verificación del resultadoSonnet 5.5 acertó en 234 / 234; GPT-6.1 Sol falló en 7 de 18 llamadas para una tarea
Chat y herramientas interactivas, donde importa la latenciaSonnet 5.5 con su ajuste predeterminado3.9 s frente a 5.7 s por tarea breve; 17.2 s frente a 22.4 s por documento
Bucles de agentes donde importa más el coste por ejecución que la latenciaGPT-6.1 Sol con su ajuste predeterminado$0.0052 por ejecución frente a $0.0112; 12.2 s frente a 6.7 s
Documentos con secciones obligatoriasGPT-6.1 Sol, o Sonnet 5.5 con márgenes amplios de extensiónincluyó todo lo necesario en 80 / 80 frente a 68 / 80; los casos fallidos quedaron entre 1 y 28 palabras cortos
Trabajo difícil y abierto donde importa la puntuación máximaSonnet 5.5 u Opus 5.5 en maxpuntuaciones de 56 y 58 frente a 52 en índices públicos, por un coste por tarea entre 7 y 11 veces mayor

Con cualquiera de los modelos, valida los valores que vaya a utilizar un programa.

Preguntas frecuentes

¿Cuesta menos GPT-6.1 Sol que Claude Sonnet 5.5? GPT-6.1 Sol cuesta menos por tarea que Sonnet 5.5 pese a compartir el precio de lista de $2 / $10: 0.49x por tarea de una sola respuesta con los ajustes predeterminados de cada modelo y 0.46x por ejecución del bucle de herramientas en nuestras pruebas. Con una puntuación equivalente de 52 en Artificial Analysis, cuesta $0.72 frente a $2.74. Sonnet 5.5 fue más rápido y puntúa más alto en max.

¿Es GPT-6.1 Sol tan bueno como Claude Opus 5.5? GPT-6.1 Sol queda unos 6 puntos por debajo de Opus 5.5 tanto en el índice de inteligencia de Artificial Analysis (52 frente a 58) como en el índice Vals (61.2% frente a 67.0%), con un coste por tarea de entre una octava y una décima parte. En nuestras pruebas costó 0.29x por tarea breve. En las pruebas de OpenAI lo supera por 2.2 puntos en AutomationBench.

¿Puedo seguir desactivando el razonamiento en GPT-6.1 Sol? El nivel de razonamiento más bajo de GPT-6.1 Sol es low; none, que aceptaba GPT-6 Sol, ya no está disponible. Usa low, que en nuestras pruebas costó $0.0018 por tarea de una sola respuesta.

Mediciones relacionadas: Claude Sonnet 5.5 frente a Sonnet 5, los niveles de razonamiento de GPT-6 Astra y cómo reducir el coste de GPT-5.6.

Mediciones realizadas el 2026-09-30, un día después del lanzamiento de GPT-6.1 Sol, mediante un gateway hacia OpenAI Responses API y Anthropic Messages API: 234 llamadas de una sola respuesta a GPT-6.1 Sol (13 tareas, 3 repeticiones, 6 ajustes), 800 llamadas para documentos empresariales (80 prompts que solo indicaban el objetivo en 6 combinaciones de modelo y nivel de razonamiento, y 80 que especificaban las partes en 4) y 36 ejecuciones del bucle de herramientas. Las cifras de Sonnet 5.5 y Opus 5.5 para tareas de una sola respuesta y bucles de herramientas proceden del 2026-09-29, con las mismas tareas. Consultamos los resultados de los benchmarks públicos en las páginas de sus responsables el 2026-10-01.

← Volver al blog