Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.
Guía de prompting GPT-5.6: dos defaults que cuestan 1.5x y 10x más

Guía de prompting GPT-5.6: dos defaults que cuestan 1.5x y 10x más

Contenido
  1. ¿Qué estructura debe tener una solicitud a GPT-5.6?
  2. ¿Cómo se debe configurar reasoning_effort?
  3. ¿Cómo se organiza un prompt para que la caché compense?
  4. ¿Qué falla al migrar prompts desde GPT-5.5?
  5. ¿Qué nivel debe ejecutar el prompt?
  6. Preguntas frecuentes

Para hacer buen prompting con GPT-5.6 basta, sobre todo, con controlar dos parámetros de la solicitud. Ambos usan por defecto la opción más cara. En nuestra matriz de 50 llamadas, omitir reasoning_effort costó 1.5x más que fijarlo en "none"", aunque las respuestas fueron idénticas. Si no se marca un prefijo estable, cada llamada lo factura a una tarifa 10x superior a la de una lectura desde caché. Esta guía convierte las mediciones de nuestra guía de costes de GPT-5.6 en una serie de reglas prácticas: cómo estructurar una solicitud, ajustar el nivel de esfuerzo según la tarea, organizar el prompt para aprovechar la caché y evitar problemas al migrar prompts desde GPT-5.5.

TL;DR

  • Fija reasoning_effort en todas las solicitudes a GPT-5.6: en nuestra matriz de 4 tareas, omitirlo costó 1.5x más que usar "none", con respuestas idénticas.
  • Los niveles aceptados van de none a xhigh; "max" devuelve un error 400 tanto en Sol como en Terra.
  • Marca los prefijos estables con puntos de corte de caché explícitos: las lecturas cuestan el 10% de la tarifa de entrada y las escrituras, 1.25x. Marca lo que se repite, no lo que solo parece estable.
  • prompt_cache_options y los puntos de corte devuelven un error 400 en GPT-5.5 y versiones anteriores; activa estos cambios según la versión.

¿Qué estructura debe tener una solicitud a GPT-5.6?

Parte de esta estructura y elimina lo que no necesites. Así, los dos controles quedan definidos explícitamente en lugar de heredar los valores predeterminados más caros:

{
  "model": "gpt-5.6-terra",
  "reasoning_effort": "low",
  "prompt_cache_options": { "mode": "explicit", "ttl": "30m" },
  "prompt_cache_key": "tenant-42",
  "messages": [
    { "role": "system", "content": "…stable instructions…",
      "prompt_cache_breakpoint": { "mode": "explicit" } },
    { "role": "user", "content": "…the part that changes per request…" }
  ]
}

La regla de orden es sencilla: todo lo estable va antes del punto de corte y todo lo específico de cada solicitud, después. Ningún dato dinámico, timestamps, nombres de usuario o documentos recuperados que cambien entre llamadas, debe quedar dentro del bloque marcado. Basta con que cambie un byte para que el bloque vuelva a facturarse con el recargo de escritura de 1.25x. prompt_cache_key dirige las solicitudes repetidas a la misma caché; usa una clave estable por tenant o sesión y ten en cuenta el límite flexible documentado de unas 15 solicitudes por minuto y clave.

¿Cómo se debe configurar reasoning_effort?

Siempre de forma explícita. La única opción que conviene evitar es no configurarlo. En nuestras mediciones, las solicitudes sin reasoning_effort costaron 1.5x más que las fijadas en "none", aunque las respuestas fueron idénticas en toda la matriz. Los valores aceptados son none, low, medium, high y xhigh; "max" se rechaza con un error 400 que enumera el rango válido. Esto es lo que aportó cada nivel en nuestra prueba matemática de una línea con Luna:

reasoning_effortTokens de razonamientoRespuestaCoste por llamada
none0correcta$0.000062
low52correcta$0.000410
medium85correcta$0.000608
high74correcta$0.000542

En nuestro estudio sobre la composición del uso de tokens, GPT-5.6 fue la única familia que resolvió correctamente esa prueba con el razonamiento completamente desactivado. Por eso, none es un valor predeterminado razonable para extracción, clasificación, formateo y llamadas basadas en recuperación. Cuando el modelo razona, esos tokens no son visibles y se facturan a la tarifa completa de salida: en el ejemplo matemático con la configuración predeterminada, el 88% del coste de salida correspondió a una cadena de pensamiento que no se puede consultar. Aumenta el nivel cuando tus evaluaciones indiquen que la tarea lo necesita, no porque el valor predeterminado ya lo haga.

¿Cómo se organiza un prompt para que la caché compense?

Ordena el prompt por estabilidad y marca cada capa: primero las instrucciones del sistema, después las definiciones de herramientas y luego los documentos de referencia. Cada capa debe terminar en un punto de corte, y el turno variable del usuario debe ir después de la última marca. Dispones de cuatro escrituras en caché por solicitud. En el modo implícito predeterminado, un punto de corte automático en el mensaje más reciente consume una de ellas. El modo explícito permite usar las cuatro y, sobre todo, guardar en caché únicamente lo que marques.

La ventaja está en la reutilización parcial, y la medimos. Con un bloque A estable y una cola B sustituida, el contador solo volvió a facturar la cola: de un prompt de 2,431 tokens, leyó 1,212 desde caché y escribió 1,210 de nuevo con recargo. El resultado coincidió exactamente con la tabla de tarifas. De ahí se desprenden tres reglas para calcular el presupuesto:

  • Las lecturas cuestan el 10% de la tarifa de entrada, por lo que un prefijo por capas ya disponible en caché reduce el coste de entrada.
  • Las escrituras cuestan 1.25x, así que guardar un bloque que no volverá a leerse cuesta un 25% más que no usar la caché. Marca lo que se repite, no todo lo que parezca estable.
  • En repeticiones completas, la longitud coincidente puede quedar por debajo de la marca (en una prueba se recuperaron 1,897 tokens de una escritura de 2,422). Calcula el presupuesto con la tarifa reducida, no con el número exacto de coincidencias; nuestro estudio sobre los mínimos de caché recoge los umbrales de cada familia.

El valor mínimo de ttl: "30m" es una garantía, no un límite máximo, y multiplica por 6 los 5 minutos predeterminados de Claude. Ya no existe un nivel de 24 horas, así que las cargas por lotes diarias que dependían de una retención ampliada deben volver a calcular el punto de equilibrio.

¿Qué falla al migrar prompts desde GPT-5.5?

Dos fallos son evidentes y uno pasa inadvertido. Los evidentes: prompt_cache_options y prompt_cache_breakpoint devuelven un error 400 claro en GPT-5.5 y versiones anteriores (prompt_cache_options is not supported on this model), por lo que cualquier generador de prompts compartido debe comprobar la versión. "max", presente en algunas configuraciones de 5.5, también se rechaza.

El fallo silencioso sale más caro: GPT-5.6 razona por defecto, mientras que una carga de GPT-5.5 podía tener el razonamiento desactivado. Si el prompt migrado nunca define reasoning_effort, se le aplica el sobrecoste de 1.5x por omisión con la misma tabla de tarifas. La migración de la caché funciona al revés: la detección automática de prefijos de 5.5 no requería marcas, pero tampoco podía activarse ni depurarse. En 5.6, el mismo prompt no hace nada hasta que se marca. A partir de entonces, cada escritura aparece en usage.prompt_tokens_details.cache_write_tokens; un fallo de caché se representa con un cero en un campo que has creado, en lugar de no mostrar nada.

¿Qué nivel debe ejecutar el prompt?

La misma estructura de solicitud funciona en los tres niveles, así que la elección depende del precio, no del prompting: Sol cuesta $5/$30 por millón de tokens, Terra cuesta la mitad y Luna, una quinta parte. Cuando el prefijo es estable, tiene una clave asignada y ya está disponible en caché, el descuento de lectura reduce el coste de entrada en todos los niveles. El precio de salida pasa a ser el factor diferencial; baja de nivel hasta donde permitan tus evaluaciones de calidad de salida. La guía de costes incluye el cálculo completo por nivel, incluido el punto de equilibrio del recargo de escritura.

Preguntas frecuentes

¿Admite GPT-5.6 reasoning_effort: “max”?

No. Tanto en Sol como en Terra, las solicitudes con "max" devuelven un error 400 que enumera como valores válidos desde none hasta xhigh. Las cargas que necesiten el nivel máximo deben enviar xhigh explícitamente.

¿Funcionan los puntos de corte de caché en GPT-5.5?

No. GPT-5.5 y las versiones anteriores rechazan prompt_cache_options y los marcadores de puntos de corte con un error 400. En esos modelos se vuelve a la detección automática de prefijos, que no puede activarse, asociarse a una clave ni depurarse. Trata allí la caché como una optimización sin garantías y haz que cualquier generador de prompts que emita los campos nuevos compruebe la versión.

¿Cuántos puntos de corte debería usar realmente un prompt?

Tantos como capas se repitan de verdad, dentro del límite: hay cuatro escrituras por solicitud, y el punto de corte automático del modo implícito consume una salvo que se cambie al modo explícito. Un prompt por capas típico necesita dos o tres, instrucciones, herramientas y bloque de referencia. Un quinto marcador se acepta sin errores, pero comparte los slots de escritura, ya que una marca posterior abarca todo lo anterior.

Todas las cifras de esta guía se midieron mediante el gateway de Synthorai con los modelos GPT-5.6 del primer día y coinciden con el contador activo de usage.cost; la metodología y las pruebas sin procesar están en la guía de costes y el estudio sobre los mínimos de caché. Compruébalas con tus propios registros de uso; las tarifas y los valores aceptados pueden cambiar.

← Volver al blog