GPT-5.6 Sol vs Terra vs Luna: Qué nivel usar (2026)
GPT-5.6 se lanza en tres niveles — Sol, Terra, Luna. Aquí el desglose de precios, benchmarks y casos de uso, y cómo elegir el adecuado para tu carga de trabajo de API.

TL;DR
- GPT-5.6 pasó a disponibilidad general el 9 de julio de 2026 en tres niveles: Sol (flagship), Terra (equilibrado por defecto) y Luna (el más barato y rápido)
- Por 1M de tokens: Sol cuesta $5/$30, Terra $2.50/$15, Luna $1/$6 — una diferencia de 5× de arriba a abajo
- La brecha en benchmarks es mucho menor que la de precios: Terra se sitúa a ~2 puntos de Sol en la mayoría de las pruebas a la mitad del coste, así que Terra es la opción por defecto para la mayoría del trabajo
- Usa Sol solo para las tareas agentic y de horizonte largo más difíciles; usa Luna para trabajos de alto volumen y contexto corto — pero no de contexto largo (su recall se derrumba)
OpenAI no lanzó un solo GPT-5.6. Lanzó tres — Sol, Terra y Luna — a precios que abarcan 5× de arriba a abajo. La pregunta obvia para cualquiera que llame a la API: ¿necesitas de verdad el flagship, o basta con el nivel barato? La respuesta honesta es que la brecha en benchmarks es mucho más estrecha que la de precios, así que la mayoría de las cargas de trabajo no deberían usar Sol por defecto. Aquí va el desglose precio-rendimiento, nivel por nivel, con el único punto en el que el nivel barato sí se desmorona de verdad.

¿Qué son GPT-5.6 Sol, Terra y Luna?
GPT-5.6 Sol, Terra y Luna son tres niveles de la misma familia de modelos, lanzados juntos el 9 de julio de 2026, que intercambian capacidad por coste. Sol es el flagship, Terra es el nivel equilibrado de uso diario y Luna es el campeón de coste y velocidad.
Comparten la misma generación — Programmatic Tool Calling (el modelo escribe JavaScript que se ejecuta en un sandbox V8 aislado sin acceso a red) y el nuevo prompt caching predecible se aplican a los tres. Lo que cambia entre niveles es la capacidad bruta, la latencia y el precio. Los tres están disponibles ya a través de la OpenAI API, ChatGPT, Codex y GitHub Copilot.
Niveles de GPT-5.6 de un vistazo:
| Tier | API model ID | Price /1M (in/out) | Best for |
|---|---|---|---|
| Sol | gpt-5.6-sol | $5 / $30 | Hardest agentic + long-horizon work |
| Terra | gpt-5.6-terra | $2.50 / $15 | The default for most production tasks |
| Luna | gpt-5.6-luna | $1 / $6 | High-volume, latency-sensitive, short-context |
*Fuente: lanzamiento de OpenAI GPT-5.6, 9 de julio de 2026. gpt-5.6 es un alias que apunta al flagship.*
El mensaje que OpenAI empuja — "intelligence that scales with your ambition" — en realidad significa: elige el nivel más pequeño que supere el listón de tu tarea, y solo paga más cuando no te quede más remedio.
¿Cuánto cuesta cada nivel de GPT-5.6?
Por 1M de tokens, Sol cuesta $5 de entrada / $30 de salida, Terra cuesta $2.50 / $15 y Luna cuesta $1 / $6. Es un descenso limpio de 2× en cada nivel y una diferencia total de 5× entre Sol y Luna.
Los precios por token son abstractos hasta que los aplicas a una carga real. Toma una app de producción moderada con 10M de tokens de entrada y 2M de salida al mes:
Coste mensual para una carga de 10M-in / 2M-out:
| Tier | Input cost | Output cost | Monthly total |
|---|---|---|---|
| Sol | $50 | $60 | $110 |
| Terra | $25 | $30 | $55 |
| Luna | $10 | $12 | $22 |
*Cálculo ilustrativo sobre las tarifas publicadas por token; tu reparto de entrada frente a salida moverá los totales.*

Misma tarea, 5× de diferencia en la factura. Esa brecha es toda la razón para preocuparte por a qué nivel enrutas — y por qué usar Sol por defecto en cada llamada es la forma más habitual en que los equipos gastan de más en esta familia.
¿Cómo se comparan GPT-5.6 Sol, Terra y Luna en benchmarks?
En la mayoría de los benchmarks los tres niveles se agrupan mucho más cerca de lo que sugieren sus precios — Terra suele situarse a unos 2 puntos de Sol, y Luna a unos cuantos más. La excepción es el long-context recall, donde Luna se cae por un precipicio.
Aquí van las cifras publicadas de la familia:
Comparación de benchmarks de GPT-5.6:
| Benchmark | Sol | Terra | Luna |
|---|---|---|---|
| Terminal-Bench 2.1 | 88.8% | 87.4% | 84.7% |
| Agents' Last Exam | 53.6 | 50.4 | 50.3 |
| Coding Agent Index (Artificial Analysis) | 80 | 77.4 | 74.6 |
| MRCR long-context recall | 91.5% | 89.6% | 41.3% |
*Fuente: tablas de benchmarks publicadas de GPT-5.6, 2026 (Vellum, OpenAI). Sol también obtiene 92.2% en BrowseComp; Sol Ultra llega a 91.9% en Terminal-Bench 2.1.*
Saltan dos cosas. Primero, en tareas de coding y agentic los niveles están cerca — Luna retiene aproximadamente el 85% de la calidad de Sol a una quinta parte del precio, un excelente intercambio para trabajo de alto volumen. Segundo, MRCR long-context recall es donde el nivel barato se rompe: Luna cae al 41.3% mientras Sol y Terra se mantienen cerca del 90%. Si tu carga de trabajo alimenta documentos largos o contextos grandes, Luna queda fuera de la mesa sin importar el precio.
¿Cuándo deberías usar cada nivel de GPT-5.6?
Por defecto Terra, escala a Sol solo para el trabajo agentic más duro, y baja a Luna para trabajos de alto volumen y contexto corto. No elijas un nivel por prestigio — elígelo por lo que la tarea exige de verdad.
- Terra — el valor por defecto. Iguala o se acerca a ~2 puntos de Sol en la mayoría de los benchmarks a la mitad del precio. Para la mayoría de las apps de producción, chat, asistencia de coding y pasos agentic generales, Terra es el punto de partida correcto. Busca otra cosa solo cuando una tarea concreta demuestre que Terra no basta.
- Sol — los casos difíciles. Flujos multi-paso de horizonte largo, operaciones complejas de terminal, investigación de ciberseguridad, computer use y cualquier cosa que necesite máximo razonamiento o ultra mode. Sol es el único nivel que soporta por completo las funciones frontier, y lidera todos los benchmarks — solo que no por lo suficiente como para justificar usarlo en todas partes.
- Luna — volumen, no profundidad. Pipelines de alto throughput y sensibles a la latencia donde el coste por consulta importa más que los últimos puntos de razonamiento: clasificación, etiquetado, enrutado, resúmenes cortos, generación masiva. Manténlo lejos del trabajo de contexto largo.
El patrón práctico al que llegan la mayoría de los equipos no es "elige uno". Es el enrutado: Luna o Terra para la mayor parte de las llamadas, Sol reservado para los pasos que de verdad lo necesitan. Ahí es donde un setup de niveles mixtos se paga solo.
¿Cómo se cambia entre niveles de GPT-5.6 en la API?
Cambias de nivel modificando el model ID — gpt-5.6-sol, gpt-5.6-terra o gpt-5.6-luna — mientras el resto de la petición se mantiene idéntico. Como los niveles comparten una sola interfaz, enrutar por tarea es un cambio de un solo campo.
from openai import OpenAI
client = OpenAI(api_key="sk-...") # use an environment variable, never hardcode
def answer(prompt, hard=False, bulk=False):
# route by task: cheap by default, escalate only when needed
model = "gpt-5.6-sol" if hard else "gpt-5.6-luna" if bulk else "gpt-5.6-terra"
return client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)El problema de ir en directo es que este enrutado vive en tu código, atado a los niveles de un solo proveedor. Si más adelante quieres mandar parte del tráfico a un modelo no OpenAI más barato, o hacer fallback cuando un nivel tiene rate-limit, lo reconstruyes. Un gateway unificado como Velokey pone Sol, Terra, Luna y los modelos de otros vendors detrás de un solo endpoint compatible con OpenAI, de modo que el enrutado por nivel y el fallback entre modelos pasan a ser configuración, no una reescritura — que es todo el sentido de repartir una carga entre niveles para controlar el coste.
Para el contexto del lanzamiento y cómo llegó GPT-5.6 hasta aquí, consulta nuestra cobertura del lanzamiento de GPT-5.6; para ver cómo se compara con otros modelos frontier, nuestro desglose de GLM-5.2 vs GPT-5.5 vs Claude Opus 4.8 y la guía de precios de la Claude API son buenas lecturas siguientes.
Preguntas frecuentes
¿Qué nivel de GPT-5.6 debería usar por defecto?
Terra. Rinde a unos 2 puntos de Sol en la mayoría de los benchmarks a la mitad del precio ($2.50/$15 por 1M de tokens frente a $5/$30). Empieza las cargas de producción en Terra y solo escala a Sol para tareas que de forma medible necesiten más — agentes de horizonte largo, trabajo complejo de terminal o modos de máximo razonamiento.
¿Cuál es la diferencia de precio entre Sol, Terra y Luna?
Por 1M de tokens: Sol es $5 de entrada / $30 de salida, Terra es $2.50 / $15 y Luna es $1 / $6. Es un descenso de 2× en cada nivel y una diferencia de 5× de Sol a Luna. En una carga mensual de 10M-in/2M-out, eso es aproximadamente $110 (Sol) frente a $22 (Luna).
¿Es GPT-5.6 Luna suficiente para producción?
Para tareas de alto volumen y contexto corto, sí — Luna retiene alrededor del 85% de la calidad de Sol a una quinta parte del precio. Pero su long-context recall cae al 41.3% (frente a ~90% de Sol y Terra), así que evita Luna con documentos largos o prompts de contexto grande. Úsalo para clasificación, etiquetado, enrutado y generación masiva.
¿Cuáles son los model IDs de la API de GPT-5.6?
gpt-5.6-sol, gpt-5.6-terra y gpt-5.6-luna. El alias simple gpt-5.6 apunta al flagship (Sol). Cambiar de nivel es un cambio de un solo campo en la petición, ya que los tres comparten la misma interfaz de API.
¿Cuándo merece Sol 5× el precio de Luna?
Cuando la tarea necesita de verdad razonamiento frontier: agentes multi-paso de horizonte largo, operaciones complejas de terminal, investigación de ciberseguridad, computer use o trabajo de contexto largo donde el recall de Luna falla. Para chat cotidiano, ayuda de coding y pasos agentic rutinarios, la ganancia en benchmarks sobre Terra o Luna rara vez justifica el coste de Sol.
¿Puedo mezclar niveles de GPT-5.6 en una sola aplicación?
Sí, y la mayoría de los setups eficientes en coste lo hacen. Enruta la mayor parte de las llamadas a Luna o Terra y reserva Sol para los pasos más duros. Como los niveles comparten una sola interfaz, puedes seleccionar el modelo por petición. Un gateway unificado convierte este enrutado (más el fallback a otros modelos) en un cambio de configuración en lugar de un cambio de código.
¿Quieres enrutar entre niveles de GPT-5.6 sin hardcodear un solo proveedor? Obtén tu API key de Velokey y llama a Sol, Terra y Luna — más los modelos de otros vendors — a través de un solo endpoint compatible con OpenAI, con selección de modelo por petición y fallback automático.
*Última actualización: 10 de julio de 2026. Las cifras de precios y benchmarks proceden del lanzamiento de GPT-5.6 de OpenAI y de tablas de evaluación publicadas en el momento de la redacción. Los números los fija OpenAI y pueden cambiar — verifica las tarifas y benchmarks actuales antes de comprometer presupuestos de producción.*

