Codex

GPT-5.6 Sol, Terra y Luna en Codex: cómo elegir modelo y ahorrar créditos

Para la mayoría de las tareas cotidianas en Codex, GPT-5.6 Terra con razonamiento Medium ofrece el mejor punto de partida: cuesta la mitad de créditos por categoría de token que GPT-5.5 o Sol. Luna conviene para trabajo claro y repetible; Sol, para problemas ambiguos, críticos o que exigen más criterio.

Publicado
Lectura
14 min
Ilustración conceptual no oficial de Codex rodeado por Sol, Terra y Luna como tres niveles de capacidad

GPT-5.6 Sol, Terra o Luna: respuesta rápida

Si querés cuidar los créditos de Codex sin bajar automáticamente el nivel que obtenías con GPT-5.5, empezá con GPT-5.6 Terra en Medium. Reservá Luna Medium para tareas mecánicas, repetibles y con un resultado verificable. Usá Sol Medium o High cuando el problema sea ambiguo, el contexto sea difícil de interpretar o el costo de equivocarse sea alto.

Una configuración inicial razonable para ChatGPT Pro 5x queda así:

  • Predeterminado: Terra Medium.
  • Extracción, clasificación, conversiones y cambios mecánicos: Luna Medium.
  • Trabajo estructurado que antes enviabas a GPT-5.5 High: Terra High.
  • Arquitectura, depuración difícil, investigación abierta o entrega muy pulida: Sol Medium; escalá a Sol High si hace falta.
  • XHigh: solamente después de comprobar que High no alcanza.
  • Max: para problemas excepcionales donde la calidad importa más que el consumo.
  • Ultra: cuando el trabajo puede dividirse de verdad entre varios agentes.
  • Fast mode: apagado si la prioridad es estirar el límite.

Recomendación práctica. No optimices “créditos por mensaje”. Medí créditos por tarea aceptada: una respuesta barata que exige tres correcciones puede costar más que una resolución correcta con un modelo superior.

Qué diferencia a Sol, Terra y Luna

La documentación oficial de modelos de Codex presenta a Sol como la opción de mayor capacidad para trabajo complejo y abierto; a Terra como el modelo equilibrado para el día a día; y a Luna como la alternativa rápida y económica para tareas claras y repetibles.

Esa separación no significa “bueno, medio y malo”. Describe tres perfiles de costo y capacidad:

  • Sol prioriza análisis, criterio y terminación. Tiene sentido en cambios complejos, seguridad, investigación profunda, contexto difícil y piezas donde el pulido final evita retrabajo.
  • Terra busca equilibrio. Es la opción natural para features habituales, bugs reproducibles, refactors con alcance definido, revisión de código y trabajo con herramientas.
  • Luna prioriza volumen. Funciona mejor cuando podés explicar con precisión qué debe producir, qué no debe tocar y cómo se valida el resultado.

El esfuerzo de razonamiento es otro eje. Low o Light favorece rapidez; Medium equilibra velocidad y análisis; High y XHigh destinan más razonamiento a problemas difíciles; Max amplía todavía más ese presupuesto. Subir el esfuerzo puede mejorar una tarea, pero también consume más tiempo y tokens.

Dato oficial. OpenAI aclara que no existe una equivalencia exacta entre los esfuerzos de GPT-5.5 y GPT-5.6. También indica que la mayoría de las tareas no necesita Max ni Ultra.

Ultra no es un valor de reasoning.effort. Es un modo multiagente: coordina subagentes para resolver partes separadas en paralelo. Puede mejorar calidad y latencia en trabajo divisible, pero el costo total incluye los tokens de todos los agentes. No lo uses para una única cadena secuencial que no puede partirse.

Costos y límites: créditos de Codex no son precios de API

Hay dos números distintos que conviene mantener separados. Los créditos de Codex determinan el consumo dentro de los planes compatibles de ChatGPT. Los precios de API se facturan en dólares por tokens utilizados. Comparten la misma relación entre modelos, pero no son la misma bolsa ni el mismo mecanismo de cobro.

Según la tabla oficial de pricing de Codex, los créditos por un millón de tokens son:

Modelo
GPT-5.5
Entrada
125
Entrada en caché
12,5
Salida
750
Relación frente a GPT-5.5
1,00×
Modelo
GPT-5.6 Sol
Entrada
125
Entrada en caché
12,5
Salida
750
Relación frente a GPT-5.5
1,00×
Modelo
GPT-5.6 Terra
Entrada
62,5
Entrada en caché
6,25
Salida
375
Relación frente a GPT-5.5
0,50×
Modelo
GPT-5.6 Luna
Entrada
25
Entrada en caché
2,5
Salida
150
Relación frente a GPT-5.5
0,20×

Dato oficial. Sol tiene la misma tarifa de créditos que GPT-5.5; Terra cuesta 0,5× y Luna 0,2× en cada categoría de token. Eso no garantiza que una tarea completa cueste exactamente la mitad o una quinta parte: modelos, razonamiento, contexto, herramientas y reintentos pueden cambiar la cantidad de tokens usada.

En la API, el anuncio oficial de GPT-5.6 informa USD 5 de entrada y USD 30 de salida por millón de tokens para Sol; USD 2,50 y USD 15 para Terra; y USD 1 y USD 6 para Luna. Las escrituras explícitas de caché cuestan 1,25× la entrada no cacheada, mientras que las lecturas conservan el descuento del 90%. Esos precios sirven para presupuestar llamadas con API key, no para calcular una supuesta bolsa mensual fija del plan ChatGPT Pro ni forman parte de la fórmula simplificada de créditos de Codex que aparece más adelante.

Qué incluye Pro 5x y cómo leer sus rangos

El plan ChatGPT Pro de USD 100 ofrece un límite de uso 5× superior a Plus, de acuerdo con la explicación oficial de los niveles Pro. Aun así, no conviene traducirlo a una cantidad mensual fija de tokens.

Los rangos publicados para mensajes locales en una ventana de cinco horas son:

ModeloMensajes locales estimados por 5 h
GPT-5.575–400
GPT-5.6 Sol75–450
GPT-5.6 Terra100–550
GPT-5.6 Luna250–1400

Son estimaciones amplias, no cuotas garantizadas. Los mensajes locales y las tareas cloud comparten la ventana de cinco horas, pueden aplicarse límites semanales adicionales y una tarea grande puede consumir mucho más que una consulta breve.

Recomendación práctica. Revisá el panel de uso y consultá /status antes y después de ejecuciones representativas. Sin tu consumo real, proyectar “tantas tareas por mes” sería inventar precisión.

También evitá Fast mode cuando querés ahorrar. La documentación de velocidad indica que acelera aproximadamente 1,5× los modelos soportados a cambio de una tasa mayor de créditos. Al publicarse esta guía soporta GPT-5.5 y GPT-5.4, y GPT-5.5 consume 2,5× la tarifa Standard en ese modo; la familia GPT-5.6 no figura como compatible.

Matriz compacta: qué modelo usar según la tarea

La mejor elección depende menos del nombre del modelo que de cuánta incertidumbre tenga el trabajo. Esta matriz es una política inicial, no una equivalencia oficial:

Tipo de tareaPrimera opciónEscalamiento
Extraer, clasificar, renombrar o convertir formatosLuna Low o MediumTerra Medium si aparecen excepciones
Resúmenes estructurados y transformaciones repetiblesLuna MediumLuna High si son multietapa
Documentación, boilerplate y tests sencillosLuna MediumTerra Medium para mayor contexto
Cambio pequeño o bug reproducible en un repositorio conocidoTerra MediumTerra High si requiere más análisis
Feature o refactor habitual en varios archivosTerra Medium o HighSol Medium si el alcance se vuelve ambiguo
Migración amplia o repositorio desconocidoTerra HighSol Medium para criterio global
Arquitectura, concurrencia, rendimiento o seguridadSol Medium o HighSol XHigh solo tras validar High
Contexto de cientos de miles de tokens o investigación abiertaSol Medium o Terra HighSol High para casos críticos
Frontend, documento o presentación con pulido finalSol MediumTerra High para el borrador
Proyecto divisible en líneas independientesSol UltraSol High si no se justifica multiagente

Recomendación práctica. Luna necesita una definición de “terminado” especialmente concreta: archivos permitidos, formato esperado, tests, ejemplos y condiciones de rechazo. Mejorar la especificación suele ahorrar más que subir el razonamiento sin diagnóstico.

Para tareas automatizadas de alto volumen, esta lógica permite separar borrador, validación y excepción. Si querés llevarla a un proceso real, podés ver el enfoque de automatizaciones. Y si te interesa comparar otras formas de trabajo autónomo, el artículo sobre Claude Code Web creando contenido muestra un flujo de agente aplicado a un proyecto Astro.

Cómo migrar desde GPT-5.5 sin asumir equivalencias

No hay una tabla oficial que diga “GPT-5.5 Medium equivale a Terra Medium” o “GPT-5.5 High equivale a Sol High”. La guía oficial de migración de modelos recomienda conservar primero el esfuerzo de razonamiento actual como línea base y después comparar un nivel inferior.

Aplicado a Codex, la migración puede hacerse así:

  1. Tomá una tarea conocida que ya tenga criterio de aceptación y resultado histórico con GPT-5.5.
  2. Probá Terra con el mismo esfuerzo. Si usabas Medium, empezá en Terra Medium; si usabas High, empezá en Terra High.
  3. Compará calidad y consumo. No mires solamente si “respondió”: revisá tests, correcciones, archivos innecesarios y créditos totales.
  4. Bajá un nivel dentro de la misma categoría. Si Terra High mantiene el resultado, probá Terra Medium en una tarea comparable.
  5. Derivá a Luna solo lo repetible. Cuando la categoría tenga criterios estables, evaluá Luna Medium.
  6. Cambiá a Sol por ambigüedad, no por inercia. Si el fallo exige mejor comprensión global, seguir subiendo Luna o Terra puede ser menos eficiente que usar Sol Medium.

Para el uso que antes resolvía GPT-5.5 Medium, Terra Medium es el reemplazo general que conviene evaluar primero. Luna Medium es una alternativa agresiva para categorías claras; Sol Medium, la opción conservadora cuando el error cuesta caro.

Para trabajo que antes justificaba GPT-5.5 High, Terra High es el punto económico en problemas estructurados. En arquitectura, depuración difícil o requisitos abiertos, probá Sol Medium directamente. Sol High queda como referencia conservadora para los casos críticos.

Cuándo Luna sigue siendo más barata aunque razone más

Como las tarifas mantienen la misma proporción entre entrada, caché y salida, se puede resumir el uso ponderado con una variable:

W = entrada + 0,1 × entrada_cacheada + 6 × salida

Sol o GPT-5.5 = 125 × W
Terra            = 62,5 × W
Luna             = 25 × W

De ahí surgen los puntos de equilibrio:

  • Luna puede consumir hasta 2,5× el uso ponderado de Terra y costar lo mismo.
  • Terra puede consumir hasta el uso ponderado de Sol y costar lo mismo.
  • Luna puede consumir hasta el uso ponderado de Sol y costar lo mismo.

Cálculo derivado. Luna XHigh puede salir más barata que Terra High si consume menos de 2,5 veces sus tokens ponderados y ambos resultados alcanzan la misma calidad mínima. El nombre del esfuerzo no permite conocer de antemano el consumo final ni la tasa de éxito.

El límite práctico es el retrabajo. Si Luna produce una implementación incorrecta, lee más archivos en el segundo intento y necesita una corrección con Terra, el ahorro teórico puede desaparecer. Por eso el orden correcto es: primero resultado aceptable, después menor crédito total.

Tampoco hay que asumir que XHigh siempre supera a High en una ejecución concreta. Más razonamiento puede explorar caminos innecesarios o sobredimensionar una solución. Si ambos esfuerzos logran la misma tasa de éxito en una categoría, High domina por menor consumo y latencia.

Escenario 70/20/10: de dónde sale el 49%

Como escenario inicial para Pro 5x, suponé que 70% del uso ponderado total se procesa con Terra, 20% con Luna en categorías validadas y 10% con Sol para escalamiento. Bajo esa distribución, el factor sería:

0,70 × 0,50 + 0,20 × 0,20 + 0,10 × 1,00 = 0,49

Cálculo derivado. El 0,49 representa 49% del consumo que tendría usar GPT-5.5 o Sol para todo: un ahorro hipotético de 51%. Bajo esas condiciones ideales, los mismos créditos ofrecerían aproximadamente 2,04× la capacidad teórica de uso ponderado, no 2,04× más tareas reales garantizadas.

No es una promesa de ahorro real. El cálculo supone uso ponderado comparable y no incorpora que Luna puede requerir reintentos, que High genera más razonamiento, que una herramienta añade contexto o que las ventanas incluidas no escalan linealmente. Sirve como hipótesis para medir, no como resultado para publicar sin datos.

Qué muestran los benchmarks —y qué no demuestran

Los resultados publicados por OpenAI respaldan a Terra como candidato económico para programación, aunque no comparan necesariamente Medium contra Medium ni predicen cada repositorio.

Benchmark
AA Coding Agent Index v1.1
Sol
80,0
Terra
77,4
Luna
74,6
GPT-5.5
76,4
Benchmark
SWE-Bench Pro
Sol
64,6%
Terra
63,4%
Luna
62,7%
GPT-5.5
59,4%
Benchmark
DeepSWE v1.1
Sol
72,7%
Terra
69,6%
Luna
67,2%
GPT-5.5
67,0%
Benchmark
Terminal-Bench 2.1
Sol
88,8%
Terra
87,4%
Luna
84,7%
GPT-5.5
85,6%

Terra supera a GPT-5.5 en esas cuatro evaluaciones. Luna supera a 5.5 en SWE-Bench Pro, queda prácticamente igual en DeepSWE y por debajo en el índice agregado y Terminal-Bench. Eso justifica probar Terra como reemplazo; no convierte a Luna en equivalente universal.

Las excepciones muestran por qué importa el perfil de la tarea:

  • En MRCR de 256K–512K, Luna obtiene 41,3%, frente a 81,5% de GPT-5.5, 89,6% de Terra y 91,5% de Sol.
  • En Toolathlon, Terra y Luna quedan debajo de GPT-5.5; en AutomationBench lo superan.
  • En ARC-AGI-3, Sol se distancia con claridad, señal de que más esfuerzo en un modelo menor no siempre reemplaza capacidad.
  • OpenAI también muestra mejoras cualitativas de GPT-5.6 en presentaciones, documentos y hojas de cálculo. Esa evidencia apoya usar Sol cuando el pulido evita retrabajo, pero no calcula un ahorro por tarea.

Dato oficial. Los benchmarks son mediciones bajo configuraciones concretas. No establecen equivalencias universales entre modelo y esfuerzo, ni garantizan que tu base de código reproduzca el mismo orden.

Cómo validar la estrategia durante siete días

La forma más segura de adoptar la familia GPT-5.6 es una prueba corta con tareas reales. No hace falta gastar una semana usando todos los modelos en todo.

Día 1: definí la línea base

Elegí entre ocho y doce tareas que representen tu trabajo: una mecánica, un bug normal, una feature, un refactor y un problema ambiguo. Escribí el criterio de aceptación antes de ejecutar. Recuperá, cuando exista, el consumo o resultado equivalente con GPT-5.5.

Días 2 y 3: validá Terra

Ejecutá las tareas cotidianas con Terra conservando el esfuerzo anterior. Después probá un nivel inferior en casos comparables. Registrá éxito en el primer intento, tests, cambios innecesarios, créditos y tiempo hasta aceptar.

Días 4 y 5: delimitá Luna

Enviá a Luna únicamente las categorías claras. Si falla, clasificá el motivo: especificación incompleta, falta de capacidad o exceso de contexto. No repitas el mismo prompt varias veces sin corregir la causa.

Día 6: comprobá el escalamiento a Sol

Usá Sol Medium en los problemas donde Terra falló por ambigüedad o criterio global. Reservá High para un caso que realmente necesite mayor profundidad. No actives Ultra salvo que puedas enumerar partes independientes.

Día 7: fijá reglas por categoría

Conservá Luna donde mantenga el piso de calidad, Terra como valor predeterminado y Sol donde reduzca correcciones. Calculá créditos por tarea aceptada, no promedios de mensajes mezclando trabajos distintos.

Una planilla mínima debería registrar: categoría, modelo, esfuerzo, éxito inicial, tests aprobados, número de correcciones, créditos totales, tiempo y observaciones. Repetí la revisión cuando OpenAI cambie precios, límites o modelos.

Preguntas frecuentes

¿Terra Medium equivale oficialmente a GPT-5.5 Medium?

No. OpenAI dice que no existe un mapeo exacto de esfuerzos. Terra Medium es un punto de partida práctico por su perfil cotidiano y menor tarifa, pero necesitás validarlo con tareas representativas.

¿Qué modelo GPT-5.6 gasta la mitad de créditos?

Terra usa la mitad de créditos que Sol o GPT-5.5 en entrada, entrada cacheada y salida. Una tarea completa puede no costar exactamente 50% si utiliza otra cantidad de tokens o necesita correcciones.

¿Luna XHigh puede ser más barata que Terra High?

Sí, si Luna consume menos de 2,5× el uso ponderado de Terra y alcanza el mismo resultado aceptable. No conviene comparar solamente la etiqueta High o XHigh.

¿Cuándo conviene Sol en vez de Terra High?

Cuando el problema es abierto, ambiguo, crítico o exige criterio global. Para una migración bien especificada, Terra High suele ser la primera prueba económica; para arquitectura o depuración difícil, Sol Medium puede evitar escalones inútiles.

¿Ultra es un nivel de razonamiento?

No. Ultra es un modo multiagente que reparte partes de una tarea entre subagentes. Los niveles de reasoning.effort llegan hasta Max; Ultra tiene sentido cuando el trabajo se puede paralelizar.

¿Fast mode ayuda a ahorrar el límite?

No. Intercambia más créditos por aproximadamente 1,5× de velocidad en modelos compatibles. En GPT-5.5 aplica una tasa de 2,5×, por lo que no es la opción adecuada si priorizás duración.

¿Cuál debería ser el predeterminado en Pro 5x?

Para una política orientada al ahorro, Terra Medium. El ajuste Power predeterminado de Codex prioriza capacidad con Sol Medium; elegir Terra desde Advanced cambia ese equilibrio hacia costo efectivo.

Conclusión

La forma más útil de aprovechar GPT-5.6 en Codex no es buscar un único modelo para todo. Es construir una ruta breve: Luna para trabajo claro y repetible, Terra para el día a día y Sol para ambigüedad, criticidad o pulido.

En Pro 5x, Terra Medium ofrece el mejor punto de partida para cuidar créditos sin asumir una caída de calidad. El escenario 70/20/10 muestra un consumo teórico de 49%, pero solamente una prueba con tus tareas puede convertir esa hipótesis en una política confiable. Medí resultados aceptados, correcciones y consumo total; después bajá de modelo o esfuerzo donde los datos lo permitan.

Fuentes oficiales

Datos y documentación consultados el 12 de julio de 2026. OpenAI puede modificar precios, límites, disponibilidad y recomendaciones.

SOBRE EL AUTOR

Desarrollador web full stack y consultor de automatizaciones con IA en Buenos Aires. Publica guías técnicas basadas en ejemplos reproducibles y recursos que pueden verificarse.