El 9 de julio de 2026 OpenAI presentó GPT-5.6, su nueva familia de modelos: Sol, Terra y Luna. Tres semanas después, el 30 de julio, hizo algo mucho menos habitual que un lanzamiento: bajó el precio de Luna un 80%. El modelo más barato de la familia pasó de U$S 1 a U$S 0,20 por millón de tokens de entrada, y de U$S 6 a U$S 1,20 de salida.
Esa segunda noticia es la importante, y casi nadie la contó bien. Un recorte de esa magnitud, aplicado al modelo más chico de la generación más nueva, cambia la cuenta de cualquiera que opere Agentes de IA en volumen. Deja de ser cierto que "el modelo bueno es caro y el barato es tonto": Luna puntúa 51 en el índice de inteligencia de Artificial Analysis —a 8 puntos del modelo insignia— y cuesta un quinto de lo que costaba hace dos semanas.
En AsisteClick la familia 5.6 completa ya está disponible en el constructor de Agentes de IA desde el pasaje a producción de este fin de semana. Puedes elegir Sol, Terra o Luna en el selector de modelo de cualquier agente, sin tocar código. Este artículo es la explicación de qué alcanza cada uno, dónde se posiciona Luna en el cruce costo/inteligencia, y cuánto cuesta de verdad atender mil conversaciones con cada modelo.
Tabla de contenidos
- Qué es la familia GPT-5.6
- Sol: el techo
- Terra: el medio incómodo
- Luna: la sorpresa
- El mapa: inteligencia contra costo
- Los benchmarks, uno al lado del otro
- El precio: qué cambió el 30 de julio
- Cuánto cuesta atender 1.000 conversaciones
- Por qué el recorte pesa distinto en LATAM
- Cuál elegir para atención al cliente
- Cómo medirlo en tu propio tráfico
- Lo que los benchmarks no te dicen
- Cómo usar la familia 5.6 en AsisteClick
- El resumen que importa
- Sigue leyendo
Qué es la familia GPT-5.6
Los nombres forman una escala astronómica: Sol, Terra —tierra, en latín— y Luna. De mayor a menor potencia, y de mayor a menor costo. Es el primer cambio de nomenclatura relevante de OpenAI en años —se abandonan los sufijos mini y nano que venían desde la serie 4.1— y tiene una lógica: los tres modelos comparten la misma arquitectura y las mismas capacidades de API, y lo que varía es el presupuesto de cómputo que cada uno dedica a pensar.
Las tres comparten estos rasgos:
- Ventana de contexto de 1,05 millones de tokens —hasta 922K de entrada y 128K de salida. Los pedidos que pasan de 272K tokens de entrada tienen recargo (2× la entrada y 1,5× la salida sobre el pedido completo), así que la ventana gigante conviene usarla con criterio, no por default.
- Llamada programática de herramientas (programmatic tool calling): en lugar de pedir una herramienta por turno, el modelo escribe JavaScript que se ejecuta en un runtime V8 aislado y sin acceso a red. OpenAI documenta reducciones de entre 38% y 63,5% en tokens consumidos para clientes que orquestaban muchas herramientas por conversación. Para un agente que consulta stock, valida un CUIT y agenda un turno en el mismo turno de conversación, esto es plata.
- Caché de prompt con descuento del 90% sobre el precio de entrada, con puntos de corte explícitos y una vida mínima de caché de 30 minutos. En Luna eso significa U$S 0,02 por millón de tokens leídos de caché, contra U$S 0,25 por escribirlos. Volvemos sobre esto en la sección de costos, porque es lo que más mueve la aguja en atención al cliente.
- Entrada de texto e imagen, salida de texto. Relevante para WhatsApp, donde el cliente manda la foto del comprobante, del producto roto o de la etiqueta del router en lugar de describirlo.
- Cinco niveles de esfuerzo de razonamiento —de light a ultra—, donde cada escalón agrega aproximadamente 50% de costo. El mismo modelo puede salir tres veces más caro según cómo lo configures.
Es decir: la elección de modelo es una de tres decisiones. Las otras dos son el nivel de esfuerzo y la estrategia de caché. Un Sol mal configurado puede costar más y responder peor que un Luna bien configurado.
Sol: el techo
Sol es el modelo insignia. Es el que hay que usar cuando la tarea es genuinamente difícil: cadenas largas de razonamiento, análisis de documentos extensos, generación de código intrincado, trabajo de investigación con muchos pasos.
Los números que publicó Artificial Analysis lo ubican en 58,9 puntos de índice de inteligencia (v4.1) y al frente del Coding Agent Index con 80 puntos. En el detalle por benchmark: 88,8% en Terminal-Bench 2.1, 72,7% en DeepSWE, 64,6% en SWE-Bench Pro, 90,4% en BrowseComp y 62,6% en OSWorld 2.0.
Dos detalles más interesantes que el ranking:
Es eficiente en tokens. Sol resuelve una tarea del índice con unos 15.000 tokens de salida, contra 16.000 de la generación anterior. Suena menor, pero en un modelo cuya salida cuesta U$S 30 el millón, gastar menos tokens por tarea es un descuento silencioso. Sam Altman afirmó una mejora de 54% en eficiencia de tokens para tareas de programación.
Tiene un modo multiagente. El nivel de esfuerzo ultra corre cuatro agentes en paralelo y levanta Terminal-Bench de 88,8% a 91,9%, y BrowseComp a 92,2%. Es la configuración más cara que existe en la familia, y para atención al cliente es casi siempre desproporcionada. Está pensada para problemas nuevos, multisistema y con restricciones detalladas.
Para nuestro terreno —conversaciones de atención y ventas— Sol es la excepción, no la regla. Tiene sentido cuando el agente tiene que razonar sobre un caso complejo con muchas fuentes: una reclamación con historial largo, un diagnóstico técnico con varias variables, una cotización que depende de reglas de negocio encadenadas.
Terra: el medio incómodo
Terra es, en el papel, la opción de equilibrio: la mayor parte de la inteligencia de Sol a la mitad del precio. Puntúa 55 de índice, 77,4 en Coding Agent Index, 87,4% en Terminal-Bench, 69,6% en DeepSWE, 63,4% en SWE-Bench Pro y 87,5% en BrowseComp. En papel, un modelo muy sólido.
Pero acá aparece el hallazgo más contraintuitivo del análisis independiente, y conviene decirlo sin vueltas: Terra está dominado. Artificial Analysis lo señala explícitamente —Sol y Luna están por delante de Terra en todos los puntos de la curva inteligencia/costo. Traducido: para cualquier nivel de esfuerzo, existe otra opción de la misma familia que es más inteligente sin costar más, o igual de inteligente costando menos.
La aritmética posterior al recorte del 30 de julio lo empeora. Terra bajó 20% (de U$S 2,50 a U$S 2 la entrada, de U$S 15 a U$S 12 la salida); Luna bajó 80%. El resultado es que hoy Terra cuesta diez veces más que Luna a cambio de cuatro puntos de índice de inteligencia. Cuatro puntos importan en algunos escenarios —volvemos a eso—, pero diez veces el precio es un precio muy alto por ellos.
Hay un caso donde Terra sí se defiende, y es visual: en OSWorld 2.0 —el benchmark de control de computadora— saca 50,2% contra 45,6% de Luna. Si tu agente opera interfaces gráficas, la brecha se nota. Para conversación de texto, es difícil justificarlo.
Luna: la sorpresa
Luna es el modelo más rápido y económico de la familia, y el motivo por el que vale la pena escribir sobre GPT-5.6. Puntúa 51,2 de índice de inteligencia, lo que la ubica —según el relevamiento de Cerebras— en el puesto 16 de 576 modelos evaluados. No es un modelo chico: es un modelo de frontera con menos presupuesto de razonamiento.
Lo revelador está en el patrón de los benchmarks, no en el promedio. Mira dónde Luna se acerca a Sol y dónde no:
- SWE-Bench Pro: 62,7% vs 64,6% de Sol. Brecha: 1,9 puntos.
- Agents' Last Exam: 50,3% vs 52,7%. Brecha: 2,4 puntos.
- Terminal-Bench 2.1: 84,7% vs 88,8%. Brecha: 4,1 puntos.
- DeepSWE: 67,2% vs 72,7%. Brecha: 5,5 puntos.
- BrowseComp: 83,3% vs 90,4%. Brecha: 7,1 puntos.
- OSWorld 2.0: 45,6% vs 62,6%. Brecha: 17 puntos.
Un detalle que hay que decir antes de sacar conclusiones: todos esos puntajes son con el nivel de esfuerzo en max, el más alto de los cinco. Y en esa configuración Luna tarda cerca de 127 segundos hasta el primer token, con una velocidad de salida de 176 tokens por segundo. Dos minutos de silencio antes de empezar a responder es aceptable para un agente que procesa un caso en segundo plano, y es inaceptable en una conversación de WhatsApp en vivo.
Es decir: los benchmarks miden el techo de cada modelo, no la configuración con la que vas a atender. En producción conversacional vas a correr esfuerzo bajo o medio, donde la latencia baja a segundos y los puntajes también bajan —para los tres modelos por igual—. La comparación relativa entre Sol, Terra y Luna se sostiene; los valores absolutos, no. Es una razón más para medir sobre tu propio tráfico antes de decidir.
La lectura operativa es directa. En tareas de razonamiento sobre texto y en flujos agénticos con herramientas, Luna está a dos o tres puntos del modelo insignia. En control de interfaces visuales, está a diecisiete. La brecha no es uniforme: es angosta justo donde vive la atención al cliente y ancha en un terreno que la mayoría de los agentes conversacionales no pisa.
Eso es lo que convierte el recorte de precio en una noticia de producto y no solo en una noticia de mercado.
El mapa: inteligencia contra costo
La forma honesta de mirar esto es el cruce de dos ejes: cuánto sabe un modelo (eje vertical) contra cuánto cuesta resolver una tarea con él (eje horizontal, en escala logarítmica porque el rango va de centavos a dólares). La línea punteada es la frontera eficiente: los modelos que están sobre ella no tienen alternativa que los supere en ambos ejes a la vez. Los que quedan por debajo y a la derecha están pagando de más por lo que entregan.
Lo que muestra el gráfico, en tres lecturas:
Luna está sobre la frontera. Con 51 puntos y U$S 0,21 por tarea, no hay nada en la familia —ni en la comparación con la generación anterior— que entregue esa inteligencia más barato. Es el punto de mejor relación de todo el cuadrante para trabajo conversacional.
Sol también está sobre la frontera, en el extremo caro. A 59 puntos y U$S 1,04 por tarea, queda un punto por debajo del modelo más inteligente medido —Fable 5, de Anthropic, con 60— pero a alrededor de un tercio de su costo. Si necesitas el techo de razonamiento, Sol es hoy la forma más eficiente de comprarlo.
Terra está adentro de la curva, y GPT-5.5 y Opus 4.8 también. GPT-5.5 con esfuerzo xhigh saca los mismos 55 puntos que Terra pero cuesta U$S 0,99 por tarea contra U$S 0,55. Opus 4.8 saca 56 puntos a U$S 1,78. Ese es el sentido concreto de "la generación nueva corrió la frontera": lo que hace tres semanas era una compra razonable, hoy no lo es.
Y el punto de referencia del extremo barato: DeepSeek V4 Pro resuelve la tarea a U$S 0,04 con 44 puntos de índice. Siete puntos menos que Luna por un quinto del precio. Para clasificación y enrutamiento —tareas donde 44 puntos alcanzan— es una opción real que conviene tener en el radar.
Los benchmarks, uno al lado del otro
| Benchmark | Sol | Terra | Luna |
|---|---|---|---|
| Índice de Inteligencia AA v4.1 | 58,9 | 55,0 | 51,2 |
| Coding Agent Index v1.1 | 80,0 | 77,4 | 74,6 |
| Terminal-Bench 2.1 | 88,8% | 87,4% | 84,7% |
| DeepSWE v1.1 | 72,7% | 69,6% | 67,2% |
| SWE-Bench Pro | 64,6% | 63,4% | 62,7% |
| Agents' Last Exam | 52,7% | 50,4% | 50,3% |
| BrowseComp | 90,4% | 87,5% | 83,3% |
| OSWorld 2.0 (control de PC) | 62,6% | 50,2% | 45,6% |
| Costo por tarea del índice | U$S 1,04 | U$S 0,55 | U$S 0,21 |
Fíjate en la última fila del bloque de benchmarks y en la penúltima columna: en Agents' Last Exam, Terra saca 50,4% y Luna 50,3%. Una décima de diferencia, diez veces el precio.
El precio: qué cambió el 30 de julio
Estas son las tarifas por millón de tokens, antes y después del recorte:
| Modelo | Entrada (lanzamiento) | Entrada (hoy) | Salida (lanzamiento) | Salida (hoy) | Entrada cacheada |
|---|---|---|---|---|---|
| Sol | U$S 5,00 | U$S 5,00 | U$S 30,00 | U$S 30,00 | U$S 0,50 |
| Terra | U$S 2,50 | U$S 2,00 (−20%) | U$S 15,00 | U$S 12,00 (−20%) | U$S 0,20 |
| Luna | U$S 1,00 | U$S 0,20 (−80%) | U$S 6,00 | U$S 1,20 (−80%) | U$S 0,02 |
Sol no bajó. La razón que dio OpenAI es que las mejoras de GPT-5.6 permiten que Luna y Terra absorban cargas de trabajo que antes requerían un modelo premium: en vez de abaratar el techo, abarataron el piso para que más trabajo baje de nivel. Es una jugada de mercado —hay presión competitiva fuerte en el segmento de bajo costo— pero el efecto práctico para quien construye producto es el mismo.
El dato que casi nunca aparece en las notas es la entrada cacheada de Luna: U$S 0,02 por millón. Dos centavos. En atención al cliente, donde cada llamada al modelo reenvía el mismo prompt de sistema, la misma base de conocimiento y un historial que crece, la caché no es una optimización menor: es la mayor parte de la factura.
Cuánto cuesta atender 1.000 conversaciones
Los benchmarks miden tareas de programación y de navegación web. Nuestro caso es otro, así que hagamos la cuenta de verdad, con supuestos explícitos para que puedas rehacerla con los tuyos.
Supuestos de una conversación de atención típica:
- 8 llamadas al modelo por conversación (ocho turnos de ida y vuelta).
- 4.000 tokens de entrada por llamada: prompt de sistema, fragmentos de la base de conocimiento e historial acumulado.
- Caché activa: los tokens nuevos se escriben en caché (tarifa de escritura, 1,25× la entrada) y en los turnos siguientes se leen con el descuento del 90%. La primera llamada escribe 4.000 tokens; las siete restantes escriben 400 nuevos y leen 3.600.
- 150 tokens de salida por respuesta.
Eso da, por conversación: 6.800 tokens de entrada escritos en caché, 25.200 leídos de caché y 1.200 de salida. Multiplicado por mil conversaciones y por las tarifas de cada modelo:
| Modelo | 1.000 conversaciones | 10.000 conversaciones/mes | Contra Luna |
|---|---|---|---|
| Luna (hoy) | U$S 3,64 | U$S 36,40 | — |
| Luna (antes del 30/07) | U$S 18,22 | U$S 182 | 5× |
| Terra | U$S 36,44 | U$S 364 | 10× |
| Sol | U$S 91,10 | U$S 911 | 25× |
Tres conclusiones que salen de esta tabla y no de los benchmarks:
La diferencia entre modelos es de un orden de magnitud, no de porcentajes. Elegir Sol por default para un agente que responde preguntas frecuentes no es "un poco más caro": es veinticinco veces más caro. En una cuenta con volumen real, esa decisión sola define si la unidad económica del agente cierra.
La caché pesa más que el modelo en la estructura de costos. Sin caché, los mismos mil diálogos con Luna costarían cerca de U$S 7,84 en lugar de U$S 3,64. El prompt de sistema y la base de conocimiento son texto idéntico en cada llamada; pagarlo a precio pleno ocho veces por conversación es el desperdicio más común que vemos.
El costo del modelo casi nunca es el costo del proyecto. U$S 36 mensuales por diez mil conversaciones es menos de lo que cuesta una hora de trabajo humano en la mayoría de los mercados donde operamos. Lo que define el retorno de un Agente de IA no es el precio del token: es cuántas de esas conversaciones resuelve sin intervención. Sobre eso escribimos la fórmula de ROI de un chatbot, y sigue siendo la cuenta que importa.
Por qué el recorte pesa distinto en LATAM
Un 80% de descuento se lee igual en cualquier idioma, pero no significa lo mismo en cualquier mercado. Tres razones por las que este movimiento cambia más cosas acá que en Estados Unidos o Europa.
El costo del modelo se paga en dólares; el ahorro se mide contra sueldos locales. Una operación de atención en Buenos Aires, Bogotá o Ciudad de México compara el gasto de IA contra el costo de una hora de agente humano en moneda local, mientras que la factura de OpenAI llega en divisa fuerte. Eso hace que cada baja de tarifa tenga un efecto amplificado sobre la decisión de automatizar: no cambia solo el margen, cambia el umbral a partir del cual el proyecto se justifica. A U$S 18,22 por mil conversaciones, un piloto de una PyME con volumen moderado era una discusión. A U$S 3,64, deja de serlo.
Baja el piso de entrada, no el techo. Antes del recorte, una operación chica que quería calidad de frontera tenía dos caminos: pagar modelos premium con volumen bajo —costo por conversación alto— o usar modelos viejos y resignar calidad. Luna al precio actual rompe ese trade-off: una cuenta de dos mil conversaciones mensuales accede a un modelo del top 20 por menos de U$S 8 al mes. El acceso a calidad de frontera dejó de estar correlacionado con el tamaño de la empresa.
El volumen de WhatsApp castiga los modelos caros. En LATAM la conversación de atención vive en WhatsApp, y WhatsApp es asíncrono y conversacional: muchos mensajes cortos, no una consulta larga y bien formulada. Eso multiplica la cantidad de llamadas al modelo por conversación resuelta —de ahí los ocho turnos del cálculo de arriba— y hace que el precio unitario del token pese mucho más que en un canal tipo formulario o email. Un modelo caro en un canal de mensajería se paga varias veces por conversación. Es exactamente el escenario donde Luna rinde mejor y donde Sol por default es más difícil de justificar.
Vale una advertencia: el precio del modelo no es el único costo de la conversación. En WhatsApp también se paga a Meta por conversación de plantilla, y ese costo no bajó. Si tu operación es intensiva en mensajes salientes, el token es una fracción menor de tu factura —lo detallamos en el análisis de precios de un chatbot de WhatsApp para empresas.
Cuál elegir para atención al cliente
La recomendación de OpenAI y de los integradores que ya probaron la familia converge en una estrategia de escalado: empezar abajo y subir cuando el modelo se traba. Aplicado a nuestro terreno:
| Escenario | Modelo | Por qué |
|---|---|---|
| Preguntas frecuentes, horarios, estado de pedido, datos de la base de conocimiento | Luna | Es exactamente donde la brecha con Sol es de 2-3 puntos. Pagar más no compra mejores respuestas. |
| Calificación de leads, enrutamiento, clasificación de intención | Luna | Tareas de decisión acotada. Si el volumen es muy alto, vale medir modelos aún más económicos. |
| Agente con muchas herramientas por turno (stock, CRM, agenda, facturación) | Luna y, si falla, Terra | La llamada programática de herramientas reduce tokens en toda la familia. Mide primero con Luna. |
| Reclamaciones con historial largo, diagnóstico técnico multivariable, cotizaciones con reglas encadenadas | Sol | Acá los puntos de índice se traducen en respuestas materialmente mejores. |
| Agente que opera interfaces gráficas o sistemas legacy por pantalla | Sol | 17 puntos de brecha en OSWorld. Es el único caso donde el salto de precio se justifica solo. |
| Redacción de respuestas sensibles, escalamientos delicados, resúmenes para supervisión | Sol con esfuerzo medio | Volumen bajo, costo del error alto. El gasto es marginal. |
El patrón: Luna como default, Sol como excepción justificada, Terra casi nunca. Y una regla que vale más que la elección de modelo: no subas de modelo para tapar un problema de prompt o de base de conocimiento. Un Luna con contexto bien armado le gana a un Sol mal alimentado, y cuesta veinticinco veces menos. Las tres capas de conocimiento de un Agente de IA definen mucho más la calidad de la respuesta que el modelo elegido.
Cómo medirlo en tu propio tráfico
Toda la evidencia de este artículo es de terceros y sobre tareas que no son las tuyas. La única medición que importa para decidir es la que corre sobre tus conversaciones reales. Un protocolo de cuatro pasos que se puede ejecutar en una semana:
1. Arma el conjunto de prueba con conversaciones reales, no inventadas. Toma entre 80 y 150 conversaciones cerradas de los últimos 30 días, e incluye a propósito los casos difíciles: mensajes con errores de tipeo, audios transcritos, consultas ambiguas, clientes que preguntan tres cosas en un mensaje y los que escriben en una sola palabra. Un conjunto de prueba limpio miente: te va a decir que cualquier modelo sirve.
2. Corre el mismo conjunto con Luna y con Sol, sin tocar nada más. Mismo prompt, misma base de conocimiento, mismo nivel de esfuerzo. Si cambias dos variables a la vez no vas a saber cuál explica la diferencia. Guarda las dos respuestas de cada conversación, una al lado de la otra.
3. Que un humano de tu equipo las compare a ciegas. Sin saber qué modelo produjo cada respuesta. Tres criterios binarios alcanzan: ¿es correcta?, ¿está completa?, ¿la mandarías al cliente tal cual? El sesgo de saber que una respuesta es "la del modelo caro" arruina la evaluación, y es el error más común cuando se evalúa internamente.
4. Decide con la tasa de empate, no con el promedio. El número que importa es en qué porcentaje de casos Luna empata o supera a Sol. Si empata en 90% de tus conversaciones, la respuesta es Luna con escalamiento para el 10% restante, y el ahorro es de 25 veces sobre la mayor parte del volumen. Si empata en 60%, mira qué tienen en común los casos donde pierde: casi siempre es un problema de contexto faltante, no de capacidad del modelo, y se arregla más barato mejorando la base de conocimiento que subiendo de modelo.
El resultado útil de este ejercicio no es un ganador: es un criterio de enrutamiento. Los agentes que atienden preguntas frecuentes van a Luna; los que manejan casos complejos van a Sol; y la lista de los casos donde Luna falla se convierte en la lista de mejoras de tu base de conocimiento.
Lo que los benchmarks no te dicen
Cuatro advertencias, porque un artículo que solo celebra números no te sirve para decidir.
Las cifras de latencia y costo de OpenAI son simulaciones, no mediciones de producción. Está declarado en la documentación del lanzamiento. Los números de Artificial Analysis sí son medidos de forma independiente, pero sobre su propia suite de tareas.
El índice v4.1 se reponderó hacia trabajo agéntico. Artificial Analysis actualizó tres evaluaciones, eliminó una y reponderó el conjunto hacia tareas de agentes. Es una buena noticia para nuestro caso —los agentes con herramientas se parecen más a lo que hacemos que un examen de conocimientos— pero significa que los puntajes no son comparables uno a uno con rankings de versiones anteriores.
Ninguno de estos benchmarks mide atención al cliente en español. No hay evaluación pública de calidad conversacional en español latinoamericano, ni de manejo de modismos regionales, ni de tolerancia a mensajes con errores de tipeo y audios transcritos —que es el 100% del tráfico real de WhatsApp. Los puntajes orientan; no reemplazan medir en tu propio tráfico.
Los puntajes publicados son del esfuerzo máximo, no del que vas a usar. Es la advertencia que más se pasa por alto: un modelo evaluado en max puede tardar más de dos minutos en empezar a responder. Cuando leas cualquier tabla de benchmarks —esta incluida— pregúntate a qué nivel de esfuerzo se midió, y compara contra el nivel que tu caso tolera en latencia.
El precio de hoy no es el precio de siempre. Luna bajó 80% veintiún días después de su lanzamiento. Cualquier arquitectura que dependa de un precio puntual es frágil. La conclusión correcta no es "migra todo a Luna": es construye de forma que cambiar de modelo sea una decisión de configuración, no un proyecto.
Cómo usar la familia 5.6 en AsisteClick
Los tres modelos ya están disponibles en el constructor de Agentes de IA. En la configuración de cualquier agente basado en IA generativa, el selector de modelo ahora incluye GPT 5.6 Sol, GPT 5.6 Terra y GPT 5.6 Luna, con la descripción de cada uno al lado. Cambiar de modelo es elegir una opción de una lista y guardar: no requiere migración, ni reescribir prompts, ni tocar la base de conocimiento.
Eso importa por lo que decíamos arriba. Como el modelo es un parámetro del agente y no una decisión de arquitectura, puedes hacer lo que recomendamos: poner Luna por default, medir, y subir a Sol solo los agentes donde la medición lo justifique. Si el precio vuelve a moverse —y se va a mover— la respuesta es cambiar un selector.
La misma configuración está expuesta en la API de Playbooks, así que si administras muchas cuentas puedes fijar el modelo por agente de forma programática en lugar de entrar uno por uno.
Si estás evaluando qué modelo conviene para tu operación y no quieres hacer la prueba a ciegas, nuestro equipo se encarga: revisamos tus conversaciones reales, comparamos las respuestas de Luna y Sol sobre el mismo tráfico y te decimos con datos tuyos dónde conviene cada uno.
El resumen que importa
La familia GPT-5.6 movió la frontera de lo que cuesta operar Agentes de IA con calidad de producción. Sol es el techo, y es hoy la forma más eficiente de comprar el máximo de razonamiento. Terra quedó en una posición incómoda que la aritmética del recorte de precios empeoró. Y Luna —51 puntos de índice, U$S 0,20 el millón de tokens de entrada, dos centavos si están cacheados— es la noticia: un modelo de frontera al precio de un modelo chico, con una brecha de apenas dos o tres puntos justo en las tareas donde vive la atención al cliente.
La decisión práctica no es cuál es el mejor modelo. Es cuál es el modelo más barato que resuelve bien tu conversación, y cómo te aseguras de poder cambiarlo cuando el mercado se mueva otra vez. Porque a este ritmo, se va a mover.
Preguntas frecuentes
¿Qué son Sol, Terra y Luna?
Son los tres modelos de la familia GPT-5.6 de OpenAI, presentada el 9 de julio de 2026. Sol es el modelo insignia (máxima capacidad de razonamiento), Terra el intermedio y Luna el más rápido y económico. Los tres comparten arquitectura, capacidades de API y una ventana de contexto de 1,05 millones de tokens; lo que varía es el presupuesto de cómputo dedicado a razonar y, en consecuencia, el precio.
¿Cuánto cuesta GPT-5.6 Luna después del recorte de precio?
Desde el 30 de julio de 2026, Luna cuesta U$S 0,20 por millón de tokens de entrada y U$S 1,20 por millón de salida, una baja del 80% respecto de los U$S 1 y U$S 6 del lanzamiento. La entrada cacheada cuesta U$S 0,02 por millón. Terra bajó 20% (U$S 2 y U$S 12) y Sol se mantuvo en U$S 5 y U$S 30.
¿Luna es suficiente para un agente de atención al cliente?
En la mayoría de los casos, sí. En los benchmarks de razonamiento sobre texto y de flujos agénticos con herramientas, Luna queda entre 1,9 y 2,4 puntos de Sol: en Agents' Last Exam saca 50,3% contra 52,7%, y en SWE-Bench Pro 62,7% contra 64,6%. La brecha grande aparece en control de interfaces gráficas (45,6% contra 62,6% en OSWorld 2.0), que no es lo que hace un agente conversacional. La recomendación es empezar con Luna y escalar a Sol solo los casos donde la medición sobre tráfico propio lo justifique.
¿Por qué conviene Luna antes que Terra?
Porque Terra está dominado en la curva inteligencia/costo: para cualquier nivel de esfuerzo existe otra opción que es más inteligente sin costar más, o igual de inteligente costando menos. Después del recorte del 30 de julio, Terra cuesta diez veces más que Luna por cuatro puntos de índice, y en Agents' Last Exam la diferencia entre ambos es de una décima (50,4% contra 50,3%). Terra se justifica principalmente en tareas visuales, donde saca 50,2% contra 45,6% en OSWorld.
¿Cuánto cuesta atender 1.000 conversaciones con cada modelo?
Con supuestos de ocho turnos por conversación, 4.000 tokens de entrada por turno con caché activa y 150 tokens de salida por respuesta: Luna cuesta cerca de U$S 3,64, Terra U$S 36,44 y Sol U$S 91,10. Es una diferencia de 25 veces entre el más barato y el más caro de la familia. Activar la caché de prompt es lo que más incide en la factura: sin caché, esas mismas mil conversaciones con Luna costarían alrededor de U$S 7,84.
¿Ya puedo usar GPT-5.6 en AsisteClick?
Sí. Los tres modelos están disponibles en el selector de modelo del constructor de Agentes de IA y también vía la API de Playbooks. Cambiar el modelo de un agente es elegir una opción y guardar: no requiere migrar el agente ni reescribir prompts ni la base de conocimiento.
Sigue leyendo
- GPT-5.4 vs Mini vs Nano: qué modelo usar en 2026 — la comparativa de la generación anterior, útil para ver cuánto se movió la frontera en pocos meses
- Chatbot NLP vs GPT vs híbrido: qué tecnología elegir — para decidir antes qué motor necesita tu agente
- Las 3 capas de conocimiento de un Agente de IA — por qué el contexto define la calidad más que el modelo
- La fórmula del ROI de un chatbot — cómo se calcula el retorno más allá del costo por token
- Por qué fracasan los agentes de IA en atención al cliente — las causas de proceso que ningún modelo arregla