Le 9 juillet 2026, OpenAI a présenté GPT-5.6, sa nouvelle famille de modèles : Sol, Terra y Luna. Trois semaines plus tard, le 30 juillet, l'entreprise a fait quelque chose de bien moins habituel qu'un lancement : elle a baissé le prix de Luna de 80 %. Le modèle le moins cher de la famille est passé de 1 USD à 0,20 USD par million de tokens en entrée, et de 6 USD à 1,20 USD en sortie.
C'est cette seconde nouvelle qui compte, et presque personne ne l'a bien racontée. Une baisse de cette ampleur, appliquée au plus petit modèle de la génération la plus récente, change le calcul de quiconque exploite des agents d'IA à grande échelle. Il n'est plus vrai que « le bon modèle est cher et le modèle pas cher est bête » : Luna obtient 51 à l'indice d'intelligence d'Artificial Analysis — à 8 points du modèle phare — et coûte un cinquième de ce qu'elle coûtait il y a deux semaines.
Chez AsisteClick, toute la famille 5.6 est déjà disponible dans le constructeur d'agents d'IA depuis la mise en production de ce week-end. Tu peux choisir Sol, Terra ou Luna dans le sélecteur de modèle de n'importe quel agent, sans toucher au code. Cet article explique ce que permet chacun, où se situe Luna dans le rapport coût/intelligence, et ce que coûte vraiment le traitement de mille conversations avec chaque modèle.
Table des matières
- Ce qu'est la famille GPT-5.6
- Sol : le plafond
- Terra : le milieu inconfortable
- Luna : la surprise
- La carte : intelligence contre coût
- Les benchmarks, côte à côte
- Le prix : ce qui a changé le 30 juillet
- Ce que coûte le traitement de 1 000 conversations
- Pourquoi la baisse pèse différemment en Amérique latine
- Lequel choisir pour le service client
- Comment le mesurer sur ton propre trafic
- Ce que les benchmarks ne te disent pas
- Comment utiliser la famille 5.6 dans AsisteClick
- Le résumé qui compte
- À lire ensuite
Ce qu'est la famille GPT-5.6
Les noms forment une échelle astronomique : Sol, Terra — la terre, en latin — et Luna. Du plus puissant au moins puissant, et du plus cher au moins cher. C'est le premier changement de nomenclature significatif d'OpenAI depuis des années — les suffixes mini y nano héritées de la série 4.1 disparaissent — et il y a une logique : les trois modèles partagent la même architecture et les mêmes capacités d'API, et ce qui varie, c'est le budget de calcul que chacun consacre à réfléchir.
Les trois partagent ces caractéristiques :
- Une fenêtre de contexte de 1,05 million de tokens — jusqu'à 922 K en entrée et 128 K en sortie. Les requêtes dépassant 272 K tokens en entrée sont majorées (2× l'entrée et 1,5× la sortie sur l'ensemble de la requête), il vaut donc mieux utiliser cette fenêtre géante avec discernement, pas par défaut.
- Appel programmatique d'outils (programmatic tool calling) : au lieu de demander un outil par tour, le modèle écrit du JavaScript qui s'exécute dans un runtime V8 isolé et sans accès réseau. OpenAI documente des réductions de 38 % à 63,5 % des tokens consommés pour des clients qui orchestraient de nombreux outils par conversation. Pour un agent qui vérifie un stock, valide un numéro fiscal et fixe un rendez-vous dans le même tour de conversation, cela représente de l'argent.
- Cache de prompt avec une remise de 90 % sur le prix d'entrée, avec des points de coupure explicites et une durée de vie minimale de cache de 30 minutes. Sur Luna, cela signifie 0,02 USD par million de tokens lus depuis le cache, contre 0,25 USD pour les écrire. Nous y revenons dans la section sur les coûts, car c'est ce qui pèse le plus dans le service client.
- Entrée texte et image, sortie texte. Pertinent pour WhatsApp, où le client envoie la photo du reçu, du produit cassé ou de l'étiquette du routeur au lieu de le décrire.
- Cinq niveaux d'effort de raisonnement — de light a ultra—, où chaque palier ajoute environ 50 % de coût. Le même modèle peut coûter trois fois plus cher selon la façon dont tu le configures.
Autrement dit : le choix du modèle est l'une de trois décisions. Les deux autres sont le niveau d'effort et la stratégie de cache. Un Sol mal configuré peut coûter plus cher et répondre moins bien qu'un Luna bien configuré.
Sol : le plafond
Sol est le modèle phare. C'est celui qu'il faut utiliser quand la tâche est vraiment difficile : longues chaînes de raisonnement, analyse de documents volumineux, génération de code complexe, travail de recherche à nombreuses étapes.
Les chiffres publiés par Artificial Analysis le situent à 58,9 points à l'indice d'intelligence (v4.1) et en tête du Coding Agent Index avec 80 points. Dans le détail par benchmark : 88,8 % sur Terminal-Bench 2.1, 72,7 % sur DeepSWE, 64,6 % sur SWE-Bench Pro, 90,4 % sur BrowseComp et 62,6 % sur OSWorld 2.0.
Deux détails plus intéressants que le classement :
Il est efficace en tokens. Sol résout une tâche de l'indice avec environ 15 000 tokens en sortie, contre 16 000 pour la génération précédente. Cela paraît mineur, mais sur un modèle dont la sortie coûte 30 USD le million, consommer moins de tokens par tâche est une remise silencieuse. Sam Altman a annoncé une amélioration de 54 % de l'efficacité en tokens pour les tâches de programmation.
Il dispose d'un mode multi-agent. Le niveau d'effort ultra lance quatre agents en parallèle et fait passer Terminal-Bench de 88,8 % à 91,9 %, et BrowseComp à 92,2 %. C'est la configuration la plus chère de la famille, et pour le service client elle est presque toujours disproportionnée. Elle est pensée pour des problèmes nouveaux, multi-systèmes et à contraintes détaillées.
Sur notre terrain — conversations de service et de vente — Sol est l'exception, pas la règle. Il a du sens quand l'agent doit raisonner sur un cas complexe à sources multiples : une réclamation avec un long historique, un diagnostic technique à plusieurs variables, un devis qui dépend de règles métier enchaînées.
Terra : le milieu inconfortable
Sur le papier, Terra est l'option d'équilibre : l'essentiel de l'intelligence de Sol pour la moitié du prix. Il obtient 55 à l'indice, 77,4 au Coding Agent Index, 87,4 % sur Terminal-Bench, 69,6 % sur DeepSWE, 63,4 % sur SWE-Bench Pro et 87,5 % sur BrowseComp. Sur le papier, un modèle très solide.
Mais c'est ici qu'apparaît le constat le plus contre-intuitif de l'analyse indépendante, et il vaut mieux le dire sans détour : Terra est dominé. Artificial Analysis le signale explicitement — Sol et Luna sont devant Terra en tout point de la courbe intelligence/coût. Traduction : pour n'importe quel niveau d'effort, il existe une autre option de la même famille qui est plus intelligente sans coûter plus cher, ou aussi intelligente pour moins cher.
L'arithmétique postérieure à la baisse du 30 juillet aggrave la situation. Terra a baissé de 20 % (de 2,50 USD à 2 USD en entrée, de 15 USD à 12 USD en sortie) ; Luna a baissé de 80 %. Résultat : aujourd'hui Terra coûte dix fois plus que Luna en échange de quatre points d'indice d'intelligence. Quatre points comptent dans certains scénarios — nous y revenons — mais dix fois le prix est un prix très élevé pour les obtenir.
Il existe un cas où Terra tient bon, et il est visuel : sur OSWorld 2.0 — le benchmark de contrôle d'ordinateur — il obtient 50,2 % contre 45,6 % pour Luna. Si ton agent pilote des interfaces graphiques, l'écart se voit. Pour la conversation textuelle, c'est difficile à justifier.
Luna : la surprise
Luna est le modèle le plus rapide et le plus économique de la famille, et la raison pour laquelle GPT-5.6 mérite un article. Il obtient 51,2 à l'indice d'intelligence, ce qui le place — selon le relevé de Cerebras — au 16e rang sur 576 modèles évalués. Ce n'est pas un petit modèle : c'est un modèle de frontière doté d'un budget de raisonnement plus réduit.
Le plus révélateur, c'est la répartition des benchmarks, pas la moyenne. Regarde où Luna se rapproche de Sol et où il ne le fait pas :
- SWE-Bench Pro : 62,7 % contre 64,6 % pour Sol. Écart : 1,9 point.
- Agents' Last Exam : 50,3 % contre 52,7 %. Écart : 2,4 points.
- Terminal-Bench 2.1 : 84,7 % contre 88,8 %. Écart : 4,1 points.
- DeepSWE : 67,2 % contre 72,7 %. Écart : 5,5 points.
- BrowseComp : 83,3 % contre 90,4 %. Écart : 7,1 points.
- OSWorld 2.0 : 45,6 % contre 62,6 %. Écart : 17 points.
Un détail à préciser avant de tirer des conclusions : tous ces scores sont obtenus avec le niveau d'effort réglé sur max, le plus élevé des cinq. Et dans cette configuration, Luna met près de 127 secondes avant le premier token, avec une vitesse de sortie de 176 tokens par seconde. Deux minutes de silence avant de commencer à répondre, c'est acceptable pour un agent qui traite un dossier en arrière-plan, et inacceptable dans une conversation WhatsApp en direct.
Autrement dit : les benchmarks mesurent le plafond de chaque modèle, pas la configuration avec laquelle tu vas réellement servir. En production conversationnelle, tu utiliseras un effort faible ou moyen, où la latence retombe à quelques secondes et où les scores baissent aussi — pour les trois modèles de la même manière. La comparaison relative entre Sol, Terra et Luna tient ; les valeurs absolues, non. Une raison de plus pour mesurer sur ton propre trafic avant de décider.
La lecture opérationnelle est directe. Sur les tâches de raisonnement textuel et sur les flux agentiques avec outils, Luna est à deux ou trois points du modèle phare. Sur le contrôle d'interfaces visuelles, il est à dix-sept points. L'écart n'est pas uniforme : il est étroit précisément là où vit le service client et large sur un terrain que la plupart des agents conversationnels n'abordent jamais.
C'est ce qui transforme la baisse de prix en actualité produit et pas seulement en actualité de marché.
La carte : intelligence contre coût
La façon honnête d'aborder la question, c'est le croisement de deux axes : ce que sait un modèle (axe vertical) contre ce que coûte la résolution d'une tâche avec lui (axe horizontal, en échelle logarithmique car l'amplitude va des centimes aux dollars). La ligne pointillée est la frontière efficiente : les modèles qui s'y trouvent n'ont aucune alternative qui les dépasse sur les deux axes à la fois. Ceux qui restent en dessous et à droite paient trop cher pour ce qu'ils livrent.
Ce que montre le graphique, en trois lectures :
Luna est sur la frontière. Avec 51 points et 0,21 USD par tâche, rien dans la famille — ni dans la comparaison avec la génération précédente — ne délivre cette intelligence pour moins cher. C'est le meilleur rapport de tout le quadrant pour le travail conversationnel.
Sol est aussi sur la frontière, à l'extrémité chère. Avec 59 points et 1,04 USD par tâche, il reste un point en dessous du modèle le plus intelligent mesuré — Fable 5, d'Anthropic, à 60 — mais à environ un tiers de son coût. Si tu as besoin du plafond de raisonnement, Sol est aujourd'hui la façon la plus efficace de l'acheter.
Terra est à l'intérieur de la courbe, et GPT-5.5 et Opus 4.8 aussi. GPT-5.5 avec un effort xhigh obtient les mêmes 55 points que Terra mais coûte 0,99 USD par tâche contre 0,55 USD. Opus 4.8 obtient 56 points à 1,78 USD. C'est le sens concret de « la nouvelle génération a déplacé la frontière » : ce qui était un achat raisonnable il y a trois semaines ne l'est plus.
Et le point de référence à l'extrémité économique : DeepSeek V4 Pro résout la tâche à 0,04 USD avec 44 points d'indice. Sept points de moins que Luna pour un cinquième du prix. Pour la classification et le routage — des tâches où 44 points suffisent — c'est une option réelle à garder en tête.
Les benchmarks, côte à côte
| Benchmark | Sol | Terra | Luna |
|---|---|---|---|
| Indice d'intelligence AA v4.1 | 58,9 | 55,0 | 51,2 |
| Coding Agent Index v1.1 | 80,0 | 77,4 | 74,6 |
| Terminal-Bench 2.1 | 88,8% | 87,4% | 84,7% |
| DeepSWE v1.1 | 72,7% | 69,6% | 67,2% |
| SWE-Bench Pro | 64,6% | 63,4% | 62,7% |
| Agents' Last Exam | 52,7% | 50,4% | 50,3% |
| BrowseComp | 90,4% | 87,5% | 83,3% |
| OSWorld 2.0 (contrôle d'ordinateur) | 62,6% | 50,2% | 45,6% |
| Coût par tâche de l'indice | USD 1,04 | USD 0,55 | USD 0,21 |
Regarde la dernière ligne du bloc de benchmarks et l'avant-dernière colonne : sur Agents' Last Exam, Terra obtient 50,4 % et Luna 50,3 %. Un dixième de point d'écart, dix fois le prix.
Le prix : ce qui a changé le 30 juillet
Voici les tarifs par million de tokens, avant et après la baisse :
| Modèle | Entrée (au lancement) | Entrée (aujourd'hui) | Sortie (au lancement) | Sortie (aujourd'hui) | Entrée en cache |
|---|---|---|---|---|---|
| Sol | USD 5,00 | USD 5,00 | USD 30,00 | USD 30,00 | USD 0,50 |
| Terra | USD 2,50 | USD 2,00 (−20%) | USD 15,00 | USD 12,00 (−20%) | USD 0,20 |
| Luna | USD 1,00 | USD 0,20 (−80%) | USD 6,00 | USD 1,20 (−80%) | USD 0,02 |
Sol n'a pas baissé. La raison donnée par OpenAI est que les améliorations de GPT-5.6 permettent à Luna et Terra d'absorber des charges qui exigeaient auparavant un modèle premium : au lieu de rendre le plafond moins cher, ils ont rendu le plancher moins cher pour que davantage de travail descende d'un niveau. C'est un coup de marché — la pression concurrentielle est forte sur le segment bas coût — mais l'effet pratique pour quiconque construit un produit est le même.
La donnée qui n'apparaît presque jamais dans les articles, c'est l'entrée en cache de Luna : 0,02 USD par million. Deux centimes. Dans le service client, où chaque appel au modèle renvoie le même prompt système, la même base de connaissances et un historique qui grandit, le cache n'est pas une optimisation mineure : c'est l'essentiel de la facture.
Ce que coûte le traitement de 1 000 conversations
Les benchmarks mesurent des tâches de programmation et de navigation web. Notre cas est différent, faisons donc le calcul réel, avec des hypothèses explicites pour que tu puisses le refaire avec les tiennes.
Hypothèses d'une conversation de service type :
- 8 appels au modèle par conversation (huit tours d'échange).
- 4 000 tokens en entrée par appel : prompt système, extraits de la base de connaissances et historique accumulé.
- Cache actif : les nouveaux tokens sont écrits en cache (tarif d'écriture, 1,25× l'entrée) et aux tours suivants ils sont lus avec la remise de 90 %. Le premier appel écrit 4 000 tokens ; les sept autres écrivent 400 nouveaux et lisent 3 600.
- 150 tokens en sortie par réponse.
Cela donne, par conversation : 6 800 tokens d'entrée écrits en cache, 25 200 lus depuis le cache et 1 200 en sortie. Multiplié par mille conversations et par les tarifs de chaque modèle :
| Modèle | 1 000 conversations | 10 000 conversations/mois | Face à Luna |
|---|---|---|---|
| Luna (aujourd'hui) | USD 3,64 | USD 36,40 | — |
| Luna (avant le 30/07) | USD 18,22 | USD 182 | 5× |
| Terra | USD 36,44 | USD 364 | 10× |
| Sol | USD 91,10 | USD 911 | 25× |
Trois conclusions qui sortent de ce tableau et non des benchmarks :
L'écart entre les modèles est d'un ordre de grandeur, pas de quelques pourcents. Choisir Sol par défaut pour un agent qui répond à des questions fréquentes, ce n'est pas « un peu plus cher » : c'est vingt-cinq fois plus cher. Sur un compte à volume réel, cette seule décision détermine si l'économie unitaire de l'agent tient.
Le cache pèse plus que le modèle dans la structure de coûts. Sans cache, ces mêmes mille dialogues avec Luna coûteraient près de 7,84 USD au lieu de 3,64 USD. Le prompt système et la base de connaissances sont un texte identique à chaque appel ; le payer au prix plein huit fois par conversation est le gaspillage le plus courant que nous voyons.
Le coût du modèle n'est presque jamais le coût du projet. 36 USD par mois pour dix mille conversations, c'est moins que le coût d'une heure de travail humain sur la plupart des marchés où nous opérons. Ce qui détermine le retour d'un agent d'IA, ce n'est pas le prix du token : c'est le nombre de ces conversations qu'il résout sans intervention. Nous en avons parlé dans la formule du ROI d'un chatbot, et c'est toujours le calcul qui compte.
Pourquoi la baisse pèse différemment en Amérique latine
Une remise de 80 % se lit pareil dans toutes les langues, mais elle ne signifie pas la même chose sur tous les marchés. Trois raisons pour lesquelles ce mouvement change davantage de choses ici qu'aux États-Unis ou en Europe.
Le coût du modèle se paie en dollars ; l'économie se mesure face aux salaires locaux. Une opération de service à Buenos Aires, Bogotá ou Mexico compare la dépense d'IA au coût d'une heure d'agent humain en monnaie locale, alors que la facture d'OpenAI arrive en devise forte. Chaque baisse de tarif a donc un effet amplifié sur la décision d'automatiser : elle ne change pas seulement la marge, elle change le seuil à partir duquel le projet se justifie. À 18,22 USD les mille conversations, un pilote pour une PME à volume moyen faisait débat. À 3,64 USD, il n'en fait plus.
Cela abaisse le plancher d'entrée, pas le plafond. Avant la baisse, une petite opération qui voulait de la qualité de frontière avait deux voies : payer des modèles premium à faible volume — coût par conversation élevé — ou utiliser de vieux modèles et renoncer à la qualité. Luna au prix actuel casse ce compromis : un compte de deux mille conversations mensuelles accède à un modèle du top 20 pour moins de 8 USD par mois. L'accès à la qualité de frontière n'est plus corrélé à la taille de l'entreprise.
Le volume de WhatsApp pénalise les modèles chers. En Amérique latine, la conversation de service vit sur WhatsApp, et WhatsApp est asynchrone et conversationnel : beaucoup de messages courts, pas une requête longue et bien formulée. Cela multiplie le nombre d'appels au modèle par conversation résolue — d'où les huit tours du calcul ci-dessus — et fait peser le prix unitaire du token bien plus que sur un canal de type formulaire ou e-mail. Un modèle cher sur un canal de messagerie se paie plusieurs fois par conversation. C'est exactement le scénario où Luna se comporte le mieux et où Sol par défaut est le plus difficile à justifier.
Une mise en garde : le prix du modèle n'est pas le seul coût de la conversation. Sur WhatsApp, on paie aussi Meta par conversation de modèle de message, et ce coût n'a pas baissé. Si ton opération est intensive en messages sortants, le token représente une fraction moindre de ta facture — nous le détaillons dans l' analyse des prix d'un chatbot WhatsApp pour les entreprises.
Lequel choisir pour le service client
La recommandation d'OpenAI et des intégrateurs qui ont déjà testé la famille converge vers une stratégie d'escalade : commencer en bas et monter quand le modèle bloque. Appliqué à notre terrain :
| Scénario | Modèle | Pourquoi |
|---|---|---|
| Questions fréquentes, horaires, statut de commande, données de la base de connaissances | Luna | C'est exactement là où l'écart avec Sol est de 2-3 points. Payer plus n'achète pas de meilleures réponses. |
| Qualification de leads, routage, classification d'intention | Luna | Tâches de décision circonscrites. Si le volume est très élevé, il vaut la peine de mesurer des modèles encore plus économiques. |
| Agent avec de nombreux outils par tour (stock, CRM, agenda, facturation) | Luna et, en cas d'échec, Terra | L'appel programmatique d'outils réduit les tokens dans toute la famille. Mesure d'abord avec Luna. |
| Réclamations à long historique, diagnostic technique multivarié, devis à règles enchaînées | Sol | Ici, les points d'indice se traduisent par des réponses nettement meilleures. |
| Agent qui pilote des interfaces graphiques ou des systèmes legacy par écran | Sol | 17 points d'écart sur OSWorld. C'est le seul cas où le saut de prix se justifie à lui seul. |
| Rédaction de réponses sensibles, escalades délicates, synthèses pour la supervision | Sol avec effort moyen | Faible volume, coût de l'erreur élevé. La dépense est marginale. |
Le schéma : Luna par défaut, Sol comme exception justifiée, Terra presque jamais. Et une règle qui vaut plus que le choix du modèle : ne monte pas de modèle pour masquer un problème de prompt ou de base de connaissances. Un Luna avec un contexte bien construit bat un Sol mal alimenté, et coûte vingt-cinq fois moins. Les trois couches de connaissance d'un agent d'IA définissent la qualité de la réponse bien plus que le modèle choisi.
Comment le mesurer sur ton propre trafic
Toutes les preuves de cet article viennent de tiers et portent sur des tâches qui ne sont pas les tiennes. La seule mesure qui compte pour décider est celle qui tourne sur tes conversations réelles. Un protocole en quatre étapes exécutable en une semaine :
1. Constitue le jeu de test avec des conversations réelles, pas inventées. Prends entre 80 et 150 conversations closes des 30 derniers jours, et inclus volontairement les cas difficiles : messages avec fautes de frappe, audios transcrits, requêtes ambiguës, clients qui demandent trois choses dans un message et ceux qui écrivent un seul mot. Un jeu de test propre mensonge : il te dira que n'importe quel modèle convient.
2. Fais tourner le même jeu avec Luna et avec Sol, sans rien changer d'autre. Même prompt, même base de connaissances, même niveau d'effort. Si tu changes deux variables à la fois, tu ne sauras pas laquelle explique la différence. Conserve les deux réponses de chaque conversation, côte à côte.
3. Fais-les comparer à l'aveugle par quelqu'un de ton équipe. Sans savoir quel modèle a produit chaque réponse. Trois critères binaires suffisent : est-elle correcte ? est-elle complète ? l'enverrais-tu au client telle quelle ? Le biais de savoir qu'une réponse vient « du modèle cher » ruine l'évaluation, et c'est l'erreur la plus courante en interne.
4. Décide sur le taux d'égalité, pas sur la moyenne. Le chiffre qui compte, c'est le pourcentage de cas où Luna égale ou dépasse Sol. S'il égale sur 90 % de tes conversations, la réponse est Luna avec escalade pour les 10 % restants, et l'économie est de 25 fois sur l'essentiel du volume. S'il égale sur 60 %, regarde ce que les cas perdus ont en commun : c'est presque toujours un manque de contexte, pas une limite du modèle, et cela se corrige moins cher en améliorant la base de connaissances qu'en montant de modèle.
Le résultat utile de cet exercice n'est pas un gagnant : c'est un critère de routage. Les agents qui traitent les questions fréquentes vont sur Luna ; ceux qui gèrent des cas complexes vont sur Sol ; et la liste des cas où Luna échoue devient la liste d'améliorations de ta base de connaissances.
Ce que les benchmarks ne te disent pas
Quatre avertissements, car un article qui ne fait que célébrer des chiffres ne t'aide pas à décider.
Les chiffres de latence et de coût d'OpenAI sont des simulations, pas des mesures de production. C'est indiqué dans la documentation du lancement. Les chiffres d'Artificial Analysis sont mesurés de façon indépendante, mais sur leur propre suite de tâches.
L'indice v4.1 a été repondéré vers le travail agentique. Artificial Analysis a mis à jour trois évaluations, en a retiré une et a repondéré l'ensemble vers les tâches d'agents. C'est une bonne nouvelle pour notre cas — les agents outillés ressemblent davantage à ce que nous faisons qu'un examen de connaissances — mais cela signifie que les scores ne sont pas comparables un à un avec les classements des versions antérieures.
Aucun de ces benchmarks ne mesure le service client en espagnol. Il n'existe aucune évaluation publique de la qualité conversationnelle en espagnol latino-américain, ni de la gestion des expressions régionales, ni de la tolérance aux messages avec fautes de frappe et aux audios transcrits — soit 100 % du trafic WhatsApp réel. Les scores orientent ; ils ne remplacent pas la mesure sur ton propre trafic.
Les scores publiés correspondent à l'effort maximal, pas à celui que tu utiliseras. C'est l'avertissement le plus souvent négligé : un modèle évalué en max peut mettre plus de deux minutes à commencer à répondre. Quand tu lis un tableau de benchmarks — celui-ci compris — demande-toi à quel niveau d'effort il a été mesuré, et compare avec le niveau que ton cas tolère en latence.
Le prix d'aujourd'hui n'est pas le prix pour toujours. Luna a baissé de 80 % vingt-et-un jours après son lancement. Toute architecture qui dépend d'un prix ponctuel est fragile. La bonne conclusion n'est pas « migre tout vers Luna » : c'est construis de façon à ce que changer de modèle soit une décision de configuration, pas un projet.
Comment utiliser la famille 5.6 dans AsisteClick
Les trois modèles sont déjà disponibles dans le constructeur d'agents d'IA. Dans la configuration de tout agent basé sur l'IA génératives, le sélecteur de modèle inclut désormais GPT 5.6 Sol, GPT 5.6 Terra y GPT 5.6 Luna, avec la description de chacun à côté. Changer de modèle, c'est choisir une option dans une liste et enregistrer : cela ne demande aucune migration, aucune réécriture de prompts, aucune modification de la base de connaissances.
Cela compte pour la raison évoquée plus haut. Comme le modèle est un paramètre de l'agent et non une décision d'architecture, tu peux faire ce que nous recommandons : mettre Luna par défaut, mesurer, et ne faire passer à Sol que les agents où la mesure le justifie. Si le prix bouge à nouveau — et il bougera — la réponse consiste à changer un sélecteur.
Le même réglage est exposé dans l'API Playbooks : si tu administres de nombreux comptes, tu peux fixer le modèle par agent de façon programmatique au lieu d'entrer un par un.
Si tu évalues quel modèle convient à ton opération et que tu ne veux pas faire le test à l'aveugle, notre équipe s'en charge : nous examinons tes conversations réelles, comparons les réponses de Luna et de Sol sur le même trafic et te disons, avec tes propres données, où chacun convient.
Le résumé qui compte
La famille GPT-5.6 a déplacé la frontière de ce que coûte l'exploitation d'agents d'IA à qualité de production. Sol est le plafond, et c'est aujourd'hui la façon la plus efficace d'acheter le maximum de raisonnement. Terra s'est retrouvé dans une position inconfortable que l'arithmétique de la baisse de prix a aggravée. Et Luna — 51 points d'indice, 0,20 USD le million de tokens en entrée, deux centimes s'ils sont en cache — est la nouvelle : un modèle de frontière au prix d'un petit modèle, avec un écart d'à peine deux ou trois points précisément sur les tâches où vit le service client.
La décision pratique n'est pas de savoir quel est le meilleur modèle. C'est de savoir quel est le modèle le moins cher qui traite bien ta conversation, et comment tu t'assures de pouvoir le changer quand le marché bougera de nouveau. Car à ce rythme, il bougera.
Questions fréquentes
Que sont Sol, Terra et Luna ?
Ce sont les trois modèles de la famille GPT-5.6 d'OpenAI, présentée le 9 juillet 2026. Sol est le modèle phare (capacité de raisonnement maximale), Terra l'intermédiaire et Luna le plus rapide et le plus économique. Les trois partagent l'architecture, les capacités d'API et une fenêtre de contexte de 1,05 million de tokens ; ce qui varie, c'est le budget de calcul consacré au raisonnement et, par conséquent, le prix.
Combien coûte GPT-5.6 Luna après la baisse de prix ?
Depuis le 30 juillet 2026, Luna coûte 0,20 USD par million de tokens en entrée et 1,20 USD par million en sortie, soit une baisse de 80 % par rapport aux 1 USD et 6 USD du lancement. L'entrée en cache coûte 0,02 USD par million. Terra a baissé de 20 % (2 USD et 12 USD) et Sol est resté à 5 USD et 30 USD.
Luna suffit-il pour un agent de service client ?
Dans la plupart des cas, oui. Sur les benchmarks de raisonnement textuel et sur les flux agentiques avec outils, Luna se situe entre 1,9 et 2,4 points de Sol : sur Agents' Last Exam il obtient 50,3 % contre 52,7 %, et sur SWE-Bench Pro 62,7 % contre 64,6 %. Le grand écart apparaît sur le contrôle d'interfaces graphiques (45,6 % contre 62,6 % sur OSWorld 2.0), ce qui n'est pas le travail d'un agent conversationnel. La recommandation est de commencer par Luna et de ne faire passer à Sol que les cas où la mesure sur son propre trafic le justifie.
Pourquoi choisir Luna plutôt que Terra ?
Parce que Terra est dominé sur la courbe intelligence/coût : pour n'importe quel niveau d'effort, il existe une autre option plus intelligente sans coûter plus cher, ou aussi intelligente pour moins cher. Après la baisse du 30 juillet, Terra coûte dix fois plus que Luna pour quatre points d'indice, et sur Agents' Last Exam l'écart entre les deux est d'un dixième de point (50,4 % contre 50,3 %). Terra se justifie surtout sur les tâches visuelles, où il obtient 50,2 % contre 45,6 % sur OSWorld.
Combien coûte le traitement de 1 000 conversations avec chaque modèle ?
Avec des hypothèses de huit tours par conversation, 4 000 tokens d'entrée par tour avec cache actif et 150 tokens de sortie par réponse : Luna coûte environ 3,64 USD, Terra 36,44 USD et Sol 91,10 USD. C'est un écart de 25 fois entre le moins cher et le plus cher de la famille. Activer le cache de prompt est ce qui influe le plus sur la facture : sans cache, ces mêmes mille conversations avec Luna coûteraient environ 7,84 USD.
Puis-je déjà utiliser GPT-5.6 dans AsisteClick ?
Oui. Les trois modèles sont disponibles dans le sélecteur de modèle du constructeur d'agents d'IA et aussi via l'API Playbooks. Changer le modèle d'un agent, c'est choisir une option et enregistrer : cela ne demande ni de migrer l'agent, ni de réécrire les prompts, ni de toucher à la base de connaissances.
À lire ensuite
- GPT-5.4 vs Mini vs Nano : quel modèle utiliser en 2026 — le comparatif de la génération précédente, utile pour voir à quel point la frontière a bougé en quelques mois
- Chatbot NLP vs GPT vs hybride : quelle technologie choisir — pour décider d'abord quel moteur il faut à ton agent
- Les 3 couches de connaissance d'un agent d'IA — pourquoi le contexte définit la qualité plus que le modèle
- La formule du ROI d'un chatbot — comment calculer le retour au-delà du coût par token
- Pourquoi les agents d'IA échouent dans le service client — les causes de processus qu'aucun modèle ne corrige