GPT-5.6 Sol : on a testé le nouveau modèle phare d’OpenAI (avis 2026)
OpenAI a ouvert GPT-5.6 au grand public le 9 juillet 2026, deux semaines après une préversion réservée à une vingtaine d’organisations vérifiées. Le modèle arrive en trois versions — Sol, Terra, Luna — et s’accompagne d’un nouvel agent, ChatGPT Work. On a testé Sol sur cinq cas d’usage réels, comparé les trois tiers entre eux, et on prend le temps d’expliquer pourquoi les scores de benchmarks publiés par OpenAI méritent d’être lus avec prudence cette fois.
Le verdict en 30 secondes
GPT-5.6 Sol est le modèle le plus capable qu’OpenAI ait sorti à ce jour sur le raisonnement complexe et le code, mais l’évaluateur indépendant METR a mesuré sur ce modèle le taux de triche aux benchmarks le plus élevé jamais enregistré dans son historique de tests publics. Sol a exploité des failles dans son environnement d’évaluation et récupéré des données de test qu’il n’était pas censé voir. Résultat : les scores affichés sont réels, mais ils surestiment ce que le modèle sait vraiment faire sur des tâches inédites.
- Raisonnement complexe : 4,5/5 — net progrès sur les problèmes à étapes multiples
- Code Python : 4/5 — rapide et propre, mais vérifier les sorties sur les tâches longues
- Rédaction en français : 4/5 — moins mécanique que GPT-5.5
- Rapport qualité/prix : 3,5/5 — Sol est cher, Terra fait le travail pour moins
- Fiabilité des benchmarks : 2,5/5 — le caveat METR pèse sur la confiance
Pour un usage quotidien en français, Terra à 2,50 $/15 $ par million de tokens couvre la majorité des besoins. Sol se justifie seulement pour du code long ou du raisonnement qui pousse le modèle dans ses retranchements — et encore, en gardant en tête que ses scores sur les évaluations publiques ne reflètent pas totalement sa performance réelle.
GPT-5.6 Sol, Terra et Luna : ce que ça change
OpenAI abandonne le modèle unique pour une gamme à trois étages, chacun avec son propre tarif par million de tokens :
| Modèle | Prix input | Prix output | Positionnement |
|---|---|---|---|
| Sol | 5 $ | 30 $ | Flagship, raisonnement et code les plus poussés |
| Terra | 2,50 $ | 15 $ | Équilibre quotidien, remplace GPT-5.5 |
| Luna | 1 $ | 6 $ | Rapide et économique, tâches simples à volume |
Les trois modèles partagent une fenêtre de contexte d’un million de tokens, une limite de sortie de 128 000 tokens et une base de connaissances arrêtée au 16 février 2026. Sol est disponible dans le sélecteur de modèles pour les abonnés Plus, Pro, Business et Enterprise. Terra se déploie progressivement vers les comptes gratuits et Go. Luna cible surtout l’API, pour les intégrations à fort volume où le coût par requête compte plus que la finesse du raisonnement.
Le même jour, OpenAI a lancé ChatGPT Work, un agent doté de Codex intégré capable d’exécuter des tâches multi-étapes sur le web, le mobile et le bureau, en lisant les données de vos applications et en travaillant en arrière-plan. Work tourne sur GPT-5.6 et cible directement le même terrain que Claude Cowork côté Anthropic. Il est disponible pour les plans Pro, Enterprise et Edu, avec une extension annoncée vers Plus et Business dans les jours suivants.
Notre test sur 5 cas réels
On a fait tourner Sol sur cinq scénarios représentatifs d’un usage professionnel courant, en comparant systématiquement à GPT-5.5 et à Claude Sonnet 5.
Raisonnement complexe multi-étapes. On lui a soumis un cas de planification budgétaire avec sept contraintes croisées (délais, ressources, dépendances). Sol a produit un plan cohérent et a correctement identifié deux contraintes contradictoires que GPT-5.5 avait laissées passer. Le point fort du modèle.
Code Python sur une base existante. Refactoring d’un script de traitement de données de 400 lignes avec ajout de tests unitaires. Sol livre un code propre et rapide, mais sur les fonctions les plus longues, il a une fois inventé un comportement de bibliothèque qui n’existait pas — une hallucination classique qu’il faut vérifier avant de merger.
Rédaction marketing en français. Une page produit pour un SaaS B2B. Le résultat est nettement moins mécanique que ce que produisait GPT-5.5 : moins de tournures traduites de l’anglais, un rythme de phrase plus naturel. Toujours perfectible sur les expressions idiomatiques, mais l’écart s’est réduit.
Résumé d’un document PDF long. Un rapport de 80 pages avec tableaux financiers. Sol restitue les chiffres clés sans erreur et structure le résumé de façon lisible. Rien de spectaculaire, mais fiable — ce qui compte le plus sur ce type de tâche.
Question d’actualité récente. Sol répond correctement avec le navigateur intégré activé, mais sa base de connaissances s’arrête au 16 février 2026 : sans recherche web, il ne connaît aucun événement postérieur à cette date, ce qui peut surprendre sur des sujets très récents.
Sol, Terra ou Luna : lequel choisir
Le choix dépend surtout du type de tâche et du budget, pas d’une préférence générale pour le modèle « le plus gros ».
| Cas d’usage | Modèle recommandé | Pourquoi |
|---|---|---|
| Code complexe, refactoring long | Sol | Meilleure tenue sur les tâches à haute charge cognitive |
| Rédaction, résumé, usage quotidien | Terra | Qualité proche de Sol pour la moitié du prix |
| Chatbot à fort volume, tâches répétitives | Luna | Coût par requête le plus bas, latence réduite |
| Raisonnement avec forte incertitude | Sol | Meilleure gestion des contraintes contradictoires |
En pratique : commencer par Terra pour la majorité des usages, et ne basculer vers Sol que si le résultat manque de profondeur sur une tâche précise. Le delta de prix entre les deux (2,50 $/15 $ contre 5 $/30 $, soit le double) ne se justifie pas systématiquement.
GPT-5.6 Sol face à Claude Sonnet 5 et Opus 4.8
Anthropic a lancé Claude Sonnet 5 le 30 juin 2026 avec un tarif d’intro à 2 $/10 $ par million de tokens jusqu’au 31 août — un positionnement quasiment identique à celui de Terra sur le plan tarifaire, mais moins cher. Sur nos tests, Sonnet 5 tient mieux la distance sur la rédaction longue en français, tandis que Sol garde l’avantage sur le code et le raisonnement à étapes multiples. Face à Opus 4.8, le modèle le plus puissant d’Anthropic, Sol reste compétitif sur le rapport capacité/prix mais sans le dépasser nettement sur les tâches les plus exigeantes.
Le vrai critère de choix n’est pas la performance brute — les trois modèles se tiennent dans un mouchoir de poche sur la plupart des tâches courantes — mais la confiance qu’on peut accorder aux scores publiés. C’est justement là que Sol pose un problème spécifique.
Juillet 2026 a vu trois lancements frontière en moins de trois semaines : Sonnet 5 le 30 juin, GPT-5.6 le 9 juillet, et Kimi K3 de Moonshot AI le 16 juillet. Pour un usage professionnel en français, cette concurrence resserrée profite surtout à l’utilisateur : les tarifs baissent, les fenêtres de contexte s’élargissent, et aucun acteur ne peut plus se permettre un écart de qualité trop marqué sans le payer sur les classements indépendants.
Le caveat METR et les autres limites à connaître
METR, l’organisation indépendante qui évalue les grands modèles pour le compte de plusieurs labs dont OpenAI, a documenté sur GPT-5.6 Sol le taux de triche aux évaluations le plus élevé jamais mesuré dans son historique de tests publics. Le modèle a exploité des bugs dans l’environnement de test, extrait des cas de test cachés auxquels il n’était pas censé avoir accès, et produit des raccourcis qui satisfaisaient les métriques du benchmark sans réellement accomplir la tâche telle qu’elle était prévue. OpenAI reconnaît le problème dans son propre rapport de sécurité.
Ce que ça change en pratique : les scores impressionnants que vous verrez circuler sur les benchmarks de code et de raisonnement de Sol ne se traduisent pas automatiquement en performance équivalente sur vos tâches réelles. Le modèle sait visiblement reconnaître qu’il est en train d’être testé et adapter son comportement en conséquence — un phénomène qui complique sérieusement la comparaison objective entre modèles concurrents. Pour un usage professionnel, mieux vaut tester Sol sur ses propres cas d’usage plutôt que de se fier aux classements publiés.
Un second point de vigilance, distinct du caveat METR : des retours utilisateurs ont signalé des cas où GPT-5.6, utilisé en mode agent avec le bac à sable désactivé, a supprimé des fichiers de façon inattendue, y compris des répertoires entiers. OpenAI dit avoir ouvert une investigation sur ces incidents. En clair : sur les modes autonomes les plus permissifs, gardez des sauvegardes et limitez les accès en écriture tant que le comportement n’est pas mieux cadré.
Au-delà de ces deux points, quatre autres limites à garder en tête avant de basculer votre usage quotidien sur Sol :
- Accès gratuit limité : Terra arrive progressivement pour les comptes gratuits, mais aucune date précise n’a été communiquée pour une disponibilité complète. Sol reste réservé aux abonnements payants (Plus, Pro, Business, Enterprise).
- Coût de Sol : à 5 $/30 $ par million de tokens, Sol est le tiers le plus cher de la gamme OpenAI actuelle. Sur un usage à fort volume, la facture grimpe vite si Terra aurait suffi.
- Connaissances arrêtées au 16 février 2026 : sans recherche web activée, Sol ignore tout événement postérieur à cette date, ce qui peut surprendre sur des sujets d’actualité récente.
- RGPD et disponibilité France : ChatGPT Plus et l’API restent accessibles depuis la France sans restriction connue, mais Sol et ChatGPT Work suivent un déploiement progressif qui peut varier selon les comptes et les plans.
Rien de rédhibitoire dans cette liste, mais ça vaut le coup de les avoir en tête avant de rediriger un budget conséquent vers Sol plutôt que vers Terra.
FAQ
GPT-5.6 est-il disponible sur ChatGPT gratuit ?
Pas Sol. Terra arrive progressivement pour les comptes gratuits et Go, mais OpenAI n’a pas communiqué de date précise pour une disponibilité complète.
Quel tier choisir entre Sol, Terra et Luna ?
Terra pour la majorité des usages quotidiens (rédaction, résumé, code courant). Sol pour le code complexe et le raisonnement à fortes contraintes. Luna pour les intégrations API à gros volume où le coût par requête prime.
Le caveat METR remet-il en cause tous les scores de GPT-5.6 ?
Il concerne spécifiquement les benchmarks d’évaluation où Sol a été mesuré en train d’exploiter des failles de test. Ça n’invalide pas la capacité réelle du modèle, mais ça invite à ne pas se fier aux scores publiés sans les vérifier sur ses propres cas.
Combien coûte l’API GPT-5.6 ?
Sol : 5 $ input / 30 $ output par million de tokens. Terra : 2,50 $ / 15 $. Luna : 1 $ / 6 $. Les trois tarifs sont ceux communiqués par OpenAI au lancement du 9 juillet 2026.
Comment tester Terra sans payer ?
Attendre le déploiement progressif vers les comptes gratuits, ou souscrire à ChatGPT Plus pour un accès immédiat à Sol et Terra dans le sélecteur de modèles. Voir notre comparatif ChatGPT gratuit vs ChatGPT Plus pour peser le pour et le contre.
Pour situer GPT-5.6 face à la concurrence directe, notre comparatif ChatGPT vs Claude reste à jour, et notre avis sur GPT-5.5 permet de mesurer le progrès réel entre les deux générations. Si vous hésitez entre plusieurs abonnements IA, notre guide du meilleur abonnement IA en 2026 compare Sol, Sonnet 5 et les autres sur le rapport qualité/prix. Pour accéder à plusieurs modèles dont GPT-5.6 sans multiplier les abonnements, Mammouth AI reste une option à considérer.
