Le 12 août 2026, xAI a mis en ligne Grok 4.6. Le modèle affiche un indice d’intelligence égal à GPT-5.6 Sol pour un coût d’API nettement inférieur. Cette sortie relance la question de la maturité technologique des modèles de langage pour les besoins professionnels. Le comparatif IA qui suit oppose Grok 4.6, Claude Fable 5 et GPT-5.6 Sol sur les benchmarks, les tarifs et les cas d’usage concrets.
Grok 4.6 : le nouveau modèle de xAI entre en scène
Grok 4.6 est disponible depuis le 12 août 2026. Le déploiement couvre Cursor, Grok Build, l’API xAI ainsi que les plateformes OpenRouter, Vercel et Cloudflare. Les utilisateurs de Grok Build et de Cursor bénéficient d’un quota d’usage doublé pendant la première semaine.
Ce modèle de langage se concentre sur deux axes : l’exécution d’agents sur de longues chaînes d’étapes et la production de projets interactifs ou visuels aboutis dès la première passe. xAI met aussi en avant une auto-vérification renforcée sur les sessions longues.
Les environnements d’accès pour tester Grok 4.6 :
- Cursor
- Grok Build
- API xAI
- OpenRouter
- Vercel
- Cloudflare
Cette disponibilité élargie marque une étape pour xAI. L’éditeur, longtemps perçu comme un challenger, élargit sa distribution et entend peser sur le marché des modèles de langage professionnels. Pour mesurer le chemin parcouru, une analyse de l’écosystème vocal de xAI, notamment son agent vocal, complète utilement ce comparatif.
L’arrivée de Grok 4.6 ne se limite pas à une mise à jour technique. Son positionnement tarifaire interroge directement les habitudes des équipes qui consomment des tokens à grande échelle.
Indice d’intelligence et coût d’API : la nouvelle donne économique
Sur l’indice Artificial Analysis Intelligence, Grok 4.6 obtient 61 points. GPT-5.6 Sol Max atteint le même score et Claude Fable 5 Max reste en tête avec 62 points. L’écart avec Grok 4.5 est de cinq points. La performance composite ne raconte toutefois pas toute l’histoire.
| Critère | Grok 4.6 High | GPT-5.6 Sol Max | Claude Fable 5 Max |
|---|---|---|---|
| Indice AA Intelligence | 61 | 61 | 62 |
| GDPVal-AA v2 (travail de bureau) | 1753 | 1728 | 1741 |
| AA-Briefcase (dossiers, synthèse) | 1577 | 1502 | 1574 |
| Terminal-Bench v3.0 (agent en terminal) | 26 % | 34,6 % | 34,1 % |
| DeepSWE v1.1 (ingénierie logicielle) | 65,9 % | 73 % | 70 % |
| Harvey LAB (juridique, Vals) | 15,8 % | 2,5 % | 11,3 % |
| Prix API (entrée / sortie par million de tokens) | 2 $ / 6 $ | 5 $ / 30 $ | 10 $ / 50 $ |
Les scores de Grok proviennent du tableau d’évaluations publié par xAI. Pour ses concurrents, l’éditeur indique reprendre les meilleurs résultats auto-déclarés ou publiquement disponibles. Les tarifs d’API sont ceux des grilles publiques d’OpenAI et d’Anthropic au 15 août 2026. Le rapport de coût est immédiat : un million de tokens générés coûte 6 $ chez xAI, 30 $ chez OpenAI et 50 $ chez Anthropic. Le rapport entre les deux extrêmes atteint un facteur huit.
La structure de prix joue aussi. Du côté d’OpenAI, la sortie coûte six fois l’entrée. Chez xAI, elle en coûte trois. Pour des workflows d’agents avec planification, vérification et rapports intermédiaires, la facture est directement liée à la génération de tokens. Le choix d’un modèle dépend donc du volume de sortie attendu. Notre comparatif IA régulièrement mis à jour suit ces évolutions.
Les chiffres composites ont leurs limites. Le détail des benchmarks révèle des profils très différents selon les domaines. Une analyse par tâche s’impose avant d’orienter un budget.
Performances par tâche : les points forts et les angles morts
Agents en terminal et ingénierie logicielle : le retard de Grok 4.6
Terminal-Bench v3.0 mesure la capacité d’un agent à exécuter une tâche technique de bout en bout sans intervention. Grok 4.6 plafonne à 26 %, loin des 34,6 % de GPT-5.6 Sol Max et des 34,1 % de Claude Fable 5 Max. L’écart atteint huit points sur ce test.
Le constat se confirme sur DeepSWE v1.1 : 65,9 % pour Grok 4.6, 73 % pour GPT-5.6 Sol Max et 70 % pour Claude Fable 5 Max. La performance IA du modèle de xAI est donc en retrait sur l’ingénierie logicielle autonome.
Code assisté et interfaces de développement : un niveau comparable
Le résultat change sur CursorBench v3.2, qui mesure le code écrit dans un éditeur avec un humain dans la boucle. Grok 4.6 atteint 69,9 %, Claude Fable 5 monte à 70,5 % et GPT-5.6 Sol Max recule à 67,2 %. L’écart se resserre. Le modèle de xAI tient la comparaison quand l’humain garde la main.
Pour les équipes qui intègrent des assistants IA directement dans leur environnement de développement, le choix de l’interface compte autant que le modèle. Les résultats de Grok 4.6 sur CursorBench le confirment.
Travail de bureau et synthèse documentaire : le point fort
GDPVal-AA v2 place Grok 4.6 en tête avec 1753 points, devant GPT-5.6 Sol Max (1728) et Claude Fable 5 Max (1741). Sur AA-Briefcase, Grok 4.6 prend aussi l’avantage avec 1577 points, contre 1502 pour GPT-5.6 Sol Max et 1574 pour Claude Fable 5 Max.
Le domaine juridique complète le portrait : Harvey LAB donne 15,8 % à Grok 4.6, 11,3 % à Claude Fable 5 et seulement 2,5 % à GPT-5.6 Sol. Le modèle de xAI se distingue donc sur l’analyse documentaire.
Quel modèle retenir pour vos besoins professionnels ?
Cas d’usage : agents autonomes et exécution système
Pour les agents qui exécutent seuls dans un terminal, les résultats de Grok 4.6 incitent à la prudence. L’écart sur Terminal-Bench ne se rattrape pas facilement. GPT-5.6 Sol et Claude Fable 5 gardent une avance nette sur ce terrain.
Une migration vers xAI demanderait des tests approfondis avant de reconfigurer les outils. Les équipes techniques devraient mesurer l’impact sur leurs propres workflows avant de changer de fournisseur.
Cas d’usage : rédaction, analyse, synthèse
Pour la recherche, la synthèse, l’analyse de dossiers et les premières versions d’applications, Grok 4.6 offre une économie d’environ 80 % sur la sortie. Avec 2 $ par million de tokens en entrée et 6 $ en sortie, le modèle de xAI devient rentable pour les équipes qui consomment des volumes importants.
Le quota doublé de Grok Build renforce l’intérêt d’un test rapide. Les résultats sur GDPVal-AA et AA-Briefcase suggèrent une vraie valeur sur le travail intellectuel écrit.
Cas d’usage : projets interactifs et visuels
xAI a conçu Grok 4.6 pour la production de projets interactifs ou visuels aboutis dès la première passe. Les premiers retours sur CursorBench et les benchmarks de code assisté montrent des résultats honorables. Pour du contenu visuel ou des interfaces, le modèle peut constituer une alternative crédible.
Points clés à retenir avant de choisir :
- Grok 4.6 : le meilleur rapport qualité-prix pour le travail intellectuel écrit.
- GPT-5.6 Sol : le choix pour les agents en terminal et l’ingénierie logicielle.
- Claude Fable 5 : la référence pour l’autonomie longue durée et le codage avancé.
- Le prix de sortie pèse lourd : 6 $ chez xAI, 30 $ chez OpenAI, 50 $ chez Anthropic.
La maturité technologique de Grok 4.6 dépend donc du cas d’usage. Le modèle de xAI ne domine pas tous les benchmarks, mais son positionnement tarifaire bouscule les repères du marché. La feuille de route de xAI annonce une accélération dans les prochaines années. Les équipes professionnelles ont désormais un nouvel arbitre à intégrer dans leur comparatif IA.