La guerre des modèles IA

EDIT septembre 2026 : réécriture complète au vu des nombreux changements récents.
Sur le terrain des modèles d'IA, on n'avait pas vu une telle compétition depuis le dernier trimestre 2025. À l'époque, Anthropic avait donné le coup d'envoi avec Claude Opus 4.5, un bond de géant salué par tous les utilisateurs.
Un an plus tard, Anthropic continue de faire bouger les lignes. La rivalité avec OpenAI est désormais frontale, tandis que les offres alternatives se multiplient : open source asiatique, approches radicalement différentes, outsiders. Tour d'horizon, acteur par acteur, d'un semestre où les annonces se sont enchaînées à un rythme inédit.
Anthropic impose le tempo
Le 9 juin, Anthropic lache une bombe avec Claude Mythos 5 en préversion, réservée aux partenaires du projet Glasswing, et l'accompagne de Fable 5, une version de Mythos dotée de garde-fous renforcés. Le succès est immédiat, mais le produit est jugé trop sensible. Trois jours plus tard, le Département du Commerce américain interdit l'accès aux deux modèles à tout ressortissant non américain, pour des motifs de sécurité nationale, et Anthropic suspend l'accès pour l'ensemble de ses clients. Les restrictions sont levées le 30 juin, et les modèles reviennent le 1er juillet.
Le retour se fait sans perte de terrain. Fable 5, premier modèle de la classe Mythos ouvert au grand public, s'installe durablement à la première place du classement Arena. Anthropic enchaîne le 1er septembre avec Fable 5.1 et son jumeau sur invitation, Mythos 5.1. Sur le segment stratégique des agents, Fable 5.1 prend la tête du classement agentique d'Arena, devant le nouveau modèle phare d'OpenAI. Au classement général, la domination est nette : sept modèles d'Anthropic figurent dans le top 10.
Le 22 septembre, l'entreprise change de terrain et place le prix au cœur de son argumentaire. Claude Opus 5.5 égale Fable 5.1 sur la plupart des tâches pour un coût d'exécution inférieur d'environ 40 % à celui d'Opus 5, et ses tarifs passent à 4$ et 20$ par million de tokens. Il s'attaque aussi à une critique récurrente : le style « Claudish », jugé formaté et alambiqué. Sonnet 5.5 et Haiku 5.5 doivent suivre dans les prochaines semaines.
OpenAI : la riposte
Distancé au printemps, OpenAI prépare sa réponse pendant tout l'été. Elle arrive le 3 septembre avec GPT-6 Astra. Son entraînement est de loin le plus lourd de l'histoire de l'entreprise : pour la première fois, le préentraînement a mobilisé plus de 100 000 GPU sur le site Stargate au Texas. Son principal argument est le pilotage autonome de l'ordinateur. Il accomplit les tâches 1,9 fois plus vite que son prédécesseur, et c'est le premier modèle d'OpenAI classé « critique » en cybersécurité, capable de trouver et d'exploiter seul des failles inconnues. Le pari est réussi sur les usages professionnels : Astra est deuxième du classement agentique et du classement WebDev du classement Arena, et premier en génération de sites web à partir d'images.
Trois semaines plus tard, le jour même de la sortie d'Opus 5.5, OpenAI élargit sa gamme avec GPT-6 Sol et Luna, qui mettent la technologie d'Astra à la portée du plus grand nombre. Sol coûte moitié moins par token qu'Opus 5.5, même si Anthropic fait valoir que son modèle consomme moins de tokens par tâche, ce qui rend la comparaison délicate. Luna descend à 0,10$ en entrée et 0,50$ en sortie. Sol fait une entrée remarquée à la cinquième place du classement WebDev.
Newsletter
Vous aimez ce type de contenu ? Chaque mois, je partage mes analyses sur l'IA, la Data et le Digital Learning.
S'abonner →- Nouveaux articles
- Actualités du mois
- Tendances observées
- Ressources dénichées
La concurrence asiatique : l'open source à prix cassés
Pendant que les Américains se disputent le haut de gamme, les laboratoires chinois jouent une autre carte : des modèles ouverts, téléchargeables, et des tarifs imbattables.
DeepSeek avait préparé le terrain au printemps. Sa famille V4, sortie le 24 avril 2026, repose sur une architecture Mixture-of-Experts qui n'active qu'une partie des paramètres à chaque requête, ce qui fait baisser les coûts. La version Flash est facturée 0,14$ le million de tokens en entrée, une fraction des tarifs de la concurrence.
L'été voit les autres acteurs monter en puissance :
-
Moonshot dévoile Kimi K3 le 17 juillet : avec 2 800 milliards de paramètres, il se présente comme le plus grand modèle open source du monde. Il est aujourd'hui le seul modèle non américain du top 10 agentique d'Arena.
-
Z.ai répond avec GLM-5.3, lancé le 14 août.
-
Alibaba pousse Qwen 3.8, qui a décroché un succès symbolique début septembre : sur le volet fullstack du classement Arena consacré au code, Qwen3.8 Max était passé devant les modèles d'Anthropic.
-
Dernier arrivé, Xiaomi publie le 21 septembre MiMo-V2.6-Pro sous licence MIT, qui devient le meilleur modèle ouvert pour un coût par tâche dérisoire.
Google, Meta et xAI : les grands américains en embuscade
Les autres géants américains avancent plus discrètement, mais ils restent dans la course. Au classement texte du classement Arena, ils occupent les trois places du top 10 que laisse Anthropic.
Meta est le plus présent, avec deux modèles de sa gamme Muse Spark dans le top 10 texte : la version 1.2 en quatrième position et la 1.3, sortie le 2 septembre, en huitième. Le groupe joue aussi la carte de l'ouverture : son modèle plus léger Muse Glimmer a été publié en août sous licence Apache 2.0, sans les restrictions d'usage qui encadraient Llama 4.
Google a préféré miser sur les modèles rapides et légers. Sorti le même jour avec une variante « Cyber » à accès restreint, Gemini 3.8 Flash se hisse à la neuvième place du classement texte, une performance notable pour un modèle de cette catégorie. En revanche, Google n'a pas encore de modèle phare capable de concurrencer Fable ou Astra sur les agents.
Quant à xAI, devenu SpaceXAI, il a lancé Grok 4.7 le 21 septembre, présenté comme son modèle le plus performant pour le code et le travail intellectuel. Le modèle se classe devant Astra sur les deux classements agentiques d'Artificial Analysis. Son prix au token reste inchangé, mais le coût par tâche augmente, car il produit environ deux fois plus de texte.
Les approches alternatives : changer les règles du jeu
C'est peut-être là que se joue l'avenir de l'IA. Plusieurs acteurs refusent de concourir sur le terrain des grands modèles de langage classiques et parient sur des architectures radicalement différentes.
Mercury (Inception Labs) s'attaque à la vitesse. Au lieu de générer le texte mot après mot, comme tous les grands modèles, Mercury part d'une réponse approximative et l'affine en parallèle, sur le principe des générateurs d'images comme Stable Diffusion. Mercury 2, sorti fin février, dépasse les 1 000 tokens par seconde, soit cinq à dix fois plus vite que les modèles rapides d'OpenAI, Anthropic et Google. Son fondateur reconnaît toutefois qu'il joue dans la catégorie des modèles légers de type Haiku ou Flash, pas dans celle des modèles phares. Début septembre, Inception a enfoncé le clou avec Mercury 2.5, plus capable tout en gardant son avance en vitesse.
Jev (TypeSafe AI) mise sur la décision plutôt que sur la conversation. Lancé le 15 septembre, il ne produit pas de texte : il répond par des valeurs typées, accompagnées de probabilités et de scores de confiance, que les logiciels peuvent utiliser directement. Son fondateur, Diogo Almeida, a travaillé près de quatre ans chez OpenAI. Plutôt que de concurrencer les géants de front, Jev vient compléter leurs offres : un agent n'a pas besoin d'un modèle géant pour décider s'il faut router une requête ou valider une action. Parce que les sorties sont définies à l'avance, il ne peut pas halluciner, ses tokens de sortie sont gratuits, et l'afflux de développeurs a brièvement saturé son API. Ses promesses spectaculaires restent toutefois à confirmer à grande échelle.
AMI Labs est le pari le plus ambitieux, et le plus lointain. Fondée à Paris par Yann LeCun après son départ de Meta, la société a levé 1,03 milliard de dollars en mars, le plus gros tour d'amorçage jamais réalisé par une entreprise européenne. Elle développe des « modèles du monde » fondés sur l'architecture JEPA, conçue par LeCun pour apprendre des représentations abstraites de données réelles plutôt que prédire des tokens un à un. Les cibles visées sont l'industrie, la robotique et la santé. Sa faiblesse est aussi sa singularité : AMI ne propose encore aucun produit, et LeCun a prévenu que la première année serait consacrée à la recherche, avec un horizon commercial mesuré en années.
Et maintenant ?
Cette course a un revers que les concurrents eux-mêmes commencent à reconnaître. Les modèles de pointe savent désormais trouver des failles informatiques inconnues, et leurs capacités les plus sensibles sont bridées ou réservées à des professionnels vérifiés. Début septembre, Dario Amodei, le PDG d'Anthropic, a même appelé l'ensemble du secteur à ralentir le rythme de diffusion des nouvelles capacités pour laisser le temps de traiter les enjeux de sécurité. Reste à savoir qui acceptera de lever le pied le premier, et si la prochaine rupture viendra des géants ou de ceux qui ont choisi de changer les règles du jeu.