Aller au contenu
Le Bien Heureux · Belgique
L’essentiel geek, le temps d’une pause.
Jeudi 8 octobre 2026 Édition du matin N° 43
Bien expliqué · À l’heure du sandwich · ≈ 3 min de lecture

Comment une IA à quelques milliers de dollars a battu le meilleur joueur de Stratego

Ataraxos bat le meilleur joueur de Stratego 15 parties à 1. Sa recette, publiée dans Nature : deviner les pièces cachées, avec seulement 16 GPU.

Plusieurs boîtes du jeu Stratego de différentes éditions alignées sur une table nappée de rouge lors d'un tournoi.
Différentes éditions de Stratego exposées au tournoi Patras Battles 2024. © Catlemur / Wikimedia Commons, CC BY-SA 4.0 (recadrée)

Les échecs sont tombés en 1997, le go en 2016, le poker a suivi. Le Stratego, lui, résistait. Une équipe de Carnegie Mellon, du MIT, de l’université de New York et de Stanford vient d’y mettre fin : son programme, Ataraxos, a battu Pim Niemeijer, considéré comme le meilleur joueur de l’histoire, 15 parties à 1, avec 4 nulles. Les travaux sont parus dans Nature le 30 septembre 2026.

Pourquoi ce jeu de société tenait tête aux machines

Au Stratego, chacun voit où sont les 40 pièces adverses, mais pas ce qu’elles sont. Un grade n’est révélé que lorsqu’une pièce en attaque une autre. C’est un jeu à information cachée, comme le poker, à une tout autre échelle : au Texas Hold’em, un joueur cache deux cartes, soit 1 326 mains possibles, explique Gabriele Farina (MIT) à Ars Technica. Au Stratego, 40 pièces peuvent être placées dans n’importe quel ordre.

S’y ajoutent la durée, jusqu’à 2 000 coups contre une quarantaine aux échecs, et le bluff : avancer une pièce faible comme si c’était le maréchal. DeepNash, le programme de DeepMind présenté en 2022, n’avait pas atteint le niveau des tout meilleurs.

Deux idées, dont un réseau qui devine

Ataraxos apprend en jouant contre lui-même, 163 millions de parties au total. Première astuce : l’information cachée fait tourner cet apprentissage en rond, alors l’équipe modifie fortement la stratégie au début de l’entraînement, puis de plus en plus prudemment.

La seconde est la vraie nouveauté. Avant chaque coup, le programme réfléchit, comme AlphaGo. Impossible pourtant d’examiner toutes les dispositions adverses. Un second réseau de neurones estime donc l’identité des pièces cachées d’après la façon dont l’adversaire les a déplacées. Ataraxos tire au sort quelques dispositions plausibles, y joue les coups candidats et retient celui qui s’en sort le mieux.

16 GPU, pas un centre de données

L’entraînement a demandé 16 processeurs graphiques et quelques milliers de dollars, selon les auteurs cités par Ars Technica. Le résumé de l’article rappelle que des efforts industriels à plusieurs millions de dollars avaient échoué. Les chercheurs présentent leurs techniques comme générales, valables au-delà du jeu. Cela reste à démontrer hors d’un plateau de 40 pièces, mais le résultat prouve qu’une bonne idée peut encore peser plus lourd qu’un gros budget.

En bref

  • Ataraxos a battu le champion Pim Niemeijer 15 à 1, avec 4 nulles.
  • Le Stratego cache l’identité de 40 pièces par camp pendant des parties très longues.
  • Clé du succès : un second réseau qui devine les pièces cachées, pour pouvoir calculer avant chaque coup.
  • Coût annoncé : 16 GPU et quelques milliers de dollars.

Sources : Nature, « Scalable decision-making for games of imperfect information » (30 septembre 2026) · Ars Technica (1er octobre 2026)