Infographie · Histoire de l'IA

Comment les machines ont appris à parler

ChatGPT arrive fin 2022. Son histoire commence onze ans plus tôt, dans une poignée de laboratoires, avec un jeu d'enfant : deviner la suite d'un texte.

Les scientifiques visaient des objectifs modestes : compresser des fichiers, classer des phrases, traduire. Des machines capables d'écrire sur n'importe quel sujet sont arrivées par surprise, en 2019.

15 min de lecture · Sans prérequis · Tout public

Le jeu du mot suivant Une phrase en tuiles : « Il pleut, je prends mon ». La dernière tuile porte un point d'interrogation. Au-dessus, les paris de la machine : parapluie 64 %, manteau 21 %, temps 9 %. LES PARIS DE LA MACHINE parapluie 64 % manteau 21 % temps 9 % IL PLEUT, JE PRENDS MON ?
Chaque mot écrit par une IA naît d'un pari de ce genre.

Le mécanisme

Un seul jeu : deviner le mot suivant

Toutes les IA qui écrivent (ChatGPT, Claude, Gemini, Le Chat…) reposent sur le même exercice. Elles lisent le début d'un texte et parient sur le mot qui vient ensuite. Essaie à ton tour, en trois manches.

Manche 1 sur 3

« Il pleut. Avant de sortir, je prends mon … »

Pourcentages inventés pour l'exemple.

Pendant son entraînement, une IA joue à ce jeu des milliards de fois. À chaque erreur, on ajuste un tout petit peu ses réglages internes. Peu à peu, ses paris deviennent bons.

Écrire, c'est rejouer ce jeu en boucle

Pour écrire, la machine tire un mot, l'ajoute au texte, puis parie sur le suivant. Encore et encore, jusqu'au point final. Avance mot par mot.

Il pleut. Avant de sortir, je prends mon

La machine n'a encore rien écrit.

Paris pour le mot suivant :parapluie 64 %manteau 21 %temps 9 %

Pourquoi une IA répond-elle différemment à la même question ? Elle tire chaque mot au sort, en suivant ses paris. Le mot favori sort le plus souvent. Un autre sort de temps en temps. Le texte prend alors une autre direction.

Une vraie machine choisit parmi des dizaines de milliers de mots et de morceaux de mots, appelés jetons.

La grille

Parler, c'est quoi au juste ?

Aligner des mots dans un ordre correct, des programmes le font depuis des décennies. Dans son livre La parole aux machines, le philosophe Thibaut Giraud (Monsieur Phi sur YouTube) propose une grille plus exigeante : parler, c'est cocher trois cases à la fois.

Du neuf

Des phrases que personne n'a jamais écrites. C'est le cas de presque tout ce que tu dis dans une journée.

Un fil

Un texte qui tient debout sur plusieurs paragraphes et suit une idée du début à la fin.

S'adapte au contexte

Le texte répond à ce qu'on lui donne (une question, un début d'histoire, un style), quel que soit le sujet.

Teste la grille

Choisis un candidat :

Un être humain

  • Du neuf oui
  • Un fil oui
  • Le contexte oui

Trois cases sur trois. Jusqu'en 2019, l'humain est le seul candidat à les cocher toutes.

Avant 2011

L'IA a 70 ans. Les machines qui parlent en ont 7.

Pendant des siècles, le langage passe pour la marque de la pensée. Les premières machines « bavardes » récitent des phrases préparées par des humains.

  1. 1637

    René Descartes

    Dans le Discours de la méthode, il écrit qu'une machine ne saura jamais arranger des paroles pour répondre au sens de tout ce qu'on lui dit. Pour lui, c'est la marque d'un esprit qui pense.

  2. 1950

    Alan Turing

    Il remplace la question « Une machine peut-elle penser ? » par un test : tenir une conversation écrite sans se faire démasquer.

  3. 1956

    Dartmouth, États-Unis

    Un atelier d'été réunit des pionniers autour d'une expression nouvelle : « intelligence artificielle ». On date de là la naissance du domaine.

  4. Vers 1960

    MIT

    Dans un documentaire télévisé, un ordinateur écrit de petits scénarios de western, à partir de règles écrites à la main.

  5. 1966

    ELIZA

    Ce programme imite un·e psychothérapeute en reformulant tes propres phrases. Des personnes lui confient leurs secrets, à la surprise de son créateur, Joseph Weizenbaum.

La frise

De la devinette à ChatGPT

Les grands ronds marquent les tournants.

Cette policesignale un texte écrit par une machine, traduit de l'anglais.

Du neufLa grille indique les cases cochées.

Chapitre 1 · 2011-2016

Des machines qui devinent des lettres

2011Université de Toronto

Deviner la lettre suivante

Ilya Sutskever, James Martens et Geoffrey Hinton font lire 100 Mo d'articles de Wikipédia à un réseau de neurones. Sa seule tâche : deviner la lettre qui vient ensuite.

Le but
Mieux compresser des fichiers de texte.
Ce qui arrive
Sans aucune leçon de grammaire, le programme apprend à refermer les parenthèses qu'il ouvre.
Texte de machine · 2011

« Le sens de la vie est la tradition de l'antique reproduction humaine… »

La suite part en vrille. Le ton encyclopédique, lui, est déjà là.

  • Oui : Du neuf
  • Non : Un fil
  • Oui : Le contexte
Pour aller plus loin

Le programme s'entraîne cinq jours sur huit cartes graphiques. L'article se termine sur une intuition : des modèles beaucoup plus gros, nourris de beaucoup plus de calcul, pourraient aller bien plus loin. Ilya Sutskever cofondera OpenAI quatre ans plus tard.

2012Université de Toronto

L'apprentissage profond décolle

AlexNet, un réseau de neurones à plusieurs couches, écrase la concurrence en reconnaissance d'images. Deux de ses trois auteurs signaient l'article de 2011. Les machines apprennent à voir. Le langage résiste.

Mai 2015Université Stanford

Un faux Shakespeare

Le doctorant Andrej Karpathy publie sur son blog des textes générés lettre par lettre : du faux Shakespeare, du faux code informatique, de fausses formules mathématiques. L'allure trompe l'œil. Le sens est absent.

Titre du billet : « L'efficacité déraisonnable des réseaux de neurones récurrents ».

Juin 2015Google

Un chatbot nourri aux sous-titres de films

Oriol Vinyals et Quoc Le entraînent un programme sur des millions de répliques de films. Leur méthode, mise au point un an plus tôt avec Ilya Sutskever, servait à traduire.

Conversation avec une machine · 2015

HumainCombien de pattes a un chat ?

MachineQuatre, je crois.

HumainCombien de pattes a une araignée ?

MachineTrois, je crois.

  • Oui : Du neuf
  • Non : Un fil
  • Oui : Le contexte

Décembre 2015San Francisco

Naissance d'OpenAI

Un laboratoire à but non lucratif, cofondé entre autres par Ilya Sutskever, qui promet de partager ses recherches. Ses projets les plus visibles portent sur les jeux vidéo, dont une IA pour Dota 2. Le langage occupe une petite équipe.

Mars 2016Séoul

AlphaGo bat Lee Sedol

L'IA de DeepMind bat la star mondiale du go, quatre parties à une. Quelques années plus tôt, l'exploit paraissait inimaginable. Le monde de l'IA se passionne pour les jeux.

Chapitre 2 · 2017-2018

La machine trouve sa forme

Janvier 2017Google

Des réseaux « outrageusement gros »

Une équipe de Google, avec Geoffrey Hinton, entraîne un modèle de langage de 137 milliards de réglages. Elle mesure ses performances sous tous les angles. L'article ne lui fait écrire aucune phrase.

Pourquoi personne ne le fait écrire ?

Les modèles de l'époque sont jugés sur leur capacité à prévoir le mot suivant, phrase par phrase. Le grand corpus de référence, un milliard de mots tirés d'articles de presse, a même ses phrases mélangées au hasard : aucun texte suivi au-delà d'une phrase. Écrire de longs textes cohérents ne figure tout simplement pas au programme.

Avril 2017OpenAI

Le neurone du sentiment

Alec Radford fait deviner la lettre suivante de 82 millions d'avis de clients Amazon. Le programme ne voit jamais les notes attribuées aux produits. Il développe pourtant, tout seul, un « neurone » qui suit le ton de l'avis, positif ou négatif.

Le but
Apprendre des choses utiles sans étiqueter les données à la main.
Ce qui arrive
En réglant ce neurone, on lui fait écrire des avis ravis ou furieux, à la demande.
Textes de machine · 2017

Neurone réglé sur positif« Exactement ce que je cherchais. »

Neurone réglé sur négatif« Une perte de temps et d'argent. »

Juin 2017Google

Le transformer, le T de GPT

Huit scientifiques de Google publient « Attention Is All You Need » (« L'attention suffit »), un titre qui joue avec une chanson des Beatles. Ils y décrivent une nouvelle forme de réseau de neurones : le transformer.

Avant 2017 : un mot après l'autre

presque effacé Le chat fixe le vase : il miaule.

Le programme lit les mots un par un et garde un résumé de taille fixe. Au moment de lire « il », le mot « chat » s'est presque effacé.

Depuis 2017 : tout le texte d'un coup

attention forte moyenne Le chat fixe le vase : il miaule.

Le transformer garde tout le texte sous les yeux. Chaque mot peut « regarder » tous les autres. Pour interpréter « il », le modèle porte surtout son attention sur « chat » et sur « miaule ».

Le but
Mieux traduire de l'anglais vers l'allemand et le français.
Ce qui arrive
Il bat les records de traduction après seulement trois jours et demi d'entraînement sur huit cartes graphiques.

Les grandes IA qui écrivent aujourd'hui reposent toutes sur cette invention.

Juin 2018OpenAI

GPT, un modèle sans nom

L'équipe d'Alec Radford entraîne un transformer à deviner le mot suivant dans 7 000 livres jamais publiés : aventure, fantasy, romance. Le modèle compte 117 millions de réglages. Dans l'article, il n'a même pas de nom. On l'appellera plus tard GPT-1.

Le but
Un modèle de base, à spécialiser ensuite pour des tests de compréhension : dire si une phrase est correcte, si une critique de film est positive, si deux phrases se contredisent.
Ce qui arrive
Il bat le record sur 9 tests sur 12. L'article ne montre pas un seul texte écrit par le modèle.
Texte de machine · GPT-1

« Le projet a réussi à développer et à développer une nouvelle technologie appelée moteur à fusion. »

Le texte tourne en rond. Exemple publié plus tard par OpenAI.

  • Oui : Du neuf
  • Non : Un fil
  • Oui : Le contexte

Octobre 2018Google

BERT, champion du texte à trous

Google entraîne BERT à retrouver des mots cachés au milieu des phrases. Il regarde à gauche et à droite du trou. Sur les tests de compréhension, il écrase GPT. Fin 2018, le domaine parie sur BERT.

Il plonge sa cuillère dans le ?bol, café, pot…

Il plonge sa cuillère dans le ? de confiture.pot

Les mots situés après le trou aident à le remplir.

Une ironie de l'histoire

D'après Monsieur Phi, le sigle « GPT » (Generative Pre-trained Transformer) apparaît pour la première fois par écrit dans un article de Google : celui de BERT. OpenAI l'adopte ensuite.

Chapitre 3 · 2019-2020

La surprise

Le tournant

14 février 2019OpenAI

GPT-2 se met à écrire

OpenAI refait le même modèle, en dix fois plus gros : 1,5 milliard de réglages, entraînés sur 8 millions de pages web repérées grâce à Reddit. L'objectif reste modeste : un meilleur modèle de base.

En le testant, l'équipe découvre qu'il écrit des paragraphes qui tiennent debout, sur à peu près n'importe quel sujet.

Début écrit par un humain, suite écrite par GPT-2

« Des scientifiques ont découvert un troupeau de licornes vivant dans une vallée reculée des Andes. »

« Le scientifique a baptisé la population “la licorne d'Ovide”, d'après sa corne caractéristique. »

La suite tient sur plusieurs paragraphes. OpenAI précise avoir gardé le meilleur de dix essais.

  • Oui : Du neuf
  • Oui : Un fil
  • Oui : Le contexte

Premier programme à cocher les trois cases.

  • Ajoute « TL;DR: » à la fin d'un article (l'abréviation d'internet pour « trop long, pas lu ») : GPT-2 en écrit un résumé. Personne ne lui a appris à résumer.
  • On avait retiré les pages en français de ses lectures. Il traduit pourtant un peu, grâce à 10 Mo de français restés dans 40 Go de texte, surtout des citations, soit 1/4 000e du total.
  • OpenAI retarde la publication de la version complète, par crainte d'abus : fausses nouvelles, spam. Elle la publie en novembre 2019.
Prudence ou coup de communication ?

La décision est souvent moquée comme un coup de communication. Monsieur Phi y voit une prudence raisonnable : l'équipe venait d'obtenir un outil dont personne ne connaissait les limites.

Mars 2019Richard Sutton

La leçon amère

Le chercheur Richard Sutton tire en une page la leçon de 70 ans de recherche en IA : sur le long terme, les méthodes générales qui profitent d'une puissance de calcul croissante l'emportent sur les connaissances humaines codées à la main. Amère, pour qui a passé sa carrière à coder ces connaissances.

Mai 2020OpenAI

GPT-3, cent fois plus gros

Le modèle compte 175 milliards de réglages, cent fois GPT-2. L'article réunit 31 signataires, contre 4 pour GPT-1 et 6 pour GPT-2 : le langage est devenu la priorité d'OpenAI. Le philosophe David Chalmers le décrit aussitôt comme l'un des systèmes d'IA les plus intéressants et les plus importants jamais créés.

Texte de machine · GPT-3, lettre en réponse à des philosophes

« Je ne fais que parler devant vous. »

  • Oui : Du neuf
  • Oui : Un fil
  • Oui : Le contexte

Pour Monsieur Phi, c'est le moment où l'humanité perd le « monopole du langage ».

Chapitre 4 · 2022-2026

Tout le monde s'en sert

30 novembre 2022OpenAI

ChatGPT ouvre la porte au grand public

Une fenêtre de discussion, posée sur un modèle de la famille GPT-3.5. Les spécialistes connaissent déjà la technique. Le succès surprend tout le monde.

Mars 2023OpenAI

GPT-4

Encore un cran au-dessus. Ce qui paraissait impossible cinq ans plus tôt devient banal.

Aujourd'hui2026

Le même jeu, en bien plus fort

Les IA qui écrivent rédigent, traduisent, résument, programment et s'attaquent à des problèmes de mathématiques de haut niveau. Au cœur, on retrouve le jeu de devinette du début, complété par d'autres entraînements.

La taille

Même recette, en beaucoup plus gros

De GPT-1 à GPT-3, la méthode change peu. La taille explose. On la mesure en réglages internes, que les spécialistes appellent paramètres.

Nombre de réglages, barres à l'échelle

GPT-1 juin 2018

117 millions, soit 0,07 % de GPT-3 : trop petit pour apparaître

GPT-2 février 2019

1,5 milliard, soit 0,86 % de GPT-3

GPT-3 mai 2020

175 milliards

Compte un réglage par seconde, jour et nuit

3,7 ans

pour GPT-1

47,5 ans

pour GPT-2

5 545 ans

pour GPT-3, plus que l'âge de la grande pyramide de Gizeh (environ 4 500 ans)

C'est la « leçon amère » en action : la même recette, nourrie de toujours plus de calcul, finit par l'emporter.

La généalogie

Un tout petit monde

Avant 2019, les modèles de langage occupent une niche de la recherche. Les mêmes noms reviennent d'une étape à l'autre.

Ilya Sutskever

  • 2011
  • 2012
  • 2014
  • 2015
  • 2017
  • 2018
  • 2019
  • 2020

Doctorant de Geoffrey Hinton, puis cofondateur et directeur scientifique d'OpenAI jusqu'en 2024. Présent à presque chaque étape.

Geoffrey Hinton

  • 2011
  • 2012
  • 2017

Un des pères de l'apprentissage profond. Prix Turing 2018, prix Nobel de physique 2024. Il alerte depuis plusieurs années sur les risques de l'IA.

Oriol Vinyals et Quoc Le

  • 2014
  • 2015
  • 2016
  • 2017

Chez Google, coauteurs de la méthode de traduction de 2014, du chatbot de 2015 et de travaux sur les très grands modèles de langage.

Andrej Karpathy

  • 2015

Son billet de blog de 2015 fait découvrir la génération de texte à beaucoup de passionné·es. Il fait partie de l'équipe fondatrice d'OpenAI.

Alec Radford

  • 2017
  • 2018
  • 2019
  • 2020

Chercheur à OpenAI, premier auteur du neurone du sentiment, de GPT-1 et de GPT-2, cosignataire de GPT-3.

Dario Amodei

  • 2019
  • 2020

Cosigne GPT-2 et GPT-3, puis cofonde en 2021 Anthropic, l'entreprise qui développe Claude.

À retenir

Cinq idées à garder en tête

  • Une IA qui écrit joue à deviner la suite, un mot après l'autre.
  • Elle déduit seule la grammaire de milliards d'exemples.
  • La capacité d'écrire sur tout est apparue par surprise, en 2019, chez des scientifiques qui visaient bien moins.
  • Le grand saut vient de la taille : GPT-3 est 1 500 fois plus gros que GPT-1, pour une recette presque identique.
  • L'IA a 70 ans. Les machines qui parlent en ont 7.

Les mots

Petit lexique

Intelligence artificielle (IA)
Le domaine qui cherche à confier aux machines des tâches qui demandent de l'intelligence quand un humain les fait. Il existe depuis 1956.
Réseau de neurones
Un programme fait de millions de petits calculs reliés entre eux, vaguement inspiré du cerveau. Il apprend à partir d'exemples.
Apprentissage profond
Des réseaux de neurones empilés en de nombreuses couches. En anglais : deep learning. La méthode décolle en 2012.
Paramètre
Un petit bouton de réglage à l'intérieur du réseau. L'entraînement tourne ces boutons un tout petit peu à chaque erreur. GPT-3 en compte 175 milliards.
Entraînement
La phase où le programme devine, se trompe et se fait corriger, des milliards de fois.
Modèle de langage
Un programme entraîné à deviner la suite d'un texte. On parle de grand modèle de langage (en anglais LLM, pour Large Language Model) quand il compte des milliards de réglages.
Jeton
Le morceau de texte deviné à chaque tour : un mot entier ou un bout de mot. En anglais : token.
Transformer
La forme de réseau de neurones inventée chez Google en 2017. Chaque mot du texte peut « regarder » tous les autres.
GPT
Generative Pre-trained Transformer, soit un transformer génératif pré-entraîné : il produit du texte après avoir appris sur une montagne de textes.
Chatbot
Un programme avec lequel on discute par écrit. ChatGPT est un chatbot posé sur un grand modèle de langage.

Teste-toi

Vrai ou faux ?

  1. ChatGPT est le premier modèle de langage.

  2. En 2018, l'équipe d'OpenAI cherchait avant tout à fabriquer une machine qui parle.

  3. GPT-2 a appris un peu de français alors qu'on avait retiré les pages en français de ses lectures.

  4. Le « T » de GPT désigne une invention de Google.

  5. Pour répondre, une IA comme ChatGPT recopie des phrases trouvées sur internet.

Score : 0 sur 5

Sources

D'où viennent ces informations

Cette infographie s'inspire d'une vidéo de 2026 de Monsieur Phi (Thibaut Giraud) consacrée à la généalogie des grands modèles de langage. La grille des trois cases vient de son livre La parole aux machines. Philosophie des grands modèles de langage (Grasset, 2025).

Les dates et les chiffres renvoient aux publications d'origine :

Les textes de machines sont traduits de l'anglais. Les pourcentages des jeux sont inventés pour l'exemple.