Vue d'ensemble
Un logiciel classique suit une liste d'instructions écrites par des humains : si ceci se produit, faire cela. L'IA inverse cette logique. Au lieu d'écrire les règles, les ingénieurs montrent de nombreux exemples à un système et laissent un algorithme d'apprentissage découvrir les règles par lui-même.
Presque tous les systèmes d'IA que vous utilisez aujourd'hui suivent les mêmes étapes.
| Étape | Ce qui se passe | Exemple : un assistant conversationnel |
|---|---|---|
| Données | Collecter et nettoyer des exemples. | De grandes quantités de textes, de code et de conversations. |
| Modèle | Choisir une architecture aux paramètres ajustables. | Un réseau de neurones Transformer doté de milliards de paramètres. |
| Entraînement | Ajuster les paramètres pour réduire les erreurs. | Prédire le prochain token, puis affiner le modèle grâce aux retours humains et de l'IA. |
| Évaluation | Tester le modèle sur des données qu'il n'a jamais vues. | Tests de référence, tests de sécurité et évaluation humaine. |
| Inférence | Utiliser le modèle avec une nouvelle entrée. | Répondre à votre message en quelques secondes. |
Étape 1 : les données
Les données sont la matière première de l'IA. Un modèle ne peut apprendre que les schémas présents dans ses données d'entraînement. Leur qualité, leur diversité et leur équité déterminent donc tout ce qui suit.
- Données structurées : des tableaux contenant, par exemple, des transactions, des relevés de capteurs ou des dossiers médicaux.
- Données non structurées : textes, images, contenus audio et vidéos, qui constituent l'essentiel de l'information dans le monde.
- Données étiquetées : des exemples accompagnés de la bonne réponse, comme des photos portant l'étiquette « chat » ou « chien ».
- Données synthétiques : des exemples générés par d'autres modèles d'IA, aujourd'hui largement utilisés pour entraîner et affiner de nouveaux modèles.
Avant l'entraînement, les données sont nettoyées, dédupliquées, filtrées pour écarter les contenus nuisibles ou de mauvaise qualité, puis converties en nombres que le modèle peut traiter. Pour le texte, cela consiste à le découper en tokens, c'est-à-dire en mots ou en fragments de mots.
Étape 2 : les méthodes d'apprentissage
L'apprentissage automatique offre plusieurs façons d'apprendre à partir des données. Les systèmes modernes les combinent souvent.
Apprentissage supervisé
Apprend à partir d'exemples étiquetés. Utilisé pour détecter les spams, classer des images médicales et prédire les prix.
Apprentissage non supervisé
Repère des structures dans des données non étiquetées, comme des segments de clientèle ou des transactions inhabituelles.
Apprentissage auto-supervisé
Crée ses propres étiquettes à partir de données brutes, par exemple en masquant un mot pour le prédire. C'est ainsi que les LLM sont pré-entraînés.
Apprentissage par renforcement
Apprend par essais et erreurs à partir de récompenses. Utilisé pour les IA capables de jouer, la robotique et l'entraînement des modèles de raisonnement.
Étape 3 : les réseaux de neurones
La plupart des IA modernes utilisent des réseaux de neurones artificiels. Un réseau se compose de couches de petites unités (neurones). Chaque unité multiplie ses entrées par des poids, additionne les résultats et transmet le tout à la couche suivante après l'avoir soumis à une fonction non linéaire simple.
- La couche d'entrée reçoit des nombres représentant les données, comme les valeurs des pixels ou les représentations vectorielles des tokens.
- Les couches cachées transforment progressivement ces nombres en caractéristiques plus abstraites, comme les contours, les formes et les objets d'une image.
- La couche de sortie produit le résultat, par exemple une probabilité pour chaque prochain mot possible.
L'apprentissage profond désigne simplement des réseaux comportant de nombreuses couches. Différentes architectures conviennent à différents types de données : les réseaux convolutifs pour les images, les réseaux récurrents pour les anciens systèmes de reconnaissance vocale, les modèles de diffusion pour la génération d'images et les Transformers pour le langage et, de plus en plus, presque tout le reste.
Étape 4 : l'entraînement
L'entraînement est un processus d'optimisation qui se répète des milliards de fois.
- Propagation avant : le modèle fait une prédiction sur un lot d'exemples.
- Perte : une fonction de perte mesure l'écart entre la prédiction et le résultat attendu.
- Rétropropagation : l'algorithme calcule la contribution de chaque poids à l'erreur.
- Descente de gradient : chaque poids est légèrement ajusté dans le sens qui réduit l'erreur.
Les modèles de langage les plus avancés sont entraînés sur d'immenses jeux de données à l'aide de milliers de puces spécialisées (GPU ou TPU), pendant des semaines ou des mois. Selon les estimations publiques, entraîner les plus grands modèles coûte des dizaines, voire des centaines de millions de dollars. C'est pourquoi seules quelques entreprises les créent de toutes pièces.
Un problème courant est le surapprentissage : le modèle mémorise les exemples d'entraînement au lieu d'apprendre des règles générales. Les ingénieurs le détectent en le testant sur des données de validation distinctes et le limitent avec davantage de données, la régularisation et l'arrêt anticipé.
Étape 5 : l'inférence
L'inférence, c'est ce qui se passe lorsque vous utilisez l'IA. Les poids du modèle entraîné ne changent plus, et votre entrée traverse le réseau une fois (ou, pour la génération de texte, une fois par token généré) afin de produire un résultat.
L'inférence coûte bien moins cher que l'entraînement, mais à l'échelle de centaines de millions d'utilisateurs, elle nécessite tout de même de grands centres de données. Les fournisseurs proposent donc plusieurs tailles de modèles : des modèles petits et rapides pour les tâches simples, et des modèles plus grands ou spécialisés dans le raisonnement pour les problèmes difficiles.
Comment fonctionnent les grands modèles de langage
Les grands modèles de langage (LLM), comme GPT d'OpenAI, Claude d'Anthropic, Gemini de Google et les modèles à poids ouverts tels que Llama, Mistral, Qwen ou DeepSeek, sont créés en plusieurs étapes.
Tokens et représentations vectorielles
Le texte est découpé en tokens, puis chaque token est associé à une représentation vectorielle : une longue liste de nombres qui capture son sens. Les mots de sens proche obtiennent des représentations similaires.
Le Transformer et le mécanisme d'attention
L'architecture Transformer, présentée en 2017, utilise un mécanisme appelé « attention ». Pour chaque token, ce mécanisme détermine quels autres tokens du contexte sont les plus importants. Le modèle peut ainsi relier un pronom au bon nom ou une question au passage pertinent d'un long document.
Préentraînement
Le modèle lit d'énormes quantités de texte et apprend à prédire le token suivant. Pour y parvenir, il doit assimiler la grammaire, des faits, des façons de raisonner et des structures de code.
Post-entraînement
Un modèle brut préentraîné ne fait que continuer un texte. L'ajustement sur des instructions, l'apprentissage par renforcement à partir de retours humains (RLHF) et d'autres méthodes similaires lui apprennent à suivre des consignes, à converser, à refuser les demandes dangereuses et à reconnaître ses incertitudes.
Contexte et outils
Lors de l'inférence, le modèle dispose d'une fenêtre de contexte contenant votre conversation, des instructions et parfois des documents récupérés. La génération augmentée par récupération (RAG) et la recherche web lui donnent accès à des informations récentes qu'il n'a pas apprises pendant l'entraînement.
Modèles de raisonnement et agents IA
Depuis 2024, deux avancées ont changé la façon dont l'IA avancée fonctionne en pratique.
Les modèles de raisonnement sont entraînés, souvent par apprentissage par renforcement, à résoudre un problème en passant par des étapes intermédiaires avant de donner une réponse finale. Consacrer plus de puissance de calcul à la réponse améliore généralement les résultats en mathématiques, en sciences, en programmation et en planification. La plupart des grands fournisseurs proposent désormais des modes de raisonnement ou de « réflexion ».
Les agents IA font fonctionner un modèle en boucle : planifier, agir à l'aide d'un outil, observer le résultat, puis planifier à nouveau. Leurs outils peuvent inclure la navigation web, l'exécution de code, la modification de fichiers ou d'autres logiciels. Les agents peuvent accomplir des tâches en plusieurs étapes, mais ils ont toujours besoin d'objectifs clairs, d'autorisations et d'une vérification humaine.
Les systèmes multi-agents vont plus loin en faisant collaborer ou débattre plusieurs rôles IA. Les recherches sur le « débat entre IA » suggèrent que des modèles qui examinent mutuellement leurs arguments peuvent révéler des erreurs qu'un seul modèle ne détecterait pas.
Ce que cela change au quotidien
Comprendre le fonctionnement de l'IA aide à adopter de bonnes habitudes.
- Donnez du contexte. Le modèle ne connaît que ce qui figure dans ses données d'entraînement et dans votre demande.
- Pour les informations importantes, demandez le raisonnement et les sources, puis vérifiez-les.
- Utilisez un modèle de raisonnement pour les problèmes complexes et un modèle rapide pour les premiers brouillons.
- Comparez les points de vue. Des modèles entraînés sur des données différentes peuvent tirer des conclusions différentes.
Debatly facilite cette comparaison : plusieurs personnages IA débattent de votre question, puis un juge IA résume qui a présenté les meilleurs arguments et pourquoi. Vous pouvez aussi discuter directement avec les derniers modèles d'OpenAI, d'Anthropic et de Google dans la même application.