Pourquoi l’IA se trompe ? Biais, erreurs et limites des modèles LLM
Qui n’a jamais remarqué une erreur ou un biais dans son intelligence artificielle favorite ?
Les IA de langage que nous utilisons au quotidien – comme ChatGPT – nous surprennent parfois : un fait erroné, un mot hors contexte, un raisonnement bizarre, un faux calcul, ou encore une réponse orientée sur le plan idéologique.
Pour bien comprendre pourquoi, il faut s’intéresser à la façon dont ces applications.
Les causes principales d’erreur dans une IA basée sur un LLM
Premier entraînement du LLM
Les capacités de « raisonnement » d’un LLM ne sont pas définies par des règles que des humains auraient écrites à l’avance, comme des règles de grammaire ou des principes logiques que l’on apprend en cours. Au contraire, un algorithme « apprend » ces règles sur le tas, implicitement, en regardant de milliards d’exemples de textes. On parle alors d’entraînement.
Ainsi, lors d’une première phase d’entraînement, le modèle de langage « apprend » le langage naturel en quantifiant, à très grande échelle, les relations entre les mots. Il apprend également à reconnaître des motifs et de la structure dans le langage. C’est un peu comme apprendre une langue en immersion dans un autre pays, sans cours formels.
Ce premier entraînement, également appelé « Pre-Training », se fait sur un ensemble massif de textes, parfois jusqu’à 10 000 milliards de mots (oui, 13 zéros) pour les plus gros modèles.
Après cette première phase, le modèle arrive à faire des phrases cohérentes, un peu par imitation. Il n’est pas encore prêt à répondre à nos questions de façon satisfaisante. C’est un peu brut de décoffrage.
D’ailleurs, au départ (entre 2015 et 2017), les LLM avaient été conçus pour résoudre des problèmes de traduction. Pas pour écrire votre business plan, résoudre des problèmes mathématiques complexes, faire un diagnostic médical, ou vous expliquer l’invasion des Huns.
Le fine-tuning (ajustement ciblé)
Après avoir appris le langage naturel, le modèle doit maintenant donc être affiné et ajusté pour produire des réponses qui correspondent à ce que nous attendons :
🔹 Adapter le contenu, la forme et le style des réponses à notre intention, généralement inspiré de la façon dont nous répondons nous-mêmes aux mêmes types de questions.
🔹 Éviter des réponses « socialement inappropriées ».
🔹 Parfois se spécialiser dans un domaine précis.
Dans ces phases, les LLM sont plutôt dressés pour produire des réponses à chaque prompt, même lorsqu’il n’y a pas de certitude. Ils ne sont pas entraînés pour dire « Je ne sais pas ». Lorsqu’ils sont quand même entraînés pour distinguer le vrai du faux, ça ne se fait pas dans la nuance : c’est tout ou rien (mais en 2026, des réglages intéressants ont déjà été faits sur certains grand modèles).
Le LLM et sa mémoire
Le LLM ne possède pas de mémoire spécifique où sont stockés les faits et événements vérifiables. Les réponses sont construites dans le contexte des milliards de phrases ingérées. Il ne « sait » rien dans le sens humain du terme. Au mieux, il peut scraper des pages web qu’il considère crédibles, par exemple pour parler d’un fait historique.
La capacité de raisonnement d’une IA
Le LLM de base n’arrive pas à réellement tenir un raisonnement abstrait, logique, critique ou créatif comme un humain. Il imite nos raisonnements à partir de ce qu’il a « appris » en « regardant » les humains raisonner (et il le fait souvent très bien).
Mot à mot
Le LLM écrit mot par mot, et pour chaque nouveau mot il »réfléchit » pour décider quel est le meilleur prochain mot. Il puise dans tout ce qu’il a « appris », en cohérence avec votre prompt et tout ce qu’il vient d’écrire lui-même. Ceci pour chaque mot. Un à un. Le tout est basé sur des calculs de probabilités : le prochain mot peut être le meilleur, ou le moins mauvais.
Dans son fonctionnement brut il n’y a donc pas de plan ni de trame, pas de but final imaginé avant d’écrire. Et si le résultat nous paraît quand même cohérent, c’est parce qu’il s’inspire des textes humains et autres exemples qu’il a ingérés lors des entraînements, qui servent de modèle et l’aident justement à faire les bons choix de mots dans un contexte précis ou pour un sujet précis.
Le LLM et les maths
Un LLM de base ne comprend pas les chiffres. Sauf si une fonctionnalité spécifique est invoquée (agent externe, plugin, etc.), il traite un nombre comme un mot. Il peut imiter un calcul simple, mais sans vraie compréhension mathématique.
Pas d’apprentissage autonome
Il ne dispose pas de capacité d’apprentissage et d’adaptation à des situations totalement nouvelles. Il ne développe pas de représentations plus abstraites comme celles fondées sur nos expériences en interaction avec le monde réel.
Tout ceci est propice aux erreurs et aux biais.
Alors, est-ce grave que l’IA fasse des erreurs ?
Cela dépend.
(1) Oui, c’est gênant si l’on prend ses réponses pour argent comptant, sans esprit critique ni vérification.
(2) Oui, c’est grave si le fine-tuning ou le « prompt système » oriente volontairement les réponses (Certains modèles évitent les questions sur certains faits historiques et géopolitiques gênants, ou les déforment).
(3) Non, ce n’est pas grave : nous n’en sommes qu’au début du début.
ChatGPT est sorti pour le public en novembre 2022. Le présent article, à l’origine écrit en juillet 2025, a déjà été affiné en septembre 2026, puisque des progrès importants ont déjà été observés depuis. Et ce n’est pas fini.
Si c’était Internet, on serait quelque part entre 1994 et 1998.
Si c’était des jeux vidéo, on serait en 1981 avec Donkey Kong et Pac-Man, ou encore Tetris.
Si c’était une voiture électrique, on serait en 1881.
Les modèles de langage ne sont qu’une brique de départ. Chercheurs et entreprises travaillent désormais à aller au-delà de la simple génération de texte ou d’images : ajouter des capacités de raisonnement, planification, action, adaptation, et surtout construire des IA capables de manipuler des représentations abstraites du monde réel.
On se rapprocherait ainsi d’une architecture plus complexe, inspirée du fonctionnement du cerveau humain : des couches multiples, apprenant chacune des fonctions et des niveaux d’abstraction distincts.
21 juillet 2025.
Histoire de l’intelligence artificielle
Data centers, I.A. et énergie bas-carbone
Quelles solutions sont mises en œuvre pour optimiser l'usage des énergies bas-carbone ?
Data centers, I.A. et énergie bas-carbone
Quelles solutions sont mises en œuvre pour optimiser l'usage des énergies bas-carbone ?


Laisser un commentaire