Pourquoi l’IA invente des chiffres et des sources, et comment l’en empêcher
Les modèles inventent quand ils ne savent pas répondre. Voici les réglages et les formulations qui réduisent les erreurs de 70 à 85 pour cent.
En bref. Un modèle de langage ne consulte pas une base de faits : il produit la suite de mots la plus probable, et quand il ne sait pas, la suite la plus probable ressemble quand même à une réponse. Le levier le plus efficace n’est pas une formulation magique mais l’accès à une source : activer la recherche web ou coller le document fait tomber le taux d’erreur factuelle de 70 à 85 % selon les mesures publiées en 2026. Le reste se joue sur trois habitudes : autoriser explicitement le « je ne sais pas », demander la source ligne par ligne, et vérifier soi-même tout chiffre que l’on va publier.
Ce qui se passe vraiment quand un modèle « invente »
Le mot « hallucination » induit en erreur. Il suggère un bug, un accident, quelque chose qui casse. En réalité, c’est le fonctionnement normal du système poussé dans une zone où il n’a rien de solide à quoi se raccrocher.
Un modèle de langage calcule, mot après mot, ce qui a le plus de chances de venir ensuite. Si vous demandez le chiffre d’affaires 2025 d’une PME de Roubaix, il n’a aucune donnée là-dessus, mais il a vu des milliers de phrases de la forme « le chiffre d’affaires de X s’élevait à Y millions d’euros ». Il complète la forme. Le résultat a la texture d’un fait : un nombre plausible, une unité correcte, parfois même une source qui ressemble à une source.
Deux conséquences pratiques en découlent. D’abord, les erreurs les plus dangereuses ne sont pas les plus grosses : une réponse absurde se repère, un chiffre crédible à 12 % près passe. Ensuite, l’assurance affichée par le modèle n’a aucune valeur d’indice. Il écrit « selon les données de l’INSEE » avec exactement le même aplomb qu’il écrit « bonjour ».
À quel point le problème est-il réel en 2026 ?
Les mesures dépendent entièrement du test utilisé, et c’est la première chose à comprendre avant de citer un pourcentage. Résumer un document que l’on fournit au modèle est une tâche facile : les taux d’erreur tournent autour de 3 à 6 %. Répondre de mémoire à des questions factuelles pointues sur des entités peu connues est une tâche difficile : les mêmes modèles se trompent alors sur la moitié des réponses.
| Type de tâche | Taux d’erreur observé | Ce que cela veut dire pour vous |
|---|---|---|
| Résumer un texte que vous fournissez | 3 à 6 % | Fiable, mais relisez les chiffres repris du texte |
| Répondre de mémoire, sans source | 25 à 55 % | Inutilisable tel quel pour du factuel |
| Répondre avec recherche web active | 5 à 10 % | Exploitable si vous ouvrez les liens |
| Reformuler, structurer, traduire | proche de zéro | Aucun risque factuel, c’est du texte vers du texte |
Un modèle affiché à 0 % d’erreur dans certains classements n’est pas plus intelligent : il refuse simplement de répondre plus souvent. C’est une stratégie légitime, et c’est précisément celle qu’il faut lui demander d’adopter.
Le réglage qui compte plus que tous les prompts
Les comparaisons publiées en 2026 convergent sur un point : activer la recherche web réduit davantage les erreurs que d’activer le mode « raisonnement ». Les écarts mesurés sur des jeux de questions factuelles sont de cet ordre.
| Configuration | Erreurs sans recherche | Erreurs avec recherche | Réduction |
|---|---|---|---|
| Questions factuelles courtes | 47 % | 9,6 % | −80 % |
| Biographies détaillées | 37,7 % | 5,1 % | −86 % |
| Faits vérifiables sur entités | 24,2 % | 5,7 % | −76 % |
La traduction opérationnelle tient en une phrase : avant de travailler la formulation de votre demande, vérifiez que l’outil a le droit d’aller chercher. Beaucoup d’interfaces d’entreprise désactivent la recherche par défaut, pour des raisons de confidentialité tout à fait valables — mais alors il faut savoir que l’on travaille en mode mémoire, et traiter chaque affirmation comme une hypothèse.
Deuxième source d’ancrage, souvent supérieure à la recherche web : le document lui-même. Coller le PDF du rapport, l’export du tableur, la page de tarifs, plutôt que d’espérer que le modèle s’en souvienne. Vous passez d’une tâche à 40 % d’erreur à une tâche à 4 %.
Six formulations qui réduisent réellement les inventions
Aucune ne remplace la vérification, mais chacune change le comportement du modèle de façon mesurable dans un usage quotidien.
- Autoriser l’ignorance explicitement. « Si tu n’as pas l’information, écris exactement : information non disponible. N’estime pas, ne devine pas. » Sans cette permission, le modèle interprète toute question comme une demande de réponse.
- Séparer ce qui vient de la source et ce qui vient du modèle. « Pour chaque affirmation, indique entre crochets : [source] si elle vient du document fourni, [inférence] si tu l’as déduite. » Vous obtenez une carte du risque en un coup d’œil.
- Interdire les chiffres non sourcés. « N’écris aucun nombre que tu ne peux pas rattacher à un passage précis du texte fourni. Si un ordre de grandeur est utile, écris fourchette estimée et explique le calcul. »
- Demander le niveau de confiance par affirmation, pas globalement. Un « je suis assez confiant » en fin de réponse ne sert à rien. Une mention élevée/moyenne/faible sur chaque puce vous dit où regarder.
- Faire lister d’abord ce qui manque. « Avant de répondre, liste les informations qui te manquent pour répondre correctement. » Cette étape révèle souvent que la question est mal posée, et coûte dix secondes.
- Demander la contre-analyse dans un second message. « Relis ta réponse précédente en cherchant les affirmations les plus fragiles. » Un modèle critique mieux un texte qu’il n’en produit un exact.
Une formulation courante fait exactement l’inverse de ce qu’on croit : « ne fais pas d’erreur » ou « sois précis » n’a aucun effet mesurable. Le modèle ne dispose pas d’un curseur de rigueur qu’il aurait laissé en position basse. Ce qui fonctionne, c’est de lui retirer l’obligation implicite de répondre.
Le protocole de vérification en dix minutes
Vérifier ne veut pas dire tout refaire. Il s’agit de concentrer l’effort là où le coût d’une erreur est réel.
- Surlignez tous les nombres, noms propres et dates. C’est là que se logent 90 % des inventions. Le reste du texte — structure, transitions, formulations — ne présente pas de risque factuel.
- Ouvrez les liens, un par un. Une URL citée peut exister et ne rien contenir de ce qui lui est attribué. Vérifiez que la page dit bien ce que la réponse prétend, pas seulement qu’elle se charge.
- Recherchez le chiffre exact entre guillemets. Si « 34,7 % des PME françaises » ne remonte nulle part, le nombre a probablement été fabriqué.
- Testez la date. Beaucoup d’erreurs sont des faits vrais mais périmés : un tarif de 2024 présenté au présent, un dirigeant qui a changé de poste.
- Reposez la question dans un fil vide. Une divergence entre deux réponses indépendantes signale une zone d’incertitude. Une convergence ne prouve rien, mais l’écart, lui, est informatif.
Les domaines où il ne faut pas déléguer la vérification
Il existe des sujets où le taux d’erreur résiduel, même à 5 %, reste inacceptable, parce que l’erreur ne se rattrape pas après publication.
- Références juridiques et réglementaires. Numéros d’articles, délais de recours, seuils d’obligation : à vérifier systématiquement sur Légifrance ou le texte officiel.
- Chiffres financiers d’une entreprise nommée. Les bilans publics se consultent sur les registres officiels ; un modèle qui les récite de mémoire les approxime.
- Citations attribuées à une personne réelle. C’est la catégorie où l’invention est à la fois la plus fréquente et la plus dommageable.
- Références bibliographiques et académiques. Titres crédibles, auteurs réels, revue existante, et article inexistant : la combinaison classique.
- Tout ce qui sera repris par d’autres. Un chiffre faux dans un article se propage ; le corriger trois mois plus tard ne rattrape pas les reprises.
Ce que cela change dans une journée de travail
La conclusion n’est pas qu’il faut se méfier de tout. Elle est qu’il faut trier les tâches selon leur exposition au risque factuel.
Reformuler un texte, structurer des notes désordonnées, produire dix variantes d’un objet d’e-mail, traduire, résumer un document fourni, transformer un tableau en texte : aucune de ces tâches ne comporte de risque factuel notable, parce que la matière vient de vous. C’est là que le gain de temps est net et sans contrepartie.
Demander des statistiques de marché, des prix pratiqués, des références légales, l’historique d’une entreprise ou des sources à citer : ce sont des tâches où le modèle produit une hypothèse bien formulée. Elle peut faire gagner du temps, à condition d’être traitée comme un point de départ de recherche et non comme un résultat.
La règle qui résume tout : si vous ne pouvez pas vérifier une affirmation en moins de deux minutes, ne la publiez pas.
Questions fréquentes
Quel modèle invente le moins de choses ?
La question est mal posée, parce que le classement change à chaque test et à chaque mise à jour. Un modèle affiché comme très fiable l’est souvent parce qu’il refuse plus volontiers de répondre. Le paramètre qui pèse le plus dans votre résultat n’est pas la marque du modèle mais l’accès à une source : le même modèle passe de 40 % à 5 % d’erreur selon que la recherche web est active ou non. Choisissez un outil qui cite ses sources et permet de les ouvrir.
Est-ce que demander « cite tes sources » suffit à régler le problème ?
Non, et c’est un piège classique. Sans accès web, un modèle peut fabriquer une référence complète : titre plausible, auteur réel, année cohérente, revue qui existe. La demande de source n’a de valeur que si les liens sont cliquables et que vous les ouvrez. Une bibliographie non vérifiée donne un faux sentiment de rigueur, ce qui est pire qu’une réponse sans source.
Faut-il activer le mode raisonnement pour éviter les erreurs factuelles ?
Il aide sur les problèmes de logique, de calcul et de cohérence interne, mais peu sur la connaissance des faits. Un raisonnement long et bien construit à partir d’une donnée inventée reste faux. Les comparaisons de 2026 montrent que la recherche web réduit les erreurs factuelles beaucoup plus fortement que le raisonnement seul. Si vous devez choisir, activez la recherche.
Combien de temps faut-il compter pour vérifier un texte produit par une IA ?
Comptez 10 à 15 minutes pour un article de 1 500 mots contenant une dizaine de chiffres et cinq liens. Le poste le plus long reste l’ouverture des sources. Si la vérification prend systématiquement plus longtemps que la rédaction, c’est le signe que la tâche a été mal découpée : il aurait fallu fournir les données au modèle plutôt que les lui demander.