Leçon 6/7 8 min

Date de connaissance : pourquoi l'IA ignore l'actualité (et comment la lui donner)

Ton IA a été figée à une date. Voilà pourquoi elle ignore l'actu, et comment lui rebrancher le monde.

Ce que tu vas apprendre

  • Comprendre pourquoi un modèle reste figé à une « date de connaissance »
  • Distinguer le fine-tuning d'une vraie mise à jour des connaissances
  • Savoir comment l'IA accède (ou non) à l'actualité via la recherche web

Demande à ChatGPT ce qui s'est passé hier dans ton secteur. Deux réactions possibles. Soit il t'avoue qu'il n'a pas accès aux informations récentes, soit il invente une actualité plausible qui n'a jamais eu lieu. Dans les deux cas, la même cause : le modèle que tu utilises a été figé à une date, et tout ce qui s'est produit après lui est invisible. Cette leçon t'explique pourquoi une IA aussi impressionnante peut ignorer l'élection de la semaine dernière, ce que le fine-tuning change vraiment, et comment lui rebrancher le monde quand tu en as besoin.

D'où vient ce que l'IA sait : l'entraînement

Reviens une seconde à la leçon 3. Pour fabriquer un LLM, on lui fait avaler des centaines de milliards de mots : pages web, livres, articles, forums. Pendant des semaines, sur des milliers de processeurs, le modèle ajuste ses milliards de paramètres en jouant au même jeu des milliards de fois, devine le mot suivant. Ce qu'il faut retenir aujourd'hui, c'est que ce texte d'entraînement n'est ni infini ni continu. C'est une photo de ce qui était disponible jusqu'à une date précise. Tout ce que le modèle sait du monde vient de cette photo. Rien d'autre.

Après l'entraînement, le modèle est gelé

Une fois l'entraînement terminé, les paramètres ne bougent plus. Le modèle est livré tel quel, identique pour tous, et il reste figé jusqu'à ce que l'éditeur en entraîne une nouvelle version. Quand tu lui parles en juin, il est exactement le même qu'en janvier : il n'a rien appris entre-temps, ni de vos conversations, ni de l'actualité. La date où s'arrêtent ses données d'entraînement porte un nom, la date de connaissance (knowledge cutoff en anglais). Au-delà, c'est le noir complet. Prends ChatGPT 5.5, sorti le 23 avril 2026. Sa date de connaissance est fixée au 1er décembre 2025. Le jour de sa sortie, il ignorait déjà près de cinq mois d'actualité, jusqu'à l'existence de sa propre version. Une subtilité utile, mesurée par des chercheurs de Johns Hopkins en 2024 : la date de connaissance réelle d'un modèle diffère souvent de la date annoncée. Les jeux de données mélangent pages anciennes et récentes, si bien que le modèle maîtrise parfois mieux 2022 que les derniers mois avant sa coupure. Retiens le principe : il y a un mur, et tu ne sais jamais tout à fait où il se trouve.

ChatGPT 5.5 date de connaissance : 1er déc. 2025 · sortie : 23 avr. 2026

Connu du modèle

2023
2024
été 2025
nov. 2025

Inconnu sans outil externe

23 avr. 2026 sa sortie
actualité récente  
aujourd'hui  

Source de l'exemple : OpenAI, documentation GPT-5.5

Le fine-tuning ne rajeunit pas ses connaissances

Tu entendras souvent parler de fine-tuning, qu'on traduit par réglage fin. C'est une seconde phase, bien plus légère que l'entraînement, où l'on réajuste un modèle déjà entraîné sur un petit jeu d'exemples ciblés. Son but est de changer le comportement, pas le savoir. C'est du fine-tuning qui transforme un moteur de prédiction brut en assistant poli qui suit tes consignes. En 2022, des chercheurs d'OpenAI ont montré qu'un modèle de 1,3 milliard de paramètres réglé ainsi était jugé plus utile qu'un modèle brut 100 fois plus gros. Attention au contresens, malgré tout : fine-tuner un modèle lui apprend un style, un format, un ton ou une tâche précise. Ça ne lui réinjecte pas l'actualité du jour. Pour les connaissances récentes, le fine-tuning ne sert à rien.

Pourquoi l'IA ne connaît pas l'actualité d'hier ?

Tu as maintenant la réponse complète. L'IA ne lit pas les news le matin comme toi. Elle n'a aucun capteur sur le monde, aucun fil d'actualité branché en permanence. Elle dispose d'une photo figée du passé, et c'est tout. Quand tu l'interroges sur un événement postérieur à sa date de connaissance, soit elle te le dit honnêtement, soit, comme tu l'as vu à la leçon 5, elle complète avec quelque chose de plausible et faux. La règle pratique tient en une phrase : pour tout ce qui touche à l'actualité, aux prix du moment, à la dernière version d'un produit ou aux événements récents, ne fais jamais confiance à la seule mémoire du modèle.

L'IA ne navigue pas : un outil va chercher pour elle

Comment ChatGPT te donne-t-il alors, parfois, des infos toutes fraîches avec des liens ? Parce qu'on a ajouté une couche par-dessus le modèle figé, la recherche web. Et le mécanisme est plus simple que tu ne le crois. Le modèle, lui, ne navigue pas. Un outil séparé lance une recherche, récupère quelques pages, et colle leur texte dans la fenêtre de contexte, celle de la leçon 4. Le modèle lit alors ces pages comme si tu les avais collées toi-même, puis répond en s'appuyant dessus. C'est la technique dite de génération augmentée par la recherche (RAG), décrite par des chercheurs de Meta dès 2020. Deux conséquences concrètes. D'abord, la qualité de la réponse dépend de la qualité des pages trouvées : web douteux, réponse douteuse. Ensuite, selon l'outil et le mode, la recherche se déclenche automatiquement ou seulement si tu la demandes. Le réflexe pro : pour une question d'actualité, vérifie qu'une recherche web a bien eu lieu, et exige les liens.

Pourquoi pas un apprentissage en continu ?

Question légitime : pourquoi ne pas laisser le modèle apprendre en temps réel, au fil de ses conversations et du web ? Deux raisons. La première est terre à terre : ré-entraîner un grand modèle coûte des millions et prend des semaines. On ne le fait pas tous les matins. La seconde est plus profonde. Quand on force un réseau de neurones à apprendre du nouveau en continu, il a une fâcheuse tendance à écraser ce qu'il savait déjà. Les chercheurs appellent ça l'oubli catastrophique : en mémorisant les infos de mars, le modèle dégrade ce qu'il avait appris en février. Une équipe de DeepMind a décrit le problème et des parades en 2017, mais la mise à jour continue et fiable d'un grand modèle reste un sujet de recherche ouvert. En attendant, les éditeurs font deux choses : ils ré-entraînent de nouvelles versions de temps en temps, et ils branchent la recherche web pour le reste. Voilà pourquoi ton IA a une date de connaissance, et pourquoi ce mur n'est pas près de tomber.

Essaie toi-même

Trouve le mur toi-même

Ouvre ChatGPT, Claude ou Mistral, et pose-lui d'abord cette question, sans activer la recherche web :

Prompt ChatGPT / Claude / Mistral
Quelle est ta date de connaissance ? Cite un type d'événement récent que tu ne peux pas connaître, et explique-moi pourquoi.

Pose-lui ensuite une vraie question d'actualité (le dernier modèle sorti chez un concurrent, un résultat sportif récent), une première fois sans recherche web, une seconde fois en l'activant. Compare les deux réponses. Sans le web, tu vois le mur : aveu d'ignorance ou réponse inventée. Avec le web, tu vois la couche de recherche au travail, liens à l'appui. Tu sais désormais distinguer ce que le modèle sait de ce qu'il vient de lire.

Quiz

Teste ta compréhension

Question 1/4 Pourquoi une IA ne connaît-elle pas l'actualité d'hier ?
Question 2/4 À quoi sert le fine-tuning ?
Question 3/4 Quand une IA « cherche sur internet », que se passe-t-il vraiment ?
Question 4/4 Pourquoi les IA n'apprennent-elles pas en continu, en temps réel ?
Récap — Ce que tu sais maintenant
  • L'IA n'a qu'une photo figée du texte jusqu'à sa date de connaissance. Après, c'est le noir.
  • Le fine-tuning règle son comportement (ton, format, tâche). Il ne rafraîchit pas ses connaissances.
  • L'IA ne navigue pas : un outil colle des pages web dans sa fenêtre de contexte, et elle les lit.
  • Pas d'apprentissage en continu, à cause du coût et de l'oubli catastrophique. D'où le mur, et la recherche web pour le franchir.

Termes du glossaire

Sources

  1. Cheng, J. et al. (2024). « Dated Data: Tracing Knowledge Cutoffs in Large Language Models ». COLM 2024.

    arxiv.org →
  2. Lewis, P. et al. (2020). « Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks ». NeurIPS 2020.

    arxiv.org →
  3. Kirkpatrick, J. et al. (2017). « Overcoming catastrophic forgetting in neural networks ». PNAS.

    arxiv.org →
  4. Ouyang, L. et al. (2022). « Training language models to follow instructions with human feedback » (InstructGPT).

    arxiv.org →