Découvrir le RAG

Répondre avec des documents

Répondre avec des extraits de documents. Vérifier si la réponse s’appuie bien sur eux.

Un modèle peut utiliser des documents pour répondre.

Le RAG ajoute une recherche de documents. Ici, le modèle reçoit des extraits de programmes scolaires. Compare sa réponse avec et sans ces extraits.

Note pour l'enseignant

Idée-clé : vérifier les documents retrouvés, puis vérifier que la réponse leur est fidèle. Le RAG peut réduire certaines erreurs, sans toutes les supprimer.

La base : des programmes scolaires indexés avec un modèle d’embeddings sur Albert. Ces représentations numériques servent à chercher des passages proches de la question.

En classe : ne pas annoncer quelle réponse sera meilleure. Examiner la pertinence, la date et la suffisance des extraits, puis les deux réponses.

Avec des 2nde : trois angles qui rendent l'outil concret — interroger le programme de leur année (« on doit vraiment apprendre ça ? »), éclairer le choix des spécialités en interrogeant les programmes de 1re, et le défi « question piège » hors programme, qui fait toucher du doigt l'invention. Lien direct avec la SNT (moteurs de recherche, données) et le vocabulaire du cadre d'usage de l'IA.

Le système cherche des passages proches de la question. Choisis une question pour voir un exemple de classement.

    Extraits et scores fictifs pour le jeu. Un score de proximité n’est pas une probabilité de vérité. L’autre onglet interroge la base documentaire du service ; sa couverture peut être incomplète.

    Des nombres pour rapprocher les textes

    Un modèle transforme le texte en une liste de nombres : un vecteur. Il peut rapprocher deux formulations de sens voisin. Il peut aussi se tromper.

    Le RAG en 3 étapes

    1. Chercher — retrouver dans la base les extraits les plus proches du sens de la question.
    2. Fournir — glisser ces extraits dans la consigne donnée à l'IA.
    3. Rédiger — l'IA écrit à partir de ces extraits, et peut donc citer ses sources.

    Cette architecture, dite Retrieval-Augmented Generation, a été formalisée par Lewis et al. (NeurIPS 2020) — sources en bas de page.

    L'onglet suivant compare la réponse avec et sans cette recherche.

    À retenir

    Des sources peuvent aider le modèle. Mais une source fiable peut être mal comprise ou mal citée. Vérifie le lien entre la réponse et les extraits.

    Références
    • Éduscol — MEN (2025). Programmes scolaires officiels — la base documentaire interrogée par la recherche
    • DINUM / Etalab (2025). Albert, l'IA de l'État français — génération (Mistral) et vecteurs de sens (embeddings BAAI/bge-m3)
    • Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (NeurIPS) — article de recherche
    • CSEN — GT8 « Développer l'esprit critique » (2025). Fiabilité des sources et qualité des preuves — compétences réinvesties dans la lecture des extraits
    Sources et limites des explications