Plusieurs modèles, une question
Poser la même question à plusieurs modèles. Comparer, puis vérifier leurs réponses.
Une même question posée à plusieurs IA ne donne pas la même réponse.
D'abord comprendre pourquoi croiser, puis interroger plusieurs modèles et comparer leurs réponses côte à côte.
Comparer des réponses ne suffit pas. Dans ces trois exemples inventés, que peut-on vraiment conclure ?
A — « Les Misérables est le meilleur roman à lire. »
B — « Victor Hugo a écrit Les Misérables. »
C — « Trois modèles donnent la même date : elle est donc vraie. »
3 affirmations à classer.
Le jeu porte sur la vérification. Il ne permet pas de deviner l’origine d’un modèle.
Ce que montre le jeu
Compare, puis vérifie. Un accord entre modèles ne remplace pas un document fiable. Un désaccord ne dit pas, à lui seul, qui a raison.
Côté enseignant. Ce formulaire prépare l'activité. L'élève, lui, reçoit les réponses côte à côte : les comparer, repérer les écarts, et décider laquelle mérite confiance.
Prompt assemblé
Température réglée à — les réponses seront très prévisibles, presque identiques à chaque essai.les réponses seront équilibrées entre précision et créativité.les réponses seront plus créatives et variées, avec plus de risque d'erreurs.
Points de vigilance
- •
Comparaison multi-LLM
Pourquoi les réponses sont-elles différentes ?
Ici, on compare des modèles de langage. Ils passent par Albert API, un service de l’État. Le modèle et le service qui l’héberge sont deux choses différentes.
Ils apprennent avant de répondre. L’entraînement ajuste leurs réglages à partir de textes. Ensuite, la consigne et le contexte guident la réponse.
Ils écrivent par morceaux. Ces morceaux s’appellent des tokens. Le modèle leur donne des probabilités. Le plus probable n’est pas forcément vrai.
Ils peuvent se tromper. Une réponse fausse ou sans appui peut sembler très convaincante : c’est une hallucination. Ici, les appels ordinaires ne lancent pas de recherche web ; le module RAG ajoute des documents.
Pourquoi les réponses changent-elles ?
Les données, l’entraînement, la consigne et la température jouent un rôle. Le pays du concepteur ne suffit pas à expliquer une réponse.
Plus de paramètres ne garantit pas plus de justesse. Deux modèles peuvent aussi répéter la même erreur.
Un assistant peut ajouter des outils de recherche à un modèle. Ces outils aident à vérifier, sans garantir une réponse exacte.
✂️ Réponse tronquée (limite de longueur atteinte).
Grille de comparaison — À remplir (pour les élèves)
Remplir cette grille en lisant les réponses de chaque IA ci-dessus. Ce qui est écrit est conservé dans le navigateur et repris dans l'export. Les critères sont alignés sur les 5 compétences du référentiel CSEN (GT8, janvier 2025).
| Question à se poser | Compétence CSEN | |
|---|---|---|
| Le contenu est-il vraisemblable ? | Plausibilité de l'information | |
| Des sources sont-elles citées ? Sont-elles fiables ? | Fiabilité des sources | |
| Le raisonnement est-il logique et bien construit ? | Qualité des arguments | |
| Y a-t-il des preuves ou des exemples à l'appui ? | Qualité des preuves | |
| Ai-je les connaissances pour juger cette réponse ? | Fiabilité du jugement |
Grille de comparaison — Version IA (analyse automatique)
Une IA va analyser les réponses des autres modèles selon les critères du tableau. Attention : cette analyse est elle-même produite par une IA et peut contenir des erreurs !
Points de vigilance
- •
Références
- Compar:IA (beta.gouv.fr) (2025). Outil de comparaison à l'aveugle de modèles d'IA conversationnelle
- CSEN — GT8 « Développer l'esprit critique » (2025). Référentiel et grilles pour l'évaluation en classe des compétences de l'esprit critique
- Frau-Meigs, D. (2025). Référentiel de compétences EMI en algo-IA-littératie (AlgoWatch.eu)
- CLEMI (2024). L'intelligence artificielle générative : quelle révolution et quels enjeux pour les médias ? — croiser les sources et les points de vue