Les mots ont des biais
Observer des exemples, puis repérer les stéréotypes dans les réponses d’un modèle.
Un modèle de langage peut reproduire des stéréotypes.
D'abord voir d'où viennent les biais, puis générer des descriptions, repérer les clichés et reformuler.
Dans ce jeu simplifié, dix phrases parlent de médecins. On compte « il » et « elle » pour calculer les chances du mot suivant. Un vrai LLM utilise un calcul plus complexe.
Le point de départ est inventé pour l’exercice. Il ne mesure pas la place des femmes dans les textes du web.
Le mini-modèle doit compléter : « Le médecin a examiné son patient, puis ___ a rédigé l'ordonnance. »
Ce que montre la manipulation
Ici, les chances suivent exactement les dix phrases. À cinq sur dix, elles sont égales. Dans un vrai modèle, cela ne suffit pas à supprimer tous les biais.
C'est documenté depuis 2016
Une étude de 2016 a trouvé des associations stéréotypées dans des représentations de mots. Elle éclaire un risque ; elle ne mesure pas les réponses de tous les LLM actuels.
Côté enseignant. Ce formulaire prépare l'activité. L'élève, lui, travaille sur les descriptions produites : y repérer les clichés, puis les reformuler.
Prompt assemblé
Température réglée à — les réponses seront très prévisibles, presque identiques à chaque essai.les réponses seront équilibrées entre précision et créativité.les réponses seront plus créatives et variées, avec plus de risque d'erreurs.
Points de vigilance
- •
Expérience : comparer deux températures sur le même modèle
Envoyez exactement le même prompt au même modèle avec deux températures différentes. Observez comment le degré d'aléatoire change la réponse !
Observe : la température change les chances des tokens. Les réponses peuvent varier. Répète l’essai et vérifie les faits : une variation ne prouve ni la justesse ni l’absence de compréhension.
Comparaison multi-LLM
Pourquoi les réponses sont-elles différentes ?
Ici, on compare des modèles de langage. Ils passent par Albert API, un service de l’État. Le modèle et le service qui l’héberge sont deux choses différentes.
Ils apprennent avant de répondre. L’entraînement ajuste leurs réglages à partir de textes. Ensuite, la consigne et le contexte guident la réponse.
Ils écrivent par morceaux. Ces morceaux s’appellent des tokens. Le modèle leur donne des probabilités. Le plus probable n’est pas forcément vrai.
Ils peuvent se tromper. Une réponse fausse ou sans appui peut sembler très convaincante : c’est une hallucination. Ici, les appels ordinaires ne lancent pas de recherche web ; le module RAG ajoute des documents.
Pourquoi les réponses changent-elles ?
Les données, l’entraînement, la consigne et la température jouent un rôle. Le pays du concepteur ne suffit pas à expliquer une réponse.
Plus de paramètres ne garantit pas plus de justesse. Deux modèles peuvent aussi répéter la même erreur.
Un assistant peut ajouter des outils de recherche à un modèle. Ces outils aident à vérifier, sans garantir une réponse exacte.
✂️ Réponse tronquée (limite de longueur atteinte).
Grille de comparaison — À remplir (pour les élèves)
Remplir cette grille en lisant les réponses de chaque IA ci-dessus. Ce qui est écrit est conservé dans le navigateur et repris dans l'export. Les critères sont alignés sur les 5 compétences du référentiel CSEN (GT8, janvier 2025).
| Question à se poser | Compétence CSEN | |
|---|---|---|
| Le contenu est-il vraisemblable ? | Plausibilité de l'information | |
| Des sources sont-elles citées ? Sont-elles fiables ? | Fiabilité des sources | |
| Le raisonnement est-il logique et bien construit ? | Qualité des arguments | |
| Y a-t-il des preuves ou des exemples à l'appui ? | Qualité des preuves | |
| Ai-je les connaissances pour juger cette réponse ? | Fiabilité du jugement |
Grille de comparaison — Version IA (analyse automatique)
Une IA va analyser les réponses des autres modèles selon les critères du tableau. Attention : cette analyse est elle-même produite par une IA et peut contenir des erreurs !
Expérience : relancer avec une autre température
Relancez exactement la même question à tous les modèles mais avec une température différente. Comparez avec les résultats ci-dessus !
Points de vigilance
- •
Références
- Frau-Meigs, D. (2025). Référentiel de compétences EMI en algo-IA-littératie (AlgoWatch.eu)
- AlgoWatch.eu (2025). Kit pédagogique AlgoWatch — Éducation aux médias et à l'information à l'ère de l'IA
- CSEN — GT8 « Développer l'esprit critique » (2025). Référentiel et grilles pour l'évaluation en classe des compétences de l'esprit critique
- Bolukbasi, T. et al. (2016). Man is to Computer Programmer as Woman is to Homemaker? Debiasing Word Embeddings (NeurIPS) — mise en évidence des biais de genre appris dans les textes du web