L’IA n’évalue pas. Elle aide à formuler.

Vous avez demandé à vos étudiants d’évaluer les copies de leurs camarades. Le dispositif est en place, la grille est claire, les délais tiennent. Et pourtant, une partie des retours tient en deux mots : « bien », « à retravailler », « peut mieux faire ». L’étudiant a bien ouvert la copie. Il a même une idée de ce qui cloche. Il n’arrive pas à le dire.

Produire un feedback argumenté est une compétence. On le sait depuis longtemps, et on le redécouvre chaque semestre, surtout quand la promotion passe de quarante à cent vingt. Les premières années de BUT, les grands cours de licence, les promotions de business school : le problème n’est pas que les étudiants refusent de jouer le jeu. C’est qu’on leur demande de juger un travail, puis d’écrire un retour utile, souvent sans les accompagner vraiment sur cette deuxième étape. Nous sommes là pour vous aider à tenir cette deuxième étape sans faire évaluer la machine à la place des humains.

Le goulot n’est pas la note, c’est la phrase

La recherche est assez nette sur un point : l’évaluation par les pairs peut être très utile surtout quand elle est formative. Elle oblige à relire les critères, à prendre position, à justifier. Keith Topping la définit comme un arrangement où des apprenants de même statut considèrent le niveau, la valeur ou la qualité du travail d’un pair. Ce que les synthèses de Gao, de Zhang et de Schunn montrent aussi, c’est que tout se joue ensuite dans le contenu du commentaire. Un score sans phrase n’aide presque personne. Une phrase vague non plus.

Dans les faits, deux choses cassent le dispositif. D’abord la logistique : répartir les copies, relancer, s’assurer que chaque travail a bien été lu, surtout quand vous avez plusieurs centaines de rendus et peu de TD. Ensuite la qualité. Certains étudiants rédigent un retour précis, ancré dans un critère. D’autres s’arrêtent au verdict. Face à des centaines de commentaires, l’enseignant n’a plus le temps de rattraper ça un par un, et le pair qui a besoin d’un vrai retour reçoit trop souvent un mot générique.

C’est là que l’IA arrive, et c’est là qu’on se trompe souvent de rôle.

Ce que dit la revue « Enhancing Peer Assessment »

En janvier 2025, Topping, Gehringer, Khosravi et leurs collègues ont publié une revue de 79 études sur l’IA dans l’évaluation par les pairs. Ils cartographient six usages possibles : affecter les évaluateurs, améliorer les revues individuelles, dériver des notes et des feedbacks, analyser les commentaires, aider l’enseignant à superviser, et concevoir des systèmes complets. La grande majorité des papiers concluent que l’IA améliore le dispositif. Mais le plus gros morceau, 44 % des études, porte sur le calcul d’une note ou l’agrégation des retours. L’aide à formuler une revue reste une petite zone. Le feedback vraiment automatisé, encore plus.

On comprend l’attrait. Si la machine peut lisser les écarts entre évaluateurs ou produire une note « moyenne juste », la charge semble enfin tenable à quatre cents copies. La revue le montre clairement : beaucoup de travaux poussent dans cette direction, avec des modèles de consensus, de calibration ou de détection d’évaluations aberrantes.

Nous ne prenons pas ce chemin comme boussole produit.

Une étude randomisée en pharmacie, publiée en 2025, a montré que des étudiants aidés par une IA, avec un cadre précis (ce qui tenait, ce qui manquait, quoi faire ensuite), écrivaient des retours plus spécifiques. Ça va dans le bon sens, à une condition. L’IA n’a pas décidé à leur place si le travail était bon. Elle a aidé à dire ce qu’ils avaient déjà vu.

Dans le cas RiPPLE, que Topping et Khosravi détaillent longuement, l’IA propose un retour en temps réel sur le feedback rédigé par l’étudiant, et l’interface le prévient : ce n’est qu’un guide, il peut être inexact, c’est à lui de juger avec sa connaissance du domaine. Un étudiant écrit que l’outil lui a donné « la réponse que je cherchais, sans savoir comment la formuler ». C’est exactement le geste que nous défendons. Pas le jugement. La phrase. Si vous déplacez le jugement vers la machine, vous perdez ce que le dispositif prétend observer : une lecture située, entre pairs, d’un travail réel.

Le geste, dans l’ordre

Le geste utile est plus étroit, et plus exigeant.

L’étudiant ouvre la copie. Il lit. Il positionne un critère : « à renforcer » sur la rigueur argumentative, « satisfaisant » sur la structure, « solide » sur les sources. Ce positionnement est le sien. Personne ne le pose à sa place. Une fois le critère posé, l’IA peut proposer une formulation : une phrase qui dit ce qui manque, et comment progresser. L’étudiant relit, corrige, garde ce qui sonne juste, jette le reste. Rien n’est envoyé sans lui.

Côté enseignant, le même principe. Quand vous avez déjà lu et positionné, l’outil peut aider à rédiger le retour. Vous ajustez. Vous validez. Le jugement reste le vôtre.

Une fois les retours humains là, l’IA peut aussi les synthétiser : ce qui revient souvent, ce qui est contradictoire, ce que l’étudiant évalué peut prioriser. Elle compile ce que des humains ont déjà écrit. Elle n’infère pas un niveau de compétence à la place de l’équipe pédagogique, et elle ne remplace pas le regard que vous posez sur un dossier quand quelque chose cloche.

C’est ce qu’Antoine Chollet a testé en BUT Informatique, à l’Université de Montpellier, dans le projet PairsIA, et présenté à LUDOVIA 2026. L’agent pose des questions, reformule, signale les imprécisions. Il n’écrit pas à la place de l’étudiant. Les feedbacks deviennent plus argumentés, plus alignés sur la grille. Les écarts se resserrent entre celui qui est déjà à l’aise pour évaluer et celui qui peine à formuler. L’enseignant, lui, retrouve des retours qu’il peut vraiment lire.

Ce qu’on refuse de déléguer

Tant que le critère n’est pas positionné par un humain, l’IA n’a rien à formuler. Si elle commence trop tôt, elle évalue. Et ce n’est pas son rôle. Nous n’ouvrons pas une copie pour qu’une machine dise ce qu’elle « vaudrait » avant vous. Nous ne transformons pas un commentaire vague en score de qualité argumentative. Nous ne faisons pas d’un tableau de bord un verdict automatique sur un parcours.

Cette ligne n’est pas un détail de wording. Elle change le design. Le pair lit. Le pair positionne. Ensuite seulement, on aide à dire. L’enseignant garde la main sur ce qui compte pour le cours et pour le diplôme.

Ce que ça change dans un cours que vous donnez déjà

Vous n’avez pas besoin d’un nouvel outil pour commencer à tenir cette ligne. Prenez la prochaine évaluation par les pairs que vous avez déjà prévue. Gardez la grille courte. Demandez d’abord un positionnement sur chaque critère, ensuite un commentaire. Si vous allumez une aide à la formulation, elle arrive après le positionnement, jamais avant.

Deux ou trois tours valent mieux qu’un seul marathon de fin de semestre. Morgane Senden, dans sa thèse à l’UCLouvain (2024), le montre pour la confiance et la sécurité psychologique : les étudiants s’engagent davantage quand ils ont été formés, quand ils peuvent évaluer la qualité des retours reçus, et quand le cadre est clair. L’anonymat aide souvent à oser un commentaire cognitif. Il ne remplace pas la formation au geste.

Sur ChallengeMe, c’est ce cadre que l’on tient : dépôt, critères, tours, restitution. Le module IA, quand on l’active, aide à formuler le feedback et à synthétiser les retours humains déjà là. Il n’évalue pas à la place de l’enseignant. Il ne note pas. Il ne classe pas. Nous sommes là pour vous aider à tenir ce rôle, pas pour le remplacer.

Andrés González, à Grenoble École de Management, l’a dit pour un groupe de 800 étudiants : ce qui tenait, c’était l’inscription, le passage de phase, la restitution. Pas un algorithme qui aurait noté à sa place. À Kedge, à SKEMA, à CentraleSupélec avec François Cluzel, le même fil : le pair juge, l’enseignant garde la main, l’outil porte la logistique.

Si vous voulez voir le geste côté étudiant, le retour d’Antoine Chollet est déjà en ligne : https://challengeme.online/ia-feedback-evaluation-par-les-pairs/

Pour le cadrage recherche plus large : https://challengeme.online/levaluation-par-les-pairs-que-dit-la-recherche/

Envie d’essayer ChallengeMe ?
Demander une démo

Sources

1. Topping, K. J., Gehringer, E., Khosravi, H., Gudipati, S., Jadhav, K. & Susarla, S. (2025). Enhancing peer assessment with artificial intelligence. International Journal of Educational Technology in Higher Education, 22(3). https://doi.org/10.1186/s41239-024-00501-1

2. BMC Medical Education (2025). AI-ding peer feedback: a randomized study of self-generated vs. AI-assisted peer feedback. https://doi.org/10.1186/s12909-025-08225-0

3. Articles ChallengeMe déjà en ligne : Chollet (30/06/2026), synthèse recherche pairs (24/05/2025), Senden / confiance (19/03/2025), REX Montpellier / PairsIA.

4. Senden, M. (2024). Designing Peer Feedback in Higher Education. Thèse, UCLouvain.

5. Ligne produit ChallengeMe : l’IA aide à formuler après positionnement humain ; elle ne note pas, ne classe pas, ne décide pas seule.

Envie d'essayer ChallengeMe ?

Découvrez comment transformer vos évaluations en 15 minutes chrono.

Tags

Restez informé de nos dernières actualités

Recevez chaque semaine nos conseils pédagogiques et nos nouveautés
directement dans votre boîte mail.

Pas de spam, désinscription possible à tout moment.

Articles recommandés

Continuez votre lecture avec ces articles complémentaires

Démonstration d’un challenge en co-évaluation

Renforcer la confiance et la sécurité psychologique dans l’évaluation par les pairs

Communautés de pratique APCSup

Participez à notre communauté de pratiques APC avec Jacques Tardif et Christelle Lison. A partir du 10 mars, retrouvez des webinaires réguliers avec des retours d'expériences d'établissements francophones.

Le QCM note le savoir. Le SCM révèle le raisonnement

Un QCM dit si l’étudiant connaît la bonne réponse. Une situation à choix multiples montre ce qu’il ferait, et une IA relit sa justification pour le faire progresser.