Quand ChatGPT réussit l’examen, pluraliser les modalités

Un devoir maison rendu le dimanche soir. Un QCM de fin de module. Une dissertation « classique » sur un corpus fermé. Sur le papier, tout cela mesure encore quelque chose. Dans les faits, une part croissante d’étudiants peut traiter une bonne partie de ces tâches avec un grand modèle de langage, parfois sans même le cacher.

Ce n’est plus une anecdote de couloir. Cathia Papi et ses collègues (Université TÉLUQ) ont passé au crible 111 articles anglophones publiés entre 2020 et 2024 dans des revues à double aveugle. Leur revue systématique narrative, parue en 2026 dans Distances et médiations des savoirs, dresse un constat net : l’IA générative réussit souvent les évaluations sommatives standardisées. Elle est nettement plus faible dès qu’on monte dans la taxonomie de Bloom (analyse, évaluation, créativité) et dès que la tâche devient orale, projective, collaborative ou située en laboratoire.

Autrement dit : ce n’est pas « l’évaluation » qui est en crise. Ce sont certaines formes d’évaluation, celles qui produisent un artefact facilement externalisable.

Ce que les étudiants disent déjà (sans attendre la politique)

Dans le corpus, les usages avoués d’IAG pour les travaux se situent souvent autour d’un tiers à la moitié des étudiants, selon les enquêtes et les contextes. La frontière entre aide légitime et triche reste floue. Beaucoup d’établissements n’ont pas encore de règles claires ; quand elles existent, elles sont souvent restrictives (interdiction, sanction) et disent peu sur les usages pédagogiques autorisés.

Les étudiants, eux, demandent surtout de la clarté. Pas seulement une liste d’interdits. Un cadre qui dise ce qui est attendu, ce qui doit rester un travail personnel, et comment l’outil peut (ou non) entrer dans le processus d’apprentissage.

Côté enseignants, deux réflexes dominent. Le premier : durcir la surveillance (détection logicielle, proctoring, salles verrouillées). Le second : redesigner la tâche. La littérature ne dit pas que la détection est inutile. Elle dit qu’elle est imparfaite (faux positifs, outils peu efficaces contre l’IAG, coûts, anxiété, questions éthiques). Comme rempart unique, elle ne tient pas dans la durée.

Détection ou redesign : choisir son camp

Le débat n’est pas moralisateur. Il est pratique. Si l’objet d’évaluation reste un produit que ChatGPT réussit bien, chaque semestre ramènera le même problème, avec des outils de détection un cran derrière. Si l’objet devient une preuve d’apprentissage difficile à déléguer à un LLM (oral soutenu, évaluation par les pairs cadrée, projet de groupe avec contribution visible, raisonnement en situation d’incertitude, journal réflexif guidé), la conversation change.

Papi et al. rappellent deux pistes déjà connues des pédagogues, mais désormais sous pression IAG : l’évaluation authentique et l’approche par compétences. Attester un savoir-agir en situation, pas seulement un rendu isolé. Documenter une trajectoire, pas une photo à un instant T.

Aucune étude du corpus n’évalue concrètement la « perte de valeur » des diplômes. Le nœud reste la frontière aide / triche, et la capacité de l’établissement à faire porter l’évaluation sur ce qui compte vraiment.

Ce que ça change concrètement dans une UE

Prenez une sommative vulnérable typique : un devoir écrit individuel hors séance, consignes fermées, critères peu visibles, peu d’oral, peu de croisement de regards. Trois gestes suffisent souvent pour commencer, sans tout refondre en un semestre.

D’abord, rendre visible le critère avant le rendu. Ce que l’étudiant doit démontrer, en langage de compétence, pas seulement en longueur de texte. Ensuite, ajouter une preuve non externalisable : un court oral asynchrone, une évaluation par les pairs sur une grille partagée, une justification en situation (type concordance / SCM), ou une auto-évaluation comparée aux retours des coéquipiers. Enfin, garder le jugement humain sur la note ou le niveau, et utiliser l’IA seulement pour accélérer la formulation du feedback une fois le critère posé.

Ce dernier point mérite d’être dit sans ambiguïté. Dans le corpus, l’IAG aide parfois les enseignants à créer des activités ou à proposer des éléments de correction. Elle reste non substitutive du jugement humain, hallucine, et manque de profondeur sur le subjectif. Une part d’étudiants préfère encore une rétroaction humaine, pour la dimension affective autant que pour la précision. L’approche mixte recommandée : rapidité de l’outil + moments humains (enseignant ou pairs) pour discuter des retours.

Pluraliser, ce n’est pas « faire plus d’évaluations »

Pluraliser les modalités, ce n’est pas multiplier les notes. C’est diversifier les preuves. Un même parcours peut enchaîner pairs, co-évaluation, oral, journal réflexif, projet, situations à choix multiples, sans que chaque brique soit sommative lourde. Le formatif régulateur (au sens de Meirieu) reste le levier : rendre l’apprentissage visible à temps pour ajuster.

Pour un responsable de programme, la question utile n’est donc plus « Comment empêcher ChatGPT ? » mais « Quelles preuves d’apprentissage restent valides si ChatGPT est dans la pièce ? ». Pour un enseignant, elle devient : « Quelle tâche de ma session est IA-vulnérable, et quelle modalité courte puis-je greffer dès le prochain semestre ? ».

Où s’arrête l’outil (et où commence la politique)

Un outil d’évaluation formative peut industrialiser le redesign : grilles partagées, multi-évaluateurs, pilotage APC, agents calibrés pour proposer un commentaire après positionnement du critère, données hébergées en France, logique AI Act (l’IA ne note pas, ne classe pas, ne décide pas seule). Il ne remplace pas une politique d’établissement co-construite, ni la littératie IA des équipes.

ChallengeMe s’inscrit explicitement dans ce camp : pluraliser les modalités, ancrer en compétences et en situations, garder l’humain sur le jugement. Pas de promesse de détection magique du « plagIA ». Pas de note autonome. Pas de caméra comme produit.

Si vous partez d’une seule évaluation vulnérable et que vous la transformez en scénario court (par exemple pairs + oral + feedback enseignant assisté), vous avez déjà un chantier réaliste pour la rentrée ou le semestre suivant.

Demander une démo

Envie d'essayer ChallengeMe ?

Découvrez comment transformer vos évaluations en 15 minutes chrono.

Tags

Restez informé de nos dernières actualités

Recevez chaque semaine nos conseils pédagogiques et nos nouveautés
directement dans votre boîte mail.

Pas de spam, désinscription possible à tout moment.

Articles recommandés

Continuez votre lecture avec ces articles complémentaires

Évaluation intra-groupe : Formative vs Sommative, nos retours d’expérience

L’évaluation par les pairs à grande échelle : retour d’expérience d’un enseignant de SKEMA Business School

Guide pour individualiser la note dans les travaux de groupe

Évaluation par compétences : transformer l’enseignement supérieur avec l’APC