1. Introduction et problème

Dans un atelier d’écriture du secondaire, l’environnement d’apprentissage assemble quatre objets au moment de rendre un brouillon. Une banque de commentaires automatiques marque « développe la thèse » et « varie le vocabulaire ». En marge, un score de rubrique produit par un modèle de langage attribue un niveau à la cohérence. En dessous, un tableau de similarité colore les recouvrements avec un corpus. Un chatbot invite à « écrire mieux » le paragraphe signalé. Le contrat appelle l’ensemble évaluation formative et laisse à l’enseignant un bouton pour publier le retour. La scène n’est pas une donnée de terrain de cet article : c’est le plafond d’exhibition que le marché traite déjà comme un métier. Rien n’est écrit, avant l’usage, sur le but d’apprentissage qui autorise ce retour. Il n’y a ni critère interprétatif que l’enseignant puisse réviser, ni dialogue avec qui a écrit, ni cycle de révision, ni nom de qui décide de l’avancement.

La thèse ne tient pas dans le titre court. Ces objets ne constituent pas une évaluation formative si le protocole de médiation enseignante manque. Le métier est le jugement qui choisit quel feedback compte, quand le rendre et comment le convertir en preuve d’apprentissage. Davies (2026) situe l’IA générative pour rendre des commentaires formatifs sur des brouillons : l’objet est le feedback sur le draft, non l’équivalence entre une banque automatique et une pratique formative. Pack, Barrett et Escalante (2024) examinent la validité et la fiabilité de l’AES par LLM de l’écriture d’apprenants d’anglais : l’objet est le score, non le cycle. Tate et al. (2024) demandent si l’IA peut offrir une notation holistique utile : l’utilité du score n’est pas, à elle seule, une médiation. Statut : pratique de feedback génératif dans un cas ; constat empirique de scoring dans les autres. Aucun ne prouve que le commentaire automatique « évalue déjà de façon formative ». Ils demandent si l’on a mesuré un score ou exercé un métier de retour.

Le texte s’appuie sur trois distinctions de la série et ne les refait pas. Le 16 septembre 2026, le harnais a été compris comme la couche qui convertit la capacité générative en travail : outils bornés, état, vérificateurs, arrêt. Le 18, l’évaluation d’agents mesure si ce travail est fiable face à un critère externe à la prose du modèle. Le 22, la supervision humaine dans la boucle gouverne le copilote : critère d’acceptation, traces, veto, attribution et seuil d’escalade. Aucune de ces trois couches n’est le jugement évaluatif formatif de qui a un groupe, une discipline et un cycle d’apprentissage. Un système peut produire des commentaires et ne pas médier. Il peut noter avec une fiabilité de scoring et ne pas former. Il peut être gouverné comme copilote et ne pas rendre de preuve d’apprentissage. Inférence de conception, non constat propre : sans médiation enseignante, il y a un produit de feedback et une métrique ; il n’y a pas d’évaluation formative.

Six substitutions illégitimes organisent le problème. Traiter le feedback GenAI comme évaluation formative : Banihashem et al. (2024) comparent des sources —pairs ou IA— ; la source n’est pas le protocole. Traiter l’AES comme jugement enseignant : Li et Liu (2024) notent le japonais non natif ; Choi et al. (2026) font de l’ancre la clé d’un AES par prompting ; Kim et Holden (2026) contrastent API et GUI. Le score n’est pas l’apprentissage : Pan (2025) indexe un feedback génératif à une rubrique ; l’indexation ne signe pas le cycle. Traiter le pair avec IA comme substitut : Guo et al. (2024) étudient le peer feedback appuyé par l’IA ; Bauer et al. (2023) veulent que le TALN appuie l’échange, non qu’il le remplace. Confondre littératie de prompts et littératie évaluative : Kokoç et al. (2026), Yang et Banks (2025) et Zhang et al. (2025) cartographient la littératie enseignante, des formateurs et des élèves ; savoir demander au modèle n’est pas savoir juger l’avancement. Croire que le harnais, l’eval d’agent ou le HITL médient déjà : Yan et al. (2024) cartographient des défis pratiques et éthiques ; Alfredo et al. (2024) et Capel et Brereton (2023) rappellent que le centré sur la personne n’est pas le catalogue. Cet article sépare artefacts et médiation et propose quatre épreuves qui ne sont pas une norme. On n’invente ni N, ni d, ni r, ni AUC, ni pourcentages, ni DOI.

2. État de l’art : pratique située vs artefact

Le discours d’« évaluation formative avec IA » écrase quatre strates. La première est l’AES par modèles de langage comme problème de validité, de fiabilité, d’ancre et d’interface de notation (Pack et al., 2024 ; Li et Liu, 2024 ; Choi et al., 2026 ; Kim et Holden, 2026 ; Tate et al., 2024). La deuxième est le GenAI comme source de feedback sur des brouillons ou indexé à une rubrique (Davies, 2026 ; Pan, 2025 ; Banihashem et al., 2024). La troisième est le peer avec appui d’IA ou de TALN, et la formation de qui commente (Guo et al., 2024 ; Bauer et al., 2023 ; Xu et al., 2024 ; Prilop et Weber, 2023). La quatrième est la littératie, l’évaluation centrée sur la personne et la compétence collaborative (Kokoç et al., 2026 ; Yang et Banks, 2025 ; Zhang et al., 2025 ; Alfredo et al., 2024 ; Yan et al., 2024 ; Capel et Brereton, 2023 ; Balducci, 2024 ; Cui et al., 2026 ; Goslen et al., 2025). L’artefact vit dans l’annonce du grader. La pratique située vit dans le but, le critère, le dialogue et le nom de qui juge.

En scoring, Pack et al. (2024) saturent le plafond de validité et de fiabilité lorsqu’un LLM note l’écriture d’apprenants d’anglais : constat empirique d’AES, non d’évaluation formative. Li et Liu (2024) étendent l’application au japonais non natif : l’objet reste de noter. Choi et al. (2026) soutiennent que l’ancre est la clé d’un AES accessible par prompting : l’ancre est une technique de scoring, non un critère interprétatif dialogué. Kim et Holden (2026) contrastent API et GUI : changer la surface de notation n’installe pas un cycle de révision. Tate et al. (2024) interrogent l’utilité d’une notation holistique : « utile » n’autorise pas à lire le nombre comme preuve d’apprentissage. Inférence de catégorie : l’état de l’art de l’AES autorise à demander la validité du score ; non à vendre le score comme médiation formative.

En feedback et en pair, Davies (2026) traite le GenAI comme un retour formatif sur des drafts : il nomme l’usage ; il n’égale pas une banque automatique à un métier de classe. Pan (2025) indexe le feedback à une rubrique en anglais médical : stratégie déclarée, non preuve que la rubrique auto-appliquée substitue l’enseignant. Banihashem et al. (2024) opposent des sources —pairs ou IA— : comparer la provenance ne clôt pas le protocole. Guo et al. (2024) éprouvent un peer appuyé par l’IA sur la qualité du commentaire et l’écriture : constat d’appui au pair, non de substitution du jugement. Bauer et al. (2023) proposent un cadre : le TALN soutient le peer ; il ne le rend pas formatif en générant du texte. Xu et al. (2024) étudient la visualisation du peer-assessment chez des enseignants en formation : voir le feedback n’est pas le médier. Prilop et Weber (2023) montrent que le feedback expert, dans un entraînement numérique par vidéo, influe sur les croyances et la qualité du commentaire : l’expert reste médiateur. Inférence : il y a pratique située lorsque quelqu’un avec un métier soutient le cycle ; il y a artefact lorsque la source ou la visualisation occupent sa place.

En littératie et conception centrée sur la personne, Kokoç et al. (2026) passent en revue la littératie en IA des enseignants en service : la carte n’est pas une littératie évaluative. Yang et Banks (2025) situent la littératie chez des formateurs du primaire, non dans un atelier de prompts. Zhang et al. (2025) valident un inventaire étudiant : le construit n’est pas le jugement de notation. Alfredo et al. (2024) révisent l’analytique et l’IA centrées sur la personne : exclure enseignants et élèves de la conception nourrit la méfiance. Capel et Brereton (2023) demandent ce qu’il y a de centré sur l’humain dans cette étiquette : la carte n’autorise pas à dire centré un grader. Balducci (2024) situe l’évaluation dans une éducation centrée sur la personne : l’acte ne s’épuise pas dans l’automatisation. Cui et al. (2026) évaluent la compétence collaborative humain–IA en écriture L2 : l’objet est la compétence conjointe, non le score. Goslen et al. (2025) génèrent des plans d’élève avec un LLM pour l’étayage dans le jeu : le plan n’est pas un jugement formatif. Yan et al. (2024) laissent ouverts les défis de noter et de rétroagir avec des modèles. Inférence : l’état de l’art distingue scoring, source, appui au pair, littératie et cadre ; le marché les écrase.

3. Méthode de revue

On a mené une revue narrative critique, non une méta-analyse ni un taux de « succès du feedback GenAI ». L’argument est de catégorie : qu’est-ce qui compte comme évaluation formative lorsqu’un enseignant médie commentaires, scores et chatbots, et qu’est-ce qui reste artefact. La fenêtre est 2021–2026. Le foyer est l’évaluation formative avec GenAI, l’AES-LLM, le peer+AI ou le TALN, et la littératie en IA des enseignants et des élèves. Si l’année d’impression diverge de l’année en ligne, on cite celle d’impression : Cui et al. (2026) malgré le DOI 2025 ; Yang et Banks (2025) malgré 2024 en ligne ; Yan et al. (2024) malgré 2023 en ligne. Inclusion : pairs avec DOI Crossref vérifié le 23 septembre 2026, créneau 09:02 America/Mexico_City. On a exclu les axes d’éducation initiale de la série, les catalogues sans article et tout chiffre absent des sources. On a utilisé les vingt-et-une entrées de fuentes.md. On n’a ajouté ni auteurs, ni revues, ni DOI.

Chaque source est marquée d’un de trois statuts. Constat empirique : ce qui a été observé en scoring, en sources de feedback, en peer appuyé par l’IA, en visualisation ou en entraînement du commentaire. Cadre : revue, agenda, carte ou instrument qui n’éprouve pas les quatre tests. Inférence de conception : ce que cet article conclut et ne peut attribuer comme résultat. Sans une étude qui les égale à une évaluation formative, la banque de commentaires, le score AES-LLM, le tableau, le chatbot, la rubrique auto-appliquée et le grader de catalogue sont un plafond de catégorie. Il n’y a pas de PRISMA propre. Les épreuves de la section 7 sont des hypothèses, non une norme. On n’invente ni N, ni d, ni r, ni AUC, ni pourcentages d’accord, ni DOI.

4. Axe 1. Les artefacts ne constituent pas un appui

L’appui que cet axe nie n’est pas celui d’un adulte dans une classe petite enfance. C’est celui qu’un fournisseur déclare en disant que l’enseignant « a déjà une évaluation formative » parce que le système a commenté le brouillon. La banque de commentaires GenAI est le premier artefact. Davies (2026) nomme l’usage de modèles génératifs pour rendre un feedback formatif sur des drafts : coller des phrases en marge peut coexister avec l’absence d’un but préalable et d’un dialogue. La banque parle en modèles, comme si elle avait déjà lu le curriculum. « Développe la thèse » ne dit ni quelle thèse, ni pour quel critère, ni dans quel cycle. Inférence restrictive : un magasin de commentaires n’est pas une pratique formative. Il peut être un apport. Exhibé comme l’évaluation, c’est un plafond.

Le score AES-LLM n’est pas un jugement enseignant. Pack et al. (2024) fixent le problème dans la validité et la fiabilité de la notation d’apprenants d’anglais : le constat vit dans le score, non dans la classe comme cycle. Li et Liu (2024) appliquent le même objet au japonais non natif. Choi et al. (2026) déplacent l’accessibilité vers le prompting et l’ancre : l’ancre calibre le modèle ; elle ne converse pas avec l’apprenant. Kim et Holden (2026) montrent que l’interface —API ou GUI— change le mode de noter ; elle n’installe pas l’attribution. Tate et al. (2024) interrogent l’utilité holistique : un nombre « utile » pour classer n’est pas la preuve que quelqu’un a appris. Yan et al. (2024) laissent la rétroaction automatique et la notation parmi les défis pratiques et éthiques : qu’un système note ne signifie pas que l’enseignant a fixé quelle erreur n’est pas déléguée. Confiance du modèle et critère interprétatif ne sont pas convertibles.

Le tableau de similarité et le chatbot « écris mieux » achèvent la grammaire d’exhibition. Xu et al. (2024) étudient la visualisation du peer-assessment : voir des données peut toucher la littératie des données, la motivation et la charge ; cela n’autorise pas à traiter un tableau de similarité comme une médiation. La couleur du recouvrement ne dit pas si l’emprunt est apprentissage, citation ou raccourci. Le chatbot qui réécrit le paragraphe occupe la place du brouillon suivant : Goslen et al. (2025) génèrent des plans d’élève avec un LLM pour l’étayage dans le jeu —objet voisin— et rappellent que produire un plan ou une réécriture n’est pas juger l’avancement. Banihashem et al. (2024) peuvent comparer un feedback d’IA à un feedback de pairs sans faire du chatbot le sujet du cycle. L’apprenant qui colle la sortie dans la remise suivante n’a pas révisé : il a substitué. Sans dialogue, il n’y a pas d’évaluation formative ; il y a cosmétique du texte.

La rubrique auto-appliquée et l’« AI grader » de marketing clôturent le critère en faux. Pan (2025) indexe le feedback génératif à une rubrique en anglais médical et le déclare stratégie formative : l’indexation est un dessin de prompt ; ce n’est pas le critère interprétatif révisable par qui enseigne. Balducci (2024) situe l’évaluation dans une éducation centrée sur la personne : automatiser la rubrique n’hérite pas de ce centrage. Capel et Brereton (2023) interdisent d’appeler centré sur l’humain ce qui n’exhibe une personne que dans la brochure. Alfredo et al. (2024) demandent un contrôle réel, non un graphique qui cache qui note. Le grader de catalogue écrase scoring, feedback et notation en un seul mot. Inférence de catégorie : banque, score, tableau, chatbot, rubrique auto-appliquée et grader partagent une grammaire de substitution. Aucune n’est autorisée par le corpus.

5. Axe 2. Le métier relationnel dans le jardin

L’intitulé est celui du moule de la série. Le référent, non. Il n’y a pas de classe de petite enfance. Le terrain est la relation entre une personne responsable d’une discipline et un système qui produit commentaires, scores, réécritures et rubriques. Il y a métier lorsque cette personne fixe des buts avant d’utiliser le modèle, soutient des critères interprétatifs qu’elle peut réviser, dialogue avec l’apprenant, ouvre des cycles de révision, nomme qui décide de la note ou de l’avancement, et alphabétise le feedback —le sien et celui de l’élève—. Prilop et Weber (2023) montrent, sans parler du GenAI comme grader, que le feedback expert change les croyances et la qualité du commentaire de ceux qui se forment : le sujet qui médie ne se télécharge pas dans un modèle. Une banque de commentaires ne recrute pas cette identité.

Le premier geste est le but d’apprentissage préalable à l’usage du modèle, non l’impression de la démo. Le critère ne naît pas de la sortie. Balducci (2024) interdit de commencer par l’outil : l’évaluation de l’élève, dans une éducation centrée sur la personne, se conçoit comme un acte, non comme un plugin. Davies (2026) ne peut rendre des commentaires sur des drafts que si quelqu’un savait déjà ce que l’on apprenait dans ce draft. Pan (2025) indexe à une rubrique : si elle est de la discipline et antérieure au modèle, elle peut être un apport ; si elle naît du prompt, c’est un artefact. Zhang et al. (2025) mesurent la littératie en IA de l’élève, non le but de la tâche. Inférence : le but s’écrit comme performance observable et comme erreur que l’on ne délègue pas. Il ne s’écrit pas comme un score élevé.

Le deuxième geste est le critère interprétatif révisable par l’enseignant. Choi et al. (2026) traitent l’ancre comme clé de l’AES par prompting : l’ancre calibre le modèle ; le critère de classe se discute, s’ajuste et s’enseigne. Pack et al. (2024) et Li et Liu (2024) peuvent décrire la validité d’un score sans que ce score soit le critère de cette consigne. Kim et Holden (2026) changent l’interface de notation : la GUI n’est pas la rubrique vive. Tate et al. (2024) interrogent l’utilité holistique : un holistique opaque ne se révise pas. Alfredo et al. (2024) lient la confiance à la participation au dessin. Inférence de conception : il y a critère lorsque l’enseignant peut dire ce qui compte comme « cohésion suffisante » dans ce genre, avec ce groupe, et amender cette lecture après avoir vu les brouillons. Si le seul critère est le nombre que le modèle a rendu, il y a scoring, non médiation.

Le troisième geste est le dialogue avec l’apprenant et le cycle de révision. Guo et al. (2024) situent le peer appuyé par l’IA dans la qualité du feedback et dans l’écriture : le pair reste interlocuteur. Bauer et al. (2023) veulent que le TALN soutienne cet échange, non qu’il le ferme. Banihashem et al. (2024) comparent des sources : la comparaison n’importe que si quelqu’un ramène le texte à un cycle. Xu et al. (2024) visualisent le peer-assessment : la visualisation peut informer ; elle ne parle pas avec l’apprenant. Prilop et Weber (2023) entraînent le commentaire : entraîner est déjà un dialogue médié. Davies (2026) travaille sur des drafts : le draft exige une version suivante, non un verdict. Inférence : il y a évaluation formative lorsque le commentaire entre dans une conversation et produit une révision attributable. Si le chatbot réécrit et que l’élève remet cette version, le cycle a été sauté.

Attribution et littératie du feedback vont ensemble. Cui et al. (2026) évaluent la compétence collaborative humain–IA en écriture L2 : le cadre oblige à dire qui fait quoi. Ce « qui » est voisin de l’attribution du jugement de notation, non son substitut. Yan et al. (2024) interdisent de traiter la notation automatique comme un geste anodin. Capel et Brereton (2023) interdisent de cacher la personne derrière l’étiquette. Kokoç et al. (2026) cartographient la littératie enseignante : savoir utiliser l’outil n’est pas savoir rendre un jugement. Yang et Banks (2025) placent la littératie chez les formateurs, non dans un clic. Zhang et al. (2025) donnent un instrument étudiant : la littératie en IA n’est pas une littératie évaluative. Goslen et al. (2025) rappellent le voisin du plan généré : étayer un jeu ne nomme pas qui note. Le nom de qui adopte le score, et de qui décide de l’avancement, s’écrit hors du modèle. L’enseignant médie, corrige ou éteint. Il n’est pas client d’un grader.

6. Contraste. Frontières de catégorie

Le feedback GenAI n’est pas une évaluation formative. Davies (2026) et Pan (2025) peuvent décrire des retours génératifs —sur des drafts ou indexés à une rubrique— sans autoriser l’équation. Banihashem et al. (2024) montrent que la source peut être l’IA : la source n’est pas le cycle. Appeler formatif le commentaire automatique et ajouter « avec l’enseignant dans la boucle » en note de bas de page efface la frontière au lieu de la traverser. L’évaluation formative nie que le système soit le sujet du jugement.

L’AES n’est pas le jugement enseignant, et le score n’est pas l’apprentissage. Pack et al. (2024), Li et Liu (2024), Choi et al. (2026), Kim et Holden (2026) et Tate et al. (2024) construisent un problème de notation : validité, fiabilité, ancre, interface, utilité holistique. Aucun n’installe un dialogue ni une attribution de la note. Un AES bien mesuré peut être un apport à une rubrique. Converti en avancement de l’élève, il a changé de bord. Xu et al. (2024) peuvent visualiser le peer-assessment sans que la couleur soit l’apprentissage. Inférence restrictive : le nombre parle du texte face à un modèle de score ; l’apprentissage parle d’un changement attributable, lu par quelqu’un qui a un critère.

Le pair avec IA ne substitue pas l’enseignant, et la littératie de prompts n’est pas une littératie évaluative. Guo et al. (2024) et Bauer et al. (2023) traitent l’appui au pair comme objet : l’enseignant continue de concevoir la tâche et, s’il y a une note, de la signer. Prilop et Weber (2023) ont besoin de l’expert pour former le commentaire. Kokoç et al. (2026), Yang et Banks (2025) et Zhang et al. (2025) désagrègent la littératie en IA —enseignant en service, formateur, élève— : « je sais demander au modèle » n’est pas savoir ce qui compte comme preuve d’avancement. Terminer un atelier sur « je peux déjà générer la rubrique » peut être une littératie fonctionnelle et rester un analphabétisme évaluatif.

Le harnais n’est pas une médiation formative, l’eval d’agent n’est pas une rubrique de classe, et le HITL n’est pas l’attribution du jugement de notation. Le 16 septembre, le harnais produit du travail avec outils, état, vérification et arrêt : une banque peut être bien harnachée et rester sans but. Le 18, l’eval d’un agent mesure la fiabilité sur une distribution : être bien mesuré à noter n’autorise pas à noter là où le seuil n’est pas écrit. Le 22, le HITL gouverne le copilote avec veto et trace : on peut opposer son veto à un commentaire sans avoir dialogué ni nommé qui décide de l’avancement. Goslen et al. (2025) illustrent une autre frontière : générer un plan d’élève est un étayage, non un jugement formatif. Cui et al. (2026) évaluent la compétence collaborative : ils n’égalent pas cette compétence à la signature d’une note. Yan et al. (2024), Alfredo et al. (2024), Capel et Brereton (2023) et Balducci (2024) interdisent de clore le problème avec un grader de catalogue. La catégorie est conjonctive : il manque une pièce et le système retombe en artefact, même si la diapositive dit évaluation formative.

7. Quatre épreuves d’appui (non artefact)

Ce qui suit est une inférence de conception de cet article, ancrée dans le corpus et non livrée par aucune source comme standard. Ce n’est pas une norme, ce n’est pas une rubrique validée et cela ne note pas des produits. Si une banque de commentaires, un score AES-LLM, un tableau, un chatbot « écris mieux », une rubrique auto-appliquée ou un grader de marketing ne passe pas les quatre épreuves, on ne peut le déclarer évaluation formative.

7.1. Épreuve des buts d’apprentissage préalables à l’usage du modèle, non de la banque de commentaires ni de la démo. Balducci (2024) place l’évaluation de l’élève dans une conception centrée sur la personne, antérieure à l’outil. Davies (2026) travaille sur des drafts : le draft est d’une tâche que quelqu’un a définie. Pan (2025) indexe à une rubrique : si elle est préalable, elle peut orienter ; si c’est une sortie de plus, non. Zhang et al. (2025) mesurent la littératie en IA de l’élève : un inventaire ne remplace pas le but de la discipline. L’épreuve est remplie lorsque, avant de coller le modèle au brouillon, est écrit ce que l’on attend d’apprendre, quelle erreur n’est pas déléguée et quels usages restent hors champ, par exemple certifier. Si le seul critère est un commentaire fluide ou une démo qui a impressionné, l’épreuve échoue.

7.2. Épreuve de critères interprétatifs révisables par l’enseignant, non du score AES ni de l’ancre de prompting. Pack et al. (2024), Li et Liu (2024) et Tate et al. (2024) parlent de validité, de fiabilité ou d’utilité d’un score : ce n’est pas le critère de cette consigne. Choi et al. (2026) font de l’ancre la clé de l’AES accessible : l’ancre ne se discute pas avec le groupe. Kim et Holden (2026) changent API et GUI : l’interface n’interprète pas. Alfredo et al. (2024) demandent une participation réelle au dessin. L’épreuve est remplie lorsque l’enseignant peut lire, amender et enseigner ce qui compte comme performance dans ce genre, et qu’un désaccord entre score et lecture humaine ne se résout pas par défaut en faveur du nombre. S’il ne voit qu’un holistique ou une rubrique auto-appliquée, il y a scoring d’exhibition, non critère.

7.3. Épreuve du dialogue et du cycle de révision avec l’apprenant, non du chatbot qui réécrit ni du tableau qui colore. Guo et al. (2024) et Bauer et al. (2023) tiennent le peer comme échange. Banihashem et al. (2024) comparent des sources : la source entre dans le cycle ou reste en marge. Xu et al. (2024) visualisent : voir n’est pas converser. Prilop et Weber (2023) entraînent le commentaire avec un expert. Davies (2026) exige, par l’objet même du draft, une version suivante. Goslen et al. (2025) génèrent des plans : le plan n’est pas la révision de l’essai. L’épreuve est remplie lorsque l’apprenant reçoit le feedback, peut interroger, produit une révision attributable et que quelqu’un la lit. Si le chatbot livre le paragraphe « meilleur » et que cette version est publiée, il y a substitution du processus. Si le tableau colore et que personne ne parle, il y a surveillance de similarité, non médiation.

7.4. Épreuve d’attribution explicite du jugement évaluatif : qui décide de la note ou de l’avancement. Cui et al. (2026) obligent à articuler la compétence collaborative : le cadre n’offre pas un sujet à qui charger la note sans le nommer. Yan et al. (2024) n’offrent pas une notation automatique anodine. Capel et Brereton (2023) ne dispensent pas de la personne. Kokoç et al. (2026) et Yang et Banks (2025) laissent la littératie aux enseignants et aux formateurs : l’écart demande une formation, non la cession du nom. Balducci (2024) maintient l’acte évaluatif dans une éducation de personnes. L’épreuve est remplie s’il est écrit qui adopte, corrige ou écarte le score et le commentaire, et quand l’avancement se déclare —ou se nie— sous un nom propre. « L’IA a noté », sans nom ni seuil, est une décharge. Les quatre se lisent ensemble : un but sans critère ne s’applique pas ; un critère sans dialogue est un fichier ; un dialogue sans attribution ne soutient pas le jugement demain ; une attribution sans but préalable s’invente sous la pression.

8. Discussion

Trois tensions organisent la discussion. La première oppose exhiber des artefacts et exercer le métier de médiation. Pack et al. (2024), Li et Liu (2024), Choi et al. (2026), Kim et Holden (2026) et Tate et al. (2024) ne disent pas la même chose : validité, fiabilité, ancre, interface, utilité holistique. Le marché les écrase dans « le grader évalue déjà ». La pièce peut être vraie dans son domaine ; « pièce = évaluation formative » ne l’est pas. Davies (2026) et Pan (2025) peuvent montrer des retours génératifs sans autoriser cette équation. Banihashem et al. (2024) peuvent contraster des sources sans faire de l’IA le sujet du cycle.

La deuxième oppose les couches antérieures de la série à la médiation formative. Le harnais produit un travail vérifiable. L’évaluation d’agents mesure la fiabilité sur une distribution. Le HITL gouverne la délégation en situation. Les trois peuvent être bien faites et le feedback de cette tâche continuer de ne pas former : parce que le score n’était pas le but (Pack et al., 2024 ; Tate et al., 2024), parce que personne n’a dialogué le commentaire (Guo et al., 2024 ; Prilop et Weber, 2023), parce que la rubrique s’est auto-appliquée (Pan, 2025), ou parce que le nom de qui note est resté vide (Cui et al., 2026 ; Yan et al., 2024). Acheter harnais, eval et HITL n’achète pas l’évaluation formative. Omettre la quatrième couche —« le modèle commente déjà, donc il forme déjà »— est un biais d’exhibition, non une conclusion des revues.

La troisième oppose littératie évaluative et confiance de prompt. Kokoç et al. (2026) trouvent un champ empirique de littératie enseignante en service : c’est une carte, non un protocole de retour. Yang et Banks (2025) travaillent la littératie chez des formateurs du primaire comme self-study : la réponse cohérente est une formation avec critère, non un atelier de confiance déclarée. Zhang et al. (2025) valident un inventaire étudiant : le mesurer n’est pas enseigner à user du feedback. Xu et al. (2024) rappellent que visualiser des données d’évaluation ne substitue pas le métier. Alfredo et al. (2024), Capel et Brereton (2023) et Balducci (2024) maintiennent le centrage sur la personne comme conception et comme acte, non comme étiquette. Bauer et al. (2023) et Goslen et al. (2025) offrent des voisins —TALN pour le pair, plans pour l’étayage— qui tiennent dans le métier et ne l’épuisent pas. Confondre l’enthousiasme d’usage avec la médiation laisse la classe gouvernée par qui veut le plus déléguer le jugement.

Les épreuves lisent ces tensions comme des hypothèses, non comme un constat d’établissement. Choi et al. (2026) n’ont pas écrit une rubrique de discipline. Kim et Holden (2026) n’ont pas étudié des cycles de révision. Le peer de Guo et al. (2024) n’est pas la signature d’une note. But, critère, dialogue et nom sont une candidature à l’évaluation formative. Banque, score, tableau, chatbot ou grader, seuls, sont de la consommation.

9. Limites

La revue est narrative. Elle n’estime pas d’effets combinés et n’applique pas de PRISMA propre. On n’invente ni tailles d’échantillon, ni d, ni r, ni AUC, ni pourcentages d’accord, ni taux d’amélioration, même si certaines sources les rapportent. Pack et al. (2024), Li et Liu (2024), Choi et al. (2026), Kim et Holden (2026) et Tate et al. (2024) se lisent par l’objet qu’ils notent, non comme des essais d’un protocole formatif. Guo et al. (2024), Banihashem et al. (2024), Xu et al. (2024) et Prilop et Weber (2023) parlent de peer, de sources ou d’entraînement : on n’importe pas d’effets. Zhang et al. (2025) valident un construit. Kokoç et al. (2026) cartographient ; ils n’auditent pas de produits. Yang et Banks (2025) sont un self-study de formateurs du primaire, non une étude de jardin ni un essai de grader.

D’autres sources sont sol ou voisin, non preuve directe du protocole. Davies (2026) et Pan (2025) décrivent des usages de feedback génératif : ils ne certifient pas les quatre épreuves. Bauer et al. (2023) proposent cadre et agenda. Cui et al. (2026) évaluent la compétence collaborative en EFL chinois. Goslen et al. (2025) génèrent des plans dans le jeu. Alfredo et al. (2024), Yan et al. (2024), Capel et Brereton (2023) et Balducci (2024) cartographient conception centrée sur la personne et défis ; ils n’installent pas un cycle de discipline. Dans ce kit, il n’y a pas d’essai qui égale banque, score, tableau ou chatbot à une évaluation formative sous les quatre épreuves. Cette absence est un plafond de catégorie, non une taille de dommage. On n’audite pas de contrats et on ne condamne pas de marques. Les quatre épreuves ne sont pas un instrument validé. L’intitulé « jardin » du titre 5 ne transfère pas de constats d’éducation initiale. Le corpus est en anglais et la synthèse est éditoriale en espagnol. La pile harnais, eval d’agent, HITL et médiation formative est une distinction de la série, non un résultat empirique des vingt-et-une sources.

10. Conclusions

Une banque de commentaires automatiques, un score de rubrique produit par un LLM, un tableau de similarité ou un chatbot « écris mieux » ne constituent pas une évaluation formative s’il manque la médiation enseignante. Pas davantage une rubrique auto-appliquée ni un grader de marketing. Le métier est le jugement qui décide quel feedback compte, quand le rendre et comment le convertir en preuve d’apprentissage. Pack et al. (2024), Li et Liu (2024), Choi et al. (2026), Kim et Holden (2026), Tate et al. (2024), Davies (2026), Pan (2025) et Banihashem et al. (2024) fixent le plafond : scoring, ancre, interface, utilité holistique, retour génératif et indexation à une rubrique, et sources qui ne sont pas, à elles seules, un cycle.

Là où il y a métier, il y a sujet et protocole. Prilop et Weber (2023), Guo et al. (2024), Bauer et al. (2023) et Xu et al. (2024) laissent le commentaire —expert, de pair, visualisé ou appuyé par le TALN— comme un objet que quelqu’un soutient, non comme un verdict du modèle. Kokoç et al. (2026), Yang et Banks (2025) et Zhang et al. (2025) déplacent la littératie du clic vers enseignants, formateurs et élèves, sans l’égaler à une littératie évaluative. Cui et al. (2026) obligent à articuler la collaboration. Alfredo et al. (2024), Capel et Brereton (2023), Balducci (2024), Yan et al. (2024) et Goslen et al. (2025) interdisent de clore le problème avec un rôle de catalogue ou un plan généré.

La pile ne se substitue pas de l’intérieur. Le harnais produit du travail. L’évaluation d’agents mesure la fiabilité. Le HITL gouverne le copilote. La médiation formative convertit le feedback en preuve d’apprentissage, avec quatre épreuves conjonctives : buts préalables au modèle ; critères interprétatifs révisables ; dialogue et cycle de révision ; attribution de qui décide de la note ou de l’avancement. Là où les sources n’ont pas mesuré ce protocole, cet article ne le donne pas pour mesuré. Là où elles ont mesuré scores, sources, peer, instruments ou cadres, on ne les traduit pas en « le grader forme déjà ». Convertir un système génératif en évaluation formative, c’est exercer un jugement sur quel commentaire se publie, quand on révise et qui signe l’avancement. Le reste est banque, notation, tableau ou chatbot de marketing. Ce n’est pas un métier, et cela ne doit pas se présenter comme ce qu’il n’est pas.

Laboratoire éditorial de NEXTECH.IA / Ingeniero Mitre.

Références

  1. Alfredo, R., Echeverria, V., Jin, Y., Yan, L., Swiecki, Z., Gašević, D., y Martinez-Maldonado, R. (2024). Human-centred learning analytics and AI in education: A systematic literature review. Computers and Education: Artificial Intelligence, 6, Article 100215. https://doi.org/10.1016/j.caeai.2024.100215
  2. Balducci, B. (2024). AI and student assessment in human-centered education. Frontiers in Education, 9, Article 1383148. https://doi.org/10.3389/feduc.2024.1383148
  3. Banihashem, S. K., Kerman, N. T., Noroozi, O., Moon, J., y Drachsler, H. (2024). Feedback sources in essay writing: peer-generated or AI-generated feedback? International Journal of Educational Technology in Higher Education, 21(1), Article 23. https://doi.org/10.1186/s41239-024-00455-4
  4. Bauer, E., Greisel, M., Kuznetsov, I., Berndt, M., Kollar, I., Dresel, M., Fischer, M. R., y Fischer, F. (2023). Using natural language processing to support peer-feedback in the age of artificial intelligence: A cross-disciplinary framework and a research agenda. British Journal of Educational Technology, 54(5), 1222–1245. https://doi.org/10.1111/bjet.13336
  5. Capel, T., y Brereton, M. (2023). What is human-centered about human-centered AI? A map of the research landscape. En Proceedings of the 2023 CHI Conference on Human Factors in Computing Systems (pp. 1–23). ACM. https://doi.org/10.1145/3544548.3580959
  6. Choi, J., Tate, T., y Warschauer, M. (2026). Anchor is the key: Toward accessible automated essay scoring with large language model through prompting. Assessing Writing, 69, Article 101053. https://doi.org/10.1016/j.asw.2026.101053
  7. Cui, H., Mahfoodh, O. H. A., Dong, H., y Ulanbek, M. (2026). An assessment framework for human-AI collaborative competence in second language writing: Evidence from the Chinese EFL context. System, 137, Article 103937. https://doi.org/10.1016/j.system.2025.103937
  8. Davies, R. (2026). Using generative AI for formative feedback on student writing drafts. Educational Technology Research and Development. https://doi.org/10.1007/s11423-026-10652-9
  9. Goslen, A., Kim, Y. J., Rowe, J., y Lester, J. (2025). LLM-based student plan generation for adaptive scaffolding in game-based learning environments. International Journal of Artificial Intelligence in Education, 35(2), 533–558. https://doi.org/10.1007/s40593-024-00421-1
  10. Guo, K., Pan, M., Li, Y., y Lai, C. (2024). Effects of an AI-supported approach to peer feedback on university EFL students' feedback quality and writing ability. The Internet and Higher Education, 63, Article 100962. https://doi.org/10.1016/j.iheduc.2024.100962
  11. Kim, J., y Holden, D. (2026). Reassessing automated essay scoring with large language models: Evidence from API and GUI interfaces. Assessing Writing, 69, Article 101080. https://doi.org/10.1016/j.asw.2026.101080
  12. Kokoç, M., Ağırman, Ş., y Yağmurlugil, B. N. (2026). Mapping in-service teacher AI literacy: A systematic review of empirical studies. Teaching and Teacher Education, 181, Article 105707. https://doi.org/10.1016/j.tate.2026.105707
  13. Li, W., y Liu, H. (2024). Applying large language models for automated essay scoring for non-native Japanese. Humanities and Social Sciences Communications, 11(1), Article 723. https://doi.org/10.1057/s41599-024-03209-9
  14. Pack, A., Barrett, A., y Escalante, J. (2024). Large language models and automated essay scoring of English language learner writing: Insights into validity and reliability. Computers and Education: Artificial Intelligence, 6, Article 100234. https://doi.org/10.1016/j.caeai.2024.100234
  15. Pan, Y. (2025). Leveraging generative AI powered rubric-indexed feedback as a formative assessment strategy for enhancing medical English education. Discover Computing, 28(1), Article 284. https://doi.org/10.1007/s10791-025-09830-9
  16. Prilop, C. N., y Weber, K. E. (2023). Digital video-based peer feedback training: The effect of expert feedback on pre-service teachers’ peer feedback beliefs and peer feedback quality. Teaching and Teacher Education, 127, Article 104099. https://doi.org/10.1016/j.tate.2023.104099
  17. Tate, T. P., Steiss, J., Bailey, D., Graham, S., Moon, Y., Ritchie, D., Tseng, W., y Warschauer, M. (2024). Can AI provide useful holistic essay scoring? Computers and Education: Artificial Intelligence, 7, Article 100255. https://doi.org/10.1016/j.caeai.2024.100255
  18. Xu, L., Zou, X., y Hou, Y. (2024). Effects of feedback visualisation of peer-assessment on pre-service teachers' data literacy, learning motivation, and cognitive load. Journal of Computer Assisted Learning, 40(4), 1447–1462. https://doi.org/10.1111/jcal.12955
  19. Yan, L., Sha, L., Zhao, L., Li, Y., Martinez-Maldonado, R., Chen, G., Li, X., Jin, Y., y Gašević, D. (2024). Practical and ethical challenges of large language models in education: A systematic scoping review. British Journal of Educational Technology, 55(1), 90–112. https://doi.org/10.1111/bjet.13370
  20. Yang, S., y Banks, A. (2025). Enhancing AI literacy: A collaborative self-study of elementary teacher educators. Studying Teacher Education, 21(3), 297–317. https://doi.org/10.1080/17425964.2024.2434213
  21. Zhang, H., Perry, A., y Lee, I. (2025). Developing and validating the Artificial Intelligence Literacy Concept Inventory: An instrument to assess artificial intelligence literacy among middle school students. International Journal of Artificial Intelligence in Education, 35(1), 398–438. https://doi.org/10.1007/s40593-024-00398-x