IA pour étudiants et doctorants : travailler avec des sources vérifiables

Vous avez une pile de PDF à lire, un mémoire à structurer et un jeu de données à analyser, le tout à rendre bientôt. Cet article montre trois tâches précises que vous pouvez terminer aujourd’hui avec des outils d’IA, sans tricher et sans exposer de données sensibles. Chaque tâche part d’un fichier fourni, donne un prompt à copier, un résultat attendu et le contrôle humain à faire ensuite.

La règle qui traverse tout l’article : l’IA aide à chercher, extraire, vérifier et reformuler. Elle ne rédige pas votre contribution intellectuelle et n’invente pas de sources. Vous restez l’auteur, et vous déclarez votre usage selon les règles de votre cours, de votre université et de la revue visée.

Ce dont vous avez besoin

  • Un compte sur une application d’IA grand public : ChatGPT (OpenAI), Claude (Anthropic), Gemini (Google) ou Le Chat (Mistral). Les trois tâches ci-dessous fonctionnent avec un compte gratuit, avec des limites d’usage plus strictes.
  • Les fichiers d’exemple de cet article : trois résumés d’articles fictifs, une fiche de cours et un petit fichier de données. Ils vous permettent de reproduire chaque tâche sans manipuler de document sous droits ni de données réelles.
  • Pour la tâche 3, un moyen d’exécuter un script : Python ou R installé sur votre ordinateur, ou l’environnement fourni par votre laboratoire.

Vérifiez une chose avant de commencer : la charte d’usage de l’IA de votre établissement et la consigne de chaque enseignant. Elles priment sur tout conseil général.

Deux règles à connaître avant de coller quoi que ce soit

Déclarer son usage. Les grands éditeurs scientifiques et le comité international des rédacteurs de revues médicales (ICMJE, mise à jour de janvier 2026) demandent la même chose : une IA ne peut pas être autrice d’un article, et tout usage substantiel doit être déclaré au moment de la soumission.

Elsevier impose une déclaration placée juste avant les références, qui nomme l’outil et son usage. La correction basique d’orthographe et de grammaire, elle, n’a pas à être déclarée. Côté universités, la note de l’UCLouvain aux étudiants (approuvée le 17 février 2026) repose sur la transparence, l’authenticité et l’interdiction de tromper l’évaluateur ; elle autorise les fonctions d’assistance linguistique sans les mentionner, mais interdit toute reprise verbatim non citée.

En France, il n’existe pas de formulaire national unique : les chartes sont adoptées établissement par établissement (Paris 1 Panthéon-Sorbonne, École de droit de la Sorbonne, entre autres). Lisez la vôtre.

Protéger les données. Ne collez jamais de données réelles de participants, de patients ou d’entretiens dans un chatbot grand public. Sur les offres gratuites et personnelles de ChatGPT et de Claude, vos saisies peuvent servir à entraîner de futurs modèles tant que vous n’avez pas désactivé cette option, et désactiver cette option ne suffit pas à rendre un protocole conforme.

Pour de vraies données sensibles, passez par un compte Éducation ou Entreprise négocié par votre université (avec accord de traitement des données), par un outil d’enquête auto-hébergé comme LimeSurvey, et par votre comité d’éthique. Dans cet article, tous les fichiers sont synthétiques.

Travailler dans un Projet privé

Un Projet (Projects chez ChatGPT et chez Claude) est un espace de travail privé : vous y déposez vos fichiers et une consigne permanente, et l’assistant s’appuie sur ce contenu pour toutes vos conversations à l’intérieur du projet.

Vous gardez le même cadre d’une séance à l’autre sans le réécrire. Les Projets existent sur tous les niveaux d’abonnement, y compris gratuit (Claude limite les comptes gratuits à cinq projets ; vérifiez la limite en vigueur dans votre compte).

Cet article s’appuie sur ces Projets privés et sur des carnets de sources. Dans les exercices ci-dessous, le Projet répond à partir des fichiers que vous déposez et des messages que vous envoyez ; il n’agit pas seul dans d’autres logiciels tant que vous n’avez pas activé un connecteur autorisé. Cette différence avec un vrai système automatisé revient plus bas.

Tâche 1 : une matrice de lecture ancrée dans les sources

C’est la tâche la plus simple : elle ne demande aucune configuration, juste un copier-coller. Objectif : transformer un petit corpus d’articles en un tableau comparatif où chaque ligne renvoie à sa source.

Application : NotebookLM de Google (voir la page officielle notebooklm.google.com), ou un Projet ChatGPT ou Claude. NotebookLM est conçu pour répondre à partir des sources que vous chargez et pour les citer, ce qui aide à remonter à l’origine de chaque affirmation.

Cela n’établit pas l’exactitude : vérifiez chaque citation dans la source. Un carnet gratuit accepte, à ce jour, jusqu’à 50 sources (PDF, DOCX, TXT, CSV, texte collé, entre autres) ; vérifiez la limite en vigueur dans votre compte.

Fichier d’exemple : resumes_articles_fictifs.txt (trois résumés inventés), fourni avec cet article. Dans un vrai travail, remplacez-les par vos propres PDF. Contenu à copier :

[Source 1] Dumont, C. & Vaskey, L. (2021). Révision espacée et rétention à quatre semaines
chez des étudiants de première année. Essai contrôlé randomisé, 120 étudiants de bac 1
répartis entre révision espacée (6 sessions courtes) et révision massée (1 session longue).
Mesure : rappel libre à 4 semaines. Le groupe « espacé » obtient un rappel supérieur de
18 points de pourcentage. Limites déclarées : une seule université, pas de suivi au-delà de
4 semaines, attrition de 11 %.

[Source 2] Ferreira, A., Blum, S. & Ndiaye, K. (2023). Rappel actif contre relecture : une
méta-analyse de 34 études. Taille d'effet globale g = 0,52 en faveur du rappel actif.
Hétérogénéité élevée. Limites déclarées : biais de publication non évalué formellement,
définitions du « rappel actif » variables selon les études.

[Source 3] Novak, P. & Petit, M. (2022). Application de cartes mémoire contre notes papier
chez des étudiants en soins infirmiers. Étude quasi-expérimentale, 88 étudiants, sans
randomisation. Aucune différence significative sur la note d'examen, mais confiance
auto-déclarée plus élevée dans le groupe application. Limites déclarées : absence de
randomisation, mesure de confiance auto-rapportée, durée limitée à un semestre.

Étapes :

  1. Ouvrez NotebookLM et créez un carnet, ou créez un Projet dans ChatGPT ou Claude.
  2. Ajoutez les sources : importez le fichier d’exemple, ou collez les trois résumés comme sources distinctes.
  3. Collez la consigne ci-dessous.
  4. Récupérez le tableau et vérifiez chaque cellule dans la source citée.

Prompt à copier :

Tu es un assistant de revue de littérature. Utilise UNIQUEMENT les sources
chargées dans ce carnet. N'ajoute aucune connaissance extérieure et n'invente
aucune référence. Construis un tableau avec une ligne par source et les colonnes :
Source (numéro et auteurs, année), Question ou objectif, Type de devis,
Échantillon, Résultat principal, Limites déclarées. Après le tableau, indique en
une phrase par source d'où vient l'information (nom du fichier). Si une information
est absente d'une source, écris « non indiqué » plutôt que de la deviner.

Résultat attendu (à partir des résumés fictifs) :

Source Auteurs (année) Question ou objectif Devis Échantillon Résultat principal Limites déclarées
1 Dumont & Vaskey (2021) Effet de la révision espacée sur la rétention à 4 semaines Essai contrôlé randomisé 120 étudiants de bac 1 Rappel supérieur de 18 points de pourcentage pour la révision espacée Une seule université, pas de suivi au-delà de 4 semaines, attrition 11 %
2 Ferreira, Blum & Ndiaye (2023) Rappel actif contre relecture Méta-analyse (34 études) 34 études Taille d’effet g = 0,52 en faveur du rappel actif Biais de publication non évalué, définitions variables du rappel actif
3 Novak & Petit (2022) Cartes mémoire (application) contre notes papier Quasi-expérimental 88 étudiants en soins infirmiers Aucune différence statistiquement significative sur la note d’examen, confiance auto-déclarée plus élevée Pas de randomisation, mesure auto-rapportée, durée d’un semestre

Contrôle humain : ouvrez chaque source et confirmez le chiffre et la limite de sa ligne. Une matrice qui ne renvoie pas à la source n’a aucune valeur pour un état de l’art.

Erreur fréquente et correction : l’assistant complète une case vide avec une valeur plausible mais absente du texte. Si vous voyez une donnée qui n’apparaît pas dans la source, supprimez-la et relancez avec la consigne « écris non indiqué si l’information n’est pas dans la source ». Quel que soit l’outil, vérifiez chaque cellule dans la source citée : un assistant qui affiche une citation peut tout de même se tromper de passage.

Tâche 2 : un exercice de compréhension et de révision

Objectif : transformer une fiche de cours en questions de révision, puis vous interroger, en gardant la fiche comme seule référence.

Application : NotebookLM (conçu pour répondre à partir des sources chargées et les citer) ou un Projet. Vérifiez ensuite chaque réponse dans la fiche.

Fichier d’exemple : fiche_cours_imrad.md (une fiche courte et autonome sur la structure IMRaD et le protocole expérimental), fourni avec cet article. Contenu à copier :

La structure IMRaD. Un article scientifique expérimental suit souvent la structure IMRaD :
Introduction, Méthodes, Résultats, Discussion. L'Introduction pose la question de recherche
et l'hypothèse. La section Méthodes décrit comment l'étude a été menée, assez précisément
pour être reproduite. Les Résultats présentent les données observées, sans les interpréter.
La Discussion interprète les résultats, les compare à la littérature et énonce les limites.

Le protocole expérimental. La variable indépendante est celle que le chercheur manipule. La
variable dépendante est celle que le chercheur mesure. Un groupe contrôle sert de point de
comparaison : il ne reçoit pas l'intervention testée. La randomisation répartit les
participants entre les groupes au hasard, ce qui réduit les biais de sélection. La validité
interne indique dans quelle mesure l'effet observé est bien dû à la variable indépendante ;
la validité externe, dans quelle mesure les résultats se généralisent à d'autres contextes.

Points d'attention. Une corrélation entre deux variables n'établit pas un lien de cause à
effet. La taille de l'échantillon influence la précision des estimations. Les limites d'une
étude doivent être déclarées dans la Discussion.

Étapes :

  1. Chargez la fiche comme unique source dans un carnet, ou dans un Projet.
  2. Collez la consigne ci-dessous pour générer les questions.
  3. Passez en mode interrogation : répondez d’abord de mémoire, puis comparez.
  4. Vérifiez que chaque réponse se retrouve mot pour mot dans la fiche.

Prompt à copier :

À partir de la SEULE fiche chargée, rédige 8 questions de révision et leur réponse.
Numérote-les. Chaque réponse doit s'appuyer sur une phrase précise de la fiche ;
n'ajoute rien qui n'y figure pas. Ensuite, passe en mode interrogation : pose-moi
les questions une par une, attends ma réponse, puis dis si elle est correcte en
citant la phrase de la fiche qui le justifie. Si une de mes questions sort de la
fiche, réponds « hors du support fourni ».

Résultat attendu (extrait) :

  • Q1. Que signifie l’acronyme IMRaD ? Réponse : Introduction, Méthodes, Résultats, Discussion.
  • Q2. Quelle section présente les données sans les interpréter ? Réponse : les Résultats.
  • Q3. Différence entre variable indépendante et variable dépendante ? Réponse : l’indépendante est manipulée par le chercheur, la dépendante est mesurée.
  • Q4. À quoi sert un groupe contrôle ? Réponse : de point de comparaison, il ne reçoit pas l’intervention testée.

Puis, en mode interrogation : « Question 4 sur 8 : à quoi sert un groupe contrôle ? »

Contrôle humain : pour chaque réponse, retrouvez la phrase d’origine dans la fiche. Si l’assistant justifie une réponse par une phrase qui n’existe pas, la question est à jeter. Cet exercice teste votre compréhension ; il ne remplace pas la lecture du cours.

Erreur fréquente et correction : l’assistant enrichit une réponse avec un détail extérieur (une statistique, un exemple non présent dans la fiche). Rappelez la contrainte « uniquement la fiche » et demandez la phrase justificative. Sur une fiche très courte, un carnet peut citer le document entier au lieu d’un passage précis : c’est normal.

Fichiers à récupérer : script Python (zip), données du quiz, résumés fictifs et fiche de cours (zip).

Tâche 3 : vérifier un script d’analyse de données sur un jeu fictif

Objectif : demander à l’IA un script d’analyse, l’exécuter vous-même, puis réconcilier les nombres avec un calcul vérifiable. L’IA écrit du code utile, mais c’est vous qui répondez des résultats.

Application : ChatGPT ou Claude pour générer le code ; Python ou R pour l’exécuter.

Fichier d’exemple : quiz_revision.csv, douze lignes fictives (identifiant, groupe, heures de révision, score sur 20). Ces heures sont hebdomadaires, pas cumulées. Une valeur d’heures a été saisie à 250, une erreur volontaire : une semaine ne compte que 168 heures, donc 250 est physiquement impossible. Le contenu du fichier, à copier tel quel :

participant_id,groupe,heures_revision,score_sur_20
P01,A,5,12
P02,A,8,14
P03,A,6,13
P04,A,7,15
P05,A,4,11
P06,A,6,10
P07,B,10,16
P08,B,12,18
P09,B,9,15
P10,B,11,17
P11,B,250,19
P12,B,8,16

Étapes :

  1. Décrivez vos colonnes et collez la consigne ci-dessous. Ne téléversez pas de données réelles de participants ; ici, le fichier est synthétique.
  2. Copiez le script produit et exécutez-le sur le fichier.
  3. Lisez la sortie, puis recalculez une valeur à la main.
  4. Traitez la valeur aberrante avec votre encadrant avant toute décision.

Prompt à copier :

Voici un fichier CSV nommé quiz_revision.csv avec les colonnes : participant_id,
groupe (A ou B), heures_revision, score_sur_20. Les heures sont hebdomadaires. Écris
un script Python autonome qui : 1) charge le fichier ; 2) signale les valeurs
manquantes et les valeurs physiquement impossibles (des heures de révision
supérieures à 168, soit plus que les heures d'une semaine) sans supprimer aucune
ligne ; 3) donne, par groupe, le nombre d'observations, la moyenne et l'écart-type
du score ; 4) réalise un test t de Student pour échantillons indépendants comparant
le score des groupes A et B, en précisant qu'il suppose des variances égales. Si un
score manque, signale-le et interromps le calcul inférentiel au lieu de filtrer la
ligne. N'invente aucune donnée, ne supprime aucune ligne, ne remplace aucune valeur
manquante. Ajoute un commentaire expliquant chaque étape.

Pour reproduire la sortie exacte, placez le script de référence analyse_quiz.py (fourni avec cet article) et quiz_revision.csv dans le même dossier, puis lancez python3 analyse_quiz.py. La dernière ligne (valeur p) utilise SciPy. Sans SciPy, le script affiche quand même les moyennes, les écarts-types et le t, puis indique où lire la valeur p ; n’installez aucun paquet sans y être autorisé.

Résultat attendu, sur une machine où SciPy est installé :

Lignes: 12
Valeurs manquantes -> heures: 0, score: 0
heures_revision min=4 max=250 (une valeur > 168 h depasse les heures d'une semaine, donc impossible: a verifier a la main)
Groupe A: n=6 moyenne=12.5000 ecart-type(echantillon)=1.8708
Groupe B: n=6 moyenne=16.8333 ecart-type(echantillon)=1.4720
Test t (variances egales): t=-4.4590, ddl=10, difference des moyennes=-4.3333
scipy ttest_ind: t=-4.4590, p=0.001218

Sans SciPy, les six premières lignes sont identiques et la dernière est remplacée par une note indiquant de lire la valeur p dans une table de t à 10 degrés de liberté.

Contrôle humain : recalculez la moyenne du groupe A à la main. Les six scores sont 12, 14, 13, 15, 11 et 10, soit 75 divisé par 6 égale 12,5. Le script affiche 12,5 : cohérent.

La valeur de 250 heures apparaît dans le maximum, au-delà des 168 heures d’une semaine : c’est votre travail de décider, avec votre encadrant, s’il s’agit d’une faute de saisie à corriger ou d’une ligne à écarter, avec une justification écrite.

Ce test t suppose des variances égales entre les deux groupes, une hypothèse à contrôler. Comme le jeu de données est fictif, la valeur p (0,0012) n’établit aucun effet réel ; elle ne dit pas non plus que la méthode B « cause » de meilleurs résultats.

Erreur fréquente et correction : certains modèles suppriment d’office la ligne à 250, filtrent en silence une valeur manquante, ou inventent une valeur p sans exécuter le code. Refusez les trois.

Exigez que le script signale l’anomalie sans y toucher, qu’il interrompe le calcul si un score manque plutôt que d’écarter la ligne, et ne retenez une valeur p que si elle sort de votre propre exécution. Falsifier ou nettoyer des données à l’aveugle est la faute la plus grave en recherche.

Des instructions de projet réutilisables

Une fois par projet, réglez la consigne permanente. Elle s’applique à toutes vos conversations dans ce Projet et vous évite de répéter le cadre. Exemple pour un travail de recherche :

Contexte : je prépare un travail universitaire. Réponds en français, registre
académique sobre. Appuie-toi uniquement sur les fichiers de ce projet et sur les
sources que je fournis ; ne cite jamais une référence que tu n'as pas vue dans ces
fichiers. Quand tu extrais une donnée, indique le fichier d'où elle vient. Ne rédige
pas de paragraphes d'analyse ou de discussion à ma place : propose des plans, des
questions et des reformulations, et signale ce qui reste à vérifier. Si une
information manque, écris « non indiqué » au lieu de la deviner.

Rappel : cette consigne vit dans votre projet privé et cadre seulement vos conversations. Vous n’êtes pas obligé de la publier ni de partager vos fichiers.

Choisir le bon outil pour la tâche

Distinguez cinq choses. Le modèle est le moteur (par exemple les familles GPT d’OpenAI, Claude d’Anthropic, Gemini de Google, Mistral). L’application grand public est l’interface (ChatGPT, Claude, Gemini, Le Chat).

L’abonnement fixe vos limites d’usage. L’API sert à intégrer un modèle dans votre propre programme. Le connecteur (protocole MCP, ou plateformes comme Zapier, Make, n8n) relie l’IA à un logiciel.

Pour choisir vite : une tâche courte et fermée (corriger un texte collé, résumer un paragraphe, générer des idées de titres) tourne très bien sur un modèle rapide et économique. Une tâche de raisonnement sur documents longs (comparer quinze articles, structurer un mémoire, relire un script d’analyse) appelle plutôt un modèle de raisonnement à grande fenêtre de contexte.

Pour transformer un chapitre en diapositives, Microsoft 365 Copilot travaille directement dans Word et PowerPoint, là où beaucoup d’universités vous donnent déjà une licence. Les noms exacts des modèles changent presque chaque mois : vérifiez la version disponible dans votre compte et consultez notre référence, Choisir son modèle IA et organiser un travail avec plusieurs agents, plutôt qu’une liste figée.

Pour la relecture linguistique, des correcteurs comme Antidote ou DeepL Write traitent l’orthographe, la grammaire et le style ; la note de l’UCLouvain range ce type d’assistance linguistique parmi les usages qui n’ont pas à être déclarés. Cela ne vous dispense pas de vérifier la consigne de votre cours.

Coordinateur et sous-agents : l’exercice manuel et le vrai système

Vous lirez partout que l’IA travaille désormais en équipe : un « coordinateur » découpe la tâche et la confie à des « sous-agents » spécialisés. Deux mises en garde évitent une confusion coûteuse.

Donner trois rôles dans un seul prompt ne crée pas trois agents indépendants : c’est une seule IA qui joue trois personnages. Copier un résultat d’une fenêtre de chat vers une autre est une délégation manuelle, faite par vous, pas une automatisation.

Un exercice que vous pouvez faire à la main, en une heure, pour comprendre le principe :

  1. Ouvrez quatre fenêtres de chat. Vous êtes le coordinateur.
  2. Fenêtre « explorateur » : listez les sources pertinentes pour votre question, à partir des résumés fictifs fournis, pas d’une liste inventée par l’IA.
  3. Fenêtre « lecteur » : collez un de ces résumés et demandez d’en extraire méthode, échantillon et résultats.
  4. Fenêtre « évaluateur » : recollez les mêmes résumés fictifs, puis demandez de juger les limites déclarées de chaque étude. Un chat neuf ne peut pas évaluer des limites sans avoir le texte sous les yeux.
  5. Fenêtre « rédacteur » : collez les extraits validés, avec le nom du fichier source pour chacun, et demandez une synthèse sourcée que vous corrigez.

À chaque étape, c’est vous qui transférez le texte et qui vérifiez. Un vrai système automatisé, lui, enchaîne ces étapes sans votre copier-coller : il demande des accès aux bases et aux fichiers via des connecteurs, des permissions, une mise en œuvre technique, et une étape de validation humaine avant tout envoi.

Cela dépasse le simple fait d’ouvrir un abonnement : il faut configurer et autoriser ces connexions, souvent avec un développement. Le schéma ci-dessous résume la différence.

Coordinateur et sous-agents : l’exercice manuel n’est pas un système automatisé

1. Exercice manuel
faisable aujourd’hui, sans outillage

Vous = coordinateur

vous copiez-collez entre les fenêtres ↓

Explorateurchercher les sources
Lecteurextraire méthode, échantillon, résultats
Évaluateurjuger la solidité
Rédacteurrédiger la synthèse sourcée

Chaque rôle est une fenêtre de chat séparée. C’est vous qui transférez le texte de l’une à l’autre. Délégation manuelle : ce n’est pas de l’automatisation.

2. Orchestration connectée
nécessite de l’outillage

Coordinateur (IA)

délégation automatique ↓

Sous-agent recherche
Sous-agent extraction
Sous-agent synthèse

↓

Connecteurs, MCP ou API vers bases bibliographiques, fichiers, agenda

↓

Validation humaine avant tout envoi

Accès, permissions et mise en œuvre techniques, au-delà d’un simple abonnement.

Schéma explicatif. À gauche, un exercice que tout étudiant reproduit à la main. À droite, un vrai système automatisé, qui demande accès, permissions et développement.

Ce que l’IA ne doit pas faire

  • Rédiger votre contribution : analyse, discussion, méthodologie, conclusion. Ces parties engagent votre responsabilité scientifique.
  • Inventer des références, des citations ou des données. Vérifiez chaque source dans son document d’origine.
  • Fabriquer des données ou des images de résultats. Une figure générée par IA qui invente un résultat est interdite ; un graphique que vous produisez à partir de vos propres données et de votre code reste légitime. Reportez-vous à la politique de la revue visée : Elsevier, par exemple, interdit d’utiliser l’IA pour créer ou modifier des résultats dans les images, tout en autorisant des retouches basiques comme la luminosité.
  • Servir à dissimuler un usage. La transparence est la règle ; déclarez selon votre cours, votre université et la revue.

Checklist pour votre prochaine session

  • J’ai lu la charte IA de mon établissement et la consigne de l’enseignant.
  • Dans un outil grand public, je n’utilise que des fichiers synthétiques (fictifs).
  • Chaque donnée extraite est vérifiée dans sa source d’origine.
  • J’ai exécuté moi-même tout script et recalculé une valeur à la main.
  • J’ai noté où et comment j’ai utilisé l’IA, prêt à le déclarer.
  • Aucune référence citée que je n’ai pas lue.

Un accompagnement, pour les équipes qui en ont besoin

Ces trois tâches se font seul, avec un abonnement grand public. Si votre laboratoire, votre département ou votre cabinet veut aller plus loin, avec un assistant configuré, des règles de données convenues, des connecteurs autorisés au cas par cas et une étape d’approbation avant tout envoi, c’est le travail de MACCUS.

L’assistant passe par Telegram (texte, notes vocales, documents) en français, anglais et néerlandais ; les fichiers et la mémoire sont hébergés en France, avec une partie du traitement chez des fournisseurs situés aux États-Unis.

Ce n’est pas une solution tout-UE ni une garantie de conformité, et cela ne remplace ni le jugement scientifique ni la déclaration d’usage. Pour en parler à partir de votre propre organisation de travail : découvrir l’assistant MACCUS.

Pour commencer par une seule tâche et comprendre la logique de bout en bout, lisez le guide Utiliser l’IA dans votre métier. Si vous travaillez en indépendant à côté de vos études, le guide IA pour consultants et freelances reprend les mêmes méthodes côté missions.

Laisser un commentaire