IA et diagnostic médical en ligne : ce que disent vraiment les études
Les titres promettent des IA qui font mieux que les médecins. Les études, elles, disent quelque chose de plus nuancé et de plus utile : l’IA brille dans certaines conditions et se trompe dans d’autres. Voici ce qu’il faut savoir avant de demander un diagnostic à une IA en ligne.
L’étude qui a fait les titres
En 2025, Google a publié dans Nature une étude sur AMIE, un modèle conçu pour la conversation diagnostique. Sur 159 scénarios joués par des acteurs, en consultation écrite, AMIE a été jugé meilleur que 20 médecins généralistes sur presque tous les critères, précision diagnostique comprise Tu.
Deux précisions changent la lecture. Les patients étaient des acteurs suivant un scénario, pas des personnes malades. Et les médecins travaillaient par messagerie, ce qui n’est pas leur façon habituelle de consulter. Les auteurs le disent eux-mêmes : il faudra d’autres travaux avant un usage en conditions réelles.
Quand l’IA doit poser les questions, elle se trompe davantage
Une équipe de Harvard a testé plusieurs modèles connus (dont GPT-4) dans 12 spécialités, en conversation plutôt que sur des QCM. Tous perdent nettement en précision quand ils doivent eux-mêmes obtenir l’histoire du patient au fil d’un dialogue Johri. Autrement dit, ce qui fait la difficulté du diagnostic, ce n’est pas seulement de connaître les maladies : c’est de poser les bonnes questions.
Et les outils d’analyse de symptômes grand public ?
- 19 – 37,9 %de bons diagnostics pour les orienteurs de symptômes en ligne
- 48,8 – 90,1 %de bonnes orientations (urgence, médecin, attente)
Ces fourchettes viennent d’une revue de dix études Wallace. Une étude plus récente sur quatre outils connus montre qu’ils repèrent à peu près aussi bien que des généralistes les situations d’urgence, mais qu’ils envoient trop de patients aux urgences et ne recherchent pas la majorité des signes d’alerte Sutaria.
Enfin, sur 137 études consacrées aux agents conversationnels de santé, la plupart ne décrivent ni le modèle utilisé ni ses instructions Huo : beaucoup de résultats annoncés sont impossibles à vérifier.
Comment utiliser l’IA sans prendre de risque
- Servez-vous-en pour organiser ce que vous ressentez, pas pour obtenir un verdict.
- Méfiez-vous d’un outil qui vous donne un nom de maladie ou un traitement sans vous avoir posé de questions.
- Apportez le résumé à votre médecin : c’est lui qui fera l’examen et le diagnostic.
- Si un signe vous inquiète, n’attendez pas la réponse d’une IA.
C’est le choix fait par Dokto : l’agent mène l’interrogatoire, repère les signes de gravité et rédige une synthèse, mais il ne donne jamais de diagnostic ni de traitement.
Questions fréquentes
Une IA peut-elle poser un diagnostic médical en ligne ?
Certaines IA obtiennent de bons résultats sur des cas simulés, mais leur précision baisse quand elles doivent mener elles-mêmes la conversation, et les outils grand public trouvent le bon diagnostic dans moins de 4 cas sur 10. Un diagnostic nécessite un médecin qui peut vous examiner.
Quelle IA utiliser pour une question médicale ?
Préférez un outil qui vous pose des questions, recherche les signes de gravité, vous oriente vers le 15 si besoin, refuse de prescrire et vous remet un résumé à montrer à votre médecin.
L’IA fait-elle mieux que les médecins ?
Dans l’étude AMIE, oui, mais face à des acteurs et par messagerie écrite. Dans un essai où des médecins utilisaient une IA, leur raisonnement ne s’est pas amélioré. Les conditions réelles n’ont pas encore été testées à grande échelle.
Sources
Chaque référence a été vérifiée sur PubMed. La phrase sous chaque entrée dit ce que l’étude a mesuré, pas ce qu’on aimerait qu’elle dise.
- Tu T, Schaekermann M, Palepu A, et al. Towards conversational diagnostic artificial intelligence Nature. 2025;642(8067):442-450. PMID 40205050.Étude randomisée en double aveugle, 159 scénarios cliniques joués par des acteurs-patients en consultation écrite. Le système AMIE a été jugé supérieur aux médecins généralistes sur la quasi-totalité des axes évalués, précision diagnostique comprise — sur des patients simulés, pas sur des patients réels.Lire sur PubMed
- Johri S, Jeong J, Tran BA, et al. An evaluation framework for clinical use of large language models in patient interaction tasks Nat Med. 2025;31(1):77-86. PMID 39747685.Le cadre CRAFT-MD évalue les modèles de langage en conversation, et non sur des QCM, dans 12 spécialités. Les modèles testés perdent nettement en précision quand ils doivent recueillir eux-mêmes l’histoire du patient au fil d’un dialogue.Lire sur PubMed
- Wallace W, Chan C, Chidambaram S, et al. The diagnostic and triage accuracy of digital and online symptom checker tools: a systematic review npj Digit Med. 2022;5:118. PMID 35977992.Revue systématique de 10 études sur les orienteurs de symptômes grand public : précision diagnostique de 19 à 37,9 %, précision d’orientation de 48,8 à 90,1 %. Les auteurs concluent à un risque pour la sécurité des patients.Lire sur PubMed
- Sutaria S, Devakumar D, Mallinson P, et al. Evaluating the use of red flags by online symptom checkers BMC Health Serv Res. 2025;25(1):1263. PMID 41034962.Quatre orienteurs de symptômes grand public testés sur 51 vignettes cliniques : ils repèrent les urgences presque aussi bien que des médecins généralistes (76,9 % contre 85,7 %, différence non significative), mais ne recherchent pas la majorité des signes d’alerte attendus.Lire sur PubMed
- Huo B, Boyle A, Marfo N, et al. Large Language Models for Chatbot Health Advice Studies: A Systematic Review JAMA Netw Open. 2025;8(2):e2457879. PMID 39903463.137 études évaluant des agents conversationnels de santé : 99,3 % portent sur des modèles fermés, et la plupart ne décrivent ni le modèle ni les instructions utilisées. Une littérature abondante et, en l’état, largement irreproductible.Lire sur PubMed
À lire ensuite
Dokto est un outil de préparation de consultation : il ne pose aucun diagnostic, ne prescrit aucun traitement et ne remplace pas un avis médical. En cas d’urgence, appelez le 15 ou le 112 — voir aussi la page Urgences. Cet article n’a pas fait l’objet d’une relecture médicale individuelle.