
Les faits : un essai supervisé avant une visite urgente
L’étude publiée dans The Lancet a fait passer AMIE, le système conversationnel médical de Google, du scénario simulé à une clinique réelle. Cent adultes ont clavardé avec l’IA jusqu’à cinq jours avant une consultation pour un nouveau problème non urgent. Parmi eux, 98 se sont présentés au rendez-vous. Le médecin recevait ensuite la transcription et un résumé avant de voir la personne. Un autre médecin surveillait chaque conversation en direct et pouvait l’interrompre selon quatre critères de sécurité prédéfinis. Aucune interruption n’a été nécessaire. Ce résultat montre qu’un tel échange peut être mené dans un cadre de recherche étroitement contrôlé. Il ne prouve pas qu’un assistant médical autonome est sécuritaire. La supervision était continue, les participants avaient consenti à l’étude et le système ne remplaçait pas la consultation. Les chercheurs ont surtout mesuré la faisabilité, l’expérience, la qualité des listes de diagnostics possibles et des plans de prise en charge. Il s’agissait d’une étude prospective à un seul groupe, dans un seul centre, sans comparaison contrôlée avec le déroulement habituel d’une visite.
Le 90 % mesure une liste de sept possibilités
Le chiffre qui retient l’attention est 90 %. Huit semaines après la visite, une révision du dossier a établi un diagnostic final. AMIE avait inclus ce diagnostic quelque part dans sa liste de sept possibilités dans 90 % des cas. Lorsque la liste est limitée aux trois premières réponses, le taux descend à 75 %. Lorsque seule la première réponse compte, il tombe à 56 %. Ces trois nombres décrivent le même système, mais ils répondent à trois questions très différentes. Une liste large mesure surtout la capacité de ne pas oublier une possibilité. En clinique, cette qualité peut être utile pour éviter un angle mort. Elle crée aussi un coût : chaque hypothèse supplémentaire peut mener à des questions, à des tests, à une attente ou à une inquiétude. Dire que l’IA a trouvé le bon diagnostic dans 90 % des cas laisse facilement croire qu’elle a choisi correctement neuf fois sur dix. Le résultat publié dit plutôt qu’elle a gardé la bonne option dans un filet de sept choix neuf fois sur dix. Cette distinction devrait figurer dans tout résumé destiné au public ou à un décideur.
La bonne hypothèse ne garantit pas un bon plan
Des cliniciens indépendants ont évalué à l’aveugle les diagnostics différentiels et les plans de prise en charge d’AMIE et des médecins de première ligne. Ils n’ont pas trouvé de différence statistiquement significative dans la qualité globale des listes diagnostiques ni dans l’adéquation et la sécurité générales des plans. Les médecins ont toutefois obtenu de meilleurs résultats pour la praticabilité et le rapport coût-efficacité, avec des différences significatives rapportées par les chercheurs. Ce contraste compte davantage que le duel abstrait entre une IA et un médecin. AMIE n’avait pas accès au dossier médical électronique, ne pouvait pas examiner la personne et ne voyait ni son apparence générale ni d’autres signaux multimodaux. Les médecins connaissaient aussi les ressources et les habitudes de leur clinique. Une recommandation peut être médicalement plausible tout en demandant un test difficile à obtenir, une consultation inutile ou un suivi mal adapté. La valeur réelle dépend donc de la capacité à choisir une prochaine étape proportionnée, disponible et compréhensible, pas seulement de nommer la maladie possible.
Le meilleur rôle pourrait se trouver avant la consultation
Les médecins ont jugé que les résumés les aidaient à se préparer dans 75 % des cas, selon Google, et qu’ils influençaient leur approche dans plus de la moitié des visites. Les entrevues rapportées par l’équipe suggèrent un changement intéressant : le rendez-vous pouvait commencer par vérifier l’information plutôt que par la recueillir depuis le début. C’est peut-être le signal le plus utile de l’étude, car il place l’IA dans une tâche de préparation révisable plutôt que dans la décision finale. Cette interprétation reste une hypothèse. L’étude n’a pas comparé aléatoirement des visites avec et sans AMIE. Elle ne permet donc pas d’affirmer que les consultations ont été plus courtes, que les soins ont coûté moins cher ou que les patients ont obtenu de meilleurs résultats. Elle ne comptabilise pas non plus l’effort d’un médecin consacré à la surveillance en direct de chaque conversation. Pour mesurer un gain net, un prochain essai devrait additionner le temps économisé pendant la visite, le temps de révision, les alertes inutiles, les examens supplémentaires et le travail requis lorsqu’un résumé est incomplet.
Au Québec, acheter la métrique qui correspond au besoin
Une clinique québécoise qui évalue un outil semblable devrait d’abord définir sa tâche. Pour préparer une rencontre, elle peut mesurer les faits importants manqués, le temps de révision du résumé et la proportion de corrections apportées par le personnel. Pour aider au triage, elle doit suivre les cas urgents sous-estimés, les orientations inutiles et les écarts selon la langue, l’âge et la littératie en santé. Pour suggérer des examens, elle doit mesurer les coûts, les délais et les conséquences des faux signaux. Un score de rappel sur sept diagnostics ne remplace aucune de ces mesures. L’échantillon de cette étude provenait d’un centre universitaire et comptait proportionnellement plus de jeunes que l’ensemble des 1 452 visites urgentes observées pendant la période. L’interface était uniquement textuelle et un médecin surveillait tout en direct. Mon interprétation est que le résultat soutient un essai prudent de collecte d’information avant la visite, avec consentement et révision clinique. Il ne soutient pas encore un déploiement autonome ni une promesse de productivité. La leçon dépasse la santé : avant d’acheter une IA, il faut demander ce que le pourcentage compte, combien d’options il permet et quel travail humain reste caché autour du score.





