Pour ne rien manquer

Tutoriels

Comparer deux assistants IA à l’aveugle avec 20 cas

Une démonstration impressionnante ne dit pas quel assistant convient le mieux à votre travail. Ce test à l’aveugle compare deux outils avec les mêmes cas et une grille décidée d’avance.

Par Le Journal IAPublié le 7 min de lectureMis à jour le
Illustration générée par IA : une coordonnatrice de centre communautaire, vue de dos, évalue à l’aveugle les réponses affichées sur deux tablettes identiques à l’aide d’une grille papier.

Commencer par une décision réelle, pas par une impression générale

Un bon test répond à une question de travail précise. Évitez de demander quel assistant est le plus intelligent. Demandez plutôt lequel prépare les réponses les plus utiles pour classer des demandes de service, résumer des comptes rendus ou extraire les conditions d’une politique. Choisissez une tâche assez fréquente pour mériter l’effort et assez limitée pour être vérifiée par une personne qui connaît le dossier. Rassemblez ensuite 20 cas représentatifs. Ce nombre ne produit pas une étude scientifique, mais il suffit souvent pour révéler des erreurs répétées. Incluez des cas simples, des cas ambigus et trois ou quatre pièges connus : une information absente, une date contradictoire, une demande hors sujet ou une consigne qui devrait mener à un refus. Retirez les renseignements personnels et remplacez-les par des données fictives. Conservez à part la bonne réponse, les éléments obligatoires et les erreurs graves pour chaque cas. Cette fiche devient votre référence. Sans elle, l’évaluation risque de récompenser la réponse la plus élégante plutôt que la plus juste.

Donner exactement les mêmes conditions aux deux assistants

Préparez une seule consigne de départ. Elle doit expliquer le rôle attendu, le format de sortie, les documents permis et la conduite à suivre lorsqu’une information manque. Copiez cette consigne sans l’améliorer entre les essais. Si un outil reçoit trois exemples et l’autre aucun, vous comparez deux configurations différentes plutôt que deux assistants. Notez aussi la version du modèle, la date, les fonctions activées et les documents fournis. Lancez chaque cas dans une nouvelle conversation afin qu’une réponse précédente n’influence pas la suivante. Utilisez les mêmes pièces jointes et le même ordre. Si l’un des outils permet un réglage de créativité, choisissez une valeur stable et inscrivez-la. Mesurez le temps du début de la demande jusqu’à l’obtention d’une réponse exploitable, mais ne confondez pas vitesse et qualité. Un résultat livré en cinq secondes peut coûter dix minutes de correction. Copiez chaque sortie dans un dossier de test et remplacez le nom de l’outil par un code aléatoire. Une autre personne devrait pouvoir lire les réponses sans savoir qui les a produites.

Construire la grille avant d’ouvrir les réponses

Choisissez quatre ou cinq critères directement liés au risque. Pour une réponse de service, la grille pourrait noter l’exactitude des faits, le respect de la politique, la présence d’une prochaine étape, la clarté et la protection des renseignements. Donnez plus de poids aux critères essentiels. Une réponse agréable qui invente une condition de remboursement devrait perdre beaucoup plus de points qu’une réponse correcte comportant une phrase maladroite. Définissez chaque note avec des mots observables. Par exemple, deux points pour tous les faits conformes à la référence, un point pour un fait incomplet sans conséquence majeure et zéro pour une invention ou une contradiction. Ajoutez une case éliminatoire pour les erreurs qui rendent la sortie inutilisable : divulgation d’un renseignement, conseil dangereux, montant inventé ou refus d’admettre qu’une donnée manque. Prévoyez enfin une colonne pour le temps de correction humaine. Demandez à l’évaluateur d’estimer les minutes nécessaires, puis vérifiez cette estimation sur quelques réponses. Cette mesure transforme une préférence de style en coût opérationnel plus concret.

Évaluer à l’aveugle et examiner les désaccords

Mélangez les 40 réponses et faites-les noter sans afficher le nom de l’assistant. Idéalement, deux personnes évaluent au moins la moitié des cas. Elles ne doivent pas discuter avant d’avoir remis leur première note. Comparez ensuite leurs résultats. Un désaccord important indique souvent que le critère est trop vague ou que la bonne réponse n’a pas été assez bien définie. Corrigez la grille, puis réévaluez les cas concernés de la même manière pour les deux outils. Regardez la distribution plutôt que la seule moyenne. Un assistant peut obtenir une bonne note générale tout en échouant aux trois cas les plus risqués. Comptez les erreurs éliminatoires, les réponses qui nécessitent une reprise complète et les cas où l’outil reconnaît honnêtement une information absente. Notez aussi la stabilité : si une même demande répétée trois fois produit des conclusions incompatibles, cette variation doit peser dans la décision. Lorsque la notation est terminée, révélez les codes. L’écart entre votre intuition de départ et le résultat à l’aveugle est lui-même une information utile.

Choisir une configuration et prévoir un nouveau test

Le gagnant n’est pas nécessairement l’assistant qui obtient le plus de points partout. Vous pouvez choisir l’outil le plus fiable pour les tâches à risque et garder un autre outil pour les brouillons peu sensibles. Calculez un coût par dossier en additionnant le prix d’utilisation, le temps de vérification et le temps de correction. Documentez les cas où une personne doit obligatoirement reprendre le contrôle. Une règle simple pourrait exiger une révision complète dès qu’un montant, un engagement, un diagnostic ou un renseignement personnel apparaît. Conservez la consigne, les 20 cas, la référence, la grille et les résultats dans un dossier daté. Ce petit jeu étalon permet de refaire le test après une mise à jour du modèle, un changement de prix ou l’ajout d’une nouvelle source documentaire. Il ne prouve pas qu’un assistant sera fiable dans toutes les situations. Vingt cas reflètent seulement le travail que vous avez choisi de représenter, et une évaluation humaine peut comporter ses propres biais. Le test sert à prendre une décision mieux informée, à rendre les erreurs visibles et à remplacer la préférence pour une marque par des preuves liées à votre propre contexte.

Ce tutoriel original du Journal IA présente une méthode pratique d’évaluation comparative. Le seuil de 20 cas sert à constituer un premier jeu étalon et ne représente pas une validation scientifique. Les exemples sont fictifs. Une IA a aidé à structurer et réviser le texte, puis la rédaction a vérifié les étapes, les calculs et les limites.

Notre démarche éditoriale · Signaler une erreur

Pour poursuivre