Benchmark : exactitude vs modèles grand public

200 questions de comptoir · sept systèmes · campagne du 31 juillet 2026 · concurrents équipés d'une recherche web en direct · 1 400 réponses jugées une par une contre les sources officielles françaises

1Ce que nous avons mesuré

Un assistant qui « répond bien » ne suffit pas à l'officine : il doit répondre juste, sur la bonne valeur, de façon traçable. Nous avons donc comparé PharmAssistant à des modèles d'IA grand public sur 200 questions telles qu'un pharmacien les pose réellement au comptoir, dont beaucoup portent sur une valeur exacte et à jour (rupture d'un médicament en direct, code de remboursement d'un dispositif, statut de commercialisation d'un générique, niveau précis d'une interaction, remboursement paru au Journal officiel) : c'est là que les modèles à simple accès web décrochent le plus, en inventant une valeur plausible mais fausse.

ModèleVersion testéeRéponses exactes
PharmAssistantoutils métier197 / 20098 %
Grokgrok-4.397 / 20048 %
Mistralmistral-large79 / 20040 %
ChatGPTgpt-5.4-mini79 / 20040 %
Claudesonnet-576 / 20038 %
ChatGPTgpt-5.6-luna63 / 20032 %
Geminigemini-2.5-flash63 / 20032 %

Les réponses de PharmAssistant sont la valeur exacte renvoyée par ses outils métier, qui interrogent directement les bases officielles de référence (interactions, risque cardiaque, génériques, disponibilités, grossesse, adaptation rénale, bilan de médication du sujet âgé, remboursements…), avec la source citée. Ses 3 points perdus sont des erreurs franches, conservées telles quelles dans le jeu publié. Chaque modèle grand public produit des dizaines de valeurs inventées affirmées avec assurance (codes, taux, dates, seuils, niveaux) ; PharmAssistant n'invente ni produit ni valeur.

2Comment le test est mené

  • Questions réalistes : formulées comme au comptoir, courtes, parfois avec abréviations ou fautes, sans jamais indiquer la source à consulter (le modèle doit la trouver seul).
  • Conditions réelles d'usage : les modèles grand public sont testés avec un accès web en direct, exactement comme un pharmacien les utiliserait dans leur application de chat. PharmAssistant dispose lui aussi du web, mais surtout d'outils métier dédiés qui interrogent directement les bases officielles et en ramènent la valeur exacte : c'est là toute la différence.
  • Vérification manuelle, même règle pour tous : chaque réponse est comparée à une vérité-terrain relevée dans la source officielle, puis jugée juste ou fausse, sans catégorie intermédiaire et sans exception pour PharmAssistant. Une valeur voisine compte faux, une réponse « au cas par cas » compte faux, et un refus de répondre compte faux : au comptoir, l'abstention ne rend pas le service demandé. Quand la question porte sur une catégorie (risque de torsades, niveau d'une contre-indication), la catégorie doit être nommée.
  • Une vérité-terrain plus solide que les réponses : quand deux référentiels divergent et que la bonne réponse dépend de celui qu'on interroge, la question est retirée du jeu plutôt que comptée contre les modèles. Sept questions ont été écartées à ce titre pendant la campagne.
  • Couverture large : écrasement et ouverture des formes orales, interactions médicamenteuses, répertoire des génériques, codes LPP, bilan de médication du sujet âgé, prix et remboursement par présentation, recommandations aux voyageurs, médicament vétérinaire, adaptation à la fonction rénale, risque cardiaque (QT), grossesse et allaitement, calendrier vaccinal, phytothérapie, homéopathie, hépatotoxicité.

Honnêteté du protocole

Les modèles grand public ne sont pas mauvais : avec le web, le meilleur d'entre eux répond correctement à près d'une question sur deux. L'enjeu n'est pas leur moyenne, mais leurs erreurs, confiantes et impossibles à repérer pour qui pose la question.

200questions

Le jeu de test complet est public

Questions, réponses attendues et sources officielles : chacun peut le rejouer sur le modèle de son choix et vérifier nos résultats.

3Des questions, ce qu'on attendait, là où ils se trompent

« est-ce que le Tentin est remboursé ? »

Attendu : Non : le Tentin (dexamfétamine) n'est inscrit sur aucun arrêté de remboursement au Journal officiel.

Erreur observée : Un modèle a répondu « oui, remboursé à 30 % » en citant une base officielle, un taux purement inventé.

« le Mounjaro est remboursé ? à quelles conditions ? »

Attendu : Oui, depuis les arrêtés de mai et juin 2026 : dans le diabète de type 2, et dans l'obésité sous conditions strictes (IMC ≥ 40, ou ≥ 35 avec comorbidité, primo-prescription par un médecin rattaché à un centre spécialisé de l'obésité).

Erreur observée : Un modèle a nié le remboursement dans le diabète et annoncé un remboursement « pour maigrir » sans aucune des conditions exigées, ancré à une date de connaissance dépassée.

« le doliprane a un générique ? »

Attendu : Non : le paracétamol seul (Doliprane) ne figure dans aucun groupe générique du répertoire ; il n'est pas substituable.

Erreur observée : Les quatre modèles ont répondu « oui, des génériques de paracétamol existent », en confondant disponibilité et groupe substituable.

« dompéridone et risque de torsades de pointes, c'est classé comment ? »

Attendu : Risque avéré : la catégorie de risque la plus élevée du référentiel international sur le QT (le médicament allonge le QT et expose aux torsades même à dose correcte).

Erreur observée : Aucun des quatre modèles ne nomme la catégorie exacte : ils disent « peut allonger le QT » sans classer le risque (0 sur 7 questions QT).

« code LPP d'une chambre d'inhalation pour un enfant asthmatique ? »

Attendu : Un code de remboursement en vigueur, vérifiable dans la nomenclature officielle des produits remboursables (la prise en charge dépend de l'âge).

Erreur observée : Un modèle a inventé un code (1128423) et un taux de remboursement ; aucun ne donne le code en vigueur de façon fiable.

« allopurinol et azathioprine ensemble, c'est ok ? »

Attendu : Non : contre-indication formelle (risque d'insuffisance médullaire grave).

Erreur observée : Des modèles l'ont rétrogradée en simple « association déconseillée », un niveau de contrainte inférieur.

Aucun modèle n'est fiable partout : le meilleur sur l'actualité réglementaire est faible sur le niveau exact d'une interaction ; le meilleur en moyenne reste figé à une date de connaissance dépassée. Chacun se trompe ailleurs, et toujours avec assurance.

4Le point le plus inquiétant : l'instabilité

En posant deux fois les mêmes questions au même modèle (ChatGPT), nous avons obtenu des réponses différentes sur 7 questions : pas des reformulations, mais des valeurs exactes opposées.

Exemple vécu avec ChatGPT (gpt-5.4-mini)

Sur la catégorie de risque cardiaque de plusieurs médicaments, d'un appel à l'autre :

  • la dompéridone est passée de « risque avéré » (correct) à « risque conditionnel » (faux) ;
  • l'ondansétron de « risque avéré » (correct) à « risque possible » (faux) ;
  • l'hydroxyzine de « risque conditionnel » (correct) à « risque avéré » (faux).

Même chose sur la substituabilité d'un générique ou le niveau d'une contre-indication : la réponse change d'une fois sur l'autre.

Pour un pharmacien, une donnée qui change d'un appel au suivant n'est pas une donnée. PharmAssistant est déterministe : la même question interroge le même outil et renvoie la même valeur exacte, avec sa source, vérifiable, opposable et reproductible.

5Deuxième mesure : le même modèle, avec et sans nos outils

Le tableau de la section 1 compare des systèmes différents. On peut donc lui opposer une objection légitime : l'écart vient-il des outils métier, ou simplement du modèle de langage employé ? Une seconde expérience, menée fin juillet 2026 sur un autre jeu de 100 questions, tranche en neutralisant le modèle. GPT-5.6 Luna, mêmes questions, même jour, deux situations : seul avec sa recherche web Google, puis branché sur les binaires métier de PharmAssistant, sans rien changer d'autre.

ConfigurationRéponses justes
PharmAssistant, la configuration que reçoivent nos abonnés97 / 100
GPT-5.6 Luna branché sur les outils métier de PharmAssistant91 / 100
GPT-5.6 Luna seul, avec sa recherche web33 / 100

33 devient 91 sans changer une ligne du modèle

Le même moteur de langage, les mêmes questions, la même journée : seul l'accès aux sources change. Ce que l'expérience isole n'est donc pas l'intelligence du modèle, c'est ce qu'il a sous la main. Les 6 points qui séparent 91 de 97 relèvent du reste du moteur (routage des outils, prompts, restitution) ; les 58 points qui séparent 33 de 91 relèvent des outils eux-mêmes.

Conditions à connaître avant de comparer les deux tableaux : ce jeu de 100 questions est distinct de celui des 200 questions, il porte principalement sur la donnée de référence française (remboursement présentation par présentation, écrasement des comprimés, groupes génériques, calendrier vaccinal, délivrance vétérinaire, fonction rénale), et trois questions où PharmAssistant se trompe y sont conservées telles quelles. Les deux mesures ne s'additionnent pas et ne se remplacent pas : la première compare des systèmes, la seconde établit la cause de l'écart.

Le détail, trois exemples de réponses fausses reprises mot pour mot et le jeu complet en téléchargement : l'article qui rend compte de cette mesure (jeu de questions en JSON et en Markdown).

6Limites assumées

  • Échantillon de démonstration, pas une étude statistique exhaustive. Le jeu privilégie volontairement les questions où l'exactitude engage le plus (valeurs officielles, listes vivantes), plutôt que des questions « moyennes » de comptoir.
  • Évaluation par un relecteur unique ; les réponses brutes sont conservées pour contrôle.
  • Un passage par modèle : le non-déterminisme observé invite à moyenner plusieurs essais.
  • Certaines questions reposent sur des listes mises à jour en continu (ruptures d'approvisionnement, remboursements) : la vérité-terrain est celle du jour du test et certaines disponibilités de produits ont pu évoluer depuis. Les questions de rupture, non rejouables, sont exclues du panel publié.
  • Gemini a été évalué sur sa version flash (2.5), réflexion minimale, les versions pro de l'API étant fréquemment indisponibles au moment du test.
  • Claude Sonnet 5 et GPT-5.6 Luna ont été interrogés par la passerelle OpenRouter avec un budget de réflexion bas, une configuration économique et non la plus favorable à ces deux modèles ; ChatGPT l'a été par la même passerelle sur une partie du jeu.