PharmAssistant 98 %, les modèles de pointe 48 % au mieux
Benchmark · 31 juillet 2026 · Johan Natter, docteur en pharmacie et en chimie médicinale · 7 min de lecture
Claude Sonnet 5, GPT-5.6 Luna et Grok 4.3 sont ce qui se fait de mieux aujourd'hui. Avec leur recherche internet, sur 200 questions de comptoir, le meilleur des six systèmes testés en réussit 48 %. PharmAssistant en réussit 98 %.
1Trois modèles de pointe, trois modèles grand public, une seule règle
Depuis notre dernier comparatif, deux modèles de tout premier plan sont arrivés : Claude Sonnet 5 et GPT-5.6 Luna. Avec Grok 4.3, ce sont les trois modèles de pointe du moment : ils raisonnent mieux que leurs prédécesseurs, ils citent leurs sources, ils écrivent mieux que nous. Nous les avons ajoutés aux trois modèles grand public déjà mesurés en juin, Mistral large, ChatGPT gpt-5.4-mini et Gemini 2.5-flash, qui ne jouent pas dans la même catégorie et qu'on retrouve pourtant au même niveau.
Chacun a reçu les mêmes 200 questions de comptoir, dans les mêmes conditions : recherche internet en direct, exactement comme un pharmacien les utiliserait dans son application de chat. Les 1 400 réponses ont été lues et jugées une par une, à la main, contre la source officielle française qui fait foi.
La règle est la même pour tous, PharmAssistant compris : la réponse est juste ou fausse, sans catégorie intermédiaire. Une valeur voisine compte faux. Une réponse « au cas par cas » compte faux. Un refus de répondre compte faux, parce qu'au comptoir l'abstention ne rend pas le service demandé.
2Le résultat
| Système | Réponses justes | |
|---|---|---|
| PharmAssistant | 197 / 200 | 98 % |
| Grok 4.3 + recherche web | 97 / 200 | 48 % |
| Mistral large + recherche web | 79 / 200 | 40 % |
| ChatGPT gpt-5.4-mini + recherche web | 79 / 200 | 40 % |
| Claude Sonnet 5 + recherche web | 76 / 200 | 38 % |
| GPT-5.6 Luna + recherche web | 63 / 200 | 32 % |
| Gemini 2.5-flash + recherche web | 63 / 200 | 32 % |
Aucun des six ne franchit la barre des 50 %, et le classement réserve une surprise : les deux modèles de pointe les plus récents, Claude Sonnet 5 et GPT-5.6 Luna, arrivent derrière des modèles plus anciens et plus légers. Non parce qu'ils raisonnent moins bien, mais parce qu'ils sont plus prudents : ils s'abstiennent plus souvent, et au comptoir une abstention ne rend pas le service demandé.
La méthode complète est détaillée sur la page du benchmark, et le jeu des 200 questions est publié en entier.
3Ce qu'ils ratent est toujours de la même nature
Ce ne sont pas des questions pièges ni des colles de pharmacologie. Ce sont des questions de comptoir dont la réponse est une valeur exacte, écrite dans un référentiel français, et que le web ouvert ne rend pas.
« Le méloxicam chez le sujet âgé : la liste européenne des médicaments potentiellement inappropriés donne-t-elle une dose maximale ? »
Attendu : Oui, et c'est une valeur inhabituelle : la liste EU(7)-PIM retient 11 mg par jour.
Réponse du modèle seul : Deux modèles annoncent 7,5 mg par jour au nom de cette liste, une valeur qu'elle ne contient pas. Les quatre autres affirment qu'elle ne donne aucune dose. Aucun des six ne trouve la bonne.
Source de référence : Liste EU(7)-PIM
« J'ai du Di-hydan et du Diphante, deux comprimés de phénytoïne 100 mg. Je peux les écraser tous les deux pour une sonde ? »
Attendu : Non : la liste nationale donne deux réponses opposées pour la même molécule au même dosage. Di-hydan, écrasement possible. Diphante, écrasement à ne pas faire.
Réponse du modèle seul : Six modèles sur six passent à côté de la divergence : deux inversent le sens, un affirme que les deux s'écrasent, un confond le Diphante avec une spécialité belge.
Source de référence : Liste nationale de l'écrasement des comprimés (OMéDIT Normandie et SFPC)
« Un éleveur a traité ses porcs au Flunixyl. Quel délai d'attente avant l'abattage ? »
Attendu : 24 jours chez le porc, quand il n'est que de 4 jours chez le bovin pour le même flacon.
Réponse du modèle seul : Trois valeurs différentes et fausses circulent chez les modèles interrogés : 10, 22 et 28 jours. Sur un délai d'attente, un chiffre faux, c'est de la viande retirée de la chaîne alimentaire ou, pire, qui n'y est pas retirée.
Source de référence : Base des médicaments vétérinaires autorisés en France (ANSES-ANMV)
« Un monsieur de 79 ans, DFG à 42, veut de l'ibuprofène pour son genou. Le référentiel gériatrique fixe un seuil ? »
Attendu : Oui : le critère STOPP vise les AINS dès que le DFG estimé passe sous 50 ml/min. Ce patient est sous le seuil.
Réponse du modèle seul : Un modèle annonce 60 ml/min « selon les référentiels gériatriques ». Trois autres affirment qu'aucun seuil chiffré n'existe. La bonne réponse existe, elle est écrite, elle ne circule simplement pas sur le web.
Source de référence : Critères STOPP/START version 3
Le point commun de ces quatre erreurs : elles sont affirmées avec aplomb, souvent en citant une source officielle, et rien dans la réponse ne permet au pharmacien de les repérer. Une erreur qui se voit fait perdre du temps. Une erreur qui ne se voit pas engage la délivrance.
4Pourquoi l'écart, alors que les modèles sont excellents
Parce que le problème n'est pas l'intelligence du modèle : c'est ce qu'il a sous la main. Un moteur de recherche généraliste ramène des pages, et beaucoup des valeurs dont un pharmacien a besoin ne sont pas sur une page : elles sont dans l'annexe intégrale d'un référentiel, dans une colonne d'un tableau réglementaire, dans une fiche produit par marque.
- PharmAssistant interroge la base, pas le web : 45 outils métier branchés en direct sur les référentiels officiels français, du thésaurus des interactions à la base vétérinaire de l'ANSES, du répertoire des génériques aux critères gériatriques.
- La réponse est construite sur la valeur renvoyée, avec la source citée sous la réponse, vérifiable en un clic.
- Elle est reproductible : la même question interroge la même base et rend la même valeur. Une donnée qui change d'un appel à l'autre n'est pas une donnée.
Le même modèle, avec et sans nos outils
Nous avons isolé la cause sur une autre mesure : GPT-5.6 seul avec sa recherche web réussit 33 questions sur 100. Le même modèle branché sur nos outils en réussit 91.
Ce n'est donc pas le moteur de langage qui fait la différence, c'est l'accès aux sources. Le détail de cette mesure est ici.
5Vérifiez par vous-même
Nous ne demandons à personne de nous croire sur parole. Les 200 questions sont publiées en entier, chacune avec sa réponse de référence, la source officielle qui l'établit et l'erreur réellement observée. Y compris les trois questions où PharmAssistant se trompe : elles sont dans le jeu, telles quelles.
Le comparatif complet et sa méthode · les 200 questions · l'essai sans inscription · 7 jours d'essai complet.
Le plus simple reste encore de poser votre propre question, celle qui vous a fait perdre dix minutes hier au comptoir. Une réponse de référence vous paraît contestable ? Écrivez-nous à contact@pharmassistant.fr, nous corrigerons publiquement.

