Pourquoi une seule réponse de ChatGPT ne prouve rien
Les IA ne répondent jamais deux fois pareil. Comment mesurer la visibilité d’une marque avec plusieurs passages et des intervalles de confiance.
Par Sébastien Monnier · · 6 min de lecture · Read in English
Posez à ChatGPT la question « quel est le meilleur plombier à Lille ? ». Notez les entreprises citées. Reposez exactement la même question. Il y a de bonnes chances que la liste change.
Ce n’est pas un bug : les modèles de langage génèrent leurs réponses de façon probabiliste. Pour un outil de mesure, cela a une conséquence simple et souvent ignorée : une seule réponse ne prouve rien.
Le piège du score sur une réponse
Imaginons un outil qui pose une fois la question et affiche : « Votre client est cité ✅ ». La semaine suivante : « Votre client n’est plus cité ❌ ». A-t-il perdu en visibilité ? Peut-être. Ou peut-être que les deux mesures sont simplement deux tirages d’un même hasard.
Avec une seule réponse, impossible de distinguer une tendance d’une fluctuation. Et un rapport client qui alterne alertes et bonnes nouvelles au gré du hasard finit par ne plus être lu.
La solution : plusieurs passages et une marge d’erreur
Il faut raisonner comme un sondage :
- Poser chaque question plusieurs fois à chaque moteur, sur la même période.
- Compter dans combien de réponses l’entreprise est mentionnée.
- Calculer un intervalle de confiance autour du taux observé.
Un intervalle de confiance à 95 % donne la plage dans laquelle se situe très probablement la vraie probabilité d’être cité. Pour des proportions calculées sur de petits échantillons, la méthode recommandée est l’intervalle de Wilson : contrairement à l’approximation « taux ± 2 écarts-types » apprise à l’école, il reste toujours entre 0 et 100 % et se comporte bien quand le taux est proche de 0 ou de 100 %.
Ce que ça donne en pratique
| Mentionnée dans… | Taux observé | Intervalle de Wilson à 95 % |
|---|---|---|
| 1 réponse sur 3 | 33 % | 6 % – 79 % |
| 5 réponses sur 15 | 33 % | 15 % – 58 % |
| 20 réponses sur 60 | 33 % | 23 % – 46 % |
Le même taux de 33 % n’a pas du tout la même valeur selon le nombre de réponses. Avec 3 réponses, la vraie valeur peut être n’importe où entre « presque jamais » et « presque toujours ». Avec 60, on sait de quoi on parle.
C’est pour cela que les chiffres de Recoia sont calculés sur plusieurs questions × plusieurs passages × plusieurs moteurs, et toujours affichés avec leur intervalle.
Des alertes qui ont du sens
L’intervalle sert aussi à décider quand alerter. Règle simple : on ne signale une baisse que si la nouvelle mesure sort nettement de l’intervalle de la précédente. Les fluctuations normales ne déclenchent rien ; les vraies ruptures (mise à jour d’un modèle, nouveau concurrent, page supprimée) ressortent immédiatement.
Et le coût ?
Poser chaque question trois fois triple la facture… sauf si l’on mutualise. Une même question normalisée, pour un même moteur, une même langue et une même zone, peut être exécutée une seule fois par période et servir à toutes les entreprises concernées. C’est le principe des panels de Recoia : plus de rigueur, pour un coût par audit plus bas.
À retenir
- Une réponse d’IA est un tirage, pas une mesure.
- Il faut plusieurs passages et un intervalle de confiance (Wilson) pour conclure.
- Afficher la marge d’erreur n’affaiblit pas un rapport : cela le rend crédible.
Pour le détail de notre méthode, consultez la page Méthodologie.