Marketing et communication

AB test : la methode simple pour booster vos conversions

Un AB test mal mené transforme du bruit statistique en fausses victoires. Découvrez les pièges qui font mentir vos chiffres et comment les éviter.

AB test : la methode simple pour booster vos conversions

La première fois que j'ai lancé un AB test sérieux, j'ai cru que j'allais tout comprendre en trois jours. Résultat : au bout de trois jours, j'avais "gagné" 40 % de conversions sur ma page d'inscription. J'étais fou de joie. Sauf que la semaine suivante, le gain avait disparu. Envolé. Je venais d'inventer, à mon insu, une technique très répandue : regarder les chiffres trop tôt et prendre du bruit pour un signal.

Un AB test, dans son principe, c'est bête comme chou : vous montrez deux versions d'une même page à deux groupes de visiteurs tirés au hasard, vous mesurez laquelle convertit le mieux, et vous gardez la gagnante. Dans la pratique, c'est un piège statistique qui se referme sur à peu près tous ceux qui débutent. Y compris sur moi, plusieurs fois.

Points clés à retenir

  • Un AB test compare deux variantes qui ne diffèrent que par un seul élément. Dès que vous en changez deux, vous ne savez plus ce qui a produit l'effet.
  • Sans taille d'échantillon calculée à l'avance, vous lirez du hasard et vous appellerez ça un résultat.
  • Le RGPD s'applique aux tests AB dès qu'ils reposent sur du tracking individuel : consentement, base légale, durée de conservation.
  • Arrêter un test "quand ça devient significatif" est la façon la plus rapide de se mentir à soi-même.
  • Les outils ne font pas le travail à votre place : ils calculent, ils ne décident pas ce qu'il faut tester.

AB test : la définition qu'on vous donne est incomplète

Vous trouverez partout la même phrase : "technique qui compare deux versions d'une page web pour voir laquelle performe le mieux". C'est vrai, mais ça cache l'essentiel. Un AB test n'est pas un outil de design. C'est un protocole expérimental avec des règles strictes, et si vous en violez une seule, tout ce que vous en tirez est faux.

Ce qu'un AB test exige vraiment

Trois conditions, dans cet ordre :

  1. Une seule variable qui change entre A et B. Pas "le titre, la couleur du bouton et l'image", sinon vous ne saurez jamais laquelle a fait bouger le chiffre.
  2. Une répartition aléatoire des visiteurs entre les deux versions. Si vous envoyez les nouveaux visiteurs sur A et les habitués sur B, vous ne mesurez pas l'effet de la variante, vous mesurez l'effet du profil.
  3. Une hypothèse écrite avant de lancer. "Je pense que remplacer 'Inscrivez-vous' par 'Commencer gratuitement' augmentera le taux d'inscription de X points, parce que…". Si vous n'écrivez pas ça avant, vous rationaliserez n'importe quel résultat après coup.

Sans le point 3, vous faites ce que j'appelle du p-hacking avec un dashboard. C'est-à-dire chercher une histoire dans des chiffres qui n'en racontent aucune.

Combien de temps doit durer un test, au minimum ?

La règle empirique que j'applique depuis quelques années, et qui m'a coûté moins de faux positifs : attendre au moins deux cycles hebdomadaires complets, soit 14 jours, avant de regarder la significativité. Pourquoi deux ? Parce que le comportement du lundi n'est pas celui du samedi. Un test arrêté au bout de 4 jours capture un micro-pic lié au jour de la semaine, pas à votre variante.

Si à 14 jours vous n'avez toujours pas de signal, deux possibilités : soit l'effet est nul, soit votre échantillon est trop petit pour le détecter. On y revient juste après.

Les erreurs qui tuent un AB test (et que j'ai toutes commises)

Le site AB Tasty publie régulièrement des listes de "7 erreurs fréquentes". Elles existent, elles sont réelles, mais leur énoncé reste souvent abstrait. Je vais vous raconter les miennes, avec les chiffres.

Les erreurs qui tuent un AB test (et que j'ai toutes commises)

L'arrêt prématuré : l'erreur numéro un

Mon premier test, donc, s'est arrêté au jour 3 sur un "gain" de 40 %. J'ai déployé. La semaine suivante, la variante B était strictement au même niveau que A. Voire légèrement en dessous. Explication : avec un échantillon de ~600 visiteurs, l'intervalle de confiance était tellement large qu'il contenait à peu près n'importe quel résultat. J'avais lu un frémissement, j'y avais vu une tendance.

Le réflexe correctif est simple mais douloureux : calculer la taille d'échantillon nécessaire AVANT de lancer. Tant que vous ne l'avez pas atteinte, vous ne regardez pas le dashboard. Vous pouvez le mettre en marque-page, mais vous n'y touchez pas.

Le test à deux variables déguisé

Deuxième erreur, plus sournoise. Je voulais tester un nouveau titre de page produit. En préparant la variante, j'ai aussi "légèrement" agrandi le bouton d'achat et changé la couleur. Franchement, la nouvelle version était plus jolie. Et elle a gagné. De 12 %. Sauf que je n'ai jamais su pourquoi. Le titre ? La couleur ? La taille ? Impossible à dire. J'ai passé trois semaines à reproduire le test en isolant chaque élément, un par un.

Leçon : un AB test one-shot qui change plusieurs choses vous coûte, au final, plus de temps qu'une série de tests propres.

Segmenter après coup pour sauver un test raté

Et là, la plus vicieuse. Vous lancez un test. À J+14 : aucune différence. Alors vous creusez. "Et si je regardais uniquement les visiteurs mobiles ? Ah, tiens, +18 % !". Sauf que si vous découpez un échantillon global en six sous-populations, vous finirez statistiquement par trouver un sous-groupe qui "gagne". C'est de la pêche au faux positif.

Si vous voulez tester sur mobile, vous le décidez avant, vous dimensionnez l'échantillon pour ce segment, et vous l'assumez. Après, c'est trop tard.

Taille d'échantillon et puissance statistique : le calcul qu'on esquive

Aucun des articles que j'ai lus au début n'expliquait de façon utilisable la mécanique statistique. Voici ce que j'aurais aimé lire.

Les trois paramètres dont dépend votre test

  • Le taux de conversion de base de votre page actuelle. Si c'est 2 %, tester un gain de 0,5 point demande énormément de trafic. Si c'est 30 %, c'est beaucoup plus rapide.
  • L'effet minimum détectable (MDE), c'est-à-dire le plus petit écart que vous voulez pouvoir repérer. Viser 5 % relatif quand votre taux est de 2 % est irréaliste sur un petit site. Viser 30 % relatif est souvent plus honnête.
  • La puissance statistique souhaitée : en pratique, on vise 80 % (la probabilité de détecter l'effet s'il existe vraiment) et un seuil de significativité de 5 %.

Concrètement : sur une page à 2 % de conversion, détecter un gain de 10 % relatif (donc passer à 2,2 %) demande plusieurs dizaines de milliers de visiteurs par variante. Si vous avez 500 visiteurs par semaine, faites le calcul. C'est impossible. La bonne réponse n'est alors pas "lancer le test quand même", c'est ne pas lancer ce test et chercher un levier plus gros.

Pourquoi 95 % et pas 90 % ou 99 %

Le seuil de 95 % (p < 0,05) est une convention héritée de la recherche en agronomie du XXe siècle, popularisée ensuite par la médecine puis par le web. Il signifie : "si la variante B était en réalité identique à A, il y aurait moins de 5 % de chances d'observer un écart au moins aussi grand". Ce n'est pas la probabilité que B soit meilleure. C'est une nuance que 90 % des dashboards marketing écrasent.

Note importante : ce seuil n'a de sens que si vous ne lancez qu'un seul test à la fois sur le même échantillon. Enchaîner trois tests simultanés sur la même audience multiplie mécaniquement le risque de faux positif global.

AB test et RGPD : ce que personne ne vous dit

Vous faites du tracking individuel, vous posez des cookies ou vous lisez des identifiants de session. Vous entrez dans le champ du RGPD. La CNIL l'a rappelé pour le ciblage publicitaire, et la logique s'applique aux AB tests dès qu'ils ne sont pas purement agrégés.

AB test et RGPD : ce que personne ne vous dit

Ce qu'il faut vérifier, concrètement

  1. Base légale : le plus souvent, le consentement. Si vous testez sur des utilisateurs identifiés (compte, email), vous pouvez parfois invoquer l'intérêt légitime, mais documentez-le.
  2. Information : vos visiteurs doivent savoir qu'ils participent à un test. Une ligne dans la politique de confidentialité ne suffit pas toujours ; une mention dans la bannière cookies est plus solide.
  3. Durée de conservation : les données de test ne vivent pas éternellement. Fixez une règle (6 mois, 12 mois) et tenez-la.
  4. Pas de profilage caché : si votre test vise à établir un profil comportemental, vous basculez dans une autre catégorie de traitement, avec des obligations renforcées.

J'ai vu plusieurs équipes se faire rattraper non pas sur le fond (leur test était plutôt propre) mais sur la forme : aucune mention nulle part. C'est la double peine idiote.

AB testing outil : gratuit, freemium, ou "on paie" ?

Il existe une tripotée de solutions. Le problème des articles qui en listent "10" sans les nommer, c'est qu'ils vous laissent en plan. Voici mon retour d'expérience sur les catégories.

Catégorie Exemples Pour qui Ce que je pense
Script maison Un bout de JS + un compteur de conversions Dev solo, budget zéro Viable pour tester un titre ou une couleur. Au-delà, vous passez votre vie à recoder la même logique.
Freemium simple Google Optimize (arrêté depuis 2023), VWO Free Petit site qui veut tester Google Optimize n'existe plus, il faut migrer. VWO a un plan gratuit limité mais suffisant pour démarrer.
Suite complète AB Tasty, Optimizely, Kameleoon Site à trafic moyen à fort Puissant, mais l'abonnement mensuel démarre vite à plusieurs centaines d'euros. À rentabiliser avec du volume.
Intégré à la plateforme Klaviyo (emails), Shopify (certains thèmes) E-commerce, email marketing Pratique quand votre stack est déjà là. Limité à leur écosystème.

Faut-il vraiment un outil payant ?

Franchement, non — pas au début. Tant que vous n'avez pas la taille d'échantillon nécessaire pour lire un résultat, l'outil ne vous sert à rien. Un script maison mal fait mais bien exécuté bat un abonnement à 400 €/mois utilisé n'importe comment. Payez l'outil le jour où il vous fait gagner du temps sur la préparation et le découpage des échantillons, pas avant.

AB test YouTube et AB test "card" : de quoi parle-t-on ?

Deux requêtes qu'on me pose souvent et qui n'ont rien à voir avec le web classique.

AB test YouTube : la plateforme permet depuis quelques années de tester plusieurs miniatures et plusieurs titres sur une même vidéo. Le principe est identique — un échantillon de spectateurs voit la version A, un autre voit la version B, vous gardez celle qui génère le plus de clics. La limite majeure : vous ne contrôlez ni la répartition, ni la durée, ni la métrique exacte. Vous subissez l'algorithme. Utile, mais pas rigoureux au sens statistique.

AB test "card" : il s'agit en général de tests sur les cartes de contenu présentées à l'utilisateur. Le mot "card" est ambigu. Soit vous testez la mise en forme d'une carte dans un flux (Netflix, e-commerce, médias), soit vous testez les cartes bancaires d'un site d'assurance. Dans les deux cas, la logique reste la même : une variable, un échantillon, une décision. Le contenu change, la méthode ne change pas.

Par où commencer votre premier AB test propre

Oubliez les variantes de bouton pendant les trois premiers mois. Commencez par une question qui vous rapporte gros si vous y répondez.

  1. Identifiez votre page à plus fort enjeu : celle où un point de conversion en plus représente le plus d'argent ou de monde.
  2. Regardez ce que font vraiment les visiteurs (heatmap, replays de session). Repérez une friction évidente.
  3. Écrivez l'hypothèse et le MDE avant de toucher au code.
  4. Calculez la taille d'échantillon et vérifiez que vous l'atteindrez dans un délai raisonnable.
  5. Ne regardez le résultat qu'à la fin de la période planifiée. Pas avant. C'est le point le plus dur, je le sais.
  6. Concluez franchement, y compris "aucun effet". Un test qui ne trouve rien n'est pas un échec : c'est une information qui vous évite de déployer du hasard.

Depuis que je m'y tiens, mes "gains" fantômes ont disparu. Mais le rythme des découvertes a baissé. C'est le prix. La plupart des AB tests que je lance aujourd'hui se concluent par "pas d'effet mesurable". Et c'est une bonne nouvelle : ça veut dire que je passais mon temps, avant, à déployer des illusions.

La prochaine fois qu'un dashboard vous annoncera une hausse spectaculaire au bout de deux jours, vous saurez quoi faire. Fermer l'onglet. Revenir dans deux semaines.

Grégoire Gauthier

Grégoire Gauthier

Grégoire Gauthier est journaliste. Depuis plus de dix ans, il couvre les thématiques de la création d’entreprise, de la gestion et des finances, ainsi que de l’innovation et de la technologie. Son travail l’a notamment amené à enquêter sur les modèles économiques des start-up et les mutations du secteur financier.

Voir tous les articles →