Est-ce que la présence d’une marque dans les réponses de ChatGPT, Gemini ou Claude produit du business ? Les annonceurs posent la question depuis un an sans obtenir de réponse chiffrée. Les outils de mesure de la visibilité - GetMint, Profound, Scrunch, Meikai, Semrush - produisent des scores, pas des contributions.

D’après une enquête de Scrunch et Scribewise citée par Digiday le 13 août, 73% des marketeurs interrogés ont déjà investi dans un outil de suivi de leur visibilité dans les réponses générées par l’IA. Ces solutions permettent de savoir si une marque est citée, à quelle fréquence, avec quelle tonalité et face à quels concurrents. Elles ne permettent pas de déterminer si cette visibilité génère des ventes supplémentaires.

Le problème vient en partie de la nature des parcours. Un utilisateur peut demander à ChatGPT de lui recommander un produit, ne cliquer sur aucun lien, puis acheter quelques jours plus tard sur Amazon, chez un distributeur ou en magasin. La recommandation a potentiellement influencé la décision, mais elle n’apparaît dans aucun outil d’attribution. Même lorsqu’un clic est généré, le trafic provenant des assistants reste faible et ne représente qu’une partie de leur influence.

La mesure doit donc répondre à deux questions différentes. La première consiste à déterminer comment la publicité, les relations presse, l’influence, les contenus ou la structure technique du site font évoluer la présence d’une marque dans les réponses. La seconde cherche à savoir si cette présence améliore la notoriété, la considération ou les ventes.

Les outils GEO - pour Generative Engine Optimization, c’est-à-dire l’optimisation de la visibilité dans les moteurs génératifs - traitent principalement la première. Le MMM pourrait, en théorie, répondre à la seconde.

Pourquoi le MMM semble adapté

Petit rappel pour les non initiés. Le marketing mix modeling est une méthode économétrique qui rapproche, sur une période donnée, l’évolution d’un indicateur business - ventes, leads, souscriptions - de celle des investissements médias et d’autres facteurs susceptibles de l’influencer : promotions, prix, distribution, saisonnalité, météo ou activité concurrentielle.

Son intérêt est de fonctionner avec des données agrégées. Il n’a pas besoin de suivre individuellement chaque consommateur entre une exposition et une transaction. Cette caractéristique le rend particulièrement pertinent pour mesurer des parcours sans clic ou des effets indirects, comme une recommandation reçue dans ChatGPT suivie d’un achat sur une autre plateforme.

Il serait donc possible d’introduire dans un MMM une série temporelle représentant la visibilité d’une marque dans les assistants IA. Le modèle chercherait alors à déterminer si les variations de cette visibilité sont associées à celles des ventes, une fois les autres facteurs pris en compte.

Cette variable ne serait pas forcément traitée comme un canal média classique. La présence organique dans les réponses ne possède ni impressions certifiées, ni investissement permettant de calculer un ROAS, c’est-à-dire un revenu rapporté aux dépenses publicitaires. Elle pourrait plutôt permettre de décomposer plus précisément la baseline : la partie des ventes que le modèle n’attribue pas directement aux investissements médias observés.

Mais le MMM a besoin de trois éléments : une variable qui évolue suffisamment dans le temps, un historique assez long et une méthode de mesure stable. Les données issues des assistants IA ne remplissent encore que très partiellement ces conditions.

La tentative de MediaROI et GetMint

MediaROI travaille avec GetMint sur une première méthode destinée à intégrer la visibilité dans les assistants IA à ses MMM. L’approche est encore en bêta et ne prétend pas produire immédiatement un ROI du GEO. Elle cherche d’abord à créer une variable d’exposition que le modèle pourra tester.

La méthode repose sur deux composantes.

La première est un indice représentant l’évolution estimée de la demande dans les assistants IA pour la catégorie de l’annonceur. Il n’existe actuellement aucune donnée publique fiable permettant de connaître le nombre de requêtes adressées à ChatGPT, Gemini ou Claude sur un secteur précis.

MediaROI reconstruit donc cette dynamique à partir de trois éléments que l’un de ses fondateurs, Antoine Szalewski, nous détaille : “la taille du marché search, estimée avec Google Keyword Planner, la saisonnalité de la demande, observée avec Google Trends, et les données publiques sur la progression générale des requêtes et des usages dans les LLM.”

L’objectif n’est pas d’obtenir le volume réel de requêtes, mais un indice relatif qui varie quotidiennement ou hebdomadairement. Pour un MMM, la dynamique d’une variable peut être exploitable même lorsque son niveau absolu n’est pas connu.

La deuxième composante est le score de visibilité produit par GetMint. MediaROI se concentre sur des prompts proches de l’acte d’achat : demander où acheter un produit, quelle marque choisir ou quel fournisseur privilégier. L’indice de demande estimée est multiplié par ce score de visibilité afin de créer une variable d’exposition à intégrer au modèle.

MediaROI a commencé à collecter ces données durant l’été auprès de plusieurs annonceurs. L’entreprise estime avoir besoin d’environ six mois d’historique et espère disposer de premiers résultats d’ici la fin de l’année. “La méthode pourrait également fonctionner avec les scores d’autres plateformes que celle de GetMint si l’annonceur possède déjà un historique suffisant”, précise Antoine Szalewski.

Cette démarche a le mérite de transformer un angle mort en hypothèse mesurable. Elle permet surtout de commencer à constituer la série de données qui manque aujourd’hui. À ce stade encore exploratoire, elle repose néanmoins sur plusieurs hypothèses qui devront être éprouvées.

Une demande LLM largement reconstruite

La première limite concerne la transposition des données search aux assistants IA. Une recherche sur Google et une conversation avec ChatGPT ne répondent pas toujours au même besoin. Les moteurs reposent historiquement sur des requêtes relativement courtes, alors que les assistants acceptent des questions plus détaillées et contextualisées. Leur rôle peut également différer selon les catégories : exploration dans le voyage, comparaison dans l’automobile, assistance technique dans l’électronique ou recommandation dans la beauté.

La progression moyenne des LLM ne permet donc pas de connaître l’évolution réelle de leur utilisation pour acheter des pièces automobiles, choisir un opérateur télécom ou comparer des produits alimentaires. Antoine Szalewski assume cette limite : son indicateur représente une dynamique estimée, pas un volume observé.

La deuxième incertitude concerne le partage entre addition et substitution. La première version de la méthode MediaROI repose sur l’hypothèse qu’une partie des requêtes adressées aux assistants s’ajoute à la recherche traditionnelle. Ekimetrics considère aussi qu’une partie de ces usages pourrait remplacer progressivement des recherches auparavant effectuées sur Google.

La distinction est déterminante. Si ChatGPT crée de nouveaux moments de découverte, la variable LLM peut apporter une information supplémentaire au modèle. S’il détourne principalement des requêtes du search, les deux variables évoluent en partie comme les deux faces d’un même comportement. Le MMM risque alors de mal répartir leurs contributions.

Des scores différents selon les outils et les prompts

La méthode dépend ensuite de la fiabilité du score de visibilité utilisé. Or les résultats varient selon le prestataire, le panel de prompts, les modèles interrogés, la langue, la fréquence des tests et la manière d’agréger les réponses.

❝

“Un KPI GEO d’un partenaire à l’autre n’est pas comparable”

France Hassenforder, partner chez Ekimetrics

“Un KPI GEO d’un partenaire à l’autre n’est pas comparable”, résume France Hassenforder, partner chez Ekimetrics. Avant même de mesurer une contribution business, il faut donc définir précisément ce que représente le score introduit dans le MMM et s’assurer que sa méthodologie reste suffisamment stable.

Une marque peut obtenir un score élevé sur une série de questions génériques et être absente des prompts réellement utilisés avant l’achat. Une modification du panel peut également faire progresser ou reculer l’indicateur sans que la visibilité réelle de la marque ait changé.

Les réponses des LLM présentent elles-mêmes une part de variabilité. Une question identique peut générer des recommandations différentes selon le moment, le compte utilisé, la localisation ou la version du modèle. Les mises à jour de ChatGPT ou Gemini peuvent par ailleurs créer une rupture dans la série historique.

“On voit nos clients très enthousiastes à l’idée de tester, mais refroidis par le manque de stabilité des KPI. Le sujet en reste encore à ses prémices”, observe France Hassenforder.

Le risque de confondre visibilité et puissance de marque

La difficulté la plus importante concerne la causalité. Une marque connue a davantage de chances d’être recommandée par un assistant IA, car elle bénéficie de plus de contenus, de citations médiatiques, de discussions sociales et de signaux d’autorité. Cette même puissance de marque est également susceptible d’expliquer une partie des ventes observées par le MMM.

Une corrélation entre visibilité dans les LLM et chiffre d’affaires ne prouve donc pas que les recommandations ont généré les ventes. Les deux peuvent être les conséquences d’un troisième facteur : la brand equity, c’est-à-dire la valeur et la notoriété accumulées par la marque.

Les campagnes de branding, les relations presse, l’influence ou la production de contenus peuvent aussi améliorer simultanément le score GEO et les ventes. Si ces effets ne sont pas correctement séparés, le MMM risque d’attribuer à la visibilité dans les assistants une contribution provenant en réalité des investissements marketing qui l’ont créée.

Le problème peut également fonctionner dans l’autre sens. Les LLM utilisent largement des contenus déjà disponibles sur le web. Leur réponse peut donc refléter la popularité passée d’une marque plutôt qu’une nouvelle exposition capable de modifier les comportements. Le score GEO devient alors un indicateur de santé de marque, pas nécessairement un levier indépendant.

Pourquoi Ekimetrics et m13h n’intègrent pas encore cette variable

Chez Ekimetrics, le sujet est considéré comme prioritaire mais reste exploratoire. L’entreprise teste plusieurs jeux de données et envisage aussi bien des méthodes économétriques que des approches causales utilisant des groupes témoins. “Nous ne disposons toutefois pas encore d’un indicateur suffisamment robuste pour être intégré de manière standardisée aux MMM”, prévient France Hassenforder.

La première question porte sur le KPI à retenir : simple citation, part de voix, position dans la réponse, tonalité, présence dans une recommandation d’achat ou mention du prix. Le bon indicateur dépend du rôle joué par l’assistant dans le parcours et du résultat marketing que l’annonceur cherche à expliquer.

Hadrien de Nijs de m13h se montre plus réservé encore. Chez ses clients, le trafic directement attribué aux assistants se situe entre 0,1% et 0,5%, et reste souvent inférieur à 0,2%. Ce chiffre sous-estime leur influence puisqu’il ne mesure pas les parcours sans clic, mais il montre que le signal directement observable reste faible face aux autres variables d’un MMM.

Le manque d’historique constitue surtout le principal blocage. “Un MMM est généralement construit à partir de deux ans ou davantage de données”, rappelle Hadrien de Nijs. La plupart des annonceurs ne possèdent que quelques mois de scores GEO, parfois quelques points de mesure seulement. “La variable apparaît donc brutalement à la fin de la série, alors que les consommateurs utilisent ChatGPT depuis plusieurs années”, poursuit l’expert qui estime qu’intégrer la partie LLM dans les MMM aujourd’hui, “c’est cavalier”. Le risque serait de demander au modèle de produire une contribution précise à partir d’une variable récente, instable et partiellement reconstruite.

Construire aujourd’hui les données nécessaires à la mesure de demain

Les réserves de m13h et d’Ekimetrics ne les conduisent, pour autant, pas à ignorer le sujet. Leur principale recommandation consiste au contraire à commencer immédiatement la collecte. “Il est important de commencer à monitorer dès maintenant, car on ne pourra pas reconstituer l’historique après coup”, prévient France Hassenforder.

La première étape est de définir un panel de prompts correspondant à des usages réels et de le maintenir dans le temps. Hadrien de Nijs distingue notamment trois dimensions : “la saillance ou la probabilité que la marque soit citée lors d’une recherche sur sa catégorie, la favour, soit la manière positive ou négative dont elle est présentée et la power, sa capacité à apparaître lorsque ses principaux concurrents sont eux-mêmes cités.”

Il faut ensuite documenter précisément les conditions de mesure : assistant interrogé, version du modèle, langue, pays, persona éventuelle, fréquence des tests et évolution du panel. Les réponses brutes, les citations et les sources doivent être conservées afin de pouvoir recalculer les indicateurs si la méthodologie change.

Les annonceurs peuvent également étudier dès maintenant le faible volume de trafic provenant des assistants : taux de conversion, panier, nouveaux clients et comportement sur le site. Des panels et des enquêtes peuvent compléter l’analyse pour identifier les consommateurs ayant utilisé un LLM sans cliquer sur un lien.

Des tests menés sur des marchés ou des populations témoins permettront enfin de vérifier si l’amélioration du score GEO s’accompagne réellement d’un changement de comportement.

L’arrivée de la publicité dans ChatGPT fournira davantage de données pour la partie payante : impressions, clics, conversions et dépenses. Elle ne résoudra cependant pas la mesure de la visibilité organique. Les annonceurs devront distinguer l’efficacité d’une campagne diffusée dans un assistant de l’influence d’une recommandation générée par le modèle.

Le MMM reste l’un des candidats les plus crédibles pour mesurer cette influence sans dépendre du suivi individuel. Mais la capacité technique à ajouter une colonne “visibilité LLM” ne suffit pas à produire une contribution fiable. Le chantier immédiat consiste à stabiliser les indicateurs et à accumuler de l’historique. Le calcul d’un véritable impact business viendra ensuite.

Continuez à lire