Une vue vidéo dure entre zéro et trente secondes selon la plateforme qui vous la vend. Ce n’est pas une approximation : c’est l’écart entre deux définitions officielles, publiées, revendiquées, et facturées.

La vidéo n’est pas un format. C’est une ligne de facturation qui recouvre des objets mesurés selon des règles différentes, et dont la métrique reine n’a jamais été reliée à un résultat commercial dans une revue à comité de lecture.

Zéro seconde, ou trente

Voici ce que chaque plateforme appelle une vue, d’après sa propre documentation.

PlateformeCe qui compte comme une vue
YouTube, contenu organiquedès le démarrage de la lecture
LinkedIn2 secondes continues, à 50 % à l’écran
X2 secondes à 50 %, ou 3 secondes à 100 %, ou 6 secondes
Meta3 secondes, et 15 secondes pour la métrique facturée
TikTokdémarrage, avec des variantes à 6 et 15 secondes
YouTube, campagne publicitaire facturée30 secondes ou la fin de la vidéo

Un facteur infini séparant les deux extrêmes, et trois définitions vendues séparément dans le même gestionnaire de campagnes chez un seul acteur.

Deux d’entre elles se rapprochent d’un socle commun, celui de la norme de visibilité, mais c’est un alignement volontaire. Rien n’oblige une plateforme à s’y tenir, et la plupart ne s’y tiennent pas.

La conséquence pratique est simple à énoncer et rarement dite : deux campagnes vidéo dont on compare les vues ne comparent rien. Le mot est le même, l’objet ne l’est pas.

Ce que chaque plateforme compte comme une vue video publicitaireCe que chaque plateforme compte comme une vue video publicitaire, d apres sa propre documentation officielle. Sur la plateforme video la plus importante, une vue de contenu organique est comptee des l instant ou la video commence a etre lue, quel que soit le format, ce qui correspond a zero seconde de visionnage minimal ; mais sur la meme plateforme, une vue dans une campagne publicitaire facturee exige que le spectateur regarde trente secondes ou jusqu a la fin de la video si celle-ci est plus courte, ou bien qu il clique sur un element de l annonce. Sur un reseau professionnel, une vue correspond a deux secondes ou plus de lecture continue alors que la video est visible a au moins cinquante pour cent a l ecran, definition explicitement calquee sur celle de l organisme de normalisation. Sur une plateforme de microblogage, trois definitions coexistent et sont vendues separement dans le meme gestionnaire de campagnes : une vue standard a deux secondes avec cinquante pour cent de surface visible, une vue a trois secondes avec cent pour cent de surface visible, et une vue a six secondes avec cinquante pour cent de surface visible. Sur les plateformes sociales principales, une vue est comptee a trois secondes, tandis que la metrique servant a l optimisation et a la facturation exige quinze secondes de lecture ou la completion si la video est plus courte. Sur une plateforme de video courte, une vue correspond au demarrage de la lecture dans le fil, avec des variantes d optimisation a six et quinze secondes. L ecart entre les deux extremes va donc de zero a trente secondes. Deux de ces definitions se rapprochent du seuil de l organisme de normalisation, a savoir cinquante pour cent de surface visible pendant deux secondes, mais cet alignement est un choix volontaire et non une obligation : rien dans les normes du secteur n impose a une plateforme de definir la vue de cette maniere, et la majorite d entre elles ne le font pas. La consequence pratique est que deux campagnes video dont on compare les nombres de vues ne comparent pas la meme grandeur.Le même mot, six objets différentsYouTube, contenu organique0 secondeLinkedIn2 secondesX, définition standard2 secondesMeta3 secondesX, variante vendue séparément6 secondesMeta, métrique facturée15 secondesYouTube, campagne facturée30 secondesDeux campagnes dont on compare les vues ne comparent pas la même grandeur.
De zéro à trente secondes. Et trois définitions différentes chez un même acteur. Source : Documentation officielle de YouTube, Google Ads, LinkedIn, X, TikTok, consultée le 10 septembre 2026 ; définitions Meta et Snapchat via sources secondaires convergentes, pages primaires inaccessibles au chargement automatise (2026)

Et vous ne payez pas forcément ce que vous croyez optimiser

Le pire n’est pas la diversité des définitions. C’est que le nom de l’objectif ne vous dit pas ce qui est facturé.

Sur Meta, l’objectif de lecture jusqu’à quinze secondes existe, et la documentation précise sa facturation :

« 15s ThruPlay is available on CPM or ThruPlay billing. 6s ThruPlay is available on CPM billing. »

L’objectif à six secondes n’est facturable qu’à l’impression. Vous optimisez pour une vue de six secondes, vous payez au mille impressions.

Sur LinkedIn, le tableau officiel est encore plus explicite. Sous l’objectif « vues vidéo », la facturation dépend de la stratégie d’enchère : livraison maximale, facturé à l’impression ; plafond de coût, facturé à l’impression ; enchère manuelle, facturé à la vue. Les deux modes automatiques, qui sont les plus utilisés, facturent donc à l’impression sous un objectif qui s’appelle « vues ».

Chez Google, l’enchère au visionnage facture bien après trente secondes ou la fin de la vidéo, et un abandon avant la trentième seconde ne coûte rien. Mais le même inventaire peut aussi être acheté au mille impressions selon le mode choisi. Chez TikTok, l’objectif de vues facture bien à la vue effective, en excluant explicitement les interactions de la première seconde.

Quatre plateformes, quatre logiques de facturation sous un vocabulaire commun. La question à poser n’est donc pas « combien coûte la vue » mais « suis-je facturé à l’impression ou à la vue, et à partir de quelle seconde ».

Un dernier chiffre, parce que c’est le seul document institutionnel trouvé qui quantifie un écart de prix entre vidéo et image : une grande plateforme publie ses enchères minimales par format et par pays. En France, 4 euros pour l’image contre 8 euros pour la vidéo. Aux États-Unis, 8 dollars contre 12. Ce n’est pas un prix de marché, c’est un plancher fixé par la plateforme, mais il confirme que l’écart est structurel et assumé.

Deux secondes, décidées par personne

Le seuil de visibilité vidéo est de cinquante pour cent des pixels pendant deux secondes continues, contre une seconde en display. La norme ajoute une précision que peu de gens connaissent :

« This required time is not necessarily the first 2 seconds of the video ad; any unduplicated content of the ad comprising 2 continuous seconds qualifies in this regard. »

Deux secondes n’importe où dans la vidéo. Pas le début.

Et ce seuil n’est motivé nulle part. Aucun document normatif ne le justifie. La seule explication publique est une déclaration d’un dirigeant de l’organisme de normalisation à une revue professionnelle : les utilisateurs « ne réagissaient pas vraiment à la publicité en elle-même avant deux ou trois secondes, c’est pour ça qu’on a retenu deux secondes ». Jamais formalisée, jamais publiée avec des données.

C’est exactement la situation du display, dont le seuil d’une seconde vient d’une négociation entre associations professionnelles. La vidéo n’est pas mieux fondée. Elle est seulement différente.

Le son n’est pas exigé. La norme le dit franchement :

« detection of audio is not currently a requirement for a viewable video ad impression under these guidelines. »

Mais une seconde norme, celle qui mesure la vidéo à travers la télévision et le numérique, exige à la fois le son et cent pour cent des pixels. Le document décrit lui-même la coexistence des deux régimes :

« digital video viewability using a 50% pixel criteria with no consideration of audio vs. cross-media video viewability using a 100% pixel criteria with consideration of audio »

Il existe donc deux définitions officielles et incompatibles de l’impression vidéo visible. Un même message peut être compté vu selon l’une et pas selon l’autre.

Dernier point sur la comparabilité, et il est technique mais lourd de conséquences : la norme autorise à mesurer cinquante pour cent des pixels de la publicité ou cinquante pour cent des pixels du lecteur, sous réserve de le déclarer et de démontrer que l’écart est négligeable. Deux prestataires peuvent donc se dire conformes et mesurer des surfaces différentes.

Les deux normes de visibilite video et les exigences differentes de chacuneLes deux normes de visibilite video et les exigences differentes de chacune. La premiere norme, publiee en aout deux mille quinze, definit l impression video visible comme une publicite video dont au moins cinquante pour cent des pixels se trouvent sur un onglet de navigateur au premier plan dans l espace visible de la page, pendant au moins deux secondes continues de lecture, en precisant que cette duree requise n est pas necessairement constituee des deux premieres secondes de la publicite et que tout segment non duplique de la publicite comprenant deux secondes continues qualifie a cet egard. Cette norme precise egalement que les limitations technologiques actuelles rendent difficile ou impossible la detection de la presence d un son non coupe dans toutes les situations, et que par consequent la detection du son n est pas une exigence pour qu une impression video soit comptee visible selon ces lignes directrices. Elle autorise en outre, par une note de bas de page, que le critere des cinquante pour cent soit calcule sur les pixels de la publicite ou sur les pixels du lecteur video, a condition que cette distinction soit divulguee de maniere proeminente et etayee par la preuve que l impact de ce choix est negligeable. La seconde norme, publiee en septembre deux mille dix-neuf et consacree a la mesure d audience croisee entre television et numerique, exige pour la mesure combinee et dedupliquee un seuil de visibilite de cent pour cent des pixels a l ecran pendant au moins deux secondes continues, pour les composantes numerique et lineaire, et exige en outre que la presence du son, definie comme un volume non nul ou l absence de coupure du son, soit mesuree pour les deux composantes dans la determination d une impression video visible, la ou cela est techniquement faisable. Le document decrit lui-meme la coexistence des deux regimes en indiquant que des metriques specifiques a un media peuvent etre rapportees a cote des metriques croisees en utilisant des bases differentes, par exemple une visibilite video numerique fondee sur un critere de cinquante pour cent des pixels sans consideration du son, par opposition a une visibilite video croisee fondee sur un critere de cent pour cent des pixels avec consideration du son. Il existe donc deux definitions officielles et incompatibles de l impression video visible, de sorte qu un meme message publicitaire peut etre compte comme vu selon l une et pas selon l autre. Enfin, aucun document normatif publie ne motive le choix du seuil de deux secondes pour la video par opposition a une seconde pour le display, la seule justification disponible etant une declaration orale d un dirigeant de l organisme de normalisation a une revue professionnelle.Deux normes, deux réponsesNorme vidéo numérique, 201550 % des pixels2 secondes continues, pas forcément les premièresSon non exigéPixels de la pub ou du lecteur, au choixNorme croisée télévision, 2019100 % des pixels2 secondes continuesSon exigéApplicable à la mesure combinéeUn même spot peut être compté vu selon l’une et pas selon l’autre.Les deux sont officielles, publiées, et coexistent.Et le seuil de deux secondesn’est motivé dans aucun document publié. Une déclaration en interview, jamais formalisée.
Deux définitions officielles de la même chose. Un spot peut être vu selon l'une et pas selon l'autre. Source : MRC, Viewable Ad Impression Measurement Guidelines v2.0, 18 août 2015, page 8 ; MRC, Cross-Media Audience Measurement Standards, Phase I Video, septembre 2019, sections 2.1.5 et 2.2.1 (2019)

Une vidéo dans une bannière n’est pas de la vidéo

La règle date de 2015 et tient en une note de bas de page :

« Banner ads with video embedded within them generally are covered by the display ad criteria for viewable impression measurement. »

Une vidéo qui joue dans un emplacement display est mesurée selon le critère display. Elle est donc visible après une seconde, pas deux. Les lignes directrices de format de 2022 reconduisent la classification sans changement : ces objets sont rangés dans la « vidéo display » et traités comme du rich media.

Et le secteur a changé sa façon de nommer la vidéo parce que l’ancienne servait à surfacturer. Le champ technique qui classait la vidéo dans les enchères a été déprécié en mars 2023. Il distinguait les emplacements : dans le flux, dans une bannière, dans un article, dans un fil. Le motif du changement est documenté : cette classification permettait de présenter de la vidéo hors flux comme de la vidéo dans le flux, laquelle se vend plus cher.

La nouvelle taxonomie ne classe plus par emplacement mais par intention de l’utilisateur et par signal sonore. Pour être qualifiée dans le flux, une vidéo doit avoir le son activé par défaut au démarrage. Et la valeur correspondant à la vidéo en bannière a disparu de la liste.

C’est un changement de doctrine, pas une mise à jour cosmétique : on ne classe plus la vidéo par l’endroit où elle s’affiche, mais par ce que l’utilisateur était venu faire.

Distinction entre les sous-categories de video publicitaire avant et apres le changement de classification de deux mille vingt-troisDistinction entre les sous-categories de video publicitaire avant et apres le changement de classification intervenu en mars deux mille vingt-trois. La norme de mesure de deux mille quinze precise en note de bas de page que les bannieres comportant une video integree relevent generalement des criteres de l annonce display pour la mesure de l impression visible, ce qui signifie qu une video jouant dans un emplacement display est comptee visible apres une seconde et non deux. Les lignes directrices de format publiees en aout deux mille vingt-deux reconduisent cette classification sans changement, en definissant la video display comme incluant les annonces video en banniere et en page qui occupent un espace publicitaire display et sont independantes de tout contenu video, et en precisant que les videos jouant dans une banniere display ou dans un emplacement display sont considerees comme une propriete des annonces rich media. Le champ technique qui classait la video dans les requetes d encheres distinguait cinq valeurs par emplacement physique : dans le flux, en banniere, dans un article, dans un fil, et interstitiel ou flottant. Ce champ a ete deprecie a compter de la revision de mars deux mille vingt-trois de la specification d encheres, au motif documente qu il permettait de presenter comme video dans le flux des annonces qui etaient en realite hors flux, la video dans le flux se vendant plus cher. La nouvelle taxonomie ne classe plus par emplacement physique mais par intention de l utilisateur et par signal sonore : pour etre qualifiee comme video dans le flux, une annonce doit avoir le son active par defaut au demarrage du lecteur, ou faire l objet d une intention explicite et claire de l utilisateur de regarder le contenu video, et doit rester le contenu principal de la page ainsi que le seul lecteur video visible capable de diffuser du son pendant la lecture. Les nouvelles valeurs comprennent la video dans le flux, la video accompagnant du contenu, l interstitiel, et la video sans contenu ou autonome, la valeur correspondant a la video en banniere ayant purement disparu de la liste. Toute impression dont le son est coupe par defaut doit signaler un placement hors flux. Il s agit d un changement de doctrine et non d une mise a jour cosmetique, puisque la video n est plus classee par l endroit ou elle s affiche mais par ce que l utilisateur etait venu faire sur la page.On ne classe plus la vidéo par où elle s’afficheAvant mars 2023, par emplacementDans le fluxEn bannièreDans un article, dans un filInterstitiel ou flottantDepuis, par intention et par sonDans le flux, son activé par défautAccompagnant du contenuInterstitiel, ou autonome« En bannière » a disparuPourquoi le changementL’ancienne classification permettait de vendre de l’out-stream au prix de l’in-stream.Et la règle de 2015, toujours en vigueurUne vidéo dans une bannière est mesurée en display : visible après une seconde, pas deux.
L'ancienne classification permettait de vendre de l'out-stream au prix de l'in-stream. La nouvelle classe par intention et par son. Source : MRC, Viewable Ad Impression Measurement Guidelines v2.0, 2015, note 1 ; IAB Tech Lab, Ad Format Guidelines for Digital Video and CTV, août 2022 ; OpenRTB 2.5 section 5.9 et AdCOM v1.0 ; dépréciation du champ placement dans OpenRTB 2.6-202303 (2023)

Sur un téléviseur, la visibilité n’existe plus

En télévision connectée, la notion de pourcentage de pixels dans l’espace visible d’un onglet perd tout sens. Le document de référence sur cet environnement, publié en août 2021, ne contient aucune occurrence des mots « pixel » ou « visibilité ».

Un chiffre de cent pour cent des pixels pendant deux secondes circule pourtant pour la télévision connectée. Il existe, il est daté et signé, mais il vient de la norme de mesure croisée avec la télévision, pas d’une norme propre à cet environnement. Le questionnaire que le même organisme fournit aux acheteurs demande d’ailleurs aux fournisseurs s’ils « développent des capacités de visibilité en télévision connectée », ce qui règle la question.

Ce qui remplace la mesure de pixels, ce sont des contrôles d’état, et l’un d’eux mérite d’être lu deux fois :

« Certain CTV devices may include dedicated power sources and as a result, may be independent of the power state of the TVs used to display their content. In such environments, CTV video content and advertising may be played while corresponding TV sets are off. […] detection of TV Off is not currently a requirement for CTV video impression measurement. »

Le boîtier a sa propre alimentation. La publicité peut donc défiler pendant que l’écran est éteint, et détecter cette situation n’est pas une exigence de mesure. C’est encouragé.

L’insertion publicitaire côté serveur aggrave le problème. Quand le contenu et la publicité sont assemblés côté serveur, le lecteur ne peut plus traiter le suivi publicitaire, et tout le trafic provient d’une même adresse. Le document en tire les conséquences sans détour :

« CTV environments especially may be more vulnerable to ad fraud than other formats »

« Due to the nature of SSAI traffic (i.e., originating from a few IP addresses, or a single IP address) IVT perpetuators may disguise themselves as SSAI providers. »

Le cas le plus documenté a été divulgué en avril 2020 : une opération usurpant plus de deux millions de personnes dans trente pays, contrefaisant trois cents éditeurs, et représentant à son pic 66 % du trafic programmatique en insertion côté serveur sur le segment observé.

Un résultat négatif à signaler ici : le rapport de référence sur la fraude publicitaire, coproduit par une association d’annonceurs, exclut explicitement la télévision connectée de son périmètre chiffré. Tous les taux qui circulent viennent de vendeurs de vérification, dont un a publié un écart de 320 % puis de 110 % pour la même mesure sur deux périodes consécutives.

Ce que la mesure en television connectee ne couvre pas et ce qui n y est pas exigeCe que la mesure en television connectee ne couvre pas et ce qui n y est pas exige. Le document de reference sur l insertion publicitaire cote serveur et la television par contournement, publie en aout deux mille vingt et un, ne contient aucune occurrence des termes pixel ou visibilite, la notion de pourcentage de pixels situes dans l espace visible d un onglet de navigateur n ayant pas de sens sur un televiseur. Le chiffre de cent pour cent des pixels pendant deux secondes qui circule pour cet environnement provient en realite de la norme de mesure croisee entre television et numerique, et non d une norme propre a la television connectee ; le questionnaire fourni aux acheteurs par le meme organisme demande d ailleurs aux fournisseurs s ils disposent de capacites de visibilite en television connectee ou s ils en developpent, ce qui confirme l absence d exigence normalisee. Ce qui remplace la mesure de pixels dans cet environnement releve de controles d etat. Le document indique que certains appareils de television connectee disposent de sources d alimentation dediees et peuvent donc etre independants de l etat d alimentation des televiseurs utilises pour afficher leur contenu, de sorte que le contenu video et la publicite peuvent etre diffuses pendant que les televiseurs correspondants sont eteints, et precise que les limitations technologiques actuelles rendent difficile la detection de l etat d alimentation d un televiseur dans toutes les situations et que par consequent la detection d un televiseur eteint n est pas actuellement une exigence pour la mesure des impressions video en television connectee, tout en encourageant vivement les fournisseurs a identifier de tels signaux. Sur l insertion publicitaire cote serveur, le document indique que le lecteur peut ne pas etre en mesure de traiter le suivi publicitaire et que le service d assemblage ne peut pas acceder aux balises utilisees dans le suivi cote client traditionnel, que ce processus de suivi de serveur a serveur peut poser probleme parce que tout le suivi provient d une seule adresse et peut donc etre affecte par les techniques de filtrage du trafic invalide, que les environnements de television connectee peuvent etre particulierement plus vulnerables a la fraude publicitaire que d autres formats, et que compte tenu de la nature du trafic d insertion cote serveur les auteurs de trafic invalide peuvent se deguiser en fournisseurs d insertion cote serveur. Une operation divulguee en avril deux mille vingt usurpait plus de deux millions de personnes dans plus de trente pays, contrefaisait plus de trois cents editeurs distincts, et representait a son pic soixante-six pour cent du trafic programmatique en insertion cote serveur sur le segment observe. Enfin, le rapport de reference sur la fraude publicitaire coproduit par une association d annonceurs exclut explicitement la television connectee de son perimetre chiffre, ses estimations de perte portant strictement sur la video, le display et les autres formats au cout pour mille sur ordinateurs et appareils mobiles.Sur un téléviseur, les repères disparaissentAucun seuil de visibilitéLe document de référence ne contient ni le mot « pixel » ni le mot « visibilité ».L’écran peut être éteintLe boîtier a sa propre alimentation, et détecter l’écran éteint n’est pas exigé.Le suivi vient d’une seule adresse« IVT perpetuators may disguise themselves as SSAI providers. »Et le rapport de référence sur la fraude exclut explicitement cet environnement de son périmètre chiffré.
Le document de référence sur cet environnement ne mentionne ni pixel ni visibilité. Et détecter un écran éteint n'est pas requis. Source : MRC, Server-Side Ad Insertion and OTT Guidance, août 2021 ; MRC, CTV Reference Document, 2021 ; HUMAN Security, divulgation du 16 avril 2020 ; ANA et White Ops, Bot Baseline 2018-2019 (2021)

La métrique reine n’a jamais été validée

Le taux de complétion est l’indicateur central de la vidéo publicitaire. Il mesure la part des publicités jouées jusqu’au bout. Personne n’a démontré, dans une revue à comité de lecture, qu’il prédise quoi que ce soit de commercial.

L’étude fondatrice sur le sujet a été publiée en 2013 dans les actes d’une conférence de l’ACM. Elle porte sur 65 millions de spectateurs uniques, 362 millions de vidéos et 257 millions de publicités, et ses auteurs la présentent comme « la première étude scientifique rigoureuse des publicités vidéo et de leur efficacité ». Ses résultats sur ce qui détermine la complétion sont solides : une publicité de quinze secondes se termine 2,9 % plus souvent qu’une de vingt secondes, une insertion en milieu de contenu se termine 18,1 % plus souvent qu’une insertion avant le contenu.

Puis vient la phrase que personne ne cite :

« Our current data set does not currently allow us to measure CTRs or survey responses. But, comparing the different metrics of ad effectiveness is an interesting avenue for future work. »

L’étude la plus rigoureuse jamais publiée sur le taux de complétion dit explicitement qu’elle n’a pas pu tester le lien avec un résultat, et classe la question comme travail futur. C’était il y a treize ans, et aucun article à comité de lecture identifié depuis ne l’a fermée.

Ce qui circule à la place vient de fournisseurs de technologie publicitaire vidéo, et aucune de ces publications ne traite le biais évident : les gens qui terminent une vidéo sont probablement déjà plus intéressés par son contenu, indépendamment de tout effet de la complétion elle-même.

Le même vide existe sur la comparaison entre formats. Aucune expérimentation causale publiée ne compare la vidéo à un autre format numérique sur un résultat commercial, à budget égal. L’étude observationnelle la plus proche ne distingue même pas la vidéo du display.

Et quand l’avantage persuasif de la vidéo a été testé avec la rigueur voulue, il s’est révélé modeste. Un article paru dans les comptes rendus de l’Académie des sciences américaine en 2021, fondé sur 7 609 personnes et 26 584 observations réparties sur 72 messages différents, comparant une vidéo à sa transcription écrite :

« individuals are more likely to believe an event occurred when it is presented in video versus textual form, but the impact on attitudes and behavioral intentions is much smaller […] the difference between the video and text conditions is comparable to, if not smaller than, the difference between the text and control conditions »

Une réserve importante à poser : cette étude porte sur la persuasion politique, pas sur la publicité de marque. Le résultat ne se transpose pas mécaniquement. Mais c’est le test le plus large et le plus rigoureux jamais publié de l’hypothèse « la vidéo est intrinsèquement plus persuasive », et il l’infirme largement. Aucune étude commerciale d’une ampleur comparable n’existe pour trancher la même question sur une marque.

Dernier point, pour couper court à un chiffre qui circule partout : l’affirmation selon laquelle on retiendrait 95 % d’un message vu en vidéo contre 10 % d’un message lu n’a aucune source académique identifiable.

Ce que la recherche a comite de lecture etablit sur la publicite video et ce qu elle n etablit pasCe que la recherche a comite de lecture etablit sur la publicite video et ce qu elle n etablit pas. Sur le taux de completion, l etude fondatrice publiee en deux mille treize dans les actes d une conference de mesure d internet porte sur soixante-cinq millions de spectateurs uniques, trois cent soixante-deux millions de videos et deux cent cinquante-sept millions de publicites collectees via un reseau de diffusion de contenu, et se presente comme la premiere etude scientifique rigoureuse des publicites video et de leur efficacite. Ses resultats sur les determinants de la completion sont solides : une publicite de quinze secondes se termine deux virgule neuf pour cent plus souvent qu une publicite de vingt secondes, elle-meme trois virgule neuf pour cent plus souvent qu une de trente secondes, une insertion en milieu de contenu se termine dix-huit virgule un pour cent plus souvent qu une insertion avant le contenu, et les formats longs se terminent quatre virgule deux pour cent plus souvent que les formats courts. Mais les auteurs ecrivent que leur jeu de donnees ne leur permet pas de mesurer les taux de clic ni les reponses d enquete, et que comparer les differentes metriques d efficacite publicitaire constitue une piste interessante pour des travaux futurs. Aucun article a comite de lecture identifie depuis n a etabli que le taux de completion predise un resultat commercial. Sur la comparaison entre formats, aucune experimentation causale publiee ne compare la video a un autre format numerique sur un resultat de vente a budget egal, l etude observationnelle la plus proche ne distinguant meme pas la video du display parmi les dix canaux qu elle teste. Sur l avantage persuasif de la video, une etude publiee en deux mille vingt et un dans les comptes rendus de l academie des sciences americaine, fondee sur deux experimentations par sondage a haute puissance statistique totalisant sept mille six cent neuf participants et vingt-six mille cinq cent quatre-vingt-quatre observations reparties sur soixante-douze messages persuasifs differents, avec assignation aleatoire entre une video, sa transcription ecrite detaillee et une condition de controle, conclut que les individus sont plus susceptibles de croire qu un evenement a eu lieu lorsqu il est presente sous forme video plutot que textuelle, mais que l impact sur les attitudes et les intentions comportementales est bien plus faible, la difference entre les conditions video et texte etant comparable voire inferieure a la difference entre la condition texte et la condition de controle. Cette etude porte sur la persuasion politique et non sur la publicite de marque, reserve qu il faut poser explicitement. Enfin, l affirmation selon laquelle un message vu en video serait retenu a quatre-vingt-quinze pour cent contre dix pour cent pour un message lu ne possede aucune source academique identifiable.Ce que la recherche dit, et ne dit pasLe taux de complétion, étude fondatrice de 2013257 millions de publicités analysées. Ce qui fait terminer une vidéo est établi.« does not currently allow us to measure CTRs or survey responses »Classé comme travail futur. Treize ans plus tard, personne n’a fermé la question.La vidéo contre les autres formatsAucune comparaison causale publiée sur un résultat commercial, à budget égal.L’avantage persuasif, testé sur 7 609 personnes« the impact on attitudes and behavioral intentions is much smaller »Persuasion politique, pas publicité de marque. Mais c’est le test le plus large qui existe.
L'étude fondatrice sur le taux de complétion écrit elle-même qu'elle n'a pas pu tester le lien avec un résultat. Source : Krishnan et Sitaraman, ACM Internet Measurement Conference, 2013 ; Wittenberg, Tappin, Berinsky et Rand, PNAS 118(47), 2021 ; Lewis et Rao, Quarterly Journal of Economics 130(4), 2015 ; Gordon, Zettelmeyer, Bhargava et Chapsky, Marketing Science 38(2), 2019 (2021)

Ce qu’il faut en faire

Demandez à partir de quelle seconde vous êtes facturé. C’est la première question, avant le budget et avant le ciblage. Selon la réponse, vous achetez une impression, deux secondes, six secondes ou trente. Le mot « vue » ne vous dit rien.

Ne comparez jamais des vues entre plateformes. Elles ne mesurent pas la même grandeur, et l’écart va de zéro à trente secondes. La seule comparaison qui a un sens est celle d’une plateforme avec elle-même, dans le temps, à format et placement constants.

Vérifiez si votre vidéo joue dans un emplacement vidéo. Une vidéo dans une bannière est mesurée en display. Si votre accord parle de vidéo mais que la livraison se fait en display, vous payez un prix vidéo pour un objet display, et la classification du secteur a précisément été refondue en 2023 parce que cette confusion était exploitée.

En télévision connectée, exigez ce qui est détecté. Pas de seuil de visibilité, pas d’obligation de détecter un écran éteint, et un environnement que la norme elle-même décrit comme plus vulnérable à la fraude. Demandez à votre prestataire ce qu’il détecte, comment, et ce qu’il ne détecte pas.

Et cessez d’optimiser sur le taux de complétion comme si c’était un résultat. C’est un indicateur de livraison, dont le lien avec une vente n’a jamais été établi dans une revue à comité de lecture, et dont l’étude fondatrice dit elle-même qu’elle n’a pas pu le tester. Il vous dit que votre vidéo a été jouée jusqu’au bout. Il ne vous dit pas qu’elle a servi à quelque chose.

La seule mesure qui vous appartienne, en vidéo comme ailleurs, est celle que votre propre système peut produire : ce que la campagne a coûté, et ce qu’elle a produit chez vous. Tout le reste est un vocabulaire dont vous ne contrôlez pas les définitions.

Choisir ce que l’on achète, et sur quelle définition, se décide au moment du plan. C’est ce que nous construisons dans une stratégie média.