Nous utilisons des cookies de mesure d’audience pour améliorer le site. Vous pouvez les accepter ou les refuser. Voir notre politique de confidentialité.
Une vue dure de zéro à trente secondes selon la plateforme. Le seuil de deux secondes n'a jamais été justifié, ni relié à une vente.
Axel Chatellin, Fondateur de MAstratos··31 min de lecture
Une vue vidéo dure entre zéro et trente secondes selon la plateforme qui vous la vend. Ce n’est pas une approximation : c’est l’écart entre deux définitions officielles, publiées, revendiquées, et facturées.
La vidéo n’est pas un format. C’est une ligne de facturation qui recouvre des objets mesurés selon des règles différentes, et dont la métrique reine n’a jamais été reliée à un résultat commercial dans une revue à comité de lecture.
Zéro seconde, ou trente
Voici ce que chaque plateforme appelle une vue, d’après sa propre documentation.
Plateforme
Ce qui compte comme une vue
YouTube, contenu organique
dès le démarrage de la lecture
LinkedIn
2 secondes continues, à 50 % à l’écran
X
2 secondes à 50 %, ou 3 secondes à 100 %, ou 6 secondes
Meta
3 secondes, et 15 secondes pour la métrique facturée
TikTok
démarrage, avec des variantes à 6 et 15 secondes
YouTube, campagne publicitaire facturée
30 secondes ou la fin de la vidéo
Un facteur infini séparant les deux extrêmes, et trois définitions vendues séparément dans le même gestionnaire de campagnes chez un seul acteur.
Deux d’entre elles se rapprochent d’un socle commun, celui de la norme de visibilité, mais c’est un alignement volontaire. Rien n’oblige une plateforme à s’y tenir, et la plupart ne s’y tiennent pas.
La conséquence pratique est simple à énoncer et rarement dite : deux campagnes vidéo dont on compare les vues ne comparent rien. Le mot est le même, l’objet ne l’est pas.
Et vous ne payez pas forcément ce que vous croyez optimiser
Le pire n’est pas la diversité des définitions. C’est que le nom de l’objectif ne vous dit pas ce qui est facturé.
Sur Meta, l’objectif de lecture jusqu’à quinze secondes existe, et la documentation précise sa facturation :
« 15s ThruPlay is available on CPM or ThruPlay billing. 6s ThruPlay is available on CPM billing. »
L’objectif à six secondes n’est facturable qu’à l’impression. Vous optimisez pour une vue de six secondes, vous payez au mille impressions.
Sur LinkedIn, le tableau officiel est encore plus explicite. Sous l’objectif « vues vidéo », la facturation dépend de la stratégie d’enchère : livraison maximale, facturé à l’impression ; plafond de coût, facturé à l’impression ; enchère manuelle, facturé à la vue. Les deux modes automatiques, qui sont les plus utilisés, facturent donc à l’impression sous un objectif qui s’appelle « vues ».
Chez Google, l’enchère au visionnage facture bien après trente secondes ou la fin de la vidéo, et un abandon avant la trentième seconde ne coûte rien. Mais le même inventaire peut aussi être acheté au mille impressions selon le mode choisi. Chez TikTok, l’objectif de vues facture bien à la vue effective, en excluant explicitement les interactions de la première seconde.
Quatre plateformes, quatre logiques de facturation sous un vocabulaire commun. La question à poser n’est donc pas « combien coûte la vue » mais « suis-je facturé à l’impression ou à la vue, et à partir de quelle seconde ».
Un dernier chiffre, parce que c’est le seul document institutionnel trouvé qui quantifie un écart de prix entre vidéo et image : une grande plateforme publie ses enchères minimales par format et par pays. En France, 4 euros pour l’image contre 8 euros pour la vidéo. Aux États-Unis, 8 dollars contre 12. Ce n’est pas un prix de marché, c’est un plancher fixé par la plateforme, mais il confirme que l’écart est structurel et assumé.
Deux secondes, décidées par personne
Le seuil de visibilité vidéo est de cinquante pour cent des pixels pendant deux secondes continues, contre une seconde en display. La norme ajoute une précision que peu de gens connaissent :
« This required time is not necessarily the first 2 seconds of the video ad; any unduplicated content of the ad comprising 2 continuous seconds qualifies in this regard. »
Deux secondes n’importe où dans la vidéo. Pas le début.
Et ce seuil n’est motivé nulle part. Aucun document normatif ne le justifie. La seule explication publique est une déclaration d’un dirigeant de l’organisme de normalisation à une revue professionnelle : les utilisateurs « ne réagissaient pas vraiment à la publicité en elle-même avant deux ou trois secondes, c’est pour ça qu’on a retenu deux secondes ». Jamais formalisée, jamais publiée avec des données.
C’est exactement la situation du display, dont le seuil d’une seconde vient d’une négociation entre associations professionnelles. La vidéo n’est pas mieux fondée. Elle est seulement différente.
Le son n’est pas exigé. La norme le dit franchement :
« detection of audio is not currently a requirement for a viewable video ad impression under these guidelines. »
Mais une seconde norme, celle qui mesure la vidéo à travers la télévision et le numérique, exige à la fois le son et cent pour cent des pixels. Le document décrit lui-même la coexistence des deux régimes :
« digital video viewability using a 50% pixel criteria with no consideration of audio vs. cross-media video viewability using a 100% pixel criteria with consideration of audio »
Il existe donc deux définitions officielles et incompatibles de l’impression vidéo visible. Un même message peut être compté vu selon l’une et pas selon l’autre.
Dernier point sur la comparabilité, et il est technique mais lourd de conséquences : la norme autorise à mesurer cinquante pour cent des pixels de la publicité ou cinquante pour cent des pixels du lecteur, sous réserve de le déclarer et de démontrer que l’écart est négligeable. Deux prestataires peuvent donc se dire conformes et mesurer des surfaces différentes.
La règle date de 2015 et tient en une note de bas de page :
« Banner ads with video embedded within them generally are covered by the display ad criteria for viewable impression measurement. »
Une vidéo qui joue dans un emplacement display est mesurée selon le critère display. Elle est donc visible après une seconde, pas deux. Les lignes directrices de format de 2022 reconduisent la classification sans changement : ces objets sont rangés dans la « vidéo display » et traités comme du rich media.
Et le secteur a changé sa façon de nommer la vidéo parce que l’ancienne servait à surfacturer. Le champ technique qui classait la vidéo dans les enchères a été déprécié en mars 2023. Il distinguait les emplacements : dans le flux, dans une bannière, dans un article, dans un fil. Le motif du changement est documenté : cette classification permettait de présenter de la vidéo hors flux comme de la vidéo dans le flux, laquelle se vend plus cher.
La nouvelle taxonomie ne classe plus par emplacement mais par intention de l’utilisateur et par signal sonore. Pour être qualifiée dans le flux, une vidéo doit avoir le son activé par défaut au démarrage. Et la valeur correspondant à la vidéo en bannière a disparu de la liste.
C’est un changement de doctrine, pas une mise à jour cosmétique : on ne classe plus la vidéo par l’endroit où elle s’affiche, mais par ce que l’utilisateur était venu faire.
En télévision connectée, la notion de pourcentage de pixels dans l’espace visible d’un onglet perd tout sens. Le document de référence sur cet environnement, publié en août 2021, ne contient aucune occurrence des mots « pixel » ou « visibilité ».
Un chiffre de cent pour cent des pixels pendant deux secondes circule pourtant pour la télévision connectée. Il existe, il est daté et signé, mais il vient de la norme de mesure croisée avec la télévision, pas d’une norme propre à cet environnement. Le questionnaire que le même organisme fournit aux acheteurs demande d’ailleurs aux fournisseurs s’ils « développent des capacités de visibilité en télévision connectée », ce qui règle la question.
Ce qui remplace la mesure de pixels, ce sont des contrôles d’état, et l’un d’eux mérite d’être lu deux fois :
« Certain CTV devices may include dedicated power sources and as a result, may be independent of the power state of the TVs used to display their content. In such environments, CTV video content and advertising may be played while corresponding TV sets are off. […] detection of TV Off is not currently a requirement for CTV video impression measurement. »
Le boîtier a sa propre alimentation. La publicité peut donc défiler pendant que l’écran est éteint, et détecter cette situation n’est pas une exigence de mesure. C’est encouragé.
L’insertion publicitaire côté serveur aggrave le problème. Quand le contenu et la publicité sont assemblés côté serveur, le lecteur ne peut plus traiter le suivi publicitaire, et tout le trafic provient d’une même adresse. Le document en tire les conséquences sans détour :
« CTV environments especially may be more vulnerable to ad fraud than other formats »
« Due to the nature of SSAI traffic (i.e., originating from a few IP addresses, or a single IP address) IVT perpetuators may disguise themselves as SSAI providers. »
Le cas le plus documenté a été divulgué en avril 2020 : une opération usurpant plus de deux millions de personnes dans trente pays, contrefaisant trois cents éditeurs, et représentant à son pic 66 % du trafic programmatique en insertion côté serveur sur le segment observé.
Un résultat négatif à signaler ici : le rapport de référence sur la fraude publicitaire, coproduit par une association d’annonceurs, exclut explicitement la télévision connectée de son périmètre chiffré. Tous les taux qui circulent viennent de vendeurs de vérification, dont un a publié un écart de 320 % puis de 110 % pour la même mesure sur deux périodes consécutives.
Le taux de complétion est l’indicateur central de la vidéo publicitaire. Il mesure la part des publicités jouées jusqu’au bout. Personne n’a démontré, dans une revue à comité de lecture, qu’il prédise quoi que ce soit de commercial.
L’étude fondatrice sur le sujet a été publiée en 2013 dans les actes d’une conférence de l’ACM. Elle porte sur 65 millions de spectateurs uniques, 362 millions de vidéos et 257 millions de publicités, et ses auteurs la présentent comme « la première étude scientifique rigoureuse des publicités vidéo et de leur efficacité ». Ses résultats sur ce qui détermine la complétion sont solides : une publicité de quinze secondes se termine 2,9 % plus souvent qu’une de vingt secondes, une insertion en milieu de contenu se termine 18,1 % plus souvent qu’une insertion avant le contenu.
Puis vient la phrase que personne ne cite :
« Our current data set does not currently allow us to measure CTRs or survey responses. But, comparing the different metrics of ad effectiveness is an interesting avenue for future work. »
L’étude la plus rigoureuse jamais publiée sur le taux de complétion dit explicitement qu’elle n’a pas pu tester le lien avec un résultat, et classe la question comme travail futur. C’était il y a treize ans, et aucun article à comité de lecture identifié depuis ne l’a fermée.
Ce qui circule à la place vient de fournisseurs de technologie publicitaire vidéo, et aucune de ces publications ne traite le biais évident : les gens qui terminent une vidéo sont probablement déjà plus intéressés par son contenu, indépendamment de tout effet de la complétion elle-même.
Le même vide existe sur la comparaison entre formats. Aucune expérimentation causale publiée ne compare la vidéo à un autre format numérique sur un résultat commercial, à budget égal. L’étude observationnelle la plus proche ne distingue même pas la vidéo du display.
Et quand l’avantage persuasif de la vidéo a été testé avec la rigueur voulue, il s’est révélé modeste. Un article paru dans les comptes rendus de l’Académie des sciences américaine en 2021, fondé sur 7 609 personnes et 26 584 observations réparties sur 72 messages différents, comparant une vidéo à sa transcription écrite :
« individuals are more likely to believe an event occurred when it is presented in video versus textual form, but the impact on attitudes and behavioral intentions is much smaller […] the difference between the video and text conditions is comparable to, if not smaller than, the difference between the text and control conditions »
Une réserve importante à poser : cette étude porte sur la persuasion politique, pas sur la publicité de marque. Le résultat ne se transpose pas mécaniquement. Mais c’est le test le plus large et le plus rigoureux jamais publié de l’hypothèse « la vidéo est intrinsèquement plus persuasive », et il l’infirme largement. Aucune étude commerciale d’une ampleur comparable n’existe pour trancher la même question sur une marque.
Dernier point, pour couper court à un chiffre qui circule partout : l’affirmation selon laquelle on retiendrait 95 % d’un message vu en vidéo contre 10 % d’un message lu n’a aucune source académique identifiable.
Demandez à partir de quelle seconde vous êtes facturé. C’est la première question, avant le budget et avant le ciblage. Selon la réponse, vous achetez une impression, deux secondes, six secondes ou trente. Le mot « vue » ne vous dit rien.
Ne comparez jamais des vues entre plateformes. Elles ne mesurent pas la même grandeur, et l’écart va de zéro à trente secondes. La seule comparaison qui a un sens est celle d’une plateforme avec elle-même, dans le temps, à format et placement constants.
Vérifiez si votre vidéo joue dans un emplacement vidéo. Une vidéo dans une bannière est mesurée en display. Si votre accord parle de vidéo mais que la livraison se fait en display, vous payez un prix vidéo pour un objet display, et la classification du secteur a précisément été refondue en 2023 parce que cette confusion était exploitée.
En télévision connectée, exigez ce qui est détecté. Pas de seuil de visibilité, pas d’obligation de détecter un écran éteint, et un environnement que la norme elle-même décrit comme plus vulnérable à la fraude. Demandez à votre prestataire ce qu’il détecte, comment, et ce qu’il ne détecte pas.
Et cessez d’optimiser sur le taux de complétion comme si c’était un résultat. C’est un indicateur de livraison, dont le lien avec une vente n’a jamais été établi dans une revue à comité de lecture, et dont l’étude fondatrice dit elle-même qu’elle n’a pas pu le tester. Il vous dit que votre vidéo a été jouée jusqu’au bout. Il ne vous dit pas qu’elle a servi à quelque chose.
La seule mesure qui vous appartienne, en vidéo comme ailleurs, est celle que votre propre système peut produire : ce que la campagne a coûté, et ce qu’elle a produit chez vous. Tout le reste est un vocabulaire dont vous ne contrôlez pas les définitions.
Choisir ce que l’on achète, et sur quelle définition, se décide au moment du plan. C’est ce que nous construisons dans une stratégie média.
Questions fréquentes
Qu'est-ce qu'une vue vidéo ?
Cela dépend de qui vous la vend. Sur une plateforme, la vue est comptée dès le démarrage de la lecture, soit zéro seconde. Sur une autre, il faut trente secondes ou la fin de la vidéo. Entre les deux : deux, trois, six ou quinze secondes. Un même acteur vend jusqu'à trois définitions différentes dans le même outil.
D'où vient le seuil de deux secondes en vidéo ?
D'aucun document publié. La norme l'énonce sans le motiver. La seule justification existante est une déclaration orale d'un dirigeant de l'organisme à une revue professionnelle, jamais formalisée avec des données.
Le son est-il compté ?
Non, pas dans la norme vidéo standard : la détection du son n'y est pas exigée. Mais la norme de mesure croisée avec la télévision l'exige, en plus de cent pour cent des pixels. Deux définitions officielles incompatibles coexistent.
Le taux de complétion prédit-il quelque chose ?
Personne ne l'a démontré dans une revue à comité de lecture. L'étude fondatrice sur le sujet, portant sur 257 millions de publicités, écrit noir sur blanc que ses données ne lui permettaient pas de mesurer un résultat commercial et classe la question comme travail futur. C'était en 2013.
La vidéo est-elle plus efficace que les autres formats ?
Aucune comparaison causale publiée ne l'établit sur un résultat commercial à budget égal. Le test le plus large jamais conduit sur l'avantage persuasif de la vidéo sur le texte, sur plus de sept mille personnes, conclut que cet avantage est nettement plus modeste que l'intuition ne le suggère.
Un article traite un cas général et s'arrête là. Un diagnostic part de vos pages, de vos chiffres et de vos contraintes, et dit ce qui bloque en premier. Nous concevons des marques, des sites et des dispositifs d'acquisition pour des entreprises B2B, et la conversation commence toujours par ce constat.