Qu'est-ce que le sous-titrage et comment ça fonctionne

Résumé

Le sous-titrage est une piste de texte distincte, synchronisée à l'audio, que le spectateur peut activer ou désactiver. Il existe deux grandes distinctions : fermé (désactivable) vs ouvert (incrusté), et sous-titrage d'accessibilité (dialogue + sons + locuteurs) vs sous-titres de traduction (dialogue seul). Les formats SRT, VTT et SCC transportent la même transcription pour des destinations différentes. L'IA génère 90 à 95% du minutage ; la relecture humaine vérifie les coupures de ligne et le jargon.

Personne regardant une vidéo avec les sous-titres activés sur l'écran d'un ordinateur portable

Qu'est-ce que le sous-titrage : ce que la piste CC contient vraiment

Qu'est-ce que le sous-titrage ? C'est une piste de texte synchronisée à l'audio d'une vidéo, stockée dans un fichier séparé que le lecteur vidéo affiche à la demande. Activez le bouton CC : chaque moment sonore devient lisible à l'écran. Désactivez-le : la vidéo reprend son apparence d'origine, sans modification visuelle. Ce que cette piste contient exactement, et comment elle est construite, détermine si vos spectateurs peuvent suivre votre vidéo sans le son.

Le bouton CC est présent sur la quasi-totalité des lecteurs vidéo modernes. Ce qu'il révèle dépend entièrement de la façon dont les sous-titres ont été construits. Comprendre cette distinction est utile que vous publiiez pour des raisons d'accessibilité, pour un public qui regarde en silence dans les transports, ou simplement pour savoir ce que signifie concrètement l'icône CC de votre lecteur.

"Fermé" : pourquoi le CC se cache jusqu'à ce qu'on l'active

Le mot "closed" en anglais signifie que les sous-titres sont invisibles jusqu'à ce que le spectateur choisisse de les afficher. Le texte n'est pas gravé dans l'image. Il circule dans une piste de données distincte, que le logiciel vidéo lit et superpose à la demande.

Appuyez sur CC sur une télécommande, ou cliquez sur l'icône dans un lecteur en ligne : les sous-titres apparaissent. Appuyez à nouveau : ils disparaissent. Le fichier vidéo lui-même ne change pas.

C'est la distinction technique fondamentale avec les sous-titres incrustés. Un sous-titre incrusté, souvent appelé "open caption" dans le vocabulaire de la diffusion, est rendu directement dans les pixels de l'image lors de l'encodage. Il ne peut pas être masqué ni désactivé. Il est visible sur n'importe quel écran, n'importe quelle plateforme, même celles qui ne supportent pas les pistes de sous-titres externes.

C'est cette possibilité d'activation et de désactivation qui définit le terme "fermé". Le reste, contenu, format, style, relève d'autres choix techniques.

Sous-titrage d'accessibilité vs sous-titres de traduction : une différence de fond

Les mots "sous-titres" et "sous-titrage" circulent souvent comme des synonymes dans le langage courant. Ils décrivent pourtant deux choses différentes selon ce qu'ils contiennent.

Les sous-titres de traduction supposent que le spectateur entend. Ils reprennent les dialogues, parfois traduits dans une autre langue, et rien de plus. Si une porte claque hors champ, si une musique change d'atmosphère, si quelqu'un pousse un soupir éloquent : rien de tout cela n'apparaît dans des sous-titres de traduction.

Le sous-titrage d'accessibilité suppose que le spectateur n'entend pas, ou n'entend que partiellement. Il reprend les dialogues, mais aussi les descriptions d'effets sonores comme [PORTE QUI CLAQUE], les mentions musicales comme [JAZZ ENTRAÎNANT], et les identifications de locuteurs comme [ANNA] quand l'image seule ne permet pas de savoir qui parle. L'objectif est un équivalent écrit complet de la piste audio, pas uniquement de ses mots.

Une conséquence pratique : si vous portez votre vidéo dans une autre langue, vous avez besoin de sous-titres de traduction. Si vous rendez votre vidéo accessible à des spectateurs sourds ou malentendants qui partagent votre langue, vous avez besoin d'un sous-titrage complet. Ces deux livrables peuvent utiliser le même format de fichier SRT. Leur contenu est différent.

La distinction ouvert/fermé porte sur la technique de rendu : peut-on désactiver ? La distinction sous-titrage d'accessibilité / sous-titres de traduction porte sur le contenu : que contient la piste ? Ces deux axes sont indépendants et se combinent librement.

Timeline de montage vidéo montrant les pistes de sous-titres et les barres de synchronisation

Sous-titres fermés vs sous-titres incrustés : quand choisir l'un ou l'autre

La question se pose à chaque export. Sur quelle plateforme finira votre vidéo ?

Les plateformes comme YouTube, Vimeo ou les sites web en HTML5 lisent les fichiers de sous-titres externes (SRT, VTT). La piste est séparée, le spectateur contrôle l'affichage. C'est le cas d'usage naturel des sous-titres fermés.

Les plateformes sociales, Instagram Reels, TikTok, LinkedIn en lecture automatique, ne lisent pas les pistes de sous-titres externes. Si vos sous-titres ne sont pas incrustés dans l'image, ils n'apparaissent pas. La grande majorité des vidéos virales en flux social sont encodées avec des sous-titres incrustés pour cette raison.

Le sous-titre incrusté est permanent et universel. Le sous-titre fermé est flexible et sélectif, mais dépend d'une infrastructure de lecture qui ne l'est pas partout.

Un workflow courant : exporter une version avec sous-titres fermés pour YouTube et le site, et une version avec sous-titres incrustés pour les réseaux sociaux. L'IA génère la transcription une fois. Les deux formats partent du même fichier.

Smartphone affichant le bouton d'activation des sous-titres dans une application de streaming vidéo

SRT, VTT, SCC : quel format pour quelle destination

Un fichier de sous-titres est un document texte structuré. Chaque bloc contient un numéro de séquence, les horodatages d'entrée et de sortie, et le texte à afficher. La syntaxe change selon le format. La logique reste la même.

Le format SRT (SubRip Text) est le plus répandu. Il est lu par YouTube, Vimeo, la majorité des lecteurs de bureau, et accepté par presque tous les outils de montage vidéo. C'est le format de départ sur la grande majorité des workflows créateurs.

Le format VTT (WebVTT) est la version web, standardisée par le W3C. Il prend en charge le positionnement et les styles directement dans le fichier, et s'intègre nativement à la balise HTML5 <track>. Si vous diffusez sur votre propre site, VTT est le choix logique.

Le format SCC (Scenarist Closed Captions) est spécifique à la diffusion télévisée et au câble nord-américain. Il encode les données de sous-titrage dans le signal vidéo lui-même, dans le champ de suppression de ligne verticale. Si vous distribuez sur des plateformes broadcast américaines, c'est le format qui vous sera demandé.

La transcription et le minutage restent identiques quel que soit le format. Seule l'enveloppe change. La plupart des outils d'IA exportent en SRT par défaut et permettent la conversion vers VTT ou SCC.

Fichier de sous-titres ouvert dans un éditeur de code montrant les codes d'horodatage SRT et le texte des dialogues

Vitesse de lecture et découpe des lignes : les chiffres qui séparent le lisible de l'illisible

Un sous-titre se lit à l'écran, pas sur une page. La vitesse à laquelle les mots défilent conditionne si le spectateur lit ou abandonne.

La norme de l'industrie se situe entre 17 et 21 caractères par seconde (cps) pour un public adulte. En dessous de 17 cps, les sous-titres semblent lents. Au-dessus de 21 cps, une partie significative de l'audience décroche, en particulier sur mobile. La durée minimale d'affichage recommandée est d'une seconde et demie par bloc, même pour une réplique très courte.

La découpe des lignes suit des frontières grammaticales, pas des frontières de minutage. "J'ai trouvé / ce que tu cherchais" respecte l'unité de sens. "J'ai / trouvé ce que tu cherchais" la brise inutilement. Deux lignes maximum par bloc, 42 caractères maximum par ligne sur un format 16:9 standard.

Ces chiffres ne sont pas arbitraires. Ils décrivent ce qu'un spectateur peut lire confortablement sans perdre l'image. Un sous-titre réussi, on ne le lit pas vraiment. On le comprend avant de s'en rendre compte.

La question de l'obligation légale revient régulièrement chez les créateurs qui publient sur des plateformes professionnelles, institutionnelles ou commerciales.

En France, la loi impose le sous-titrage intégral des programmes diffusés sur les chaînes dont l'audience dépasse un seuil défini par l'ARCOM (anciennement CSA). Les grandes chaînes hertziennes, TF1, France 2, M6 et les autres, sont soumises à une obligation de 100% de leurs programmes. Les chaînes à plus faible audience ont des obligations progressives fixées par convention.

Les plateformes de streaming (SVOD, AVOD) entrent progressivement dans le périmètre de la directive européenne sur les services de médias audiovisuels (directive SMA), qui fixe des objectifs croissants d'accessibilité aux États membres. En pratique, les grandes plateformes sous-titrent l'intégralité de leurs catalogues depuis plusieurs années.

Pour les créateurs indépendants sur YouTube ou les réseaux sociaux, l'obligation légale directe reste faible. Mais les règles d'accessibilité numérique, le RGAA en France et les WCAG 2.1 au niveau européen, s'appliquent dès qu'un contenu vidéo est publié dans un contexte professionnel ou institutionnel. Le niveau AA exige des sous-titres synchronisés pour tout contenu vidéo préenregistré.

Pour toute marque, administration ou organisme de formation publiant des vidéos, le sous-titrage n'est plus une option éditoriale. C'est une exigence de conformité.

Comment l'IA génère les sous-titres aujourd'hui

Les modèles actuels de reconnaissance vocale automatique, dont Whisper d'OpenAI et ses dérivés, produisent une transcription minutée avec des horodatages au niveau du mot. L'outil regroupe ensuite ces mots en blocs de lecture selon des règles de vitesse en cps et de longueur de ligne, parfois ajustées par des modèles de langage pour coller aux frontières grammaticales.

L'IA réalise 90 à 95% du travail sur une vidéo en conditions normales : transcription, minutage, découpe initiale des lignes. Ce qui reste pour la relecture humaine : les noms propres, le jargon technique, les homophones que l'IA confond régulièrement ("ses", "ces" et "c'est" par exemple), et les passages où deux locuteurs se chevauchent.

Sur une vidéo en voix claire avec peu de bruit de fond, la relecture prend deux à trois minutes. Sur une vidéo à forte densité sonore ou avec plusieurs accents régionaux prononcés, comptez cinq à dix minutes supplémentaires.

L'IA ne remplace pas le relecteur. Elle fait 90 à 95% du minutage, vous vérifiez ce qui reste. C'est l'économie réelle du sous-titrage assisté par IA.

Testez sur votre prochaine vidéo : générez la piste SRT avec un outil IA, relisez les coupures de ligne, et exportez en piste séparée pour YouTube et en incrusté pour vos réseaux sociaux. C'est là que la différence entre les deux formats devient concrète.

Questions fréquentes

Quelle est la différence entre sous-titres et sous-titrage d'accessibilité ?
Les sous-titres reprennent uniquement les dialogues, parfois traduits dans une autre langue. Le sous-titrage d'accessibilité inclut aussi les descriptions d'effets sonores, les mentions musicales et les identifications de locuteurs, pour que les spectateurs sourds ou malentendants disposent d'un équivalent écrit complet de la piste audio.
Comment activer les sous-titres sur YouTube ?
Cliquez sur l'icône CC en bas de la vidéo, à droite de la barre de progression. Si la vidéo dispose d'une piste SRT ou VTT uploadée manuellement, ces sous-titres sont prioritaires et généralement plus précis que les sous-titres automatiques générés par YouTube.
Quelle est la vitesse de lecture recommandée pour un sous-titre ?
Entre 17 et 21 caractères par seconde (cps) pour un public adulte. En dessous de 17 cps, le rythme semble lent. Au-dessus de 21 cps, une partie de l'audience décroche. La durée d'affichage minimale recommandée est d'une seconde et demie par bloc, même pour les répliques très courtes.
Faut-il sous-titrer ses vidéos en France ?
Pour les créateurs indépendants sur les réseaux sociaux, l'obligation légale directe est faible. En revanche, pour tout contenu publié dans un contexte professionnel ou institutionnel, les règles RGAA et WCAG 2.1 imposent des sous-titres synchronisés pour les vidéos préenregistrées dès le niveau d'accessibilité AA.
Quelle est la différence entre les formats SRT et VTT ?
Les deux sont des formats de sous-titres textuels avec horodatages. SRT est le format universel, lu par presque tous les lecteurs vidéo. VTT est la version web standardisée par le W3C, avec prise en charge native dans HTML5 et quelques options de style supplémentaires. Pour YouTube, les deux fonctionnent. Pour votre propre site web, VTT est le choix logique.
Les sous-titres générés par IA sont-ils suffisamment précis ?
Sur une vidéo en voix claire avec peu de bruit de fond, oui. Les modèles actuels comme Whisper donnent une transcription propre, relisable en deux à trois minutes. La vigilance porte surtout sur les noms propres, le jargon technique et les homophones écrits que l'IA confond souvent.
Peut-on incruster des sous-titres SRT directement dans une vidéo ?
Oui, la plupart des outils de sous-titrage IA (Submagic, Veed, Kapwing, Descript) permettent de partir d'un fichier SRT et de l'incruster dans l'image pour créer une version avec sous-titres ouverts. C'est le format recommandé pour les réseaux sociaux comme Instagram et TikTok, qui ne lisent pas les pistes de sous-titres externes.
SubsVideo