Was ist Closed Captioning? Umschaltbare Untertitel erklärt

Zusammenfassung

Closed Captioning bezeichnet umschaltbare Texttracks, die einem Video als separate Datei beigefügt sind und vom Zuschauer per Knopfdruck ein- oder ausgeblendet werden. Im Gegensatz zu reinen Untertiteln enthalten Closed Captions nicht nur den Dialog, sondern auch Geräuschbeschreibungen und Sprecher-Kennzeichnungen. Die gängigen Dateiformate sind SRT, VTT und SCC. Lesbarkeit hängt von cps-Werten (14 bis 17 Zeichen pro Sekunde) und korrekten Zeilenumbrüchen ab. KI-Tools erstellen heute vollständige Caption-Tracks in Minuten.

Person schaut ein Video mit sichtbaren Closed Captions auf einem Laptop-Bildschirm

Was ist Closed Captioning? Umschaltbare Untertitel erklärt

Was ist Closed Captioning? Ein umschaltbarer Texttrack, der einem Video als separate Datei beigefügt ist und Dialog, Geräuschbeschreibungen, Sprecher-Hinweise sowie weitere Audiodetails als eingeblendeten Text zeigt. Die Captions liegen in einer Datei, die der Videoplayer synchron mit dem Ton abspielt. Schaltest du sie ab, sieht das Video identisch aus. Schaltest du sie ein, wird jeder Audiomoment zu lesbarem Text auf dem Bildschirm. Das Dateiformat ist meist SRT, VTT oder SCC, je nach Veröffentlichungsort. Die CC-Schaltfläche steuert die Sichtbarkeit. Was diese Schaltfläche sichtbar macht, hängt vollständig davon ab, wie die Captions erstellt wurden. Diese Unterscheidung ist wichtig, ob du für Barrierefreiheit produzierst, ein Publikum erreichst, das mit abgeschaltetem Ton schaut, oder einfach verstehen möchtest, was das CC-Symbol in deinem Player bedeutet.

Das "Closed" in Closed Captioning: Was Umschaltbarkeit bedeutet

Closed bedeutet, dass die Untertitel ausgeblendet sind, bis der Zuschauer sich entscheidet, sie anzuzeigen. Der Text ist nicht fest ins Bild eingebrannt. Er sitzt in einem separaten Datentrack, den die Videoabspielsoftware auf Anfrage einblendet.

Drückst du die CC-Taste auf der Fernbedienung oder klickst du auf das Caption-Symbol im Player, erscheinen die Untertitel. Drückst du erneut, verschwinden sie. Die Videodatei selbst ändert sich dabei nicht.

Das ist der technische Kernunterschied zu Open Captions. Open Captions sind dauerhaft ins Videobild eingerendert. Sie können nicht entfernt werden. Closed Captions reisen als Begleitdatei mit dem Video mit. Genau diese Umschaltbarkeit definiert das Wort "Closed" im Begriff Closed Captioning.

Für deutsche Content-Ersteller ist das besonders relevant: Plattformen wie YouTube, Instagram und TikTok unterstützen Closed-Caption-Tracks als separate Dateien. Das bedeutet, du kannst Captions in mehreren Sprachen hochladen, ohne das Video mehrfach zu rendern oder neu zu exportieren. Jede Sprachversion bleibt eigenständig und kann unabhängig aktualisiert werden.

Closed Captions und Untertitel: Ein inhaltlicher Unterschied, kein formatbasierter

Die Begriffe Captions und Untertitel werden im Alltag oft synonym verwendet. Auf der Ebene des Inhalts beschreiben sie jedoch unterschiedliche Dinge.

Untertitel setzen voraus, dass der Zuschauer hören kann. Sie enthalten den Dialog, manchmal in eine andere Sprache übersetzt, und nichts weiter. Wenn im Off eine Tür zuschlägt, erwähnen Untertitel das nicht.

Closed Captions setzen voraus, dass der Zuschauer nicht hören kann. Sie enthalten den Dialog, aber auch Beschreibungen von Geräuschen wie [TÜR SCHLÄGT ZU], Musikangaben wie [FRÖHLICHER JAZZ] und Sprecher-Kennzeichnungen wie [ANNA] wenn das Bild allein nicht erklärt, wer spricht. Ziel ist eine vollständige schriftliche Entsprechung des Audiotracks.

Video-Editing-Timeline mit Caption-Tracks und Untertitel-Cue-Bars

Eine praktische Konsequenz: Wenn du ein Video für ein anderes Sprachpublikum übersetzt, brauchst du Untertitel, also Dialog in der Zielsprache. Wenn du dein Video für gehörlose oder schwerhörige Zuschauer zugänglich machen möchtest, die deine Sprache kennen, brauchst du Closed Captions, also Dialog plus alle Audiodetails. Ein übersetzter Untertiteltrack und ein Barrierefreiheits-Caption-Track sind verschiedene Endprodukte, auch wenn beide dasselbe SRT-Dateiformat verwenden. Die Open/Closed-Unterscheidung betrifft die Umschaltbarkeit. Die Captions/Untertitel-Unterscheidung betrifft den Inhalt.

Was wirklich in Closed Captions steckt

Ein gut erstellter Closed-Caption-Track enthält mehr als nur den gesprochenen Text. Hier sind die relevanten Elemente im Überblick.

Dialog: Der vollständige gesprochene Inhalt, einschließlich Füllwörter und Korrekturen, wenn diese für das Verständnis relevant sind.

Soundeffekte: Geräusche, die die Bedeutung beeinflussen. [TÜRKLINGEL], [APPLAUS], [TELEFON KLINGELT], [STILLE]. Nicht jedes Hintergrundgeräusch muss erwähnt werden, aber solche, die das Narrativ oder die Stimmung tragen, gehören hinein.

Musik: Art und Stimmung der Musik, wenn sie inhaltlich relevant ist. [RUHIGE KLAVIERMUSIK], [DRAMATISCHE ORCHESTRIERUNG]. Bei YouTube-Content ist das oft relevant für die emotionale Rahmung eines Videos.

Sprecher-Kennzeichnungen: Bei mehreren Sprechern, deren Stimmen sich nicht klar unterscheiden lassen oder die nicht im Bild sind. Entweder als Name [MODERATORIN] oder als Beschreibung [STIMME AUS DEM OFF].

Ton und Betonung: Manchmal ist der Ton entscheidend für die Bedeutung. [IRONISCH], [FLÜSTERND] oder [RUFEND] kann den Unterschied zwischen Verständnis und Missverständnis ausmachen.

Das ist der Grund, warum Closed Captions im Sinne der Barrierefreiheit eine vollwertige Entsprechung des Audioerlebnisses darstellen, nicht nur eine Textversion des Dialogs. Wer sie als reine Transkription behandelt, erstellt keine echten Closed Captions.

Ein praktisches Beispiel: In einem Interview-Video sitzt eine Person mit dem Rücken zur Kamera. Nur eine Untertitel-Transkription würde den Dialog zeigen. Ein vollständiger Closed-Caption-Track würde außerdem kenntlich machen, wer spricht, und relevante Hintergrundgeräusche wie [PUBLIKUMSAPPLAUS] oder [MIKROFON-FEEDBACK] einschließen. Das ist der Unterschied zwischen einem zugänglichen Video und einem, das Zuschauer ohne Ton ausschließt.

Closed Captions vs. Open Captions: Im Bild oder als eigener Track?

Der Unterschied zwischen Closed und Open Captions ist kein Format-, sondern ein Sichtbarkeitsunterschied.

Open Captions sind fest ins Videobild eingebrannt. Sie sind für jeden sichtbar, der das Video abspielt, unabhängig von Playereinstellungen. Kein Knopf, keine Einstellung kann sie ausblenden. Einmal gerendert, gehören sie zum Bild.

Closed Captions liegen als separater Track vor. Der Player zeigt sie nur auf Wunsch des Zuschauers an. Auf Streamingplattformen, YouTube und in professionellen Broadcastumgebungen ist das die Standardform.

Smartphone mit Closed-Captioning-Schalter in einer Video-Streaming-App

Wann sind Open Captions sinnvoll? Wenn der Abspielort keine eigene Caption-Funktion hat. Das klassische Beispiel: Videos in sozialen Medien, die im Autoplay ohne Ton laufen. In diesem Fall möchtest du sicherstellen, dass die Untertitel immer sichtbar sind, ohne dass der Zuschauer etwas einstellen muss.

Wann sind Closed Captions besser? Für alle Umgebungen, in denen verschiedene Zuschauer unterschiedliche Präferenzen haben, für mehrsprachige Inhalte, für Barrierefreiheits-Compliance und für professionelle Distributionskanäle. Beim Erstellen von Video-Content empfiehlt sich oft ein hybrider Ansatz: Closed Captions für YouTube und die eigene Website, Open Captions für die Social-Media-Versionen der gleichen Inhalte.

SRT, VTT, SCC: Die Dateien, die Captions tragen

Closed Captions existieren nur dann als "closed", wenn sie in einem separaten Dateiformat vorliegen. Die drei gängigsten im Überblick.

SRT (SubRip Text): Das universellste Format. Eine einfache Textdatei mit Nummerierung, Zeitcode im Format 00:00:01,000 --> 00:00:04,500 und dem dazugehörigen Text. Lesbar mit jedem Texteditor. Unterstützt von YouTube, Vimeo, VLC und fast allen anderen Playern. Für die meisten Content-Ersteller die erste Wahl.

VTT (Web Video Text Tracks): Das HTML5-Standard-Format. Ähnlich wie SRT, aber mit erweiterter Styling-Unterstützung und Positionierungsmöglichkeiten. Besonders relevant für Webentwickler und Plattformen, die anpassbare Caption-Darstellung benötigen. YouTube akzeptiert es neben SRT problemlos.

SCC (Scenarist Closed Captions): Das ältere, auf Broadcast-TV ausgerichtete Format. Verwendet von Plattformen wie Netflix und traditionellen TV-Sendern. Enthält mehr technische Metadaten für professionelle Broadcast-Anforderungen. Als YouTube-Creator oder Social-Media-Produzent brauchst du es in der Regel nicht.

Untertiteldatei im Code-Editor mit SRT-Zeitcodes und Dialog-Text

Für Standard-YouTube-Uploads reicht SRT vollständig aus. Für Webseiten, die HTML5-Video einsetzen, ist VTT die bessere Wahl. Für Broadcaster oder Streamingdienste mit spezifischen Anforderungen werden SCC oder das verwandte CEA-608/CEA-708-Format gefordert. Die Entscheidung hängt vom Verbreitungsweg ab, nicht von der Qualität der Captions selbst.

Lesegeschwindigkeit und Zeilenumbrüche: Die Zahlen, die zählen

Ein Caption-Track kann technisch korrekt sein und trotzdem unlesbar wirken. Der Unterschied liegt in zwei messbaren Werten: Lesegeschwindigkeit in cps und Zeilenbrüchen.

Lesegeschwindigkeit in cps (Zeichen pro Sekunde):

Der allgemein anerkannte Richtwert für deutsche Captions liegt zwischen 14 und 17 Zeichen pro Sekunde. Netflix Deutschland definiert 17 cps als Maximum. Über 20 cps wird für die meisten Zuschauer unangenehm schnell. Unter 12 cps wirkt der Caption-Block zu träge.

Die Berechnung ist direkt: Zeichenanzahl des Caption-Blocks geteilt durch die Anzeigedauer in Sekunden. Ein Text mit 68 Zeichen, der 4 Sekunden eingeblendet ist, hat 17 cps. Genau an der Grenze.

Zeilenumbrüche an grammatikalischen Grenzen:

Kein Zeilenumbruch mitten in einer Phrase. Falsch: "Das ist ein Beispiel für schlechte / Zeilenumbrüche." Richtig: "Das ist ein Beispiel / für schlechte Zeilenumbrüche." Die Lesbarkeit eines Caption-Tracks hängt mehr von diesen Schnittpunkten ab als von der Schriftart oder -größe. Der Zuschauer liest unbewusst rhythmisch. Ein Umbruch an der falschen Stelle zerstört diesen Rhythmus und erhöht die kognitive Last beim Lesen.

Maximale Zeilenlänge:

42 Zeichen pro Zeile ist der branchenübliche Richtwert. Zwei Zeilen sind das Maximum pro Caption-Block. Mehr als das schränkt das Sichtfeld des Zuschauers auf den unteren Bildrand ein und macht das Zuschauen anstrengend.

Wie KI heute Closed Captions erstellt

Bis vor wenigen Jahren war die Erstellung qualitativ hochwertiger Closed Captions zeitaufwendig: Transkription, manuelles Timing, Formatierung. KI-basierte Caption-Tools haben diesen Prozess grundlegend verändert.

Moderne KI-Transkription arbeitet in mehreren Schritten: Zunächst wandelt das Modell den Audiostream in Text um. Dann aligniert es jeden Textbaustein zeitlich mit dem Audio. Schließlich segmentiert es den Text in lesbare Caption-Blöcke, die die cps-Vorgaben einhalten.

Der Qualitätsunterschied zwischen Tools liegt heute weniger bei der Transkription selbst als beim Segmentierungsalgorithmus. Wo setzt das Tool die Blockgrenzen? Respektiert es grammatikalische Phrasengrenzen? Hält es die Zeilenbruch-Regeln ein? Das ist der Punkt, an dem sich professionelle Caption-Tools von einfachen Autountertiteln unterscheiden.

Die gängige Praxis für Content-Ersteller: Die KI übernimmt das Timing und die grobe Segmentierung. Der Ersteller korrigiert verbleibende Fehler und überprüft die Segmentgrenzen. Das dauert für ein zehnminütiges Video heute oft weniger als zehn Minuten, statt der früher üblichen ein bis zwei Stunden.

Barrierefreiheitsanforderungen wie die WCAG 2.1 Richtlinie für voraufgezeichnete Captions werden durch KI-gestützte Caption-Workflows deutlich leichter erreichbar. Den fertigen Caption-Track exportierst du als SRT oder VTT, lädst ihn in deinen Videoplayer oder deine Plattform, und der CC-Knopf übernimmt den Rest.

Wichtig: Die KI liefert 90 bis 95 Prozent des Timings und der Segmentierung. Das menschliche Gegenlesen der Grenzen und Fehlerkorrekturen bleibt deine Aufgabe. Ein gut kalibrierter Caption-Track, den niemand bemerkt, weil er perfekt mit dem Ton läuft, ist das Ziel. Ein Untertitel, den man wirklich gut liest, fällt nicht auf.

Häufig gestellte Fragen

Was ist der Unterschied zwischen Closed Captions und Untertiteln?
Closed Captions enthalten neben dem Dialog auch Geräuschbeschreibungen, Musikhinweise und Sprecher-Kennzeichnungen. Sie sind für gehörlose oder schwerhörige Zuschauer konzipiert. Untertitel enthalten nur den Dialog und setzen voraus, dass der Zuschauer hören kann. Der Unterschied ist inhaltlicher Natur, nicht formatbasiert.
Welches Dateiformat sollte ich für YouTube-Untertitel verwenden?
Für YouTube reicht SRT (SubRip Text) vollständig aus. Das Format ist einfach aufgebaut, mit jedem Texteditor lesbar und von praktisch allen Videoplattformen unterstützt. VTT ist eine Alternative mit etwas mehr Styling-Optionen, bietet aber für Standard-YouTube-Uploads keinen wesentlichen Vorteil.
Was bedeutet der CC-Button auf meinem Videoplayer?
CC steht für Closed Captions. Durch Drücken des Buttons aktivierst du den separaten Texttrack, der dem Video beigefügt ist. Dieser Track enthält Dialog, Geräuschbeschreibungen und weitere Audiodetails als eingeblendeten Text. Du kannst ihn jederzeit wieder ausblenden, ohne das Video selbst zu verändern.
Wie schnell sollten Closed Captions sein?
Der empfohlene Richtwert für deutsche Captions liegt zwischen 14 und 17 Zeichen pro Sekunde (cps). Netflix Deutschland definiert 17 cps als Maximum. Über 20 cps wird für die meisten Zuschauer unangenehm schnell, unter 12 cps wirkt der Text zu träge. Der Wert ergibt sich aus der Zeichenanzahl geteilt durch die Anzeigedauer in Sekunden.
Sind Closed Captions für YouTube-Videos gesetzlich vorgeschrieben?
In Deutschland gibt es keine allgemeine gesetzliche Pflicht für YouTube-Content-Ersteller, Closed Captions bereitzustellen. Für öffentliche Einrichtungen, Rundfunkveranstalter und Unternehmen mit bestimmten Schwellenwerten gelten jedoch Barrierefreiheitsanforderungen. Die WCAG 2.1 empfiehlt Captions für alle voraufgezeichneten Videoinhalte im Web.
Was ist der Unterschied zwischen Closed Captions und Open Captions?
Open Captions sind dauerhaft ins Videobild eingebrannt und können nicht ausgeblendet werden. Closed Captions liegen als separater Track vor und werden nur auf Wunsch des Zuschauers angezeigt. Open Captions eignen sich für Social-Media-Videos ohne Ton. Closed Captions sind Standard für YouTube, Streamingdienste und professionelle Broadcast-Umgebungen.
Wie erstellt man Closed Captions für ein Video mit KI?
Moderne KI-Caption-Tools transkribieren den Audiotrack, alignieren jeden Textbaustein zeitlich und segmentieren ihn in lesbare Caption-Blöcke. Das Ergebnis exportierst du als SRT oder VTT. Die KI übernimmt etwa 90 bis 95 Prozent der Arbeit. Das manuelle Durchlesen und Korrigieren der Segmentgrenzen dauert für ein zehnminütiges Video oft nur wenige Minuten.
SubsVideo