Wat is closed captioning: definitie en toepassingen
Samenvatting
Closed captioning is een tekst-track die los van het videobestand staat en door de kijker aan of uit kan worden gezet. In tegenstelling tot gewone ondertitels bevatten closed captions ook geluidseffecten, muziekaanduidingen en spreker-identificaties. Het bestand is doorgaans SRT, VTT of SCC. Leessnelheid (maximaal 17 cps) en grammaticale regelindeling bepalen of de captions ook werkelijk leesbaar zijn. AI genereert de timing in minuten; nalopen kost maximaal een kwartier.
Wat is closed captioning? De schakelbare ondertiteltrack uitgelegd
Wat is closed captioning? Een tekst-track die gekoppeld is aan een video en dialoog, geluidseffecten, spreker-aanduidingen en andere auditieve details weergeeft als zichtbare tekst op het scherm. De captions staan in een apart bestand dat de videospeler synchroniseert met het geluid. Zet je ze uit, dan verandert de video niets. Zet je ze aan, dan wordt elk audiomoment leesbaar. Het gebruikte formaat is doorgaans SRT, VTT of SCC, afhankelijk van het platform. De CC-knop regelt de zichtbaarheid. Wat die knop toont, hangt volledig af van hoe de captions zijn opgebouwd. Of je nu publiceert voor toegankelijkheid, voor kijkers die op mute staan, of gewoon wil begrijpen wat het CC-icoon in je videospeler betekent: dit onderscheid is de basis.
Wat "closed" betekent: de ondertitels die je aan- en uitzet
Closed betekent dat de captions verborgen zijn totdat de kijker ze inschakelt. De tekst is niet ingebrand in het beeld. Hij staat in een apart data-track dat videosoftware op aanvraag leest en over de video legt.
Druk je op de CC-knop van een afstandsbediening of klik je het caption-icoon aan in een speler, dan verschijnen de captions. Druk je er opnieuw op, dan verdwijnen ze. Het videobestand zelf verandert niet.
Dit is het technische kernverschil met open captions. Open captions worden permanent in het videoframe gerenderd en kunnen niet worden verwijderd. Closed captions reizen als een begeleidend bestand. Die mogelijkheid om ze aan en uit te zetten is precies wat het woord "closed" in closed captioning definieert.
In de praktijk betekent dit voor videocreators dat ze twee losse elementen beheren: het videobestand en het captionbestand. Upload je alleen het videobestand naar YouTube, dan heeft de kijker geen captions om te activeren. Upload je het SRT-bestand erbij, dan verschijnt de CC-knop vanzelf. Het captionbestand bepaalt wat er te zien is; het videobestand blijft altijd ongewijzigd.
Closed captions vs ondertitels: een inhoudsverschil, geen formaatkwestie
De woorden "captions" en "ondertitels" worden in het dagelijks gebruik door elkaar gebruikt, maar ze beschrijven verschillende dingen op het niveau van wat ze bevatten.
Ondertitels gaan ervan uit dat de kijker kan horen. Ze dragen het dialoog, soms vertaald naar een andere taal, en verder niets. Als een deur achter de camera dichtsloeg, melden ondertitels dat niet.
Closed captions gaan ervan uit dat de kijker niet kan horen. Ze bevatten het dialoog, maar ook omschrijvingen van geluidseffecten zoals [DEUR SLAAT DICHT], muziekaanduidingen zoals [VROLIJKE JAZZ] en spreker-identificaties zoals [ANNA] wanneer het beeld alleen niet duidelijk maakt wie er spreekt. Het doel is een volledig schriftelijk equivalent van het audiokanaal.

Een praktisch gevolg: vertaal je een video voor een buitenlands publiek, dan wil je waarschijnlijk ondertitels (alleen dialoog, in de doeltaal). Maak je je video toegankelijk voor dove of slechthorende kijkers die jouw taal spreken, dan wil je closed captions (dialoog plus elk audiodetail). Een vertaalde ondertiteltrack en een toegankelijke captiontrack zijn twee verschillende producten, ook al gebruiken ze hetzelfde SRT-bestandsformaat. Beide kunnen worden geleverd als een schakelbaar tekstbestand of ingebrand in het beeld. Het open/closed-onderscheid gaat over of je ze kunt uitzetten. Het captions/ondertitels-onderscheid gaat over wat erin staat.
Wat er in een closed caption staat: meer dan alleen dialoog
Een caption is geen transcriptie van het gesproken woord, maar een beschrijving van de hele geluidservaring. Dat betekent in de praktijk het volgende.
Dialoog vormt de kern. Elke gesproken zin, elke opmerking of elk tussenwerpsel dat relevant is voor het begrip van de scène.
Geluidseffecten die betekenis dragen worden omschreven tussen haakjes: [TELEFOON GAAT OVER], [GLAS BREEKT], [APPLAUS]. Niet elk geluid verdient een caption; alleen wat de kijker nodig heeft om de scène te begrijpen.
Muziekaanduidingen geven context: [SPANNENDE MUZIEK], [EINDE DEUNTJE]. Ze beschrijven niet elke noot, maar brengen de emotionele lading van het beeld over aan wie niet kan horen.
Spreker-identificaties zijn cruciaal zodra meerdere personen in beeld zijn of een stem buiten beeld klinkt. [INTERVIEWER], [PERSOON 1] of een naam: ze voorkomen dat de kijker de draad kwijtraakt in een gesprek.
Dit is ook waarom een automatisch gegenereerde transcriptie nog geen volledige closed caption is. Transcriptiesoftware pikt het gesproken woord op. Goede captionsoftware voegt structuur toe: timing, regelindeling en niet-verbale elementen.
Closed captions vs open captions: ingebrand of als apart bestand
Het onderscheid zit in de manier waarop de captions aan het videobestand zijn verbonden.
Open captions zijn permanent onderdeel van het videoframe. Ze zijn ingebrand tijdens de export en kunnen niet worden uitgezet. Ze zien er altijd hetzelfde uit op elk scherm en elk platform. Ze zijn handig voor sociale media waar ondertitelbestanden niet worden ondersteund, of wanneer je volledige controle wilt over het uiterlijk van de tekst.
Closed captions reizen als een apart bestand of data-track. De kijker kan ze in- en uitschakelen. Op platforms als YouTube en Vimeo kan de kijker ook de lettergrootte en kleuren aanpassen. Closed captions zijn de standaard voor wettelijke toegankelijkheidsvereisten.

De keuze hangt af van het platform en het doel. Voor een YouTube-video of een cursusplatform: closed captions, altijd. Voor een Instagram Reel of TikTok: open captions, want die platformen renderen geen aparte teksttracks in de feed. Voor een bedrijfsvideo die op meerdere kanalen wordt gepubliceerd, lever je beide versies: een bestand voor de schakelbare versie en een ingebrande export voor de feed.
SRT, VTT en SCC: de bestanden die captions dragen
Closed captions leven in tekstbestanden. Drie formaten domineren het veld.
SRT (SubRip Text) is het universele formaat. Elk cue bestaat uit een volgnummer, een tijdcode in het formaat 00:00:01,000 --> 00:00:03,500 en de tekst. Leesbaar in elke teksteditor, ondersteund door vrijwel elk platform.
VTT (Web Video Text Tracks) is de webstandaard. Vergelijkbaar met SRT, maar met seconden als decimalen en ondersteuning voor styling, positionering en extra metadata. Standaard voor HTML5-video en modern webgebruik.
SCC (Scenarist Closed Caption) is het formaat voor televisie en broadcast. Complexer, met ingebedde stijlinformatie en timing afgestemd op de framerateklok van televisiesignalen. Vereist voor ondertiteling bij Amerikaanse omroepdiensten.

Voor de meeste videocreators is SRT de veilige keuze voor YouTube en Vimeo, VTT de standaard voor webgebaseerde spelers en SCC alleen relevant bij levering aan broadcasters.
De meeste AI-captioningtools exporteren standaard in SRT. Voor een cursusplatform of eigen website is VTT de logische keuze, omdat het formaat rechtstreeks door de HTML5-videospeler wordt gelezen zonder extra conversie. SCC heeft een steile leercurve en is alleen zinvol voor wie professionele content levert aan omroepdiensten of broadcast-distributiekanalen.
Leessnelheid en regelindeling: de cijfers die tellen
Een caption die technisch klopt maar onleesbaar is, helpt niemand. Twee maten bepalen de leesbaarheid in de praktijk.
Tekens per seconde (cps) is de snelheid waarmee tekst op het scherm verschijnt. De vuistregel voor online video: maximaal 17 cps voor een algemeen publiek, tot 20 cps voor snel sprekende sprekers. Boven de 20 cps lezen kijkers de tekst niet meer volledig; ze scannen alleen de eerste woorden. De FCC-richtlijnen voor closed captioning voor televisie stellen een maximum van 17 cps voor vooraf opgenomen content.
Regelindeling op de juiste grammaticale grens is het andere ijkpunt. Snij een zin niet midden in een gedachte: "Ik ga naar / de winkel" is slechter dan "Ik ga / naar de winkel". Logische knipplaatsen zijn na voorzetsels, voor voegwoorden of aan het einde van een bijzin.
Twee regels per cue, maximaal 42 tekens per regel: dat is de standaard die de meeste platformen en broadcasters hanteren. Niet als absolute limiet, maar als richtsnoer voor wat gemiddeld leesbaar is op een beeldscherm. De WCAG 2.1-vereisten voor captions specificeren dat captions gelijk moeten zijn aan het gesproken woord plus niet-verbale informatie die nodig is voor begrip.
Hoe AI closed captions genereert
Het handmatig invoeren van tijdcodes is voor de meeste creators verleden tijd. Moderne AI-captioningtools werken in drie stappen.
Spraakerkenning zet het audiokanaal om in tekst. De nauwkeurigheid hangt af van de geluidskwaliteit, het accent en het vocabulaire van de spreker. Voor helder gesproken Nederlands duikt de foutmarge al snel onder de vijf procent.
Automatische tijdkoppeling verbindt elk woord of elke zin aan de bijbehorende tijdcode. De meeste tools werken op woordniveau: ze weten precies wanneer elk woord begint en eindigt, en verdelen de tekst in cues op basis van die timestamps.
Regelindeling en cue-opdeling is de stap die handwerk onderscheidt van AI-gegenereerde captions. Een goede tool houdt rekening met cps, regellengtes en grammaticale grenzen. Een minder goede tool knipt gewoon op een vast aantal tekens.
De AI verzorgt timing en transcriptie in minuten. Wat overblijft is een snelle doorloop: spelfouten corrigeren, spreker-IDs toevoegen waar ze ontbreken en onlogische regelbreuken herstellen. Tien minuten nalopen voor een video van twintig minuten is realistisch voor wie dat eenmaal op eigen materiaal heeft geoefend.
Een tool die zowel transcriptie als tijdkoppeling verzorgt, scheelt aanzienlijk in doorlooptijd. Voor een interview van dertig minuten kan het verschil tussen handmatig en AI-ondersteund werken oplopen tot twee uur. De keuze voor welke tool je gebruikt, hangt af van het taalmodel dat wordt ingezet, de mate van controle die je hebt over de regelindeling en het bestandsformaat dat je als uitvoer nodig hebt. Wie regelmatig video's publiceert, merkt al snel dat de kwaliteit van de cue-opdeling meer uitmaakt dan de nauwkeurigheid van de transcriptie alleen.