Cos'e il closed captioning: guida per creator video

Riassunto

Il closed captioning è una traccia di testo attivabile che mostra dialogo, effetti sonori e dettagli audio come testo sullo schermo. A differenza dei sottotitoli, i closed caption includono tutto il layer audio per chi guarda senza suono o non sente. I file SRT, VTT o SCC portano i caption; l'IA genera oggi il minutaggio in pochi secondi, lasciando solo una breve revisione al creator.

Persona che guarda un video con i closed caption visibili sullo schermo del laptop

Cos'e il closed captioning: guida per creator video

Cos'e il closed captioning? È una traccia di testo attivabile, abbinata a un video, che mostra dialogo, effetti sonori, indicazioni sul parlante e altri dettagli audio come testo sullo schermo. I caption vivono in un file separato che il player video legge in sincronia con l'audio. Disattivali e il video è identico. Attivali e ogni momento audio diventa testo leggibile. Il formato di quel file è solitamente SRT, VTT o SCC, a seconda di dove il video viene pubblicato.

Il pulsante CC controlla la visibilità. Quello che quel pulsante rivela dipende interamente da come i caption sono stati costruiti. Capire questa distinzione è utile che tu stia pubblicando per conformità all'accessibilità, per un pubblico che guarda in silenzio, o semplicemente per capire cosa fa davvero l'icona CC nel tuo player.

"Closed" significa spegnibile: la distinzione tecnica che conta

"Closed" in inglese vuol dire chiuso, ma nel contesto del captioning significa nascosto fino a quando lo spettatore decide di mostrarlo. Il testo non è incrostato nell'immagine. Risiede in una traccia dati separata che il software video legge e sovrappone su richiesta.

Premi il pulsante CC su un telecomando o clicca sull'icona nel player e i caption appaiono. Premi di nuovo e scompaiono. Il file video stesso non cambia in nessun modo.

Questa è la distinzione tecnica fondamentale rispetto agli open caption. Gli open caption sono resi in modo permanente nel fotogramma video, non possono essere rimossi. I closed caption viaggiano come file companion esterno. Quella possibilità di attivarli e disattivarli su richiesta è esattamente ciò che definisce la parola "closed" nel closed captioning.

Un dettaglio pratico: su YouTube, il pulsante CC in basso a destra attiva i closed caption se il caricatore ha allegato un file SRT. Se quel file non c'è, non c'è nulla da mostrare. Il video non genera caption da solo.

Closed caption e sottotitoli: differenza di contenuto, non di formato

Le parole caption e sottotitoli vengono usate indifferentemente nel parlato comune, ma descrivono cose diverse a livello di contenuto.

I sottotitoli assumono che lo spettatore possa sentire. Portano il dialogo, a volte tradotto in un'altra lingua, e nient'altro. Se una porta sbatte fuori campo, i sottotitoli non lo menzionano. Se c'è musica di sottofondo che cambia il tono della scena, i sottotitoli tacciono.

I closed caption assumono che lo spettatore non possa sentire. Portano il dialogo, ma anche le descrizioni degli effetti sonori come [PORTA CHE SBATTE], le etichette musicali come [JAZZ VIVACE], e le identificazioni dei parlanti come [ANNA] quando il fotogramma da solo non rende ovvio chi stia parlando. L'obiettivo è un equivalente scritto completo della traccia audio, senza che nessun elemento sonoro narrativo vada perso.

Una conseguenza pratica: se stai traducendo un video per un pubblico straniero, probabilmente vuoi i sottotitoli, ossia solo il dialogo nella lingua di destinazione. Se stai rendendo il tuo video accessibile a spettatori sordi o con difficoltà uditive che condividono la tua lingua, vuoi i closed caption, dialogo più ogni dettaglio audio rilevante.

Una traccia di sottotitoli tradotta e una traccia di caption per l'accessibilità sono deliverable diversi, anche se usano lo stesso formato file SRT. Entrambe possono essere consegnate come file di testo attivabile oppure bruciate nell'immagine. La distinzione aperto/chiuso riguarda se puoi disattivarli. La distinzione caption/sottotitoli riguarda cosa contengono.

Timeline di montaggio video con tracce caption e barre cue dei sottotitoli

Un closed caption ben costruito per l'accessibilità include quattro categorie di informazioni audio.

Prima il dialogo: le parole esatte dei parlanti, con punteggiatura che riflette l'intonazione naturale, non una versione appiattita della sceneggiatura. "Davvero?" è diverso da "Davvero." e il caption deve rispecchiare quella differenza.

Poi gli effetti sonori narrativi: suoni che cambiano il significato della scena. [TUONO IN LONTANANZA] prima che un personaggio guardi fuori dalla finestra. [CELLULARE CHE VIBRA] quando nessuno nel fotogramma sembra reagire a nulla. Se il suono porta informazioni narrative, va incluso tra parentesi quadre.

Poi i descrittori musicali: [MUSICA TESA], [JINGLE ALLEGRO], [SILENZIO] quando quella pausa è intenzionale. Non ogni nota di ogni brano, ma i cambiamenti di umore che la musica segnala allo spettatore.

Infine le identificazioni dei parlanti: [VOCE FUORI CAMPO], [ANNA] o [TRADUTTORE] quando il visivo non lo chiarisce da solo. Questo è particolarmente importante nei podcast video, nei webinar, nelle interviste con più partecipanti, dove l'inquadratura non sempre mostra chi parla.

Questo è il motivo per cui costruire closed caption richiede più lavoro di un semplice sottotitolo. Non è solo trascrizione: è la versione leggibile di tutto il layer audio, pensata per chi guarda senza sentire.

Closed caption vs open caption: traccia separata o incrostato nell'immagine

La distinzione aperto/chiuso è tecnica: dove vivono i caption nel file video.

I closed caption viaggiano in una traccia dati separata, spesso un file sidecar (SRT, VTT, SCC). Il player video li legge e li sovrappone in modo dinamico. Lo spettatore controlla se appaiono, e la posizione, il font e il colore seguono solitamente le impostazioni del player o della piattaforma.

Gli open caption sono resi direttamente nel fotogramma video, parte dell'immagine come un grafico sovrapposto. Non possono essere disattivati, ridimensionati o tradotti senza ricodificare l'intero video.

Quando usare l'uno o l'altro: i closed caption sono lo standard per l'accessibilità legale e per qualsiasi distribuzione su piattaforma, YouTube, streaming, televisione. Gli open caption sono utili per i reel dei social media dove l'autoplay senza audio è la norma di consumo, per le presentazioni in luoghi dove il player non supporta i caption, e per i casi in cui si vuole un controllo stilistico preciso su font e posizionamento.

Molti creator fanno entrambe le cose: generano un file di closed caption per YouTube e per i requisiti di accessibilità, poi bruciano gli open caption in una versione dedicata per Instagram Reels o TikTok.

Smartphone con pulsante di attivazione closed captioning visibile in un'app di streaming video

SRT, VTT, SCC: i formati che portano i caption

Il formato del file di caption determina dove puoi usarlo. Non è una scelta indifferente.

SRT (SubRip Text) è il formato universale. Funziona su YouTube, Vimeo, la maggior parte dei player web, gli editor video, i lettori multimediali locali. La struttura è semplice: numero di sequenza, timestamp di ingresso e uscita, testo. Nessun supporto per la posizione avanzata o la formattazione complessa. Se non sai quale formato scegliere, SRT è la risposta predefinita corretta per quasi tutti i casi.

VTT (WebVTT) è lo standard del web. Progettato per l'elemento HTML video. Supporta le note di posizione (utile per non coprire lo speaker in campo), la formattazione inline come grassetto, corsivo e colore, e le note di capitolo. Se stai incorporando video direttamente su un sito web o usi un player basato su browser, VTT è più capace di SRT.

SCC (Scenarist Closed Captions) è il formato broadcast. Utilizzato per la trasmissione televisiva e il delivery a piattaforme come Netflix, Prime Video, Apple TV+. Codifica i dati di caption nel flusso video stesso secondo standard regolamentati. Per la maggior parte dei creator, SCC entra in gioco solo in un workflow di distribuzione broadcast professionale.

Per il quotidiano: genera SRT, carica su YouTube, esporta VTT se hai bisogno di incorporare sul web. Il formato SCC arriva solo se il tuo contenuto sale su una piattaforma di distribuzione certificata.

File di sottotitoli aperto in un editor di codice con codici timestamp SRT e testo del dialogo

Velocità di lettura e interruzioni di riga: i numeri che separano il leggibile dall'illeggibile

Un file di caption tecnicamente valido può essere praticamente inutilizzabile se ignora la velocità di lettura umana.

Lo standard del settore è 17 caratteri al secondo (cps) per i caption in italiano. Sopra i 20 cps, il lettore medio comincia a perdere parole. La trasmissione televisiva usa spesso limiti ancora più conservativi, intorno ai 15 cps. Non è un'opinione: è una misura verificabile in ogni editor di caption che mostri il contatore cps per cue.

Ogni cue ha bisogno di un tempo di esposizione minimo. Un cue che appare per meno di un secondo è quasi impossibile da leggere a qualsiasi velocità. Il minimo pratico è 1,0-1,5 secondi per le battute brevi, con un massimo di 7-8 secondi per i blocchi più lunghi prima che lo spettatore si chieda se i caption si siano bloccati.

Per i tagli di riga, la regola è: taglia al confine grammaticale, non al limite di carattere. "I closed caption rendono / i tuoi video accessibili" è corretto. "I closed caption / rendono i tuoi video accessibili" no. Un'interruzione nel mezzo di un sintagma preposizionale forza il lettore a rileggere per ricostruire il senso.

Due righe al massimo per cue. Se il testo è più lungo, dividilo in due cue separati piuttosto che andare a tre righe. Questi numeri separano un file di caption usabile da uno che frustra chi guarda in silenzio.

Come l'IA genera i closed caption oggi

Il flusso di lavoro manuale per i closed caption, trascrivere, timbrare ogni cue, dividere le righe, esportare, richiedeva circa 5-10 volte la durata del video. L'IA ha ridotto quella proporzione in modo significativo.

Il processo attuale: un modello di riconoscimento vocale (ASR) trascrive l'audio e produce un timestamp per ogni parola. L'algoritmo di layout divide il testo in cue secondo i vincoli di velocità di lettura, suddivide le righe ai confini grammaticali e costruisce il file SRT o VTT. Il file esce in un formato pronto per il caricamento.

L'IA fa bene il 95% del lavoro di minutaggio. Quello che rimane per la revisione umana: i nomi propri e i termini tecnici che il modello trascrive male, i cambi di parlante che non sono chiari dall'audio, e i cue in cui il layout automatico ha tagliato la riga nel posto sbagliato.

Quela revisione in due minuti trasforma un transcript grezzo in closed caption che funzionano davvero per chi guarda senza suono o non sente la tua voce. Testa su una tua video reale per vedere cosa cambia a schermo.

Per approfondire i requisiti legali di accessibilità, la normativa FCC sui closed caption e le linee guida WCAG 1.2.2 restano i riferimenti tecnici principali.

Domande frequenti

Cos'è il closed captioning e come funziona?
Il closed captioning è una traccia di testo attivabile abbinata a un video che mostra dialogo, effetti sonori e dettagli audio come testo sullo schermo. I caption vivono in un file separato (SRT, VTT o SCC) che il player legge in sincronia con l'audio. Il pulsante CC controlla la visibilità: attivali e ogni momento audio diventa testo leggibile, disattivali e il video è identico.
Qual è la differenza tra closed caption e sottotitoli?
I sottotitoli assumono che lo spettatore possa sentire e portano solo il dialogo, a volte tradotto. I closed caption assumono che lo spettatore non possa sentire: includono il dialogo ma anche gli effetti sonori come [PORTA CHE SBATTE], le etichette musicali e le identificazioni dei parlanti. La distinzione è di contenuto, non di formato.
Che differenza c'è tra closed caption e open caption?
I closed caption viaggiano in una traccia dati separata e possono essere attivati o disattivati dallo spettatore. Gli open caption sono resi direttamente nel fotogramma video, parte permanente dell'immagine: non possono essere rimossi senza ricodificare il video. I closed caption sono lo standard per l'accessibilità legale; gli open caption sono utili per i reel social dove l'autoplay senza audio è la norma.
Quali formati di file si usano per i closed caption?
I tre formati principali sono SRT (universale, funziona su YouTube e la maggior parte dei player), VTT (standard web, supporta posizionamento e formattazione inline) e SCC (formato broadcast per televisione e piattaforme come Netflix). Per la maggior parte dei creator, SRT è la scelta predefinita corretta.
Qual è la velocità di lettura consigliata per i closed caption in italiano?
Lo standard è 17 caratteri al secondo (cps). Sopra i 20 cps il lettore medio inizia a perdere parole. La trasmissione televisiva usa spesso limiti più conservativi intorno ai 15 cps. Il tempo di esposizione minimo per ogni cue è 1,0-1,5 secondi. Taglia sempre le righe al confine grammaticale, non al limite di carattere.
Come genera i closed caption l'IA?
Un modello di riconoscimento vocale (ASR) trascrive l'audio con timestamp per ogni parola. L'algoritmo di layout divide il testo in cue rispettando i vincoli di velocità di lettura e taglia le righe ai confini grammaticali. L'IA gestisce il 95% del minutaggio; la revisione umana riguarda nomi propri trascritti male, cambi di parlante ambigui e tagli di riga non ottimali.
I closed caption sono obbligatori per legge?
Negli Stati Uniti, la normativa FCC richiede i closed caption per i programmi televisivi trasmessi. Le linee guida WCAG 1.2.2 richiedono i caption per i video preregistrati nei siti web pubblici a livello AA. In Italia, le normative di accessibilità digitale (Legge Stanca e successive) si allineano progressivamente agli standard europei EN 301 549, che includono i requisiti di sottotitolazione per i contenuti audiovisivi.
SubsVideo