O que e closed captioning: guia sobre legendas ocultas

Resumo

Closed captioning é uma faixa de texto separada do arquivo de vídeo que pode ser ativada ou desativada pelo espectador. Diferente das legendas comuns, o CC inclui efeitos sonoros, identificações de falantes e descrições musicais para acessibilidade a quem não ouve o áudio. Os formatos SRT, VTT e SCC determinam onde a legenda funciona. A IA atual gera esse arquivo em minutos, com revisão rápida antes da publicação.

Pessoa assistindo a um vídeo com closed captions visíveis na tela do laptop

O que e closed captioning: guia completo sobre CC e legendas ocultas

O que e closed captioning? É uma faixa de texto vinculada a um vídeo que exibe diálogos, efeitos sonoros, identificações de falantes e outros detalhes do áudio como texto na tela. O "closed" significa que a legenda pode ser ativada ou desativada pelo espectador. Ela viaja em um arquivo separado, geralmente SRT, VTT ou SCC, que o player lê em sincronia com o áudio. O botão CC controla a visibilidade. Entender essa distinção é essencial para quem publica vídeos com foco em acessibilidade ou quer alcançar quem assiste sem som.

O que "closed" significa: a legenda que você pode desligar

"Closed" quer dizer fechada, oculta, invisível por padrão. O texto não está gravado na imagem do vídeo. Ele fica em uma faixa de dados separada que o software de reprodução lê e sobrepõe à imagem sob demanda.

Pressione o botão CC no controle remoto ou clique no ícone de legenda no player e as legendas aparecem. Clique novamente e somem. O arquivo de vídeo em si não muda.

Esse é o ponto técnico central que diferencia a legenda oculta da legenda aberta. A legenda aberta está renderizada permanentemente no quadro de vídeo. Não tem como removê-la. A legenda oculta viaja como um arquivo companheiro.

Essa capacidade de ser ligada ou desligada é o que define a palavra "closed" no closed captioning. Não é uma questão de qualidade ou precisão: é uma questão de onde o texto vive em relação à imagem.

Closed captions vs legendas: uma diferença de conteúdo, não de formato

As palavras "captions" e "subtitles" são usadas de forma intercambiável no dia a dia, mas descrevem coisas diferentes em termos do que contêm.

Legendas (subtitles) pressupõem que o espectador pode ouvir. Elas trazem apenas os diálogos, às vezes traduzidos para outro idioma. Se uma porta bate fora do quadro, a legenda não menciona. Se há música instrumental ao fundo, ela fica de fora.

O closed captioning pressupõe que o espectador não pode ouvir. Ele traz os diálogos, mas também descrições de efeitos sonoros como [PORTA BATENDO], rótulos musicais como [JAZZ ANIMADO] e identificações de falantes como [ANNA] quando o quadro sozinho não deixa claro quem está falando. O objetivo é um equivalente textual completo da faixa de áudio.

Uma consequência prática: se você está traduzindo um vídeo para uma audiência estrangeira, provavelmente quer legendas simples (apenas diálogo, no idioma de destino). Se está tornando seu vídeo acessível para espectadores surdos ou com deficiência auditiva que falam o mesmo idioma, quer closed captions completos, com cada detalhe de áudio incluído. Uma faixa de legenda traduzida e uma faixa de legenda de acessibilidade são entregas diferentes, mesmo que usem o mesmo formato de arquivo SRT.

Linha do tempo de edição de vídeo mostrando faixas de legenda e barras de marcação de subtítulo

Muita gente acha que closed captioning é só colocar o diálogo em texto. Na prática, um CC completo vai além disso.

Efeitos sonoros relevantes: não todos os sons, apenas os que importam para a compreensão da cena. [SIRENE AO FUNDO] ou [TIRO] mudam o contexto da cena. Um ruído de fundo suave provavelmente não precisa de legenda.

Identidade do falante: quando há mais de uma pessoa falando e o quadro não deixa claro quem é quem, o nome do falante aparece entre colchetes ou antes dos dois-pontos. Exemplo: PEDRO: Você viu o arquivo? Esse detalhe é especialmente importante em podcasts em vídeo, entrevistas e painéis com múltiplos participantes.

Música e tom emocional: [MÚSICA TRISTE] ou [TRILHA SUSPENSE] comunicam algo que o diálogo não carrega sozinho. Em produções dramáticas ou de entretenimento, esse contexto faz diferença na experiência do espectador surdo.

Silêncio intencional: às vezes o [SILÊNCIO] em si é informação. Em filmes de suspense ou em cenas de tensão, um momento sem som é narrativo. Ele merece estar no CC.

Esses detalhes fazem a diferença entre uma legenda que apenas reproduz palavras e uma que substitui de verdade a experiência auditiva completa.

Closed captions vs open captions: arquivo separado ou incrusação permanente

O open captioning (legenda aberta) grava o texto diretamente no quadro de vídeo. Isso é chamado de burn-in. O resultado: as legendas estão sempre visíveis, não podem ser removidas, e qualquer personalização de fonte ou posição é permanente.

O closed captioning mantém o texto em um arquivo ou faixa separada. O player sobrepõe as legendas durante a reprodução. O espectador pode ativá-las, desativá-las e, em algumas plataformas, ajustar fonte e cor conforme preferir.

Cada abordagem tem seu lugar. O burn-in faz sentido para conteúdo publicado em plataformas que não suportam CC, como stories do Instagram ou vídeos exportados para apresentações corporativas. O arquivo CC faz sentido para YouTube, plataformas de streaming e qualquer conteúdo que precise atender às diretrizes de acessibilidade da WCAG 2.1.

Um detalhe importante: o burn-in é irreversível. Uma vez incrusada, a legenda não sai sem regravação. O arquivo CC pode ser editado, traduzido e substituído sem tocar no vídeo. Para quem vai reutilizar o conteúdo em múltiplos idiomas ou mercados, o arquivo separado é sempre a escolha mais flexível.

Smartphone mostrando botão de ativação de closed captioning em aplicativo de streaming de vídeo

SRT, VTT, SCC: os formatos que carregam as legendas

O formato de arquivo determina onde a legenda funciona. Três formatos dominam o mercado.

SRT (SubRip Text): o formato mais universal. Estrutura simples: numeração sequencial, timestamps no padrão 00:00:01,000 --> 00:00:03,500, e o texto da legenda abaixo. Compatível com YouTube, Vimeo, Facebook, a maioria dos players de desktop e praticamente qualquer plataforma de vídeo. Simples de editar num editor de texto qualquer.

VTT (WebVTT): a versão web. Estrutura parecida com o SRT mas com suporte a metadados, posicionamento e estilização CSS. É o padrão para HTML5. Se você entrega conteúdo via player web customizado ou precisa controlar a posição das legendas na tela, VTT é a escolha certa.

SCC (Scenarist Closed Caption): formato de broadcast. Usado em transmissões de televisão nos EUA, exigido pela FCC para conteúdo em rede aberta e a cabo. Mais complexo de gerar e editar que os anteriores, mas necessário quando o destino é televisão ou plataformas que seguem padrões de broadcast americano.

A regra prática é simples: YouTube e redes sociais aceitam SRT. Player web customizado pede VTT. Broadcast americano precisa de SCC. Não existe motivo para usar SCC em conteúdo que vai direto ao YouTube.

Arquivo de legenda aberto em editor de código mostrando códigos de timestamp SRT e texto de diálogo

Velocidade de leitura e quebra de linha: os números que importam

Uma legenda mal cronometrada se percebe na leitura. O texto passa rápido demais, ou lento demais. A quebra de linha no meio de uma ideia força o olho a voltar e reler. Isso é corrigível com dois números simples.

Velocidade de leitura (cps): o padrão de broadcast americano é 17 cps para closed captions. Padrões europeus ficam entre 14 e 17 cps dependendo do idioma. Para o português, 15 cps é um bom ponto de partida: dá tempo suficiente para ler sem que o texto pareça arrastado demais.

Para calcular: conte os caracteres da legenda incluindo espaços, e divida pela duração em segundos. Se uma legenda de 45 caracteres fica na tela por 3 segundos, você está em 15 cps. Acima de 17 cps, a leitura começa a ficar desconfortável para a maioria das pessoas.

Quebra de linha: corte sempre em fronteiras gramaticais naturais. Nunca separe o artigo do substantivo, nem o auxiliar do verbo principal. "Você precisa/ de ajuda" é uma quebra ruim porque divide uma construção sintática inteira. "Você precisa/ revisar o arquivo" é melhor porque cada linha termina num ponto de respiro natural.

Duração mínima: legendas com menos de 1,2 segundo na tela não são percebidas conscientemente pelo espectador. Mesmo que o falante diga algo muito rápido, estenda a legenda para pelo menos 1,2 segundo.

Duas linhas por legenda é o máximo recomendado. Três linhas cobrem parte demais da imagem e parecem parágrafos de texto corrido, não legendas. A legenda certa não chama atenção. Ela se lê antes de você perceber que estava lendo.

Onde o closed captioning é legalmente exigido

A obrigação varia por mercado e tipo de conteúdo, mas a tendência global é de ampliação progressiva das exigências.

Nos EUA: a FCC exige closed captions em todo conteúdo televisivo e em vídeos online que já passaram pela televisão. A regulamentação da FCC detalha os critérios de precisão, sincronia, completude e posicionamento que o CC precisa atender.

Na União Europeia: a Diretriz de Serviços de Mídia Audiovisual exige que serviços de streaming tornem progressivamente mais conteúdo acessível, com metas crescentes de cobertura de legendas para pessoas surdas e com deficiência auditiva.

No Brasil: o Decreto 5.296/2004 e normas da ANATEL regulam a legenda oculta em transmissões de TV. Emissoras de televisão aberta têm obrigação de legendagem desde 2006, com padrões de qualidade definidos pela Norma Complementar 01/2006.

Para conteúdo online e plataformas digitais, a WCAG 2.1 é a referência internacional de acessibilidade mais adotada. O critério 1.2.2 exige legendas para todo conteúdo de vídeo pré-gravado que tenha áudio no nível de conformidade AA.

A pergunta não é mais "preciso de CC?". Para quem publica em plataformas amplas, distribui para mercados regulados ou quer alcançar o maior número possível de espectadores, a resposta já é sim.

Como a IA gera closed captions hoje

O processo manual de legendagem, em que um transcritor ouvia o áudio e digitava cada fala com timestamps precisos, levava entre 4 e 10 horas para cada hora de vídeo. A IA mudou completamente essa equação.

Os modelos atuais de transcrição segmentam o áudio em trechos, detectam silêncios naturais, identificam diferentes falantes e geram os timestamps automaticamente. O resultado é um arquivo SRT ou VTT editável disponível em minutos, não horas.

A ressalva honesta: a IA faz bem o minutage e a transcrição do conteúdo padrão. Ela ainda tropeça em nomes próprios pouco comuns, jargão técnico especializado e sotaques regionais marcados. Um revisor passa pelo arquivo em dois a cinco minutos e corrige o que escapou. Esse tempo é incomparavelmente menor que a legendagem manual completa.

Para quem publica vídeos com regularidade, a rotina que funciona na prática é: fazer o upload do vídeo, gerar o CC automaticamente pelo modelo de transcrição, revisar rapidamente os trechos sinalizados como incertos, e exportar no formato correto para a plataforma de destino. O arquivo fica pronto para publicação junto com o vídeo, sem gargalo de produção.

Perguntas frequentes

O que é closed captioning?
É uma faixa de texto vinculada a um vídeo que pode ser ativada ou desativada pelo espectador. Diferente do conteúdo gravado diretamente na imagem, o CC viaja em um arquivo separado, geralmente SRT, VTT ou SCC, e é sobreposto pelo player durante a reprodução. Inclui diálogos, efeitos sonoros e identificações de falantes.
Qual a diferença entre closed captioning e legenda comum?
Legenda (subtitle) assume que o espectador ouve e traz apenas os diálogos. Closed captioning assume que o espectador não ouve e inclui também efeitos sonoros, rótulos musicais e identificação de falantes, para uma experiência auditiva completa em texto.
Qual a diferença entre closed captions e open captions?
Open captions são gravadas diretamente no quadro de vídeo por burn-in e não podem ser removidas. Closed captions ficam em um arquivo separado e podem ser ativadas ou desativadas pelo espectador durante a reprodução, com mais flexibilidade para personalização.
Que formatos de arquivo são usados para closed captioning?
Os três principais são SRT (o mais universal, compatível com YouTube e a maioria das plataformas), VTT (padrão para players web em HTML5, com suporte a posicionamento CSS) e SCC (formato de broadcast americano, exigido pela FCC para transmissão televisiva).
O closed captioning é obrigatório por lei no Brasil?
Sim, para emissoras de televisão aberta desde 2006, regulado pelo Decreto 5.296/2004 e normas da ANATEL. Para conteúdo online, a WCAG 2.1 é a referência internacional mais adotada: o critério 1.2.2 exige legendas para vídeos pré-gravados com áudio no nível AA.
Como calcular a velocidade de leitura de uma legenda?
Divida o número de caracteres da legenda, incluindo espaços, pela duração em segundos que ela fica na tela. O resultado é a velocidade em caracteres por segundo (cps). Para o português, 15 cps é o ponto de partida recomendado. Acima de 17 cps, a leitura começa a ficar desconfortável.
A IA consegue gerar closed captions precisos?
Sim, para a maior parte do conteúdo. Modelos atuais geram transcrição e timestamps automaticamente em minutos. A revisão manual fica nos detalhes: nomes próprios pouco comuns, jargão técnico e sotaques regionais. Em geral, um revisor passa pelo arquivo em 2 a 5 minutos para corrigir o que a IA errou.
SubsVideo