¿Qué es el closed captioning? Guía para creadores de vídeo

Resumen

El closed captioning es una pista de texto separada que muestra diálogos, efectos de sonido e identificaciones de locutor. A diferencia de los subtítulos abiertos quemados en la imagen, los subtítulos cerrados se activan y desactivan con el botón CC. Los formatos más comunes son SRT, VTT y SCC. La IA actual transcribe y sincroniza el audio automáticamente; la revisión humana garantiza la precisión final.

Persona viendo un vídeo con subtítulos cerrados visibles en la pantalla de un portátil

¿Qué es el closed captioning? Guía para creadores de vídeo

La pregunta sobre que es el closed captioning tiene una respuesta clara: una pista de texto vinculada a un vídeo que muestra diálogos, efectos de sonido, pistas del locutor y otros detalles de audio como texto en pantalla. Los subtítulos viven en un archivo separado que el reproductor lee sincronizado con el audio. El botón CC controla su visibilidad. Activarlos o desactivarlos no altera el vídeo en absoluto. Es el punto de partida para publicar contenido accesible en YouTube, redes sociales o plataformas de formación en línea.

La parte «closed»: por qué puedes activarlos y desactivarlos

«Closed» significa que los subtítulos están ocultos hasta que el espectador decide mostrarlos. El texto no está grabado en la imagen. Reside en una pista de datos separada que el software de vídeo lee y superpone a demanda.

Pulsas el botón CC en un mando a distancia o haces clic en el icono de subtítulos del reproductor y los subtítulos aparecen. Vuelves a pulsarlo y desaparecen. El archivo de vídeo no cambia.

Esta es la distinción técnica central respecto a los subtítulos abiertos u open captions. Los subtítulos abiertos se renderizan de forma permanente en el fotograma del vídeo. No se pueden eliminar. Los subtítulos cerrados viajan como archivo adjunto. Esa posibilidad de activarlos y desactivarlos es lo que define la palabra «closed» en closed captioning.

Subtítulos cerrados vs subtítulos convencionales: diferencia de contenido, no de formato

Las palabras «captions» y «subtítulos» se usan indistintamente en el lenguaje cotidiano, pero describen cosas distintas en cuanto a lo que contienen.

Los subtítulos convencionales asumen que el espectador puede escuchar. Llevan el diálogo, a veces traducido a otro idioma, y nada más. Si una puerta se cierra de golpe fuera de cuadro, los subtítulos no lo mencionan.

Los subtítulos cerrados asumen que el espectador no puede escuchar. Llevan el diálogo, pero también descripciones de efectos de sonido como [PUERTA AL CERRARSE], etiquetas musicales como [JAZZ ANIMADO] e identificaciones del locutor como [ANNA] cuando el encuadre por sí solo no deja claro quién habla. El objetivo es un equivalente escrito completo de la pista de audio.

Línea de tiempo de edición de vídeo con pistas de subtítulos y barras de señales

Una consecuencia práctica: si estás traduciendo un vídeo para una audiencia extranjera, probablemente quieres subtítulos convencionales, es decir, solo el diálogo en el idioma de destino. Si estás haciendo tu vídeo accesible para espectadores sordos o con dificultades auditivas que comparten tu idioma, quieres subtítulos cerrados con el diálogo más cada detalle de audio relevante. Una pista de subtítulos traducida y una pista de accesibilidad son productos distintos, aunque usen el mismo formato de archivo SRT. Ambas pueden entregarse como archivo de texto activable o quemadas en la imagen.

Un archivo de closed captioning completo va mucho más allá de transcribir lo que se dice. Incluye cuatro categorías de información:

Diálogo: lo que dicen los hablantes, con la puntuación necesaria para que el ritmo de lectura coincida con el ritmo de la locución.

Efectos de sonido relevantes: los sonidos que contribuyen al significado de la escena. [TELÉFONO SONANDO], [EXPLOSIÓN] o [PASOS ACELERADOS] informan al espectador de contexto que no puede percibir por el audio.

Música e indicaciones de ambiente: [MÚSICA TENSA], [SILENCIO] o [APLAUSOS] sitúan al espectador en la atmósfera emocional del contenido.

Identificación del hablante: cuando dos personas hablan sin aparecer en cuadro, o cuando la voz en off y el diálogo se mezclan, etiquetar quién habla evita confusiones. El formato habitual es el nombre entre corchetes antes de la frase.

Ninguno de estos elementos es opcional si el objetivo es la accesibilidad real. Un archivo con solo el diálogo es un subtítulo convencional, no un closed caption.

Subtítulos cerrados vs abiertos: pista separada o imagen grabada

La distinción abierto/cerrado es de formato, no de contenido. Ambos pueden contener exactamente la misma información.

Los subtítulos cerrados viajan en un archivo separado del vídeo: SRT, VTT, SCC u otro formato de texto. El reproductor los superpone durante la reproducción. El espectador puede activarlos, desactivarlos y, en algunos reproductores, cambiar el estilo visual.

Los subtítulos abiertos están quemados directamente en los píxeles del vídeo. Son parte de la imagen. No se pueden eliminar ni personalizar. Siempre están visibles, para todos los espectadores.

Smartphone con el botón de activación de subtítulos cerrados en una aplicación de streaming

¿Cuándo usar cada uno? Los subtítulos cerrados son la norma en plataformas que admiten pistas de subtítulos: YouTube, Vimeo, Netflix. Los subtítulos abiertos tienen sentido cuando no controlas el entorno de reproducción: un vídeo que se reproducirá en una pantalla de tienda sin acceso al reproductor, o un clip corto en redes sociales donde los controles de subtítulos no existen.

SRT, VTT y SCC: los archivos que transportan los subtítulos

El formato de archivo determina dónde puedes usar los subtítulos.

SRT (SubRip Text) es el formato más extendido. Un archivo de texto plano con bloques numerados: índice, marcas de tiempo de entrada y salida, y texto del subtítulo. Funciona en YouTube, Vimeo, plataformas de formación en línea y la mayoría de reproductores. Si solo puedes exportar un formato, elige SRT.

VTT (Web Video Text Tracks) es la versión web moderna. Añade soporte para estilos CSS como color, posición y fuente, y es el estándar para HTML5. Las plataformas que permiten personalizar el aspecto de los subtítulos suelen preferir VTT.

SCC (Scenarist Closed Captions) es el formato de difusión broadcast, heredado de la televisión. Codifica los subtítulos en los datos verticales de la señal de vídeo. Necesario para emisión televisiva y para plataformas que siguen los estándares de la FCC en Estados Unidos.

Archivo de subtítulos abierto en un editor de código con marcas de tiempo SRT y texto de diálogo

Para la mayoría de creadores de vídeo en español, el flujo habitual es exportar en SRT para YouTube y plataformas de contenido, exportar en VTT si el sitio web necesita subtítulos personalizados, e ignorar SCC salvo que trabajen para televisión o clientes de difusión en EE. UU.

Velocidad de lectura y cortes de línea: los números que marcan la diferencia

Un archivo técnicamente correcto puede ser ilegible si ignora dos parámetros básicos.

Velocidad de lectura (cps): se mide en caracteres por segundo. El estándar de accesibilidad recomendado está entre 14 y 17 cps para contenido general. Por encima de 20 cps, la mayoría de los espectadores no pueden leer el subtítulo completo antes de que desaparezca. Los documentales suelen apuntar a 15 cps; el contenido de entretenimiento más rápido puede llegar a 18 cps con audiencias habituadas.

Duración mínima de exposición: un subtítulo debe estar visible al menos 1,5 segundos, aunque contenga una sola palabra. Un tiempo más corto no da margen para que el ojo lo localice y lo lea.

Cortes de línea: corta siempre en límites gramaticales naturales, nunca en mitad de un sintagma. «El perro / corrió» es mejor que «El / perro corrió». En subtítulos de dos líneas, la línea superior debe ser más corta que la inferior.

Número de líneas: dos como máximo. Tres líneas tapan demasiado de la imagen y dificultan seguir la acción visual.

A la pantalla, esto es lo que distingue unos subtítulos que se leen sin esfuerzo de otros que el espectador abandona a los treinta segundos.

Dónde exige la ley el closed captioning

La regulación varía por región, pero la tendencia es clara: más exigencia con el tiempo, no menos.

En Estados Unidos, la FCC obliga a subtítulos cerrados en televisión desde 1996 y en vídeos de internet que provienen de programas televisivos. La ley CVAA (Communications and Video Accessibility Act) extendió estos requisitos al entorno digital.

Las pautas WCAG 2.1 del W3C establecen el nivel AA como estándar para accesibilidad web. El criterio 1.2.2 exige subtítulos para todo contenido multimedia pregrabado. Cumplir WCAG es obligatorio para organismos públicos en la Unión Europea bajo la Directiva de Accesibilidad Web, y para muchas organizaciones privadas bajo regulación nacional.

En España y la UE, la Directiva 2019/882 sobre requisitos de accesibilidad de productos y servicios entró en vigor en junio de 2025 para los nuevos servicios. Para contenido de vídeo en plataformas de streaming, el Real Decreto 1425/2002 ya establecía obligaciones previas para personas con discapacidad.

Para un creador independiente, la pregunta no es tanto «¿me obliga la ley?» sino «¿cuántos espectadores estoy descartando sin subtítulos?». El 85% de los vídeos en redes sociales se ven sin sonido en entornos públicos. Los subtítulos cerrados no son solo una obligación legal: son el formato que permite ver un vídeo en el metro, en una sala de espera o con el móvil en silencio.

Cómo genera la IA subtítulos cerrados hoy

La generación automática de subtítulos con IA ha cambiado el flujo de trabajo por completo. Hace unos años, generar subtítulos de calidad requería transcribir manualmente o pagar un servicio de transcripción a tarifa por minuto. Hoy, los modelos de reconocimiento automático del habla producen transcripciones sincronizadas en minutos.

El proceso típico de una herramienta de IA para closed captioning es el siguiente:

  1. Transcripción del audio mediante reconocimiento automático del habla

  2. Alineación automática del texto con las marcas de tiempo del audio

  3. Segmentación en bloques de subtítulos respetando los límites de velocidad de lectura

  4. Exportación en el formato elegido

La IA hace el 90% del trabajo de minutaje. Lo que queda para el creador es revisar los errores de transcripción, especialmente nombres propios, jerga técnica y acentos marcados, y ajustar los cortes de línea donde el segmentador automático no ha encontrado el límite gramatical correcto.

Si tienes una biblioteca de vídeos sin subtítulos, el primer paso es pasar los archivos por una herramienta ASR y revisar los resultados antes de publicar. La IA produce la base; la revisión humana garantiza que el equivalente escrito del audio sea realmente completo y preciso.

Preguntas frecuentes

¿Cuál es la diferencia entre closed captioning y subtítulos normales?
Los subtítulos convencionales solo transcriben el diálogo y asumen que el espectador puede escuchar. El closed captioning también incluye efectos de sonido, indicaciones musicales e identificaciones del hablante, y está diseñado para espectadores sordos o con dificultades auditivas. La diferencia es de contenido, no de formato.
¿Puedo usar el formato SRT para todos mis vídeos?
SRT funciona en la mayoría de plataformas: YouTube, Vimeo, plataformas de e-learning y reproductores de vídeo web. Si necesitas personalizar el estilo visual de los subtítulos, VTT es más adecuado. SCC solo es necesario para emisión televisiva o distribución bajo estándares FCC en Estados Unidos.
¿Cuántos caracteres por segundo debe tener un subtítulo legible?
El estándar de accesibilidad recomendado está entre 14 y 17 cps para contenido general. Por encima de 20 cps, la mayoría de espectadores no pueden leer el subtítulo completo antes de que desaparezca. La duración mínima recomendada para cualquier subtítulo es de 1,5 segundos.
¿Son obligatorios los subtítulos en YouTube?
YouTube no obliga legalmente a añadir subtítulos a los vídeos de creadores independientes, pero la Directiva de Accesibilidad Web de la UE sí lo exige para organismos públicos. Más allá de la ley, el 85% de los vídeos en redes sociales se ven sin sonido, por lo que los subtítulos son esenciales para no perder espectadores.
¿Qué diferencia hay entre subtítulos cerrados y subtítulos abiertos?
Los subtítulos cerrados viajan en un archivo separado del vídeo y el espectador puede activarlos o desactivarlos con el botón CC. Los subtítulos abiertos están quemados directamente en los píxeles de la imagen: siempre están visibles y no se pueden eliminar ni personalizar.
¿La IA genera closed captions con la calidad suficiente para publicar?
Los modelos actuales de reconocimiento del habla producen transcripciones precisas en la mayoría de los casos. La IA hace el 90% del minutaje y la segmentación; lo que queda para el creador es revisar nombres propios, jerga técnica y cortes de línea. No es un sustituto completo de la revisión humana, pero reduce el tiempo de producción de subtítulos de horas a minutos.
¿El closed captioning es obligatorio en España?
La Directiva europea 2019/882 sobre accesibilidad entró en vigor en junio de 2025 para los nuevos servicios y obliga a garantizar accesibilidad en contenidos digitales, incluyendo vídeo. Para organismos públicos, el Real Decreto 1425/2002 ya establecía estas obligaciones con anterioridad. Para creadores independientes, la obligación depende del tipo de contenido y del canal de distribución.
SubsVideo