¿Qué es el closed captioning? Guía para creadores de vídeo
Resumen
El closed captioning es una pista de texto separada que muestra diálogos, efectos de sonido e identificaciones de locutor. A diferencia de los subtítulos abiertos quemados en la imagen, los subtítulos cerrados se activan y desactivan con el botón CC. Los formatos más comunes son SRT, VTT y SCC. La IA actual transcribe y sincroniza el audio automáticamente; la revisión humana garantiza la precisión final.
¿Qué es el closed captioning? Guía para creadores de vídeo
La pregunta sobre que es el closed captioning tiene una respuesta clara: una pista de texto vinculada a un vídeo que muestra diálogos, efectos de sonido, pistas del locutor y otros detalles de audio como texto en pantalla. Los subtítulos viven en un archivo separado que el reproductor lee sincronizado con el audio. El botón CC controla su visibilidad. Activarlos o desactivarlos no altera el vídeo en absoluto. Es el punto de partida para publicar contenido accesible en YouTube, redes sociales o plataformas de formación en línea.
La parte «closed»: por qué puedes activarlos y desactivarlos
«Closed» significa que los subtítulos están ocultos hasta que el espectador decide mostrarlos. El texto no está grabado en la imagen. Reside en una pista de datos separada que el software de vídeo lee y superpone a demanda.
Pulsas el botón CC en un mando a distancia o haces clic en el icono de subtítulos del reproductor y los subtítulos aparecen. Vuelves a pulsarlo y desaparecen. El archivo de vídeo no cambia.
Esta es la distinción técnica central respecto a los subtítulos abiertos u open captions. Los subtítulos abiertos se renderizan de forma permanente en el fotograma del vídeo. No se pueden eliminar. Los subtítulos cerrados viajan como archivo adjunto. Esa posibilidad de activarlos y desactivarlos es lo que define la palabra «closed» en closed captioning.
Subtítulos cerrados vs subtítulos convencionales: diferencia de contenido, no de formato
Las palabras «captions» y «subtítulos» se usan indistintamente en el lenguaje cotidiano, pero describen cosas distintas en cuanto a lo que contienen.
Los subtítulos convencionales asumen que el espectador puede escuchar. Llevan el diálogo, a veces traducido a otro idioma, y nada más. Si una puerta se cierra de golpe fuera de cuadro, los subtítulos no lo mencionan.
Los subtítulos cerrados asumen que el espectador no puede escuchar. Llevan el diálogo, pero también descripciones de efectos de sonido como [PUERTA AL CERRARSE], etiquetas musicales como [JAZZ ANIMADO] e identificaciones del locutor como [ANNA] cuando el encuadre por sí solo no deja claro quién habla. El objetivo es un equivalente escrito completo de la pista de audio.

Una consecuencia práctica: si estás traduciendo un vídeo para una audiencia extranjera, probablemente quieres subtítulos convencionales, es decir, solo el diálogo en el idioma de destino. Si estás haciendo tu vídeo accesible para espectadores sordos o con dificultades auditivas que comparten tu idioma, quieres subtítulos cerrados con el diálogo más cada detalle de audio relevante. Una pista de subtítulos traducida y una pista de accesibilidad son productos distintos, aunque usen el mismo formato de archivo SRT. Ambas pueden entregarse como archivo de texto activable o quemadas en la imagen.
¿Qué incluyen los subtítulos cerrados? Más allá del diálogo
Un archivo de closed captioning completo va mucho más allá de transcribir lo que se dice. Incluye cuatro categorías de información:
Diálogo: lo que dicen los hablantes, con la puntuación necesaria para que el ritmo de lectura coincida con el ritmo de la locución.
Efectos de sonido relevantes: los sonidos que contribuyen al significado de la escena. [TELÉFONO SONANDO], [EXPLOSIÓN] o [PASOS ACELERADOS] informan al espectador de contexto que no puede percibir por el audio.
Música e indicaciones de ambiente: [MÚSICA TENSA], [SILENCIO] o [APLAUSOS] sitúan al espectador en la atmósfera emocional del contenido.
Identificación del hablante: cuando dos personas hablan sin aparecer en cuadro, o cuando la voz en off y el diálogo se mezclan, etiquetar quién habla evita confusiones. El formato habitual es el nombre entre corchetes antes de la frase.
Ninguno de estos elementos es opcional si el objetivo es la accesibilidad real. Un archivo con solo el diálogo es un subtítulo convencional, no un closed caption.
Subtítulos cerrados vs abiertos: pista separada o imagen grabada
La distinción abierto/cerrado es de formato, no de contenido. Ambos pueden contener exactamente la misma información.
Los subtítulos cerrados viajan en un archivo separado del vídeo: SRT, VTT, SCC u otro formato de texto. El reproductor los superpone durante la reproducción. El espectador puede activarlos, desactivarlos y, en algunos reproductores, cambiar el estilo visual.
Los subtítulos abiertos están quemados directamente en los píxeles del vídeo. Son parte de la imagen. No se pueden eliminar ni personalizar. Siempre están visibles, para todos los espectadores.

¿Cuándo usar cada uno? Los subtítulos cerrados son la norma en plataformas que admiten pistas de subtítulos: YouTube, Vimeo, Netflix. Los subtítulos abiertos tienen sentido cuando no controlas el entorno de reproducción: un vídeo que se reproducirá en una pantalla de tienda sin acceso al reproductor, o un clip corto en redes sociales donde los controles de subtítulos no existen.
SRT, VTT y SCC: los archivos que transportan los subtítulos
El formato de archivo determina dónde puedes usar los subtítulos.
SRT (SubRip Text) es el formato más extendido. Un archivo de texto plano con bloques numerados: índice, marcas de tiempo de entrada y salida, y texto del subtítulo. Funciona en YouTube, Vimeo, plataformas de formación en línea y la mayoría de reproductores. Si solo puedes exportar un formato, elige SRT.
VTT (Web Video Text Tracks) es la versión web moderna. Añade soporte para estilos CSS como color, posición y fuente, y es el estándar para HTML5. Las plataformas que permiten personalizar el aspecto de los subtítulos suelen preferir VTT.
SCC (Scenarist Closed Captions) es el formato de difusión broadcast, heredado de la televisión. Codifica los subtítulos en los datos verticales de la señal de vídeo. Necesario para emisión televisiva y para plataformas que siguen los estándares de la FCC en Estados Unidos.

Para la mayoría de creadores de vídeo en español, el flujo habitual es exportar en SRT para YouTube y plataformas de contenido, exportar en VTT si el sitio web necesita subtítulos personalizados, e ignorar SCC salvo que trabajen para televisión o clientes de difusión en EE. UU.
Velocidad de lectura y cortes de línea: los números que marcan la diferencia
Un archivo técnicamente correcto puede ser ilegible si ignora dos parámetros básicos.
Velocidad de lectura (cps): se mide en caracteres por segundo. El estándar de accesibilidad recomendado está entre 14 y 17 cps para contenido general. Por encima de 20 cps, la mayoría de los espectadores no pueden leer el subtítulo completo antes de que desaparezca. Los documentales suelen apuntar a 15 cps; el contenido de entretenimiento más rápido puede llegar a 18 cps con audiencias habituadas.
Duración mínima de exposición: un subtítulo debe estar visible al menos 1,5 segundos, aunque contenga una sola palabra. Un tiempo más corto no da margen para que el ojo lo localice y lo lea.
Cortes de línea: corta siempre en límites gramaticales naturales, nunca en mitad de un sintagma. «El perro / corrió» es mejor que «El / perro corrió». En subtítulos de dos líneas, la línea superior debe ser más corta que la inferior.
Número de líneas: dos como máximo. Tres líneas tapan demasiado de la imagen y dificultan seguir la acción visual.
A la pantalla, esto es lo que distingue unos subtítulos que se leen sin esfuerzo de otros que el espectador abandona a los treinta segundos.
Dónde exige la ley el closed captioning
La regulación varía por región, pero la tendencia es clara: más exigencia con el tiempo, no menos.
En Estados Unidos, la FCC obliga a subtítulos cerrados en televisión desde 1996 y en vídeos de internet que provienen de programas televisivos. La ley CVAA (Communications and Video Accessibility Act) extendió estos requisitos al entorno digital.
Las pautas WCAG 2.1 del W3C establecen el nivel AA como estándar para accesibilidad web. El criterio 1.2.2 exige subtítulos para todo contenido multimedia pregrabado. Cumplir WCAG es obligatorio para organismos públicos en la Unión Europea bajo la Directiva de Accesibilidad Web, y para muchas organizaciones privadas bajo regulación nacional.
En España y la UE, la Directiva 2019/882 sobre requisitos de accesibilidad de productos y servicios entró en vigor en junio de 2025 para los nuevos servicios. Para contenido de vídeo en plataformas de streaming, el Real Decreto 1425/2002 ya establecía obligaciones previas para personas con discapacidad.
Para un creador independiente, la pregunta no es tanto «¿me obliga la ley?» sino «¿cuántos espectadores estoy descartando sin subtítulos?». El 85% de los vídeos en redes sociales se ven sin sonido en entornos públicos. Los subtítulos cerrados no son solo una obligación legal: son el formato que permite ver un vídeo en el metro, en una sala de espera o con el móvil en silencio.
Cómo genera la IA subtítulos cerrados hoy
La generación automática de subtítulos con IA ha cambiado el flujo de trabajo por completo. Hace unos años, generar subtítulos de calidad requería transcribir manualmente o pagar un servicio de transcripción a tarifa por minuto. Hoy, los modelos de reconocimiento automático del habla producen transcripciones sincronizadas en minutos.
El proceso típico de una herramienta de IA para closed captioning es el siguiente:
Transcripción del audio mediante reconocimiento automático del habla
Alineación automática del texto con las marcas de tiempo del audio
Segmentación en bloques de subtítulos respetando los límites de velocidad de lectura
Exportación en el formato elegido
La IA hace el 90% del trabajo de minutaje. Lo que queda para el creador es revisar los errores de transcripción, especialmente nombres propios, jerga técnica y acentos marcados, y ajustar los cortes de línea donde el segmentador automático no ha encontrado el límite gramatical correcto.
Si tienes una biblioteca de vídeos sin subtítulos, el primer paso es pasar los archivos por una herramienta ASR y revisar los resultados antes de publicar. La IA produce la base; la revisión humana garantiza que el equivalente escrito del audio sea realmente completo y preciso.