자막이란 무엇인가: 영상 제작자 가이드
요약
자막은 영상에 덧붙이는 텍스트 트랙으로, 대화, 음향 효과, 화자 정보 등 오디오의 모든 요소를 글로 전달한다. 폐쇄 자막은 켜고 끌 수 있으며, 별도 파일(SRT, VTT, SCC)에 저장된다. 개방 자막은 영상에 영구히 구워진다. AI는 타임코드 작업의 대부분을 처리하지만 사람의 검토는 여전히 필요하다. 소리 없이 보는 시청자에게 자막은 콘텐츠를 끝까지 볼 수 있게 하는 유일한 방법이다.
자막이란 무엇인가: 영상 제작자가 반드시 알아야 할 기본 원리
자막이란 무엇인가? 영상에 텍스트 트랙을 덧붙이는 방식이다. 대화, 음향 효과, 화자 정보 등 오디오의 모든 요소를 화면 텍스트로 표시한다. 자막 데이터는 영상과 분리된 별도 파일에 저장되고, 플레이어가 오디오 타임라인에 맞춰 동기화해 보여준다. 자막을 끄면 영상은 원래 그대로다. 켜면 모든 음성 정보가 읽을 수 있는 텍스트가 된다. CC 버튼이 이 전환을 제어한다. 그 버튼이 무엇을 보여주는지는 전적으로 자막이 어떻게 만들어졌느냐에 달려 있다.
'폐쇄' 자막이란: 끄고 켤 수 있다는 의미
폐쇄 자막(Closed Caption)에서 '폐쇄'는 시청자가 보기로 결정하기 전까지 숨겨진 상태임을 의미한다. 텍스트가 영상 이미지에 직접 구워 넣어진 것이 아니다. 별도의 데이터 트랙에 저장되어 있고, 플레이어 소프트웨어가 필요할 때 불러와 화면에 오버레이한다.
리모컨의 CC 버튼을 누르거나 플레이어의 자막 아이콘을 클릭하면 자막이 나타난다. 다시 누르면 사라진다. 영상 파일 자체는 변하지 않는다.
이것이 개방 자막(Open Caption)과의 핵심 기술적 차이다. 개방 자막은 영상 프레임 안에 영구적으로 렌더링되어 제거할 수 없다. 폐쇄 자막은 별도 파일로 함께 따라온다. 이 켜고 끄는 능력이 '폐쇄 자막'이라는 이름의 정의다.
한국의 지하철이나 카페처럼 소리를 켤 수 없는 환경에서는 이 차이가 특히 중요하다. 개방 자막은 항상 보이므로 시청 맥락과 무관하게 화면을 덮는다. 폐쇄 자막은 시청자가 선택할 수 있다.
자막과 CC의 차이: 형식이 아니라 내용의 문제
'자막'과 'CC'는 일상에서 혼용되지만, 담고 있는 내용에서 차이가 있다.
일반 자막(Subtitle)은 청각이 온전한 시청자를 전제로 한다. 대화를 담으며, 때로는 다른 언어로 번역된다. 화면 밖에서 문이 쾅 닫히는 소리가 나도 자막에는 표시되지 않는다.
CC(Closed Caption)는 청각이 없는 시청자를 전제로 한다. 대화뿐 아니라 [문이 쾅 닫힘], [경쾌한 재즈 음악], [진행자] 같은 음향 효과 설명, 음악 레이블, 화자 식별 정보도 포함한다. 목표는 오디오 트랙의 완전한 텍스트 동등물을 만드는 것이다.

실질적 차이: 외국 시청자를 위해 영상을 번역한다면 일반 자막이 필요하다. 청각장애인이나 난청인 시청자를 위해 접근성을 확보한다면 CC가 필요하다. 번역 자막 트랙과 접근성 CC 트랙은 같은 SRT 파일 형식을 사용해도 다른 결과물이다. 둘 다 전환 가능한 텍스트 파일이나 영상에 구워 넣는 방식으로 제공할 수 있다.
자막 파일 안에 들어가는 것들
좋은 CC는 단순히 말을 글로 옮기는 것이 아니다.
대화: 화자가 말하는 내용 그대로. 말실수, 망설임, 반복도 포함한다. 다만 읽기 속도를 고려해 지나치게 긴 문장은 자연스럽게 나눠야 한다.
음향 효과: [박수 소리], [배경 음악], [전화 울림] 같은 대괄호 표기로 나타낸다. 시청자가 화면 밖 맥락을 이해하는 데 필수적이다.
화자 식별: 두 사람 이상이 대화할 때 [홍길동], [인터뷰어] 형식으로 누가 말하는지 표시한다. 화면만으로는 화자를 구분하기 어려운 상황이라면 특히 중요하다.
음악 컨텍스트: [서정적인 피아노 음악] 또는 [빠른 비트의 배경 음악]처럼 음악의 분위기나 장르를 간략히 설명한다. 음악이 감정을 전달하는 경우 이 정보가 없으면 시청자는 그 감정을 놓친다.
SRT, VTT, SCC: 자막을 담는 파일 형식
자막 형식을 모르면 어디에도 올바르게 업로드할 수 없다.
SRT (SubRip Text): 가장 보편적인 형식. 번호, 타임코드, 텍스트 세 줄이 반복된다. 유튜브, 인스타그램, 카카오TV, 네이버 클립 등 대부분의 플랫폼이 지원한다. 텍스트 에디터로 직접 열어 수정할 수 있다.
VTT (WebVTT): 웹 브라우저용. HTML5 <video> 태그와 함께 사용한다. SRT와 유사하지만 추가 스타일 옵션이 있다. 웹 기반 플레이어라면 VTT가 표준이다.
SCC (Scenarist Closed Captions): 방송용. 북미 방송 업계에서 사용한다. 일반 크리에이터가 직접 다룰 일은 거의 없지만, TV 방영을 목표로 한다면 알아두어야 한다.

유튜브에 올린다면 SRT. 웹사이트에 올린다면 VTT. 방송 납품이라면 SCC. 그게 전부다.
읽기 속도와 줄 바꿈: 숫자로 보는 기준
자막이 아무리 정확해도 너무 빠르면 읽을 수 없다.
CPS (Characters Per Second, 초당 글자 수): 한국어 자막의 권장 속도는 초당 12-15자다. 화자가 빠르게 말할 때 생기는 긴 줄을 그대로 자막으로 옮기면 이 기준을 초과한다. 자막 소프트웨어가 CPS를 실시간으로 계산해 주지만, 직접 만들 때는 한 줄이 몇 자인지 항상 확인해야 한다.
최소 표시 시간: 0.8초. 그 이하는 깜빡임처럼 보여 읽을 수 없다.
최대 표시 시간: 7초. 그 이상이면 텍스트를 읽었는데도 화면에 남아 있어 어색하다.
줄 바꿈 원칙: 문법적 경계에서 나눈다. 생각의 중간에서 자르지 않는다. 의미 단위를 지켜야 시청자가 순간적으로 내용을 파악할 수 있다. 한 줄 최대 글자 수는 40자가 일반적 기준이다. 두 줄이 넘으면 화면을 너무 많이 가린다.
AI 자막의 현재: 어디까지 왔나
AI 자막 생성은 한국어도 충분히 쓸 수 있는 수준이 됐다. 하지만 한계도 분명하다.
AI가 잘 처리하는 것: 명확한 발화의 전사, 타임코드 동기화, 기본 줄 나누기. 1시간 영상을 5분 안에 자막 초안으로 만든다. 반복 작업에서 드는 시간을 대폭 줄인다.
AI가 아직 부족한 것: 방언이나 빠른 사투리, 전문 용어, 여러 화자가 겹쳐 말하는 상황. 음향 효과 설명은 대부분 자동으로 생성되지 않는다. AI는 '들리는 것'을 받아쓰지만, '느껴지는 것'은 사람이 판단해야 한다.
실용적 워크플로: AI가 95%의 타임코드 작업을 처리하고, 나머지를 사람이 검토한다. 완성된 자막을 처음부터 수작업으로 만드는 것과 비교하면 시간이 10분의 1이다. 이것이 현재 AI 자막의 실질적 가치다.

자막이 시청 완료율을 높이는 이유
한국의 디지털 콘텐츠 소비 패턴을 보면 자막이 왜 중요한지 바로 이해된다.
지하철, 카페, 버스 안. 소리 없이 영상을 보는 상황이 일상이다. 자막 없는 영상은 그 순간 재생을 멈춰야 할 이유가 된다. 소리를 켤 수 없는 시청자에게 자막은 콘텐츠를 이어 볼 수 있게 하는 유일한 방법이다.
검색 가능성도 달라진다. 유튜브는 자막 텍스트를 색인화한다. 자막 없는 영상은 제목과 설명문에 있는 단어만으로 검색된다. 자막 있는 영상은 모든 발화 내용이 검색 대상이 된다.
자막을 본 뒤 영상을 끝까지 시청한 시청자라면, 그 자막은 단순한 접근성 도구가 아니다. 콘텐츠 품질의 일부다. 자신의 영상에 맞는 파일 형식을 골라 자막을 올리는 것부터 시작해 보자.