クローズドキャプションとは?仕組みから作成方法まで
要約
クローズドキャプションとは、動画に付属する切り替え可能なテキスト字幕トラックです。セリフだけでなく効果音や話者識別も含み、聴覚障害のある視聴者が音声全体を理解できます。SRT・VTT形式で届けられ、AIツールで素早く下書きを生成し、人間が2〜3分でレビューするワークフローが現実的です。配信プラットフォームや法令遵守の観点からも、動画制作者にとって必須の知識です。
クローズドキャプションとは?仕組みから作成方法まで
クローズドキャプションとは、動画に付属する切り替え可能なテキストトラックのことだ。セリフ、効果音、話者識別、音楽ラベルなど、あらゆる音声情報を画面上の文字で表示する仕組みで、視聴者がCCボタンを押すことで表示と非表示を切り替えられる。動画プレーヤーはSRTやVTTなどのキャプションファイルを音声と同期して読み込む。キャプションをオフにしても映像ファイルそのものは変わらない。何が表示されるかは、キャプションがどう作られたかによって決まる。この切り替え可能という特性こそが、クローズドキャプションの本質だ。
「クローズド」の意味:オン・オフできることが本質
「クローズド」とは「隠れている」という意味だ。テキストは映像フレームに焼き込まれておらず、独立したデータトラックとして動画に添付されている。
プレーヤー上のCCアイコンをタップすると字幕が表示され、再度タップすれば消える。動画ファイルそのものに変化は起きない。
これがオープンキャプションとの根本的な違いだ。オープンキャプションは映像に直接焼き込まれており、削除や非表示にすることができない。クローズドキャプションはテキストが独立しているからこそ、視聴者が自分の状況に合わせて選択できる。
クローズドキャプションと字幕の違い:内容の問題
「キャプション」と「字幕」は日常的に混用されることが多いが、含まれる情報がまったく異なる。
字幕は視聴者が音声を聞けることを前提とする。セリフを表示するだけで、それ以外の音声情報は含まれない。画面外でドアが閉まっても、字幕はその音を伝えない。
クローズドキャプションは視聴者が音声を聞けないことを前提とする。セリフのほか「【ドアが閉まる音】」「【アップテンポなBGM】」「【田中アナウンサー】」といった効果音、音楽ラベル、話者識別も含まれる。音声トラックを文章で完全に再現することが目的だ。
外国語視聴者向けの翻訳が必要なら字幕(セリフのみ)、聴覚障害を持つ視聴者への対応が必要ならクローズドキャプション(音声全体)が適切だ。どちらもSRTファイルで届けられるが、内容はまったく別物になる。

クローズドキャプション vs オープンキャプション:切り替えか、焼き込みか
この2つの最大の違いは「字幕を独立したファイルとして扱うか、映像に直接埋め込むか」にある。
クローズドキャプションは独立したテキストトラックで届けられる。視聴者が表示・非表示を選択でき、フォントサイズや色の変更も可能だ。動画ファイルを軽く保てるため、ストリーミング配信に最適だ。
オープンキャプションは映像フレームに焼き込まれており、削除や変更ができない。フォントや位置がプレーヤーに依存しない点が強みで、映画館での上映、公共スペースのデジタルサイネージ、Instagramリールなど字幕をオフにされたくない場面に向いている。
YouTubeやNetflixはクローズドキャプションが標準だ。SNSのショート動画では視認性のためにオープンキャプションを選ぶケースも多い。配信先ごとに使い分けることが実際の制作では重要になる。

SRT、VTT、SCC:キャプションを届けるファイル形式
クローズドキャプションはテキストファイルとして存在する。どの形式を選ぶかは配信先によって決まる。
SRT(SubRip Subtitle) はもっとも汎用的な形式だ。YouTubeやVimeoをはじめ、大多数の動画プレーヤーが対応している。タイムコードとテキストのシンプルな構成で、テキストエディタで直接編集できる点も便利だ。
VTT(Web Video Text Tracks) はHTML5プレーヤー向けの形式だ。フォント、位置、色のスタイリング指定が可能で、ポッドキャストサイトやウェブアプリの配信に適している。
SCC(Scenarist Closed Captions) は北米のブロードキャストテレビ向けの形式で、FCCが義務付けている。一般のウェブ配信では使う機会がない専門的な仕様だ。
YouTuberやコンテンツクリエイターはSRTかVTTで十分対応できる。SCCが必要になるのはテレビ放送向けの制作に限られる。

読みやすいキャプションの基準:cpsと行の区切り方
キャプションの品質は「読める速さかどうか」で決まる。数値の基準を知っておくだけで完成度が大きく変わる。
文字表示速度(cps) は1秒あたりに表示する文字数だ。日本語では1秒あたり4〜7文字が目安とされる。これを超えると視聴者は字幕を読み切れないまま次の字幕に切り替わってしまう。
最低表示時間 は1.0秒から1.5秒が基準だ。短すぎると読めず、長すぎると次のセリフとタイミングがずれる。
行の区切り方 は意味の単位で切ることが大切だ。「田中さんは昨日」と「会議室に来た」ではなく、「田中さんは」と「昨日会議室に来た」のように文の区切れ目で分割する。こうすることで視線の移動が最小限になり、読みやすさが上がる。
AIキャプションツールはcpsを自動で計算するが、固有名詞や専門用語の誤認識は人間のレビューで補う必要がある。AIが高精度の下書きを作り、人間が仕上げるというワークフローが現在のベストプラクティスだ。
クローズドキャプションが義務付けられる場面
日本国内では、放送事業者に字幕放送の義務が課されており、特にNHKや民放キー局は総務省の字幕普及目標に沿って対応している。
Webコンテンツについては、WCAG 2.1(Webコンテンツアクセシビリティガイドライン)が事前録画されたすべての動画に字幕を要求している(達成基準1.2.2)。企業サイト、教育機関、行政機関のウェブ動画にとって実質的な標準となっている。
アメリカではFCCがテレビおよびオンライン配信に対してキャプションを義務付けており、ADAの下でも動画アクセシビリティが求められる。グローバルに配信する際はこれらを考慮に入れる必要がある。
AIがクローズドキャプションを生成する仕組み
今日のAIキャプションツールは音声認識(ASR)エンジンを使い、音声をリアルタイムでテキストに変換してタイムコードを自動付与する。精度は高いが、業界固有の専門用語、外来語、複数の話者が重なる場面では誤りが生じやすい。
もっとも効率的なワークフローはAIで下書きを作り、2〜3分でレビューして修正する方法だ。ゼロから手作業でタイムコードを打つ作業と比べると、制作時間は大幅に短縮される。以下のツールはそれぞれ異なる強みを持っている。
自分の動画で一度試してみると、仕様の数字だけでは伝わらない「読めるキャプション」と「読めないキャプション」の差が実感できる。