(ほぼ)全自動AI動画制作システム|YouTube動画の企画・音声・編集・投稿素材まで自動化
台本を渡すだけで、YouTube動画をほぼ全自動で制作
「YouTubeで情報発信したい。でも、撮影や編集に時間をかけられない。」
そんな自社の課題を解決するため、台本からAIアバター動画をほぼ全自動で制作するシステムを開発しました。
台本を用意すると、AIアバターの「サクラ」と、聞き手の「レン」が掛け合う解説動画を自動で生成します。
実際の動画はこちら
単にAI音声を流すだけではありません。
- AIアバターの表情変化
- 音声に合わせたリップシンク
- 対談形式の掛け合い
- パン・ズーム
- 図解
- 強調字幕
- 画面レイアウトの切り替え
- サムネイル制作
- YouTube概要欄作成
- ブログ記事への展開
まで、一連の工程を自動化しています。
人が担当するのは、基本的に「台本を用意すること」と「完成後の確認」です。
Before:YouTube動画は作れても、継続できなかった
以前は、自分でカメラの前に座り、一人で話す形式のYouTube動画を制作していました。
動画そのものは作れていましたが、継続するうえでいくつかの課題がありました。
画面が単調になりやすい
最初から最後まで同じ構図で話し続けるため、どうしても映像に変化が少なくなります。
視聴者に最後まで見てもらうには、図解や画面切り替え、ズームなどの編集を入れたいところですが、それには時間がかかります。
撮影環境を整える必要がある
顔出し動画では、
- カメラ
- 照明
- マイク
- 背景
- 服装
- 表情
なども気にする必要があります。
「少し動画を撮りたい」というだけでも、撮影前の準備が必要でした。
一人語りでは、視聴者の疑問を拾いにくい
一人で説明を続けると、
「それってどういう意味?」
「具体的には?」
「結局、何が便利なの?」
といった視聴者が感じる疑問を、自然に挟むことが難しくなります。
編集時間を確保できない
最も大きな問題は編集でした。
本来であれば、
- テロップ
- 図解
- ズーム
- 画面切り替え
- 強調表示
などを入れたかったものの、本業の合間に毎回編集するのは現実的ではありませんでした。
結果として、
「発信したい情報はあるのに、動画にする時間がない」
という状態になり、YouTubeの更新も止まってしまいました。
After:撮影・編集なしで、動きのあるAI動画を制作
そこで、AIとプログラムを組み合わせて、動画制作工程そのものを自動化しました。
現在は台本を用意すると、AIが内容を解析し、動画として仕上げます。
AIアバターが解説
解説役としてAIアバターの「サクラ」が登場します。
自分自身がカメラの前に立つ必要はありません。
顔出しせずに、一定のビジュアルで継続的な情報発信ができます。
音声に合わせて自然に口が動く
生成したAI音声に合わせて、アバターの口元を自動で動かします。
さらに、
- まばたき
- うなずき
- 表情変化
も加えています。
静止画に音声を重ねただけではなく、話しているように見える動画を生成します。
内容に合わせて16種類の表情を切り替え
会話の内容に合わせて、
- 笑顔
- 驚き
- 困惑
- 真剣
- 自信
- 疲れ
など、16種類の表情を切り替えます。
説明内容に応じて見た目が変化するため、同じ表情が続きにくい仕組みにしています。
「サクラ」と「レン」の対談形式
動画は一人語りではなく、サクラと聞き手役「レン」の掛け合い形式です。
レンが、
「それってどういうこと?」
「具体的にはどう使うの?」
といった視聴者目線の質問を挟むことで、解説にメリハリを付けています。
編集も自動化
動画内では、内容に応じて自動的に編集を加えます。
現在は主に、
- パン
- ズーム
- 7種類の画面レイアウト
- 10種類の図解
- 強調字幕
- アバターの表示切り替え
などを組み合わせています。
そのため、AIアバターが同じ位置で話し続けるだけの動画にはなりません。
AI音声も内容に合わせて生成
音声にはAI音声合成を利用しています。
文章を単調に読み上げるだけではなく、会話内容に応じて感情を付けることで、できるだけ自然な聞こえ方になるよう調整しています。
YouTube投稿後の素材まで生成
動画を書き出して終わりではありません。
動画制作後には、
- YouTube用サムネイル
- YouTube概要欄
- タイトル案
- ブログ記事
などもまとめて生成できます。
1つの台本から「動画+Webコンテンツ」へ展開できる仕組みにしています。
約7分30秒の動画で、78回の画面変化を自動生成
実際に制作した約7分30秒の動画では、パン・ズーム・図解・画面レイアウト変更などを含め、78回の画面変化が入りました。
これらの編集作業を、人が動画編集ソフトを操作して入れているわけではありません。
台本をもとにシステムが自動で構成・生成しています。
処理にかかった時間は、パソコン上で約30分。
人が行う主な作業は、
- 台本を用意する
- 完成動画を確認する
- 必要であれば一部を修正する
- 公開する
という流れです。
Before / After
| 項目 | Before:顔出しの一人語り | After:AI動画制作システム |
|---|---|---|
| 出演 | 自分で撮影 | AIアバターが出演 |
| 撮影準備 | カメラ・照明・マイク等が必要 | 原則不要 |
| 話し方 | 一人語り | サクラとレンの対談形式 |
| 表情 | 撮影時の状態次第 | 内容に合わせ16種類から切り替え |
| 画面 | 同じ構図が中心 | パン・ズーム・図解等を自動挿入 |
| 動画編集 | 手作業 | ほぼ自動 |
| サムネイル | 手作業 | AIで生成 |
| YouTube概要欄 | 手作業 | AIで生成 |
| ブログ記事 | 別途作成 | 動画内容から生成 |
| 人が行う作業 | 撮影・編集・投稿準備 | 台本作成・最終確認 |
| 継続性 | 制作負担が大きく更新停止 | 台本を起点に継続しやすい |
AI動画が完成するまでの流れ
動画制作は、次のような流れで進みます。
1. 台本を用意する【人】
まず、伝えたい内容を台本にします。
サクラとレンの会話形式で作成しますが、台本そのものも生成AIを使って下書きできます。
2. 動画構成を決める【AI】
AIが台本を解析し、
- どこでアバターを表示するか
- どの表情を使うか
- どこでズームするか
- どこに図解を入れるか
- どのレイアウトを使うか
などを決定します。
3. AI音声を生成【AI】
サクラとレン、それぞれの音声を生成します。
文章の内容に応じて、できるだけ自然な感情表現になるよう調整します。
4. リップシンクを生成【AI】
生成した音声に合わせて、アバターの口元を動かします。
5. 動画を自動編集【AI】
音声、アバター、字幕、図解、パン、ズームなどを組み合わせ、1本の動画として自動編集します。
6. 投稿用コンテンツを生成【AI】
完成した動画をもとに、
- サムネイル
- YouTubeタイトル案
- 概要欄
- ブログ記事
などを生成します。
7. 最終確認・公開【人】
最後に人が内容を確認します。
必要な部分だけ修正し、問題がなければ公開します。
人が「動画編集をする」のではなく、AIに動画制作工程を任せる
この仕組みで重視したのは、動画編集を少し効率化することではありません。
動画制作の工程そのものを、できるだけAIとプログラムに任せることです。
一般的な動画制作では、
撮影 → 音声調整 → カット → テロップ → 図解 → ズーム → サムネイル → 概要欄作成
と、多くの作業が発生します。
今回のシステムでは、それらを一連の処理としてつなぎました。
人はコンテンツの中身に集中し、それ以外の作業をできるだけシステム側に任せる設計です。
こんな企業・事業者に向いています
この仕組みを活用した、AIによるYouTube動画制作・情報発信の仕組み化についてもご相談いただけます。
特に、次のようなケースと相性があります。
- 自社のノウハウをYouTubeで発信したい
- 撮影や動画編集に時間を取れない
- 社長や社員が毎回出演するのが難しい
- 顔出しをせずに動画を発信したい
- YouTubeを始めたものの、更新が止まっている
- 採用・営業・マーケティング用の動画を継続的に作りたい
- 動画だけでなくブログ記事も増やしたい
- 社内に動画編集担当者を置くほどではない
- AIを活用してコンテンツ制作を効率化したい
「動画を1本作る」というより、継続して情報発信できる仕組みを作りたい場合に向いています。
使用している技術
複数のAI・動画生成技術を組み合わせ、一連の処理を自社で構築しています。
| 役割 | 使用技術 |
|---|---|
| 台本解析・動画構成・処理制御 | Claude Code |
| AI音声合成 | ElevenLabs |
| AIリップシンク | MuseTalk |
| 動画生成・編集 | Remotion |
| 各種AI処理 | 生成AI・独自プログラム |
特定の1つのAIサービスだけで動画を生成しているわけではなく、役割ごとに適した技術を組み合わせて自動化している点が特徴です。
GPUを活用し、動画生成コストも抑制
リップシンクなど一部の処理は、自社のGPU搭載パソコン上で実行しています。
そのため、動画を1本作るたびにすべての処理を外部AIサービスへ課金する構成ではありません。
現在、動画1本ごとに発生する主な外部サービス費用はAI音声生成部分です。
生成AIだけでなく、ローカルGPUやOSSも組み合わせることで、継続運用しやすいコスト構成を目指しています。
AIを活用した動画制作・情報発信の自動化をご相談いただけます
生成AIの活用というと、「文章を書く」「画像を作る」といった単体利用が注目されがちです。
しかし、AIの価値をより大きくするには、複数の処理を組み合わせて業務全体を仕組み化することが重要です。
今回のAI動画制作システムも、
台本 → 音声 → アバター → 編集 → サムネイル → YouTube → ブログ
という一連の流れを自動化した事例です。
テイルウインド株式会社では、こうした生成AI・AIエージェントを活用した業務自動化やシステム開発を行っています。
「自社でも似た仕組みを作れないか」
「動画制作や情報発信をAIで効率化したい」
といったご相談がありましたら、お気軽にお問い合わせください。