【趣味】AIで字幕つけたら、YouTube1本目からまあまあバズったのでやり方紹介
目次 この記事の内容
趣味でYouTubeの動画を撮ってみようと思い、試しにレビュー動画を1本上げてみたところ、一気に1.5万回再生されました。1本目からこんなに行くんだ、結構回るんだな、とびっくり、2匹目のドジョウを狙ったところ、2本目、3本目も数千回ずつ再生されていて、一本だけの偶然ではなさそうでした。
普段は企業の業務をAIやシステムで仕組み化したり、面倒な作業を自動化したりする仕事をしています。動画を作るたびに同じ作業を繰り返すのが嫌だったので、自分のYouTubeでも同じように仕組み化してみました。
もちろん、字幕をつけたから動画が伸びた、とまでは言えません。テーマもサムネイルも関係しているでしょうし、偶然アルゴリズムに優遇された可能性もあります。
それでも、字幕を入れてYouTubeっぽいフォーマットにきちんと仕上げることさえできれば、ただ語るだけの動画でも最小のコストで作れるのかもしれません。もしそうなら、結構アツいです。
この記事では、そのやり方について解説していきます。
動画制作の役割分担
動画制作の流れですが、大体みなさんこんな感じですよね?
企画 → 撮影 → カット編集 → 字幕 → 最終確認 → アップロード
一旦AIに丸ごと渡しているのは、今のところ字幕だけです。企画はAIと壁打ちしながら考えますが、何について話したいかは自分から出さないと始まりません。撮影は当然自分ですし、カット編集も今は自分でやっています。どこを残してどこで切るか、間をどれくらい残すかはかなり好みが出るところなので、いきなりAIに全部任せるより、一度自分でやった方がいい気がしています。(素材と比較してどこを切ったのかのデータが蓄積すれば、後々AIに渡せそうな気がしていますが)
一方、字幕は初手からかなりAI向きだと思いました。面倒で気が進まなかった上に、カット編集ほど「自分はこうしたい」というこだわりがなかったからです。
字幕を作る流れ
編集が終わった完成動画は、次の流れで字幕にしています。
完成した動画を所定のフォルダに入れる
→ Whisperでタイムコード付きの文字起こし
→ AIで固有名詞や誤変換を補正
→ 字幕として読みやすい長さに分割
→ 判断が怪しい箇所だけ私に確認して、字幕ファイルを出力
自動文字起こしはかなり精度が高いものの、固有名詞や商品名、人名はたまに変な文字になります。そこで全文を一度AIに読ませて、前後の文脈から明らかにおかしいところを直させるようにしました。そのうえで、一文が長すぎないように、変なところで切れないように、字幕として読みやすい形に整えます。フィラー(「あー」「えーーーーっと」など)は字幕には出ないようにしてもらいます。
文字起こしを担当するAIに、文章の手直しまではさせません。
最後に人間(私)に判断が必要な疑惑の単語や漢字だけAI側からチェック依頼を受け、私がそれに答えて完璧な字幕ができるという流れです。
Whisperを手元で動かし、字幕ファイルを作ろう
文字起こしには、ChatGPTを開発しているOpenAIが公開している音声認識モデル「Whisper」を使っています。いいところは自分のPC上で動かせることで、動画を外部の文字起こしサービスにアップロードせずに済みますし、文字起こしのたびに利用料がかかることもありません。毎回そこそこの長さの動画を処理するので、かなり使い勝手がいいです。
字幕は動画に焼き込まず、別ファイルで生成させましょう。誤字を一文字直すために動画を書き出し直すのはさすがにつらいので、字幕だけ直せば終わる形にしました。動画本体を仕上げた後に字幕を別工程として流すようにすることで、動画編集側への手戻りはほとんど発生していません。
手動より字幕の品質をあげるには?
やってみて良かったのは、作業時間が減ったことに加えて、字幕の品質をちゃんと上げられたことです。全部手でやると、どこかで「ここまででいいか」と妥協したくなりますが、AIなら最後まで同じルールで処理できるので、その妥協が要りません。
複数人で喋っている動画なら話者を判別して字幕の色を変えられますし、今何について話しているのかをAIに判断させて、画面上部にトピックを表示し続けることもできます。
カット編集も、全部任せるかはともかく、AIに候補を出させることはできます。こういう処理を組み合わせれば、1本目からそこそこ作り込んだ動画にできるはずです。
AIで雑に作るのではなく、人間が工程を正確に把握した上で、全部やったら面倒すぎるところをAIにやってもらう使い方が、かなりおすすめです。
字幕を分けておけば、多言語展開にも
字幕を動画と分けているので、この先は多言語化もできます。それでも日本語の字幕が一度できてしまえば、英語や韓国語、中国語などに翻訳して別の字幕として登録できますし、以前なら結構大変だったと思う作業も、今はワークフローの後ろに翻訳工程を入れ込むだけなので、小難しいことをせずに多言語化対応ができるわけです。
まとめですが、動画制作はAIと相性がいい工程を含んだ領域だと改めて思いました。
当然全部をAIにやらせる必要はなくて、こだわりのある作業は自分で行い(それ自体が動画の個性となると思います)、こだわりのない面倒な作業だけをAIに渡していくことで、動画の内容や撮影といった、人間の個性をモロに出すべき部分に注力しやすくなると感じます。動画制作とAIの組み合わせは他にも色々試しているので、この辺に興味がある方がいたら気軽にご連絡いただけたら幸いです。