ローカルとクラウドの文字起こしの違い
動画に字幕を付けるとき、音声認識は自分のパソコンでも、ファイルをサーバーに送っても行えます。どちらも使われています。違いは、プライバシー、費用、速度、ネットワークへの依存度にあります。
ひとことで言うと
ローカルの文字起こし:モデルが Mac に入っていて、音声はこのパソコンの外に出ません。クラウドの文字起こし:音声や動画がサービス提供者のサーバーに送られ、認識されて、テキストだけが戻ってきます。
4 つの観点で比べる
| ローカル | クラウド | |
|---|---|---|
| プライバシー | ファイルは Mac の中にとどまります。未公開のインタビュー、社内研修、クライアントの素材に向いています | ファイルをアップロードします。保存されるか、どう使われるかはサービス提供者の方針によるので、自分で読む必要があります |
| 費用 | モデルは無料でダウンロードできます。ツール自体の価格はまちまちで、買い切りも無料のオープンソースもあります。使うのは自分のパソコンの処理能力です | 分単位の課金やサブスクリプションが一般的で、使うほど費用がかかります |
| 速度 | 機種によります。Apple シリコンの Mac は Metal で高速化されます。古い機種やメモリの少ない機種は遅くなります | アップロードの速度とサーバーの待ち行列によります。長い動画はアップロードだけで時間がかかります |
| ネットワーク | 初回にモデルをダウンロードするときだけ必要で、あとはオフラインで動きます | 毎回ネットワークが必要です |
ローカル処理の代償
- ディスクとメモリを使う:音声モデルは数百 MB から数 GB のファイルです。
- Mac が計算し終わるまで待つ:処理中はパソコンがいつもより熱くなり、ファンが回ります。
- 機能が手元のパソコンに左右される:クラウドのサービスには、話者の区別、用語集、チームでの共同作業などがあることがありますが、ローカルのツールにあるとは限りません。
Twinsubs の具体的なやり方
- 認識:Whisper large-v3-turbo を whisper.cpp で Mac の中で動かします(whisper.cpp も Whisper モデルも MIT ライセンスです)。
- 翻訳:macOS 標準のオンデバイス翻訳です。ある言語を初めて翻訳するとき、システムが言語パックのダウンロードを求めることがあり、そのあとはオフラインで動きます。
- ネットワークを使うのは 2 か所だけです。音声認識モデルの初回ダウンロードと、macOS による言語パックのダウンロードです。動画と字幕はアップロードされません。
- アプリは匿名の利用イベント(成功か失敗か、所要時間、システムのバージョン)を送ります。ファイル名と字幕の内容は含まれず、設定でオフにできます。詳しくはプライバシーポリシーをご覧ください。
どう選ぶか
- 外に出せない内容、または長い動画や件数の多い字幕:ローカルを優先します。
- パソコンの性能が低く、短い動画をたまに 1、2 本処理するだけ:クラウドのほうが手軽です。ただし先にサービスのプライバシー条項を確認してください。
- すでに編集ソフトの有料プランに入っている:その内蔵機能をそのまま使えば十分で、乗り換える必要はありません。
更新日:2026-10-12。 Twinsubs のトップへ戻る