はじめに
Whisper Local は、OpenAI の Whisper 系モデル(Core ML 版)を使って、Mac の中だけで音声を文字にするアプリです。最初にモデルを準備すれば、そのあとの文字起こしはオフラインで動きます。
まずはセットアップガイドで、モデルを 1 つ準備しましょう。

セットアップガイドでモデルを準備する
初回起動時にセットアップガイドが開きます。言語を選び「このモデルを準備する」を押すと、モデルの取得と設定が終わり、サンプル音声で実際に試せます。ガイドは、あとから設定画面の「ガイドを開く」でいつでも開けます。
モデルの選びかた
| モデル | 大きさ | 向いている使い方 |
|---|---|---|
| Large v3 Turbo(標準) | 約 1.6 GB | 日本語を含む多言語 |
| Turbo Compact | 約 650 MB | 容量を節約したいとき |
| Base English | 約 150 MB | 英語だけのとき(英語専用) |
設定の「診断」で、手元の音声を使って速度を実測できます。
初回だけ、モデルをこの Mac 向けに変換するため数分〜10 分ほどかかります。進み具合は画面に表示されるので、そのままお待ちください。次回からは短時間で済みます。
基本操作
ファイルの文字起こし
- 音声や動画のファイルを、ウィンドウにドロップします。
- 「文字起こしを開始」(⌘↩)を押します。
- 終わると結果が表示されます。コピーしたり、TXT などに保存したりできます。
処理中も画面は操作でき、いつでも取り消せます。
- 対応形式:WAV・M4A・MP3・MP4・MOV など、macOS が読める形式
- 長さ:1 ファイル最長 2 時間(それより長い場合は分割してください)
- 言語:日本語・英語・自動検出ほか多言語
約 10 分の動画を処理した実測例では、全体で約 1 分半でした(Mac の性能により変わります)。
リアルタイム文字起こし
- 右上のマイクのボタン(⌘⇧R)で開きます。
- マイクとエンジンを選び、「開始」を押して話します。
- 初回は、マイクと音声認識の使用許可を求められるので「許可」を選びます。
確定した文字は黒、途中の文字は薄く表示されます。マイクを使うのは「開始」から「停止」までの間だけです。
エンジンの選びかた
- Mac標準(すぐ開始):押してすぐ始まり、話すのとほぼ同時に文字が出ます。macOS 26 以降で使えます。
- Whisper(高精度):精度を重視するとき。開始に数秒、アップデート直後の初回は 1〜3 分かかります。
辞書の置き換えと句読点の設定は、リアルタイムにも適用されます。停止後は、録音を通常の方法で文字起こしし直せます。話者識別や字幕の保存もできます。
録音とテキストの保存
標準では、録音(WAV)とテキストを ~/Library/Application Support/WhisperLocal/Live に保存します。設定の「リアルタイム」で、保存のオン・オフ、保存先(「書類」など)、古いものの自動削除(7〜90 日より前のものをゴミ箱へ移動)を、録音とテキストそれぞれに設定できます。
編集と書き出し
結果画面の「区間・時刻を確認」から、区間ごとの本文・開始/終了時刻・話者を編集できます。
- 区間を 2 つに分ける、時刻を秒単位で直す
- 話者名を一括で変える(例:「話者 1」→「佐藤」)
- 確認が必要な区間は色で表示されます。確定してから保存します
書き出せる形式
TXT・CSV・SRT・VTT・SBV の 5 つです。区切りは、文章/語数(1〜30)/時間(0.5〜10 秒)から選べます。
- 字幕の時刻に逆転・重なり・範囲外がある区間は、黙って書き出さずに確認を求めます。原文は常に残ります。
- CSV は UTF-8(BOM 付き)で保存するので、Excel・Numbers でそのまま開けます。数式として解釈される先頭文字には、アポストロフィを付けます。
履歴と自動保存
元の認識結果と編集内容を、この Mac に保存します。アプリを閉じても、次に開いたときに前回の結果と編集を復元します。履歴は設定の「履歴」から削除できます。
話者識別
話者識別をオンにして文字起こしすると、話者ごとに区切ります。話者の名前の変更や割り当ての修正は「区間・時刻を確認」でできます。変更はすべての書き出し形式に反映されます。
話者の数や割り当ては推定です。短い相づちや同時に話した部分では誤ることがあります(2 人の会話を 3 人と推定した例があります)。結果は確認してから使ってください。
- 人数を指定する:設定の「話者」の「人数」で、会話の人数(2〜8人)を指定できます。人数が分かっているときに指定すると、話者の取り違えが減ります。分からないときは「自動で推定」のままにしてください(0.3.16 以降)。
- 話者識別がオンのときは、アプリの起動時とオンに切り替えたときに話者モデルを裏で準備します。そのため、最初の文字起こしでも待たずに始まります。
辞書
設定の「辞書」に、よく間違える語を「誤 → 正」で登録すると、文字起こしの完了時に自動で置き換えます。
- CSV でまとめて編集できます。
- 置き換える前の、元の結果に戻せます。
- リアルタイム文字起こしにも適用されます。
辞書は文脈を判断しません。どちらも正しい言葉になりうる同音異義語(講演/公園など)には向きません。
句読点
句読点が入りにくい日本語の話し言葉に、話の区切りと文末から「、」「。」を補います。認識した言葉そのものは変えません。設定でオン・オフでき、リアルタイム文字起こしにも適用されます。
設定
このガイドで触れている、設定画面の主な項目です。句読点の自動挿入も、設定でオン・オフできます。
| 設定画面の項目 | できること |
|---|---|
| ガイドを開く | セットアップガイドを開き直して、モデルを準備します |
| リアルタイム | 録音とテキストの保存のオン・オフ、保存先、古いものの自動削除(7〜90 日) |
| 辞書 | 「誤 → 正」の登録。CSV でまとめて編集 |
| 履歴 | 保存した結果と編集の削除 |
| 診断 | 手元の音声を使って速度を実測 |
| 連携 | 「Macへのログイン時に自動で起動する」「ウインドウを閉じても常駐する」、ほかのアプリからの依頼の受付・許可フォルダー・連携アプリの登録 |
| アップデートを自動で確認する | 起動後と 1 日 1 回の更新確認のオン・オフ |
常駐と、ほかのアプリとの連携
メニューバーに常駐し、同じ Mac の許可したアプリから文字起こしの依頼を受けられます。
- 接続は同じ Mac の中(
127.0.0.1)からだけです。ブラウザーからは接続できません。 - 連携アプリごとの認証情報は、キーチェーンに保存します。
- 読み取れるのは、許可したフォルダーの中だけです。
icRec などと確認1回で連携する(0.3.15 以降)
icRec などの連携アプリで「Whisper Local と連携する」を押すと、Whisper Local に「「icRec」と連携しますか?」という確認が出ます。読み取るフォルダーと依頼したアプリ(同じ開発元のアプリかどうか)を確かめて「連携する」を押すと、常駐・フォルダーの許可・連携アプリの登録・依頼の受付がすべて自動で設定されます。ID やトークンを書き写す必要はありません。
- 心当たりのない依頼や、依頼したアプリを確認できないと表示されたときは、「キャンセル」を押してください。
- 同じアプリで連携し直すと、以前の登録は無効になり、新しい登録に置き換わります。
- 自分で設定する場合は、これまでどおり設定の「連携」で、フォルダーの許可と連携アプリの登録を行い、表示された認証情報を連携アプリに入力します。
- 連携アプリから起動されたときも、「ウインドウを閉じても常駐する」がオンなら、ウインドウを開かずにメニューバーに常駐して始まります。
Mac の起動時から使う
設定の「連携」で「Macへのログイン時に自動で起動する」と「ウインドウを閉じても常駐する」をオンにすると、ログイン時はウィンドウを開かずにメニューバーへ常駐した状態で起動します。起動したことは、画面右上のバナーで数秒間お知らせします。ウィンドウは、バナーをクリックするか、メニューバーのアイコンの「ウインドウを開く」で開けます。
困ったとき
しずく最初の 1 回が遅いのは、モデルを変換しているからです。
最初の文字起こしがなかなか終わらない
初回だけ、モデルをこの Mac 向けに変換するため数分〜10 分ほどかかります。進み具合は画面に表示されるので、そのままお待ちください。次回からは短時間で済みます。
リアルタイムの「Whisper」エンジンがすぐに始まらない
Whisper エンジンは開始に数秒、アップデート直後の初回は 1〜3 分かかります。すぐに始めたいときは「Mac標準」を選んでください(macOS 26 以降)。
「Mac標準」エンジンが使えない
「Mac標準」エンジンは macOS 26 以降で使えます。それより前の macOS では Whisper エンジンを使います。
マイクが使えない
リアルタイム文字起こしには、マイクと音声認識の許可が必要です。初回に許可しなかった場合や、あとで取り消した場合は、macOS のシステム設定の「プライバシーとセキュリティ」で Whisper Local を許可してください。
話者の数や割り当てが違う
話者識別は推定です。短い相づちや同時に話した部分では誤ることがあります。会話の人数が分かっている場合は、設定の「話者」の「人数」で指定すると取り違えが減ります。「区間・時刻を確認」で割り当ても直せます。
辞書で、直したくない言葉まで置き換わる
辞書は文脈を判断せずに置き換えます。どちらも正しい言葉になりうる同音異義語は、登録しないでください。置き換える前の元の結果には戻せます。
2 時間より長い音声を文字起こししたい
1 ファイル最長 2 時間までです。それより長い場合は分割してください。
字幕を保存しようとしたら、確認を求められた
時刻の逆転・重なり・範囲外がある区間があると、黙って書き出さずに確認を求めます。「区間・時刻を確認」で色の付いた区間を直し、確定してから保存してください。
ログイン時にウィンドウが開かない
「ウインドウを閉じても常駐する」がオンのときは、ログイン時はウィンドウを開かずにメニューバーへ常駐します。画面右上のバナーをクリックするか、メニューバーのアイコンの「ウインドウを開く」で開けます。
解決しないときは、info@k386.sub.jp へメールでお知らせください。
用語
| モデル | 音声を文字にするためのデータ。最初に一度、Hugging Face から取得します |
|---|---|
| Whisper | OpenAI が公開した音声認識のモデル。このアプリは Argmax が Core ML 向けに変換したものを使います |
| Core ML | Mac の中で機械学習のモデルを動かす、macOS の仕組み |
| Hugging Face | モデルの配布元のサイト |
| エンジン | リアルタイム文字起こしで使う認識の方式。「Mac標準」と「Whisper」から選びます |
| 区間 | 文字起こしの結果を、時刻ごとに区切ったひとまとまり。字幕の 1 枚にあたります |
| 話者識別 | 誰が話しているかを推定し、話者ごとに区切る機能 |
| SRT・VTT・SBV | 動画の字幕に使うファイルの形式 |
| キーチェーン | パスワードなどを保管する macOS の仕組み |
| 127.0.0.1 | 「この Mac 自身」を表すアドレス。連携はここからの接続だけを受け付けます |