本文へ移動
User guide

Whisper Local 使い方ガイド

モデルの準備から、文字起こし・編集・書き出しまでの流れです。インストールの手順はダウンロードのページにあります。

Getting started

はじめに

Whisper Local は、OpenAI の Whisper 系モデル(Core ML 版)を使って、Mac の中だけで音声を文字にするアプリです。最初にモデルを準備すれば、そのあとの文字起こしはオフラインで動きます。

まずはセットアップガイドで、モデルを 1 つ準備しましょう。

案内役・しずく

セットアップガイドでモデルを準備する

初回起動時にセットアップガイドが開きます。言語を選び「このモデルを準備する」を押すと、モデルの取得と設定が終わり、サンプル音声で実際に試せます。ガイドは、あとから設定画面の「ガイドを開く」でいつでも開けます。

モデルの選びかた

モデル大きさ向いている使い方
Large v3 Turbo(標準)約 1.6 GB日本語を含む多言語
Turbo Compact約 650 MB容量を節約したいとき
Base English約 150 MB英語だけのとき(英語専用)

設定の「診断」で、手元の音声を使って速度を実測できます。

最初の文字起こしは時間がかかります

初回だけ、モデルをこの Mac 向けに変換するため数分〜10 分ほどかかります。進み具合は画面に表示されるので、そのままお待ちください。次回からは短時間で済みます。

Basics

基本操作

ファイルの文字起こし

  1. 音声や動画のファイルを、ウィンドウにドロップします。
  2. 「文字起こしを開始」(⌘↩)を押します。
  3. 終わると結果が表示されます。コピーしたり、TXT などに保存したりできます。

処理中も画面は操作でき、いつでも取り消せます。

  • 対応形式:WAV・M4A・MP3・MP4・MOV など、macOS が読める形式
  • 長さ:1 ファイル最長 2 時間(それより長い場合は分割してください)
  • 言語:日本語・英語・自動検出ほか多言語

約 10 分の動画を処理した実測例では、全体で約 1 分半でした(Mac の性能により変わります)。

結果画面。日本語の文字起こし結果と、コピー・TXT 保存のボタンが表示されている
文字起こしの結果画面

リアルタイム文字起こし

  1. 右上のマイクのボタン(⌘⇧R)で開きます。
  2. マイクとエンジンを選び、「開始」を押して話します。
  3. 初回は、マイクと音声認識の使用許可を求められるので「許可」を選びます。

確定した文字は黒、途中の文字は薄く表示されます。マイクを使うのは「開始」から「停止」までの間だけです。

エンジンの選びかた

  • Mac標準(すぐ開始):押してすぐ始まり、話すのとほぼ同時に文字が出ます。macOS 26 以降で使えます。
  • Whisper(高精度):精度を重視するとき。開始に数秒、アップデート直後の初回は 1〜3 分かかります。

辞書の置き換えと句読点の設定は、リアルタイムにも適用されます。停止後は、録音を通常の方法で文字起こしし直せます。話者識別や字幕の保存もできます。

録音とテキストの保存

標準では、録音(WAV)とテキストを ~/Library/Application Support/WhisperLocal/Live に保存します。設定の「リアルタイム」で、保存のオン・オフ、保存先(「書類」など)、古いものの自動削除(7〜90 日より前のものをゴミ箱へ移動)を、録音とテキストそれぞれに設定できます。

リアルタイム文字起こしの画面。マイクとエンジンの選択欄の下に、話した内容が文字で表示されている
リアルタイム文字起こしの画面

編集と書き出し

結果画面の「区間・時刻を確認」から、区間ごとの本文・開始/終了時刻・話者を編集できます。

  • 区間を 2 つに分ける、時刻を秒単位で直す
  • 話者名を一括で変える(例:「話者 1」→「佐藤」)
  • 確認が必要な区間は色で表示されます。確定してから保存します

書き出せる形式

TXT・CSV・SRT・VTT・SBV の 5 つです。区切りは、文章/語数(1〜30)/時間(0.5〜10 秒)から選べます。

  • 字幕の時刻に逆転・重なり・範囲外がある区間は、黙って書き出さずに確認を求めます。原文は常に残ります。
  • CSV は UTF-8(BOM 付き)で保存するので、Excel・Numbers でそのまま開けます。数式として解釈される先頭文字には、アポストロフィを付けます。

履歴と自動保存

元の認識結果と編集内容を、この Mac に保存します。アプリを閉じても、次に開いたときに前回の結果と編集を復元します。履歴は設定の「履歴」から削除できます。

区間と時刻の編集画面。話者名の欄と、区間ごとの本文・開始・終了時刻が並んでいる
「区間・時刻を確認」の画面

話者識別

話者識別をオンにして文字起こしすると、話者ごとに区切ります。話者の名前の変更や割り当ての修正は「区間・時刻を確認」でできます。変更はすべての書き出し形式に反映されます。

話者の数や割り当ては推定です。短い相づちや同時に話した部分では誤ることがあります(2 人の会話を 3 人と推定した例があります)。結果は確認してから使ってください。

  • 人数を指定する:設定の「話者」の「人数」で、会話の人数(2〜8人)を指定できます。人数が分かっているときに指定すると、話者の取り違えが減ります。分からないときは「自動で推定」のままにしてください(0.3.16 以降)。
  • 話者識別がオンのときは、アプリの起動時とオンに切り替えたときに話者モデルを裏で準備します。そのため、最初の文字起こしでも待たずに始まります。

辞書

設定の「辞書」に、よく間違える語を「誤 → 正」で登録すると、文字起こしの完了時に自動で置き換えます。

  • CSV でまとめて編集できます。
  • 置き換える前の、元の結果に戻せます。
  • リアルタイム文字起こしにも適用されます。

辞書は文脈を判断しません。どちらも正しい言葉になりうる同音異義語(講演/公園など)には向きません。

句読点

句読点が入りにくい日本語の話し言葉に、話の区切りと文末から「、」「。」を補います。認識した言葉そのものは変えません。設定でオン・オフでき、リアルタイム文字起こしにも適用されます。

Settings

設定

このガイドで触れている、設定画面の主な項目です。句読点の自動挿入も、設定でオン・オフできます。

設定画面の項目できること
ガイドを開くセットアップガイドを開き直して、モデルを準備します
リアルタイム録音とテキストの保存のオン・オフ、保存先、古いものの自動削除(7〜90 日)
辞書「誤 → 正」の登録。CSV でまとめて編集
履歴保存した結果と編集の削除
診断手元の音声を使って速度を実測
連携「Macへのログイン時に自動で起動する」「ウインドウを閉じても常駐する」、ほかのアプリからの依頼の受付・許可フォルダー・連携アプリの登録
アップデートを自動で確認する起動後と 1 日 1 回の更新確認のオン・オフ

常駐と、ほかのアプリとの連携

メニューバーに常駐し、同じ Mac の許可したアプリから文字起こしの依頼を受けられます。

  • 接続は同じ Mac の中(127.0.0.1)からだけです。ブラウザーからは接続できません。
  • 連携アプリごとの認証情報は、キーチェーンに保存します。
  • 読み取れるのは、許可したフォルダーの中だけです。

icRec などと確認1回で連携する(0.3.15 以降)

icRec などの連携アプリで「Whisper Local と連携する」を押すと、Whisper Local に「「icRec」と連携しますか?」という確認が出ます。読み取るフォルダーと依頼したアプリ(同じ開発元のアプリかどうか)を確かめて「連携する」を押すと、常駐・フォルダーの許可・連携アプリの登録・依頼の受付がすべて自動で設定されます。ID やトークンを書き写す必要はありません。

  • 心当たりのない依頼や、依頼したアプリを確認できないと表示されたときは、「キャンセル」を押してください。
  • 同じアプリで連携し直すと、以前の登録は無効になり、新しい登録に置き換わります。
  • 自分で設定する場合は、これまでどおり設定の「連携」で、フォルダーの許可と連携アプリの登録を行い、表示された認証情報を連携アプリに入力します。
  • 連携アプリから起動されたときも、「ウインドウを閉じても常駐する」がオンなら、ウインドウを開かずにメニューバーに常駐して始まります。

Mac の起動時から使う

設定の「連携」で「Macへのログイン時に自動で起動する」と「ウインドウを閉じても常駐する」をオンにすると、ログイン時はウィンドウを開かずにメニューバーへ常駐した状態で起動します。起動したことは、画面右上のバナーで数秒間お知らせします。ウィンドウは、バナーをクリックするか、メニューバーのアイコンの「ウインドウを開く」で開けます。

連携設定画面。常駐・受付・許可フォルダー・連携アプリの登録欄がある
設定の「連携」
Troubleshooting

困ったとき

しずく

最初の 1 回が遅いのは、モデルを変換しているからです。

最初の文字起こしがなかなか終わらない

初回だけ、モデルをこの Mac 向けに変換するため数分〜10 分ほどかかります。進み具合は画面に表示されるので、そのままお待ちください。次回からは短時間で済みます。

リアルタイムの「Whisper」エンジンがすぐに始まらない

Whisper エンジンは開始に数秒、アップデート直後の初回は 1〜3 分かかります。すぐに始めたいときは「Mac標準」を選んでください(macOS 26 以降)。

「Mac標準」エンジンが使えない

「Mac標準」エンジンは macOS 26 以降で使えます。それより前の macOS では Whisper エンジンを使います。

マイクが使えない

リアルタイム文字起こしには、マイクと音声認識の許可が必要です。初回に許可しなかった場合や、あとで取り消した場合は、macOS のシステム設定の「プライバシーとセキュリティ」で Whisper Local を許可してください。

話者の数や割り当てが違う

話者識別は推定です。短い相づちや同時に話した部分では誤ることがあります。会話の人数が分かっている場合は、設定の「話者」の「人数」で指定すると取り違えが減ります。「区間・時刻を確認」で割り当ても直せます。

辞書で、直したくない言葉まで置き換わる

辞書は文脈を判断せずに置き換えます。どちらも正しい言葉になりうる同音異義語は、登録しないでください。置き換える前の元の結果には戻せます。

2 時間より長い音声を文字起こししたい

1 ファイル最長 2 時間までです。それより長い場合は分割してください。

字幕を保存しようとしたら、確認を求められた

時刻の逆転・重なり・範囲外がある区間があると、黙って書き出さずに確認を求めます。「区間・時刻を確認」で色の付いた区間を直し、確定してから保存してください。

ログイン時にウィンドウが開かない

「ウインドウを閉じても常駐する」がオンのときは、ログイン時はウィンドウを開かずにメニューバーへ常駐します。画面右上のバナーをクリックするか、メニューバーのアイコンの「ウインドウを開く」で開けます。

解決しないときは、info@k386.sub.jp へメールでお知らせください。

Glossary

用語

モデル音声を文字にするためのデータ。最初に一度、Hugging Face から取得します
WhisperOpenAI が公開した音声認識のモデル。このアプリは Argmax が Core ML 向けに変換したものを使います
Core MLMac の中で機械学習のモデルを動かす、macOS の仕組み
Hugging Faceモデルの配布元のサイト
エンジンリアルタイム文字起こしで使う認識の方式。「Mac標準」と「Whisper」から選びます
区間文字起こしの結果を、時刻ごとに区切ったひとまとまり。字幕の 1 枚にあたります
話者識別誰が話しているかを推定し、話者ごとに区切る機能
SRT・VTT・SBV動画の字幕に使うファイルの形式
キーチェーンパスワードなどを保管する macOS の仕組み
127.0.0.1「この Mac 自身」を表すアドレス。連携はここからの接続だけを受け付けます