操作の手順
- 「音声ファイルを選択」で録音を開きます。iPhoneのボイスメモは、共有から「ファイルに保存」して選択できます。
- 日本語・英語・自動判定と、軽量または標準モデルを選び「文字起こしを開始」を押します。初回は認識モデルのダウンロードが必要です。
- 処理中は画面を開いておきます。一時停止した場合やページを開き直した場合は、同じ音声を選び「続きから再開」を押します。
- 区間ごとの本文と開始・終了秒を元の録音と照合して修正します。「ここから再生」で該当箇所を聞き直せます。
- 全文コピー、TXT保存、字幕SRT保存、文書に追加、ノートを作成から用途に合う方法を選びます。
無料で使える仕組み
Whisperの多言語モデルをブラウザ内で実行します。認識のAPI料金やアカウント登録は不要です。初回は認識エンジンとモデルの取得で通信が発生します。通信料と端末の費用は利用者の負担です。取得済みのモデルはブラウザのキャッシュが残っていれば再利用します。
モデルと端末の選び方
スマホは軽量のWhisper Tinyを推奨します。標準のWhisper Baseはメモリと時間を多く必要とします。初回取得はエンジンを含め約70MB/120MBが目安です。2時間分を一度に展開せず、約20秒ずつ認識し、結果を端末内に保存します。処理中は画面を開いたままにしてください。画面ロックやアプリ切り替えで一時停止します。画面の自動ロックを抑える機能は対応ブラウザでのみ働きます。
長時間のM4A等はiOS 26以降のSafari、または音声のWebCodecsに対応する最新版Chrome等が必要です。形式・機種によっては開けません。非対応環境ではPCM形式のWAV、または1分・10MB以下の音声を試してください。長い処理は充電中の利用をおすすめします。実機iPhone・Androidの2時間連続発話の処理は未検証で、端末によってメモリ不足や発熱、音声の長さ以上の処理時間が生じます。
精度と対応範囲
雑音・同時発話・固有名詞・小さな声や処理区間の境界は認識を誤る場合があります。必ず原音と照合してください。話者の自動分離、要約、リアルタイム録音には対応していません。字幕時刻は目安です。結果は20区間ずつ表示し、本文と開始・終了秒を修正できます。上限は10,000区間・300,000文字です。50,000文字を超えるノートは複数に分けて保存します。
結果と元音声の保存
完成結果と途中結果は案件と .nexus に保存します。元の音声は保存・バックアップに含みません。同じ音声を選択して「続きから再開」を押すと、最後に保存できた区間の続きから処理します。ファイル内容を照合し、別の音声との混在を防ぎます。再開時のモデルと言語は最初の設定を引き継ぎます。
新しい認識が成功するまで前回の完成結果は保持します。途中結果もTXT・SRT保存できます。端末の保存領域が消去されると再開できないため、大切な途中結果は案件ごと .nexus でバックアップしてください。1区間の処理が15分以上進まない場合は停止し、保存済みの区間から再開できます。
この機能のよくある質問
音声が外部に送られますか?
音声と認識テキストを送信する処理はありません。モデル取得時はHugging Face等の配信元にIPアドレスなど通常のアクセス情報が伝わります。
長い会議の録音は使えますか?
最大2時間・2GBまで、対応するブラウザで分割読み込みと認識を行います。スマホの実機で2時間連続発話を処理する性能は未検証です。短い録音から動作を確かめ、長時間は途中保存・再開をご利用ください。
スマホのボイスメモを読み込めますか?
M4Aなどの音声ファイルを読み込めます。iPhoneはボイスメモの共有から「ファイルに保存」し、アプリの選択画面で開きます。長時間M4A等はiOS 26以降のSafariなど、対応する環境が必要です。