説明
Whisper Webは、OpenAIのWhisper AIモデルを搭載したブラウザベースの音声認識プラットフォームです。WebGPUとWebAssemblyを使用してブラウザ内で音声をローカルに処理し、ダウンロードやインストール、サーバーへのアップロードなしで音声からテキストへの文字起こしを提供します。無料モードでは、音声データはデバイスから外に出ず、初回訪問時にモデルが読み込まれると、完全にオフラインで動作します。
このツールは、手動での選択が不要な自動言語検出機能を備え、100以上の言語をサポートしています。マイク入力、ファイルアップロード、またはURLから文字起こしが可能で、結果をTXT、JSON、SRT、VTT形式でエクスポートできます。処理がローカルで行われるため、Whisper Webはアカウントを必要とせず、データを収集しません。
無料プランでは、200 MBまでのファイルと20分までの音声を文字起こしでき、文字起こしの回数に制限はありません。Whisper Web Unlimitedでは、10時間までの大きなファイルや5 GBのファイル、50ファイルを一度にバッチアップロードし、デバイス間での文字起こしの同期が可能なオプションのセキュアクラウドワークフローが追加され、月額20ドルまたは年払いで月額10ドルで利用できます。クラウドファイルは文字起こし後に削除されます。
Whisper Webの主要機能
OpenAI Whisperによるブラウザベースの音声からテキストへの変換
無料モードでのプライバシー重視のローカル処理
自動検出機能を備えた100以上の言語
WebGPUおよびWebAssemblyによる加速
マイク、ファイルアップロード、URL入力
TXT、JSON、SRT、VTT形式へのエクスポート
モデルが読み込まれた後のオフライン文字起こし
大きなファイルとバッチアップロード用のオプションのクラウドモード
Whisper Webの使い方は?
Whisper Webを開く: ブラウザでサイトを読み込み、アカウントは不要です。
モデルを選択: デフォルトのBaseモデルを使用するか、遅いデバイス用にTinyを選択します。
音声を読み込む: MP3、WAV、M4A、または動画ファイルをドラッグ&ドロップするか、マイクまたはURLを使用します。
文字起こし: AIモデルをブラウザ内でローカルに実行するためにスタートをクリックします。
エクスポート: TXT、JSON、SRT、またはVTT形式で文字起こしや字幕をダウンロードします。
Whisper Webの使用例
- プライベート文字起こし
- 字幕作成
- 短いクリップ
- 大きなファイルの文字起こし







