説明
Whisper as a Service (WAAS) は、OpenAI の Whisper モデルを活用した堅牢な音声文字起こしソリューションを提供するオープンソースプロジェクトです。直接ファイルをアップロードするためのグラフィカルユーザーインターフェイス (GUI) と、プログラムによる統合のための API の両方を提供しており、さまざまなユースケースに対応できます。
WAAS の中核機能は、文字起こしジョブの非同期処理を可能にするキューイングシステムを中心に展開されています。ユーザーは GUI を介して音声またはビデオファイルをアップロードでき、完了後、SRT、TXT、JSON などのさまざまな形式で文字起こしされたテキストのダウンロードリンクを電子メールで受け取ることができます。GUI には、文字起こしを微調整して精度を高めるためのブラウザ内エディターも含まれています。
開発者向けに、WAAS API は新しい文字起こしジョブの送信、音声言語の検出、ジョブステータスと結果の取得のためのエンドポイントを提供します。API は電子メールコールバックまたは Webhook 通知をサポートしており、アプリケーションは文字起こしが完了したときに通知を受け取ることができます。この非同期性は、大量の音声データを効率的に処理するために不可欠です。
WAAS は Docker Compose を使用して簡単にデプロイできるように設計されており、高速処理のための GPU アクセラレーションのオプションも用意されています。このプロジェクトは Python 3.8-3.10 と互換性があり、OpenAI Whisper の要件に準拠しています。コミュニティの参加とカスタマイズを促進するために、貢献ガイドラインとインストール手順が提供されています。
プロジェクトのアーキテクチャには、Redis キューと API ワーカーが含まれており、文字起こしタスクが効果的に管理されることを保証します。データの整合性を確保するために、Webhook シグネチャ検証などのセキュリティ機能も実装されています。WAAS は、高度な音声認識機能をワークフローやアプリケーションに統合する必要があるすべての人にとって価値のあるツールです。
Whisper as a Serviceの主要機能
音声ファイルアップロードと文字起こし用の GUI
プログラムによる文字起こしジョブ送信用の API
キューイングによる非同期ジョブ処理
ダウンロードリンク付きの電子メール通知
文字起こし修正用のブラウザ内エディター
複数の出力形式 (SRT, TXT, JSON) のサポート
リアルタイム通知のための Webhook 統合
音声ファイルの言語検出
高速処理のためのオプションの GPU アクセラレーション
簡単なデプロイのための Docker Compose
セキュリティのための Webhook シグネチャ検証
Whisper as a Serviceをはじめる
クローン: GitHub から WAAS リポジトリをクローンします。
インストール: Python 仮想環境をセットアップし、pip を使用して依存関係をインストールします。
設定: 必要な API キーと電子メール設定を含む .envrc ファイルを作成します。
実行: 完全なセットアップのために Docker Compose を使用してアプリケーションを実行します。
統合: 提供されている API エンドポイントを使用して文字起こしジョブを送信します。
受信: ジョブ完了通知のために電子メールコールバックまたは Webhook を設定します。
Whisper as a Serviceの使用例
- 自動文字起こし
- 会議議事録
- ポッドキャスト制作
- ビデオ字幕
- 開発者ツール
- 語学学習
- アクセシビリティ機能





