公開デモ
話者分離デモ
短い録音ファイルをアップロードし、Azure AI Speech と GPT-4o による話者分離付き文字起こしを比較できます。
できること
- 音声・動画ファイルを日本語または英語(米国)で文字起こしできます。
- Azure AI Speech と GPT-4o の話者分離結果を比較できます。
- タイムスタンプ付きの発話を確認し、Transcript のコピーや JSON のダウンロードができます。
関連する解説
使い方
- 対応する音声または動画ファイルを選びます。
- 認識言語として日本語または英語(米国)を選びます。
- Azure AI Speech では想定する最大話者数を 2〜35 人に設定します。GPT-4o は話者数を自動判定します。
- 利用するエンジンを選び、セキュリティスキャン、キュー待機、解析の完了を待ちます。
- 結果を確認し、必要に応じて Transcript をコピーするか JSON をダウンロードします。
公開デモの制限
- ファイルサイズ
- 50 MiB 以下
- 再生時間
- 5分以下
- 対応形式
- WAV、MP3、M4A、MP4、MOV、OGG、OPUS、FLAC、WMA、AAC、AMR、WebM
- 1セッション
- UTC 日ごとに受付 5回まで
- ネットワーク識別子単位
- UTC 日ごとに受付 30回まで
- 同時処理
- 1 セッションあたり 1件、ネットワーク識別子あたり 3件
- 共有処理枠
- UTC 日ごとに音声 150分、UTC 月ごとに 3,000分
利用状況、サービス容量、運用コストに応じて制限を変更する場合があります。
精度と適切な利用
- 話者ラベルは 1回の結果内だけで使う匿名ラベルです。実在人物を識別せず、別ファイルや別エンジンとの同一人物も示しません。
- 発話の重なり、短い相づち、背景雑音、録音品質、マイクとの距離によって精度が低下します。
- 結果には誤りが含まれます。証拠、本人確認、人事評価などの重大な判断には使用しないでください。
- 第三者の音声をアップロードする前に、必要な同意を得てください。
データの取り扱い
- アップロードした音声はマルウェアスキャン後、Azure AI Services へ送信されます。
- 入力音声は処理成功または最終失敗後に削除します。孤立した Blob は 1日のライフサイクル規則で削除します。
- 非公開の結果 JSON は最大 1時間、Transcript 本文を含まないジョブ情報は最大 24時間保持します。
- 音声、Transcript 本文、元のファイル名、生の IP アドレス、Cookie、トークンはアプリケーションログへ記録しません。
公開経路の保護
- Demo 本体は memobog.net の共有 Azure Front Door からだけ公開し、Web と API の origin への直接アクセスを拒否します。
- Azure Web Application Firewall がリクエストを検査し、Demo へ到達する前に upload 専用の rate limit を適用します。
- API origin は Azure Front Door Premium Private Link で接続します。ブラウザーへの応答では Content Security Policy と Permissions Policy も適用します。