公開デモ

話者分離デモ

短い録音ファイルをアップロードし、Azure AI Speech と GPT-4o による話者分離付き文字起こしを比較できます。

できること

  • 音声・動画ファイルを日本語または英語(米国)で文字起こしできます。
  • Azure AI Speech と GPT-4o の話者分離結果を比較できます。
  • タイムスタンプ付きの発話を確認し、Transcript のコピーや JSON のダウンロードができます。

関連する解説

Azure AI Speech の話者分離と話者認識の違いを詳しく解説しています。

使い方

  1. 対応する音声または動画ファイルを選びます。
  2. 認識言語として日本語または英語(米国)を選びます。
  3. Azure AI Speech では想定する最大話者数を 2〜35 人に設定します。GPT-4o は話者数を自動判定します。
  4. 利用するエンジンを選び、セキュリティスキャン、キュー待機、解析の完了を待ちます。
  5. 結果を確認し、必要に応じて Transcript をコピーするか JSON をダウンロードします。

公開デモの制限

ファイルサイズ
50 MiB 以下
再生時間
5分以下
対応形式
WAV、MP3、M4A、MP4、MOV、OGG、OPUS、FLAC、WMA、AAC、AMR、WebM
1セッション
UTC 日ごとに受付 5回まで
ネットワーク識別子単位
UTC 日ごとに受付 30回まで
同時処理
1 セッションあたり 1件、ネットワーク識別子あたり 3件
共有処理枠
UTC 日ごとに音声 150分、UTC 月ごとに 3,000分

利用状況、サービス容量、運用コストに応じて制限を変更する場合があります。

精度と適切な利用

  • 話者ラベルは 1回の結果内だけで使う匿名ラベルです。実在人物を識別せず、別ファイルや別エンジンとの同一人物も示しません。
  • 発話の重なり、短い相づち、背景雑音、録音品質、マイクとの距離によって精度が低下します。
  • 結果には誤りが含まれます。証拠、本人確認、人事評価などの重大な判断には使用しないでください。
  • 第三者の音声をアップロードする前に、必要な同意を得てください。

データの取り扱い

  • アップロードした音声はマルウェアスキャン後、Azure AI Services へ送信されます。
  • 入力音声は処理成功または最終失敗後に削除します。孤立した Blob は 1日のライフサイクル規則で削除します。
  • 非公開の結果 JSON は最大 1時間、Transcript 本文を含まないジョブ情報は最大 24時間保持します。
  • 音声、Transcript 本文、元のファイル名、生の IP アドレス、Cookie、トークンはアプリケーションログへ記録しません。

公開経路の保護

  • Demo 本体は memobog.net の共有 Azure Front Door からだけ公開し、Web と API の origin への直接アクセスを拒否します。
  • Azure Web Application Firewall がリクエストを検査し、Demo へ到達する前に upload 専用の rate limit を適用します。
  • API origin は Azure Front Door Premium Private Link で接続します。ブラウザーへの応答では Content Security Policy と Permissions Policy も適用します。