Hear2Text
話者識別

音声の文字起こしで話者を自動で識別

会議、インタビュー、ポッドキャストをアップロードすると、Hear2Textがどのプランでも全行に話者1、話者2…とラベルを付けます。人数の上限はありません。話者の名前変更・統合と、エクスポートへの追加は、月額・年額の有料プランに含まれます。

一つの声に一つのラベル、最初から最後まで

録音全体を一度に文字起こしするので、最初の1分で話者2だった声は、1時間後も話者2のままです。文字起こしの各行には話者とタイムスタンプが付き、行をクリックするとプレーヤーがその場面に移動して、誰が話したかを確かめられます。有料プランでは、ラベルを実名に変える、同一人物だった二つのラベルを統合する、といった修正ができます。判定を誤った行を別の話者に移す操作は、どのプランでも可能です。

始める

会話の配分を見る

話者パネルで各人が録音の何割を話したかが表示されるので、聞き手がゲストより多く話していないか、会議で一人の声ばかりになっていないかがひと目でわかります。Hear2Textが声を聞き分けるのは一つの録音の中だけです。録音をまたいで声を記憶したり、誰なのかを認識したりはしないので、名前は必ずご自身で付けてください。

始める

複数人の音声:話者ラベルがある場合とない場合

機能なしHear2Textで
複数人の会議誰の発言かわからない長い文章の塊すべての行に話者1、話者2…と表示
インタビューの文字起こし質問と回答がひと続きになる聞き手とゲストが別々のラベルになり、名前も変えられる
ポッドキャストの番組ノートホストとゲストを聞き分けるために再生し直す各話者がエピソードの何割を話したかをパネルで確認
発言の引用を探す耳を頼りに音声を行き来する文字起こしを検索し、行をクリックして再生

活用事例

  • チーム会議

    誰がどの論点を出し、誰が何に同意したかがわかります。話者を同僚の名前に変え、議事録を書く前に行をクリックして聞き直せます。

  • インタビューとポッドキャスト

    ホストとゲストを分けておけば、エピソードを聞き直さずに発言を引用し、番組ノートを書けます。話者パネルで各人の発言量もわかります。

  • 調査インタビューとグループインタビュー

    グループセッションの参加者を分け、それぞれの発言を見直せます。似た声が多く一本のマイクで録った場合は、いくつかの行を手で直すことになります。

話者識別のしくみ

ファイルをアップロードするか公開リンクを貼り付けるだけです。録音は一度の処理で文字起こしされ、声ごとに分けられます。あとはブラウザでラベルを整えます。設定も声のサンプルも言語の選択も要りません。

  1. ステップ 01

    録音をアップロード

    500MB・6時間までの音声や動画をアップロードするか、YouTube、Vimeo、Zoomクラウド録画の公開リンクを貼り付けます。言語は自動で判別されます。

  2. ステップ 02

    声が分けられる

    録音全体をまとめて解析するので、話者の切り替わりが見つかり、同じ声は最後まで同じラベルのままです。

  3. ステップ 03

    行に話者ラベルが付く

    各行に話者1、話者2…のラベルとタイムスタンプが付きます。声が一人分だけなら、ラベルは表示されません。

  4. ステップ 04

    名前を変えて直す

    有料プランでは、話者を実名に変え、重複したラベルを統合できます。行を正しい話者に移す操作は、どのプランでも可能です。

主要機能

  • 話者を自動で検出

    話者は音声そのものから検出されます。タグ付けも声のサンプルも、事前の人数入力も要りません。

  • 話者の名前変更と統合

    有料プランでは、話者1を一度の操作で「佐藤」に変えられ、同じ人の二つのラベルも統合できます。

  • 録音全体で一貫したラベル

    ファイル全体を一度に処理するので、同じ声は最初の1分から最後まで同じラベルです。

  • 何人でも

    話者数に上限はありません。二人のインタビューもチーム会議もパネルも対応します。クリアな音声ほどきれいに分かれます。

  • 行を手で直す

    発言の重なりや似た声は誤りの原因になります。どの行も別の話者に移せ、本文もブラウザで直せます。

  • ダウンロードにも話者を

    有料プランでは、ダウンロード時に話者を入れるかどうかを選べます。TXT、Word、PDFは各発言の頭に話者名が入り、SRTとVTTは各字幕の前に話者名が入ります。

よくある質問

何人まで話者を識別できますか?
決まった上限はありません。二人の通話でも大人数のパネルディスカッションでも、Hear2Textは見つけた声の数だけ話者1、話者2、話者3…とラベルを付けます。似た声の話者が多いほど分離は難しくなるため、一本のマイクで録った大人数の録音では、いくつかの行を手で移す必要があるかもしれません。話しているのが一人だけの場合、ラベルは表示されません。
話者の事前登録や声のサンプルは必要ですか?
いいえ。事前登録も声のサンプル録音も要りません。話者は録音そのものから聞き分けられるので、ファイルをアップロードするか公開リンクを貼り付けるだけで、ラベル付きの文字起こしが届きます。Hear2Textは誰が誰かを知らないため、話者1、話者2…と名付けます。有料プランでは、あとから名前を変えられます。
話者識別の精度はどのくらいですか?
順番に話し、それぞれが自分のマイクを使っているクリアな録音なら、信頼できる精度です。発言が重なるとき、全員が離れた一本のマイクを共有しているとき、二人の声が似ているときは精度が下がります。誤りはたいてい短い行が別の人に割り当てられる形で現れ、ブラウザでその行を正しい話者に移したり、二つのラベルを統合したりして直せます。
話者の名前を実名に変えられますか?
はい、有料プランで可能です。話者1を「佐藤」に変えると、その人の全行が一度に更新されます。一人が二つのラベルに分かれた場合は統合できます。名前はダウンロードにも反映できます。エクスポート時に話者を含めるかどうかを選べ、TXT、Word、PDF、SRT、VTTのどれにも表示されます。
複数人が同時に話すとどうなりますか?
発言の重なりは最も難しいケースです。各セグメントには話者が一人しか付かないので、二人が同時に話すとその行は声の大きいほうに割り当てられ、短い相づちは抜けたり別の人に付いたりします。激しい重なりは文字起こしの精度も下げます。あとからブラウザで本文を直し、行を正しい話者に移せば修正できます。
通話の録音でも話者を分けられますか?
はい、録音がファイルとして手元にあれば使えます。MP3、M4A、WAVなどほとんどの形式で、500MB・6時間までアップロードでき、双方にラベルが付きます。電話の音声は帯域が狭く圧縮されているため、特に声が似ている場合はスタジオ録音より分離の精度が下がります。Hear2Text自体は通話を録音せず、Zoom、Teams、Meetにボットが参加することもありません。

次の録音で話者を識別する

会議、インタビュー、ポッドキャストをアップロードすれば、どのプランでも行ごとに話者が付いた文字起こしが届きます。話者に実名を付けたり、エクスポートに含めたりするのは月額($9.99)・年額($89.99)プランの機能で、文字起こしの分数も無制限になります。