Hear2Text
说话者识别

录音转文字自动区分说话人

上传会议、采访或播客,任何方案下 Hear2Text 都会为每一行标注说话人:说话人 1、说话人 2 等,人数不限。重命名、合并说话人,以及把说话人加入导出文件,包含在付费的月付和年付方案中。

一个声音一个标签,从头到尾不变

整段录音一次性转写,所以第一分钟的说话人 2,一小时后依然是说话人 2。转录稿的每一行都带有说话人和时间戳;点击一行,播放器就会跳到那一刻,方便您核实到底是谁说的。在付费方案中,您可以把标签改成真实姓名,合并其实是同一个人的两个标签。模型分错时把任意一行移给另一位说话人,这一点任何方案都可以做。

开始使用

看清对话是怎么分配的

说话人面板显示每个人在录音中的发言占比,一眼就能看出采访者是否比嘉宾说得多,或者会议是否被某一个人主导。Hear2Text 只在单段录音内区分声音;它不会在不同录音之间记住声音,也不会识别某人的身份,所以名字始终由您来添加。

开始使用

多人录音:有无说话人标签的差别

功能没有使用Hear2Text
多人会议一大段文字,看不出谁说了什么每一行都标有说话人 1、说话人 2 等
采访逐字稿问题和回答混在一起采访者和嘉宾分属不同标签,可重命名
播客节目笔记重放整集来分辨主持人和嘉宾一个面板显示每位说话人在节目中的发言占比
查找引语拖着进度条凭耳朵找搜索转录稿,点击那一行即可播放

使用场景

  • 团队会议

    看清每个观点是谁提的、谁答应了什么。把说话人改成同事的名字,写会议纪要前点击一行再听一遍。

  • 采访和播客

    把主持人和嘉宾分开,摘引语、写节目笔记都不必重放整集。说话人面板会显示每个人说了多少。

  • 研究访谈和焦点小组

    在小组访谈中区分各位参与者,回顾每个人说了什么。如果一个麦克风录下多个相似的声音,需要手动修正部分行。

说话人识别如何运作

上传文件或粘贴公开链接。录音会在一次处理中完成转写并按声音区分,然后您在浏览器里整理标签。无需设置,无需声音样本,也不用选择语言。

  1. 步骤 01

    上传录音

    上传不超过 500 MB、6 小时的音频或视频,或粘贴公开的 YouTube、Vimeo 或 Zoom 云录制分享链接。语种自动识别。

  2. 步骤 02

    区分不同声音

    整段录音一次性分析,找出说话人之间的轮换,每个声音全程保持同一个标签。

  3. 步骤 03

    每行标注说话人

    每一行都标有说话人 1、说话人 2 等,并附时间戳。只有一个声音时,标签会隐藏。

  4. 步骤 04

    重命名并修正

    在付费方案中,把说话人改成真实姓名,合并重复的标签。把某一行移给正确的人,这一点任何方案都可以做。

核心功能

  • 自动识别说话人

    直接从音频中识别说话人。无需标记,无需声音样本,也不用事先填写人数。

  • 重命名与合并说话人

    在付费方案中,一步把说话人 1 改成“Anna”,并合并属于同一个人的两个标签。

  • 全程标签一致

    整份文件一次处理,每个声音从第一分钟到最后一分钟都保持同一个标签。

  • 人数不限

    说话人数量不限:两人采访、团队会议和座谈会都可以。音频越清晰,区分效果越好。

  • 手动修正

    抢话和声音相似会导致错误。您可以在浏览器里把任意一行移给其他说话人并修改文字。

  • 下载文件也能显示说话人

    付费方案中,下载时可以选择是否加入说话人:TXT、Word、PDF 会在每段发言前加上说话人姓名,SRT 和 VTT 会在每条字幕前加上说话人姓名。

常见问题

最多能识别几位说话人?
没有固定上限。Hear2Text 找到多少个不同的声音,就标注多少个:说话人 1、说话人 2、说话人 3……无论是两人通话还是八人座谈。说话人越多、声音越相似,区分越难,所以用一个麦克风录下的大型小组讨论可能需要手动调整几行。只有一个人说话时,标签会隐藏。
需要先登记说话人或上传声音样本吗?
不需要。没有注册步骤,也不用录制声音样本。说话人直接从录音本身区分出来,您只需上传文件或粘贴公开链接,转录稿就会带着标签返回。Hear2Text 不知道每个人是谁,所以会命名为说话人 1、说话人 2 等;付费方案可以之后再重命名。
说话人识别准确吗?
在录音清晰、大家轮流发言、每人各有麦克风的情况下很可靠。多人抢话、所有人共用一个远处的麦克风,或两人声音很像时,准确度会下降。错误通常表现为一小句话被分给了错误的人,您可以在浏览器里把任意一行移到正确的说话人,或合并两个标签。
可以把说话人改成真实姓名吗?
可以,需付费方案。把说话人 1 改名为“Anna”,她的每一行都会同时更新。如果同一个人被拆成了两个标签,可以合并。名字也能带进您下载的文件:导出时可以选择加入说话人,TXT、Word、PDF、SRT、VTT 都会显示。
多人同时说话时会怎样?
重叠说话是最难的情况。每个片段只归属一位说话人,所以两人同时说话时,这一行会分给声音占主导的人,简短的插话可能被漏掉或归错人。严重的抢话也会降低转写准确度。您可以事后在浏览器里修改文字,并把行移到正确的说话人。
电话录音也能区分说话人吗?
可以,只要您有录音文件。上传即可(不超过 500 MB、6 小时,支持 MP3、M4A、WAV 等大多数格式),通话双方都会被标注。电话音频频带窄、压缩重,区分效果不如录音室音质,尤其是两人声音相近时。Hear2Text 本身不录制通话,也不会有机器人加入 Zoom、Teams 或 Meet。

识别您下一段录音中的说话人

上传会议、采访或播客,任何方案都能得到每一行都标注说话人的转录稿。给说话人命名、把说话人加进导出文件,包含在月付(US$9.99)和年付(US$89.99)方案中,这两个方案还提供不限分钟数的转写。