Hear2Text
Sprechererkennung

Sprecher in Audio automatisch erkennen

Lade eine Besprechung, ein Interview oder einen Podcast hoch, und Hear2Text ordnet jede Zeile ihrem Sprecher zu: Sprecher 1, Sprecher 2 und so weiter, ohne Begrenzung der Anzahl, in jedem Tarif. Das Umbenennen und Zusammenführen von Sprechern sowie ihre Aufnahme in deine Exporte sind im Monats- und Jahrestarif enthalten.

Ein Label pro Stimme, vom Anfang bis zum Ende

Die ganze Aufnahme wird in einem Durchgang transkribiert, deshalb ist die Stimme, die in der ersten Minute Sprecher 2 ist, auch eine Stunde später noch Sprecher 2. Jede Zeile trägt ihren Sprecher und einen Zeitstempel; ein Klick auf die Zeile setzt den Player an diese Stelle, damit du prüfen kannst, wer es wirklich gesagt hat. In den Bezahltarifen benennst du ein Label in einen echten Namen um und führst zwei Labels derselben Person zusammen; einzelne Zeilen zu einem anderen Sprecher zu verschieben, wenn das Modell danebenlag, geht in jedem Tarif.

Loslegen

Sieh, wie das Gespräch verteilt war

Ein Sprecherfeld zeigt den Anteil jeder Person an der Aufnahme, damit du auf einen Blick siehst, ob der Interviewer mehr geredet hat als der Gast oder eine Stimme die Besprechung dominiert hat. Hear2Text unterscheidet Stimmen nur innerhalb einer Aufnahme; es merkt sich keine Stimmen zwischen Aufnahmen und erkennt nicht, wer jemand ist. Namen trägst du immer selbst ein.

Loslegen

Aufnahmen mit mehreren Sprechern, mit und ohne Sprecher-Labels

FunktionOhneMit Hear2Text
Besprechungen mit mehreren PersonenEin langer Textblock ohne Hinweis, wer was gesagt hatJede Zeile markiert mit Sprecher 1, Sprecher 2 und so weiter
InterviewtranskripteFragen und Antworten laufen ineinanderInterviewer und Gast mit getrennten, umbenennbaren Labels
Shownotes für PodcastsDie Folge erneut hören, um Host und Gast zu unterscheidenEin Feld mit dem Redeanteil jeder Person an der Folge
Ein Zitat findenNach Gehör durch die Aufnahme spulenIm Transkript suchen, Zeile anklicken, Stelle hören

Anwendungsfälle

  • Teambesprechungen

    Sieh, wer welchen Punkt eingebracht und wer was zugesagt hat. Benenne die Sprecher nach deinen Kolleginnen und Kollegen und klick eine Zeile an, um sie noch einmal zu hören, bevor du das Protokoll schreibst.

  • Interviews und Podcasts

    Halte Host und Gast auseinander, damit du Zitate herausziehen und Shownotes schreiben kannst, ohne die Folge erneut zu hören. Das Sprecherfeld zeigt, wie viel jede Person geredet hat.

  • Forschungsinterviews und Fokusgruppen

    Trenne die Teilnehmenden einer Gruppensitzung und sieh dir an, was jede Person gesagt hat. Bei vielen ähnlichen Stimmen an einem Mikrofon musst du einige Zeilen von Hand korrigieren.

So funktioniert die Sprechererkennung

Du lädst eine Datei hoch oder fügst einen öffentlichen Link ein. Die Aufnahme wird in einem Durchgang transkribiert und nach Stimmen getrennt, dann räumst du die Labels im Browser auf. Keine Einrichtung, keine Sprachproben, keine Sprache auszuwählen.

  1. Schritt 01

    Aufnahme hochladen

    Lade Audio oder Video bis 500 MB und 6 Stunden hoch oder füge einen öffentlichen Link zu YouTube, Vimeo oder einer geteilten Zoom-Cloud-Aufzeichnung ein. Die Sprache wird automatisch erkannt.

  2. Schritt 02

    Stimmen werden getrennt

    Die ganze Aufnahme wird auf einmal analysiert, so werden Sprecherwechsel gefunden, und jede Stimme behält durchgehend dasselbe Label.

  3. Schritt 03

    Zeilen bekommen Sprecher-Labels

    Jede Zeile wird mit Sprecher 1, Sprecher 2 und so weiter markiert, samt Zeitstempel. Bei nur einer Stimme wird das Label ausgeblendet.

  4. Schritt 04

    Umbenennen und korrigieren

    In den Bezahltarifen benennst du Sprecher in echte Namen um und führst doppelte Labels zusammen. Jede Zeile der richtigen Person zuzuordnen geht in jedem Tarif.

Kernfunktionen

  • Automatische Sprechererkennung

    Sprecher werden aus dem Ton selbst erkannt. Nichts zu markieren, keine Sprachproben, keine Sprecherzahl vorab einzugeben.

  • Sprecher umbenennen und zusammenführen

    In den Bezahltarifen wird aus Sprecher 1 mit einem Schritt „Anna“, und zwei Labels derselben Person lassen sich zusammenführen.

  • Einheitlich über die ganze Aufnahme

    Ein Durchgang über die ganze Datei hält jede Stimme von der ersten bis zur letzten Minute auf demselben Label.

  • Beliebig viele Sprecher

    Keine Begrenzung der Sprecher: Interviews zu zweit, Teambesprechungen und Podiumsrunden funktionieren. Klarer Ton trennt am besten.

  • Zeilen von Hand korrigieren

    Durcheinanderreden und ähnliche Stimmen führen zu Fehlern. Verschieb jede Zeile zu einem anderen Sprecher und bearbeite den Text im Browser.

  • Sprecher in deinen Downloads

    In den Bezahltarifen wählst du beim Herunterladen, ob die Sprecher mit rein sollen: TXT, Word und PDF öffnen jede Wortmeldung mit dem Namen der sprechenden Person, und SRT und VTT setzen ihn vor jeden Untertitel.

Häufig gestellte Fragen

Wie viele Sprecher kann es erkennen?
Es gibt keine feste Grenze. Hear2Text kennzeichnet so viele Stimmen, wie es unterscheiden kann, Sprecher 1, Sprecher 2, Sprecher 3 und weiter, ob Telefonat zu zweit oder Podiumsrunde mit acht Leuten. Viele ähnliche Stimmen erschweren die Trennung, bei einer großen Gruppe an einem Mikrofon musst du eventuell ein paar Zeilen von Hand verschieben. Spricht nur eine Person, wird das Label ausgeblendet.
Muss ich Sprecher vorher anlegen oder Sprachproben hochladen?
Nein. Es gibt keine Anmeldung von Stimmen und keine Sprachproben aufzunehmen. Die Sprecher werden aus der Aufnahme selbst unterschieden: Du lädst die Datei hoch oder fügst einen öffentlichen Link ein, und das Transkript kommt mit Labels zurück. Hear2Text weiß nicht, wer jemand ist, und nennt die Stimmen deshalb Sprecher 1, Sprecher 2 und so weiter; in den Bezahltarifen kannst du sie danach umbenennen.
Wie genau ist die Sprechererkennung?
Zuverlässig bei klaren Aufnahmen, in denen die Leute abwechselnd sprechen und jede Person ein eigenes Mikrofon hat. Die Genauigkeit sinkt, wenn Leute durcheinanderreden, alle ein weit entferntes Mikrofon teilen oder zwei Stimmen ähnlich klingen. Fehler zeigen sich meist als kurze Zeile bei der falschen Person; im Browser kannst du jede Zeile dem richtigen Sprecher zuordnen oder zwei Labels zusammenführen.
Kann ich Sprecher in echte Namen umbenennen?
Ja, in den Bezahltarifen. Benenne Sprecher 1 in „Anna“ um, und alle ihre Zeilen ändern sich auf einmal. Wurde eine Person auf zwei Labels verteilt, führ sie zusammen. Die Namen landen auch in deinen Downloads: Wähle beim Export, ob die Sprecher mit rein sollen, dann zeigen TXT, Word, PDF, SRT und VTT sie alle an.
Was passiert, wenn Leute durcheinanderreden?
Gleichzeitiges Sprechen ist der schwierigste Fall. Jeder Abschnitt bekommt einen Sprecher, reden also zwei zugleich, geht die Zeile an die dominierende Stimme, und ein kurzer Einwurf kann fehlen oder bei der falschen Person landen. Starkes Durcheinanderreden senkt auch die Genauigkeit der Transkription. Du kannst es danach im Browser korrigieren, indem du den Text bearbeitest und Zeilen dem richtigen Sprecher zuordnest.
Funktioniert das mit Aufnahmen von Telefonaten?
Ja, wenn du die Aufnahme als Datei hast. Lade sie hoch (bis 500 MB und 6 Stunden, als MP3, M4A, WAV oder in den meisten anderen Formaten), und beide Seiten werden gekennzeichnet. Telefonton ist schmalbandig und komprimiert, daher trennt die Erkennung schlechter als bei Studioton, besonders bei ähnlichen Stimmen. Hear2Text nimmt selbst keine Anrufe auf, und kein Bot tritt Zoom, Teams oder Meet bei.

Erkenne die Sprecher in deiner nächsten Aufnahme

Lade eine Besprechung, ein Interview oder einen Podcast hoch und bekomm in jedem Tarif ein Transkript, in dem jede Zeile ihrem Sprecher zugeordnet ist. Das Benennen der Sprecher und ihre Aufnahme in deine Exporte gehören zum Monatstarif (9,99 $) und Jahrestarif (89,99 $), die auch unbegrenzte Transkriptionsminuten enthalten.