WikiDer > Spracherkennung
Spracherkennung ist ein Teilbereich der Informatik und Computerlinguistik in denen Methoden erforscht und entwickelt werden, die insbesondere den Einsatz von Automaten ermöglichen Computers, es gesprochenes Wort zu erkennen und zu verarbeiten. Spracherkennung muss unterschieden werden von Spracherkennung, ein biometrische Methode, um eine bestimmte Person mit der Stimme zu identifizieren. Die Methoden zur Realisierung beider sind jedoch eng verwandt.
Typen
Bei der einfachsten Form der Spracherkennung wird die gesprochene Eingabe mit einer begrenzten Anzahl von während einer Trainingszeit gesprochenen Befehlen verglichen. Vorlagenabgleich. Die Einschränkungen dieser Technik bedeuten, dass die Wörter beim Diktieren separat ausgesprochen werden müssen. Dies sind die sogenannten diskreten Sprachsysteme. Durch das individuelle Training der Befehle wird ein sehr hoher Wiedererkennungsgrad erreicht, sofern das Training in der Umgebung durchgeführt wird, in der die Erkennung auch verwendet wird (zB in einem Lager). Neben dem Training wird oft eine Umgebungsmessung durchgeführt, bei der im Hintergrund Geräusche registriert werden. Dies wird mit der Lautstärke verglichen, mit der die Leute sprechen. Auf diese Weise können störende Umgebungsgeräusche von der Erkennungssoftware ignoriert werden Vorlagenabgleich hat keine Einschränkungen in Bezug auf Umgangssprache und Akzente innerhalb der gesprochenen Sprache.Die meisten Spracherkennungsprogramme erfordern, dass das Programm zuerst ein Profil des Benutzers erstellt, indem es einen Beispieltext zur richtigen Erkennung liest.
Moderne Spracherkennung arbeitet mit statistischen Modellen von Rede und Sprache und obwohl generell noch eine Schulung zur Anpassung des Modells ratsam ist, werden sie zunehmend sprecherunabhängig. Bei dieser Form der Spracherkennung wird nur eine begrenzte Anzahl von Sprachen unterstützt und jemand mit einem schweren Akzent schwer zu erkennen, auch wenn vorher ein separates Training durchgeführt wird. Herstellung der sogenannten akustisch Modelle basiert auf a Sprachkorpus bestehend aus vielen Stunden transkribierter Rede. Die Herstellung eines solchen Korpus ist sehr arbeitsintensiv und die Lizenzgebühren sind daher in der Regel hoch. Auch deshalb sind nur wenige Hersteller auf diesem Markt tätig. Das VoxForge-Projekt versucht dies zu ändern, indem es eine Sprachsammlung unter a . erstellt Open-Source-Lizenz wird verfügbar sein.
Beispiele für Anbieter von Niederländisch Spracherkennungs-Engines sein:
- Nuance
- Loquendo
Beispiele für Parteien, die Spracherkennungs-Engines in Anwendungen integrieren können, sind:
- Zeder
- Sprachintelligenz
- Fernsprecher
Geschichte
Kommerzielle Spracherkennungsprogramme gibt es seit 1990. IBM 1996 sogar veröffentlicht als Betriebssystem auf dem Markt mit integrierter Spracherkennung: OS/2 Warp. Philips hatte das Programm bis etwa 2000 Frei sprechen, von denen FreeSpeech 2000 die letzte Version vor dem war Verbrauchermarkt. Seitdem stellt Philips Spracherkennung nur für professionelle (medizinische und juristische) Anwendungen her. Das belgische Unternehmen Lernout & Hauspie war einer der Spitzenreiter in der Spracherkennung, ging aber aufgrund von Buchhaltungsskandalen und zu hohen Erwartungen unter. Sowohl die Spracherkennungssparte von Philips als auch die Technologie von Lernout & Hauspie wurden von den Amerikanern übernommen Nuance-Kommunikation. Im Juli 2010 kündigte Nuance Communications die 11. Version seiner Spracherkennungssoftware an Dragon NaturallySpeaking.
Die begrenzte Rechenkapazität der damaligen Computer war in diesen Jahren noch ein wichtiger limitierender Faktor.
Die Spracherkennung kann auch von Personen mit RSI-Beschwerden. Sie sprechen in a Headset und müssen somit keine Arme, Hände und Finger benutzen.
Der amerikanische Hersteller Vocollect liefert seit 1989 komplette Spracherkennungslösungen, bestehend aus Hard- und Software. Der Schwerpunkt liegt auf Anwendungen in Lagerhallen und Industrieumgebungen. In diesem Markt ist Vocollect weltweiter Marktführer. Weitere bekannte Hersteller sind Voxware und MCL Technologies.