FB18 Elektrotechnik und Informationstechnik · Angeboten in WiSe 2025/26
Für diesen Kurs wurden noch keine Noten gemeldet.
Notenverteilungen kommen herein, sobald jemand, der den Kurs belegt hat, den Notenspiegel mit installierter TUPlan-Erweiterung öffnet.
Noch keine Bewertungen — mach den Anfang.
Deine Bewertung hängt an einer zufälligen ID in diesem Browser. Kein Konto, nichts, was dich identifiziert.
Wir starten die Vorlesungsreihe mit einer Einführung in die menschliche Spracherzeugung und zugehörigen Modellen, die Schallausbreitung und Reflexionen, sowie die akustische Wahrnehmung beim Menschen, das menschliche Ohr mit Außen-, Mittel- und Innenohr. Im Folgenden wird immer wieder eine Abfolge von grundlegenden Verarbeitungsverfahren und zugehörigen Anwendungen in dem Bereich der Audiosignalverarbeitung erläutert. Wir fangen mit Vektorquantisierung und Codebuch Verarbeitung an. Diese Verfahren bilden die Basis für Audiocodierungsverfahren, sowohl prädiktionsbasierte als auf frequenzbereichsbasierte Verfahren werden erläutert, von denen MP3 sicherlich das bekannteste darstellt. Parallel werden Qualitätsmaße erläutert, die nicht nur im Bereich der Audiocodierung aber auch bei der Audiosignalverbesserung zur Bewertung und dem Vergleich der Verfahren genutzt werden. Diese bauen auf den zuvor erläuterten Eigenschaften der menschlichen Wahrnehmung auf. Im Bereich Audiosignalverbesserung werden Verfahren zur Geräuschreduktion, klassisch mit Filterung oder auch mit neuronalen Netzen (KI) sowie Richtmikrofonverfahren in verschiedenen Ausprägungen vorgestellt zur Reduktion der Höranstrengung aber auch Sprachverständlichkeitsverbesserung. Anwendungen bei (mobiler) Telefonie, in Hörgeräten aber auch bei der Spracherkennung in akustisch gestörten Umgebungen. Grundlage zur Spracherkennung, Sprechererkennung und auch akustischer Klassifikation bilden bilden Mel-Frequency Cepstral Coefficients (MFCC). Dies werden zunächst eingeführt und dann im Bereich akustische Klassifikation, Sprach- und Sprechererkennung angewendet. Gaußsche Mischmodelle (GNM) und Hidden-Markov-Modelle (HMM) werden hierzu als Grundlagen eingeführt. Bei Spracherkennung werden ebenso Methoden mit neuronalen Netzen vorgestellt, sowie die Konzepte von „Large language models“ (LLM). Im Bereich Musiksignalverarbeitung wird in die Konzepte der „Chroma“ Verarbeitung eingeführt mit Anwendungen im Bereich Musikerkennung, Rhythmus-Erkennung. Die Shazam-App wird als ein praktisch bekanntes Beispiel erläutert. Abschließend wird in 3D räumliche akustische Wiedergabe einführt. Basis hierzu stellen Verfahren der Wellenfeldsynthese (WFS) sowie „Higher Order Ambisonics“ (HAO). Im Bereich „Übung“ werden vier Tutorials mit praktischen MATLAB Beispielen Anwendungen einiger Verfahren zum tieferen technischen Verständnis ermöglichen. Das „Seminar“ hat erlaubt den Studenten sich in eine wissenschaftliche Publikation im erweiterten Bereich der Vorlesungsthemen einzuarbeiten und diese zusammenfassend zu präsentieren.
Kein Prüfungstermin veröffentlicht.
Zum Stundenplan hinzufügenTermine, Räume und Angaben stammen aus TUCaN und können veraltet sein. Falsche Angabe melden