CHAIS
Artificial intelligence (AI), especially large-language models, as well as speech and natural language processing, have made tremendous improvements. In particular, the combination of voice-based technologies and conversational agents has received considerable attention and might become ubiquitous. Despite their impressive capabilities under perfect conditions, problems become apparent in many real-world situations. In noisy environments, factors such as the presence of multiple speakers, background noise, echoes, or reverberated sounds often lead to failures.
In contrast to AI systems, human listeners can take advantage of the coordination between the hierarchical oscillatory structure of sounds and visual signals to focus attention on a speaker and increase the perceived voice even when multiple sounds compete. In a cross-disciplinary cooperation between core AI disciplines (i.e., speech and multimodal signal processing and human-AI communication) and neuroscience (i.e., neuroinformatics and computational neuroscience), we will develop neuro-inspired crossmodal AI-based speech signal processing algorithms to address the cocktail party phenomenon.
Künstliche Intelligenz (KI), insbesondere große Sprachmodelle sowie Sprach- und natürliche Sprachverarbeitung, haben enorme Fortschritte gemacht. Insbesondere die Kombination von sprachbasierten Technologien und konversationellen Agenten hat erhebliche Aufmerksamkeit erhalten und könnte allgegenwärtig werden. Trotz ihrer beeindruckenden Fähigkeiten unter optimalen Bedingungen zeigen sich in vielen realen Situationen deutliche Schwächen. In lauten Umgebungen führen Faktoren wie die Anwesenheit mehrerer Sprecher, Hintergrundgeräusche, Echos oder Hall oft zu Versagen.
Im Gegensatz zu KI-Systemen können menschliche Zuhörer die Koordination zwischen der hierarchischen Schwingungsstruktur von Geräuschen und visuellen Signalen nutzen, um die Aufmerksamkeit auf einen Sprecher zu lenken und die wahrgenommene Stimme zu verstärken, selbst wenn mehrere Klänge konkurrieren. In einer interdisziplinären Zusammenarbeit zwischen KI-Kerndisziplinen (Sprach- und multimodale Signalverarbeitung sowie Mensch-KI-Kommunikation) und den Neurowissenschaften (Neuroinformatik und rechnerische Neurowissenschaften) werden wir neuroinspirierte crossmodale KI-basierte Sprachsignalverarbeitungsalgorithmen entwickeln, um das Cocktailparty-Phänomen zu adressieren.
CHAIS TeamTeam
Prof. Dr. Frank Steinicke
Project Coordination Projektkoordination
Prof. Dr. Timo Gerkmann
Principal Investigator Principal Investigator
Prof. Dr. Stefano Panzeri
Principal Investigator Principal Investigator
Prof. Dr. Claus Christian Hilgetag
Principal Investigator Principal Investigator