audio visual ASR

Modality attention for end-to-end audio-visual speech recognition

Read more about Modality attention for end-to-end audio-visual speech recognition
Log in to post comments

Audio-visual speech recognition (AVSR) system is thought to be one of the most promising solutions for robust speech recognition, especially in noisy environment. In this paper, we propose a novel multimodal attention based method for audio-visual speech recognition which could automatically learn the fused representation from both modalities based on their importance. Our method is realized using state-of-the-art sequence-to-sequence (Seq2seq) architectures.

modalityAttention_icassp19-poster.pdf

modalityAttention_icassp19-poster.pdf (394)

Categories:: Audio and Acoustic Signal Processing

28 Views