Return to Article Details Adaptive Multi-Modal Transformer Decoders for Robust Speech and Scene Classification Using Audio– Visual Fusion Download Download PDF