Naukowcy z ArXiv zaproponowali MIDAS (Mutual Information Disentanglement with uncertainty-Aware fuSion), nową metodę do analizy sentymentu w warunkach niekompletnych danych multimodalnych. Istniejące podejścia zakładają dostęp do kompletnych danych ze wszystkich modalności - tekstu, obrazu i dźwięku jednocześnie - co rzadko zdarza się w rzeczywistych aplikacjach.
Framework MIDAS reprezentuje każdą modalność jako wielowymiarowe rozkłady Gaussa w przestrzeni zmiennych ukrytych, a następnie rozkłada je na czynniki wspólne dla wszystkich modalności oraz ekskluzywne dla każdej z nich. Kluczową innowacją jest minimax objective, który jednocześnie minimalizuje informację wzajemną między przestrzeniami wspólną i odrębną - zapewniając czystą separację - oraz maksymalizuje informację wzajemną między współdzielonymi przestrzeniami różnych modalności, aby wzmocnić wyrównanie semantyczne.
Metoda wprowadza też mechanizm uncertainty-aware fusion, gdzie wariancja rozkładu posterior służy jako wskaźnik niezawodności. Ta adaptacyjna waga przypisywana cechom ukrytym podczas fuzji gwarantuje robust integrację nawet gdy niektóre modalności są niekompletne lub całkowicie niedostępne. Podejście zostało przetestowane na trzech szeroko stosowanych zbiorach danych i pokazuje potencjał do praktycznych zastosowań w rzeczywistości.