Mehrstufiges kontrastives multimodales Clustering mit Erhaltung der Konsistenz

Yanzheng WANG ,  

Yujun WANG ,  

Fengshuo DAI ,  

Xin YANG ,  

Xiaoheng JIANG ,  

Pei LV ,  

Shizhe HU ,  

Mingliang XU ,  

Abstract

Kontrastives Lernen hat große Aufmerksamkeit erhalten, da es die intermodale Ausrichtung und Informationskomplementarität im multimodalen Clustering effektiv stärken kann. Es gibt jedoch zwei Hauptprobleme bei bestehenden kontrastiven multimodalen Clustering-Methoden: (1) Aktuelle Methoden führen kontrastives Lernen meist nur in einer oder zwei Phasen durch und haben unpräzise Auswahlstrategien für negative Probenpaare. (2) Die meisten Methoden konzentrieren sich nur auf kontrastives Lernen und ignorieren die Beibehaltung der Konsistenzinformationen. Um die oben genannten Herausforderungen zu bewältigen, schlagen wir ein mehrstufiges kontrastives multimodales Clustering-Framework mit Erhaltung der Konsistenz vor. Zunächst entwerfen wir ein systematisches kontrastives Lernframework, das früh-, mittel- und spätphasiges kontrastives Lernen zwischen einzelnen Merkmalen, fusionierten Merkmalen und Clustern umfasst, was die semantische Integrität und Informationsgenauigkeit der fusionierten Repräsentation verbessert. Zweitens schlagen wir eine neue Strategie zur Auswahl negativer Probenpaare vor, um für jede Probe diskriminierend das richtige negative Probenpaar auszuwählen. Schließlich fügen wir dem spätphasigen kontrastiven Lernen einen neuen Verlustterm hinzu, der erstmals die Konsistenz der Clustering-Ergebnisse derselben Probe unter verschiedenen Modalitäten berücksichtigt. Daher hat dieses Modul im Vergleich zum Basismodell die Genauigkeit um durchschnittlich 7,4 Prozentpunkte verbessert. Zusätzlich entwerfen wir ein Konsistenz-Beibehaltungsmodul, um sicherzustellen, dass das Modell die Informationen jeder Modalität lernen kann, ohne von hochwertigen/niedrigen Modalitäten gestört zu werden, was die Genauigkeit um durchschnittlich 2,2 Prozentpunkte verbessert. Experimente, die an mehreren multimodalen Datensätzen durchgeführt wurden, zeigen, dass die Genauigkeit unserer Methode im Durchschnitt um 4,1 Prozentpunkte höher ist als die der zweitbesten multimodalen Clustering-Methode, was das hervorragende Potenzial unserer Methode beweist.

Keywords

Multimodales Clustering;Kontrastives Lernen;Konsistenzbeibehaltung;Auswahl negativer Proben

READ MORE

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website