Clustering multimodal contrastif multi-étapes avec conservation de la cohérence

Yanzheng WANG ,  

Yujun WANG ,  

Fengshuo DAI ,  

Xin YANG ,  

Xiaoheng JIANG ,  

Pei LV ,  

Shizhe HU ,  

Mingliang XU ,  

Abstract

L'apprentissage contrastif a reçu une attention importante car il peut renforcer efficacement l'alignement intermodal et la complémentarité de l'information dans le clustering multimodal. Cependant, il y a deux problèmes majeurs avec les méthodes existantes de clustering multimodal contrastif : (1) Les méthodes actuelles effectuent généralement l'apprentissage contrastif à un ou deux stades seulement et disposent de stratégies de sélection imprécises pour les paires d'échantillons négatifs. (2) La plupart des méthodes se concentrent uniquement sur l'apprentissage contrastif et négligent la conservation des informations de cohérence. Pour relever ces défis, nous proposons un cadre de clustering multimodal contrastif multi-étapes avec conservation de la cohérence. Premièrement, nous concevons un cadre systématique d'apprentissage contrastif, qui comprend un apprentissage contrastif précoce, moyen et tardif entre caractéristiques individuelles, caractéristiques fusionnées et clusters respectivement, ce qui améliore l'intégrité sémantique et la fidélité de l'information de la représentation fusionnée. Deuxièmement, nous proposons une nouvelle stratégie de sélection des paires d'échantillons négatifs pour sélectionner discriminativement la bonne paire négative pour chaque échantillon. Enfin, nous ajoutons un nouveau terme de perte à l'apprentissage contrastif tardif, qui considère pour la première fois la cohérence des résultats de clustering du même échantillon sous différentes modalités. Par conséquent, par rapport au modèle de base, ce module a amélioré la précision en moyenne de 7,4 points de pourcentage (PP). De plus, nous concevons un module de conservation de la cohérence pour assurer que le modèle puisse apprendre l'information de chaque modalité sans être perturbé par des modalités de haute/basse qualité, ce qui améliore la précision en moyenne de 2,2 PP. Des expériences réalisées sur plusieurs ensembles de données multimodales démontrent que la précision de notre méthode est en moyenne de 4,1 PP supérieure à la deuxième meilleure méthode de clustering multimodal, prouvant l'excellent potentiel de notre méthode.

Keywords

Clustering multimodal;Apprentissage contrastif;Conservation de la cohérence;Sélection des échantillons négatifs

READ MORE

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website