Agrupamiento multimodal contrastivo de múltiples etapas con retención de consistencia

Yanzheng WANG ,  

Yujun WANG ,  

Fengshuo DAI ,  

Xin YANG ,  

Xiaoheng JIANG ,  

Pei LV ,  

Shizhe HU ,  

Mingliang XU ,  

Abstract

El aprendizaje contrastivo ha recibido una amplia atención porque puede fortalecer eficazmente la alineación intermodal y la complementariedad de la información en el agrupamiento multimodal. Sin embargo, existen dos problemas principales con los métodos actuales de agrupamiento multimodal contrastivo: (1) Los métodos actuales generalmente realizan el aprendizaje contrastivo en sólo una o dos etapas y tienen estrategias imprecisas para la selección de pares de muestras negativas. (2) La mayoría de los métodos se enfocan únicamente en el aprendizaje contrastivo e ignoran la retención de la información de consistencia. Para abordar los desafíos anteriores, proponemos un marco de agrupamiento multimodal contrastivo de múltiples etapas con retención de consistencia. Primero, diseñamos un marco sistemático de aprendizaje contrastivo, que incluye aprendizaje contrastivo temprano–medio–tardío entre características individuales, características fusionadas y clústeres, respectivamente, lo que mejora la integridad semántica y la fidelidad de la información de la representación fusionada. Segundo, proponemos una nueva estrategia de selección de pares de muestras negativas para seleccionar discriminadamente la pareja negativa correcta para cada muestra. Finalmente, añadimos un nuevo término de pérdida al aprendizaje contrastivo en la etapa tardía, que considera por primera vez la consistencia de los resultados del agrupamiento de la misma muestra bajo diferentes modalidades. Por lo tanto, en comparación con el modelo base, este módulo ha mejorado la precisión en un promedio de 7.4 puntos porcentuales (PP). Además, diseñamos un módulo de retención de consistencia para asegurar que el modelo pueda aprender la información de cada modalidad sin ser perturbado por modalidades de alta/baja calidad, lo que mejora la precisión en un promedio de 2.2 PP. Los experimentos realizados en múltiples conjuntos de datos multimodales demuestran que la precisión de nuestro método es 4.1 PP más alta en promedio en comparación con el segundo mejor método de agrupamiento multimodal, lo que prueba el excelente potencial de nuestro método.

Keywords

Agrupamiento multimodal;Aprendizaje contrastivo;Retención de consistencia;Selección de muestras negativas

READ MORE

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website