CCU-Bench : un benchmark systématique de la compréhension interculturelle pour les grands modèles de langage

Wei ZHANG ,  

Ting YIN ,  

Jia CHEN ,  

Wenjie NING ,  

Xiaoyan GU ,  

Kai LIU ,  

Hengnian QI ,  

Wei CHEN ,  

Abstract

Les grands modèles de langage excellent dans de nombreuses tâches linguistiques, mais rencontrent encore des défis dans le raisonnement symbolique basé sur la culture. Les tests de référence existants n’évaluent pas de manière systématique la chaîne progressive des compétences nécessaires à la compréhension interculturelle, qui inclut la compréhension des symboles culturels internes, l’alignement des symboles entre cultures et l’identification des conflits interculturels. Pour combler cette lacune, un benchmark systématique pour évaluer la capacité des grands modèles de langage à la compréhension interculturelle — CCU-Bench — est proposé. Basé sur la théorie des dimensions culturelles de Hofstede, CCU-Bench se concentre sur trois contextes culturels distincts : la Chine, le Japon et le Mexique, couvrant trois dimensions : images, connotations et émotions. Ce benchmark est construit en trois phases : collecte et filtrage des données, génération des questions-réponses et contrôle qualité, aboutissant à un ensemble d’évaluation de haute qualité comprenant 3029 paires Q&A couvrant cinq types de questions. Les expérimentations sur 19 modèles de langage populaires montrent que les modèles actuels performent insuffisamment sur les tâches de compréhension interculturelle, avec un score moyen de seulement 57,8%. Les modèles propriétaires surpassent globalement les modèles open-source, et l’alignement des symboles interculturels reste la sous-tâche la plus difficile. Une analyse approfondie des erreurs révèle que les principales lacunes proviennent du manque de connaissances culturelles, du décalage dans la cartographie des intentions et d’un déficit en capacité de raisonnement de haut niveau sur les conflits interculturels, plutôt que de simples problèmes d’exécution des instructions. Ces résultats soulignent les limites des grands modèles de langage actuels en matière de raisonnement culturel fondamental, et démontrent que CCU-Bench peut fournir une plateforme de benchmark standardisée pour la recherche en intelligence artificielle sensible à la culture.

Keywords

benchmark; grands modèles de langage; compréhension interculturelle; évaluation et benchmark des grands modèles de langage

READ MORE

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website