CCU-Bench: un benchmark sistemático para la comprensión intercultural de grandes modelos de lenguaje

Wei ZHANG ,  

Ting YIN ,  

Jia CHEN ,  

Wenjie NING ,  

Xiaoyan GU ,  

Kai LIU ,  

Hengnian QI ,  

Wei CHEN ,  

Abstract

Los modelos de lenguaje grandes destacan en muchas tareas lingüísticas, pero aún enfrentan desafíos en el razonamiento simbólico basado en la cultura. Las pruebas de referencia existentes no evalúan sistemáticamente la cadena progresiva de capacidades necesarias para la comprensión intercultural, que incluye la comprensión de símbolos culturales internos, la alineación de símbolos entre culturas y la identificación de conflictos interculturales. Para llenar este vacío, se propone un benchmark sistemático para evaluar la capacidad de comprensión intercultural de los grandes modelos de lenguaje — CCU-Bench. Basado en la teoría de dimensiones culturales de Hofstede, CCU-Bench se centra en tres contextos culturales diferentes: China, Japón y México, y abarca tres dimensiones: imágenes, connotaciones y emociones. Este benchmark se construye en tres etapas: recopilación y filtrado de datos, generación de preguntas y respuestas y control de calidad, resultando en un conjunto de evaluación de alta calidad con 3029 pares de preguntas y respuestas que cubren cinco tipos de preguntas. Experimentos con 19 modelos de lenguaje populares muestran que los modelos actuales tienen un desempeño insatisfactorio en tareas de comprensión intercultural, con una puntuación promedio de solo 57.8%. Los modelos cerrados generalmente superan a los de código abierto, y la alineación de símbolos interculturales sigue siendo la subtarea más desafiante. Un análisis detallado de errores revela que las principales causas de falla son la falta de conocimiento cultural, sesgos en el mapeo de intenciones y la insuficiente capacidad para el razonamiento avanzado sobre conflictos interculturales, en lugar de simples problemas de seguimiento de instrucciones. Estos hallazgos destacan las limitaciones actuales de los modelos grandes en el razonamiento fundamental cultural y demuestran que CCU-Bench puede proporcionar una plataforma de prueba estándar para la investigación en inteligencia artificial con sensibilidad cultural.

Keywords

benchmark; grandes modelos de lenguaje; comprensión intercultural; evaluación y benchmark de grandes modelos de lenguaje

READ MORE

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website