CCU-Bench: систематический бенчмарк межкультурного понимания больших языковых моделей

Wei ZHANG ,  

Ting YIN ,  

Jia CHEN ,  

Wenjie NING ,  

Xiaoyan GU ,  

Kai LIU ,  

Hengnian QI ,  

Wei CHEN ,  

Abstract

Крупные языковые модели демонстрируют отличные результаты во многих языковых задачах, но по-прежнему сталкиваются с трудностями в культурно обусловленном символическом рассуждении. Существующие бенчмарки не систематически оценивают цепочку прогрессивных способностей, необходимых для межкультурного понимания, которая включает внутреннее понимание культурных символов, межкультурное согласование символов и распознавание межкультурных конфликтов. Для преодоления этого пробела предложен систематический бенчмарк для оценки способности крупных языковых моделей к межкультурному пониманию — CCU-Bench. Основываясь на теории культурных измерений Хофстеда, CCU-Bench фокусируется на трёх разнообразных культурных контекстах — Китае, Японии и Мексике — и охватывает три измерения: изображения, смысл и эмоции. Бенчмарк создавался в три этапа: сбор и фильтрация данных, генерация вопросов и ответов, контроль качества, в результате чего получен высококачественный набор для оценки, включающий 3029 пар вопросов и ответов и 5 типов заданий. Эксперименты на 19 популярных крупных языковых моделях показали, что существующие модели демонстрируют неудовлетворительные результаты в задачах межкультурного понимания со средней оценкой всего 57,8%. Закрытые модели в целом превосходят открытые, а межкультурное согласование символов остаётся самой сложной подзадачей. Дополнительный анализ ошибок выявил, что основными причинами неудач являются недостаток культурных знаний, смещение сопоставления намерений и недостаточная способность к высокоуровневому рассуждению о межкультурных конфликтах, а не простое следование инструкциям. Эти выводы подчёркивают ограничения современных крупных языковых моделей в области культурно обоснованного рассуждения и доказывают, что CCU-Bench может служить стандартизированной платформой для исследований культурно осведомлённого искусственного интеллекта.

Keywords

бенчмарк;крупные языковые модели;межкультурное понимание;оценка и бенчмарк больших языковых моделей

READ MORE

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website