CCU-Bench: Ein systematischer Benchmark für das interkulturelle Verständnis großer Sprachmodelle

Wei ZHANG ,  

Ting YIN ,  

Jia CHEN ,  

Wenjie NING ,  

Xiaoyan GU ,  

Kai LIU ,  

Hengnian QI ,  

Wei CHEN ,  

Abstract

Große Sprachmodelle erzielen in vielen Sprachaufgaben hervorragende Leistungen, stehen jedoch weiterhin vor Herausforderungen beim kulturbezogenen symbolischen Schließen. Bestehende Benchmarks bewerten die schrittweise Kette von Fähigkeiten, die für interkulturelles Verständnis erforderlich sind – einschließlich des Verständnisses kultureller Symbole, der interkulturellen Symbolausrichtung und der Erkennung interkultureller Konflikte – nicht systematisch. Um diese Lücke zu schließen, wird mit CCU-Bench ein systematischer Benchmark zur Bewertung der interkulturellen Verständnisfähigkeit großer Sprachmodelle vorgeschlagen. Basierend auf Hofstedes Kulturdimensionstheorie konzentriert sich CCU-Bench auf drei kulturell unterschiedliche Kontexte – China, Japan und Mexiko – und behandelt drei Dimensionen: Bild, Bedeutung und Emotionen. Der Benchmark wird in drei Phasen konstruiert: Datenerhebung und -filterung, Frage-Antwort-Generierung und Qualitätskontrolle, was zu einem hochwertigen Evaluationsdatensatz mit 3029 Frage-Antwort-Paaren und fünf Fragetypen führt. Experimente mit 19 gängigen großen Sprachmodellen zeigen, dass die bestehenden Modelle bei Aufgaben des interkulturellen Verständnisses mit einer durchschnittlichen Punktzahl von nur 57,8 % unbefriedigend abschneiden. Geschlossene Modelle schneiden insgesamt besser ab als Open-Source-Modelle, wobei die interkulturelle Symbolausrichtung die herausforderndste Teilaufgabe bleibt. Eine weiterführende Fehleranalyse zeigt, dass die Hauptgründe für das Scheitern mangelndes kulturelles Wissen, Verzerrungen bei der Intentionszuordnung und fehlende Fähigkeiten im hochstufigen Schlussfolgern bei interkulturellen Konflikten sind, nicht jedoch einfach Probleme bei der Befolgung von Anweisungen. Diese Erkenntnisse heben die Grenzen aktueller großer Sprachmodelle im kulturell fundierten Schließen hervor und beweisen, dass CCU-Bench eine standardisierte Benchmark-Plattform für die Forschung zu kulturell sensibler künstlicher Intelligenz bieten kann.

Keywords

Benchmark; Große Sprachmodelle; interkulturelles Verständnis; Bewertung und Benchmark großer Sprachmodelle

READ MORE

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website