CCU-Bench: معيار منهجي لفهم اللغات عبر الثقافات للنماذج اللغوية الكبيرة

Wei ZHANG ,  

Ting YIN ,  

Jia CHEN ,  

Wenjie NING ,  

Xiaoyan GU ,  

Kai LIU ,  

Hengnian QI ,  

Wei CHEN ,  

Abstract

تُظهر النماذج اللغوية الكبيرة أداءً متميزًا في العديد من مهام اللغة، لكنها لا تزال تواجه تحديات في الاستدلال الرمزي القائم على الثقافة. لا تقوم المعايير الحالية بتقييم سلسلة القدرات التدريجية اللازمة للفهم عبر الثقافات بشكل منهجي، والتي تشمل فهم الرموز الداخلية للثقافة، ومحاذاة الرموز عبر الثقافات، والتعرف على الصراعات بين الثقافات. لسد هذه الفجوة، يُقترح معيار منهجي لتقييم قدرة النماذج اللغوية الكبيرة على الفهم عبر الثقافات - CCU-Bench. استنادًا إلى نظرية أبعاد الثقافة لهوفستيد، يركز CCU-Bench على ثلاث سياقات ثقافية مختلفة وهي الصين واليابان والمكسيك، ويغطي ثلاثة أبعاد هي الصور، الدلالات، والمشاعر. يتم بناء هذا المعيار من خلال ثلاث مراحل: جمع البيانات والفلترة، توليد الأسئلة والأجوبة، وضبط الجودة، وينتج عنه مجموعة تقييم عالية الجودة تحتوي على 3029 زوج سؤال-جواب تشمل 5 أنواع من الأسئلة. أظهرت التجارب على 19 نموذجًا لغويًا كبيرًا شائعًا أن النماذج الحالية لا تؤدي جيدًا في مهام الفهم عبر الثقافات، بمتوسط درجة 57.8%. تظهر النماذج المغلقة أداءً أفضل بشكل عام مقارنة بالنماذج المفتوحة المصدر، ولا تزال محاذاة الرموز عبر الثقافات هي المهمة الفرعية الأكثر تحديًا. كشف تحليل الأخطاء الإضافي أن الفشل الرئيسي يرجع إلى نقص المعرفة الثقافية، انحراف تخطيط النوايا، ونقص القدرة على الاستدلال المعقد حول الصراعات الثقافية، وليس مجرد مشاكل في اتباع التعليمات. تبرز هذه النتائج محدودية النماذج اللغوية الكبيرة الحالية في الاستدلال الجذري الثقافي، وتثبت أن CCU-Bench يمكن أن يوفر منصة معيارية لاختبار الذكاء الاصطناعي الواعي ثقافيًا.

Keywords

معيار;النماذج اللغوية الكبيرة;الفهم عبر الثقافات;تقييم النماذج اللغوية الكبيرة والمعيار

READ MORE

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website