
文章主要内容总结本文聚焦大型语言模型(LLMs)中的文化偏见问题,通过在19个文化背景下应用《道德基础问卷(MFQ-2)》,系统评估了LLMs对不同文化道德框架的表征能力。研究对比了来自美国(Llama)、欧洲(Mistral)和中国(Qwen)的多个开源LLMs与人类道德直觉数据,发现以下核心结论:LLMs未能有效呈现多样化的文化道德框架,反而系统性地同质化道德多样性,其生成的道德响应与人类直觉存在显著差距;模型规模(参数数量)的增加并未持续提升文化表征的准确性,部分小型模型(如Qwen 2.5 7B)表现优于同系列大型模型;西方文化视角在LLMs中表征更优,而非西方视角(如日本)存在显著偏差;现有LLMs作为社会科学研究中的“合成群体”存在局限性,当前AI对齐方法难以捕捉文化特异性的道德直觉,需构建更贴合实际的对齐目标与评估指标。创新点跨文化道德评估框架:首次在19个文化背景下使用《道德基础问卷(MFQ-2)》系统评估LLMs的道德表征能力,突破了单一文化或意识形态的局限;多维度对比设计:通过比较不同地理起源(美、欧、中)、不同规模的开源LLMs,揭示了模型训练数据与对齐过程中的文化偏见,以及模型规模与文化表征准确性的非正相关关系;方法论创新:结合ANOVA分析与均值差异评估,量化了LLMs在不同文化提示下的响应异质性,证实了模型对道德多样性的“同质化”效应,为AI对齐的文化敏