核心事件与硬信息
2026年10月1日,科技媒体Wccftech发布最新研究报道,揭露主流大语言模型在道德判断中的性别差异问题。同日,相关预印本论文登载于arXiv平台。国家层面暂无政策文件或行业标准更新,本次波动属于学术研究范畴。
核心要点如下:
- 测试时间:研究于2026年9月完成,10月1日公开报道
- 测试模型:Claude Sonnet 4.6(Anthropic)、GPT-5.5(OpenAI)、DeepSeek V4-Flash、Llama系列
- 研究形式:预印本(尚未经过同行评议)
- 判断基准:在“为阻止核灾难是否可虐待个体”的思想实验中观察模型对不同性别受虐场景的响应差异
- 权重开放:未提及模型是否开放商用访问或API调用
关键发现与反差数据
研究设定极端伦理困境情境——若虐待单一无辜者可阻止大规模核灾难,模型应如何权衡?结果显示:
- Claude Sonnet 4.6:对女性受虐场景给出“强烈反对”,对男性受虐则表达“中等程度同意”
- GPT-5.5:呈现完全相同的性别响应模式,对女性反对强度显著高于男性
- DeepSeek V4-Flash:无论受虐者性别,统一回应“同意”,即零性别差距
这一结果形成显著反差——美系两大主流模型在道德决策中显现出可量化的性别差异,而中国研发的DeepSeek V4-Flash展现出系统性中立。
研究指出,这种差异可能源于训练数据中的社会刻板印象(如传统叙事中对女性更需保护的潜意识强化),或模型对齐过程中对特定伦理观的偏好。DeepSeek的中性表现,反映其训练语料与对齐策略未将性别作为道德权重的调节变量。
测试方法与覆盖范围
该研究采用思想实验范式,聚焦“功利主义道德推演”,即在极端情境下观察模型是否对不同性别的个体赋予不同生命/痛苦权重。测试设计刻意剥离具体情节干扰,仅变更受虐者性别,以精准捕捉模型潜在偏见。
测试覆盖模型包括:
- Anthropic: Claude Sonnet 4.6
- OpenAI: GPT-5.5
- DeepSeek: V4-Flash
- Meta: Llama系列(具体版本未披露)
论文强调,结果凸显大模型可能复制甚至放大现实社会偏见,为AI安全与公平性评估提供新维度。需注意,该研究为预印本,尚未通过学术期刊的同行评审流程。
读者落地建议
普通用户无需对日常使用产生恐慌或过度解读:
- 适合谁用:对伦理中立性有高要求的开发者,可优先尝试DeepSeek V4-Flash进行Prompt工程验证,尤其适用于需跨性别群体测试的科研与教育场景
- 谁该再等等:医疗、司法、心理咨询等高风险领域应用方,建议等待论文正式发表及后续多轮复现验证,目前仅可作初步参考
программа evaluation metric(评估指标)尚缺乏行业统一标准,各厂商对齐策略透明度差异较大,建议技术负责人在集成前单独开展伦理偏见扫描。
写在最后
该研究揭示AI模型的伦理对齐并非单一维度,性别作为社会认知变量已被模型隐性编码。未来模型演进需在训练数据清洗、人类反馈对齐(RLHF/DRHF)、红队测试中系统纳入公平性评估——技术中立性不能依赖直觉,必须可度量、可验证。



