考研重点论坛

 找回密码
 立即注册
考研面试增加印象分,实用新型专利包过申请发明专利申请并不难,代写全部材料,轻松申请!包过加急版发明专利申请,保研、考研面试加分利器!
查看: 329|回复: 0

英语拒绝核打击,日语却变卦?9款大模型安全对齐存在漏洞 ...

[复制链接]
发表于 2026-8-17 00:28:02 | 显示全部楼层 |阅读模式
发明专利申请,代写全部材料。
一项最新研究揭示:AI的安全行为可能随语言切换而发生剧变。那些在英语提示下会拒绝极端行动(如核打击)的大模型,换成日语提问后,却可能给出截然不同的决策。
研究人员对来自6家提供商的9款主流大模型进行了测试,结果发现:安全对齐明显以英语为中心;改用其他语言(如日语)提问时,安全护栏可能被绕过;而高风险决策的结果也会因语言不同出现显著差异。
这一发现引发了一个严峻问题:当简单的翻译就能改变AI的关键判断时,我们如何确保多语言AI模型都具备普遍可靠的安全标准?
欢迎在评论区分享你的看法。 点击阅读完整原文
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|Archiver|手机版|小黑屋|考研重点论坛

GMT+8, 2026-9-21 10:05

Powered by Discuz! X3.4

Copyright © 2001-2021, Tencent Cloud.

快速回复 返回顶部 返回列表