过去式攻击 - AI话题

2024-07-20

上交GAIR发现多轮自我微调反致Llama、Mistral性能下滑；同时“过去式”提示可轻松突破GPT-4o等六大模型安全限制，攻击成功率飙至88%。自提升与对齐策略暴露脆弱性，为行业敲响警钟，安全与鲁棒性研究将成发布前必过关卡。

AI快开门