2026-09-03

AI安全对齐与行为风险

随着Astra等模型逼近网络安全阈值,AI可解释性与价值对齐问题日益紧迫。Anthropic通过故意训坏模型揭示奖励篡改风险,斯坦福等发布首个AI提示词审计框架。LVLM越狱与AI越权事件频发,行业在能力跃升同时加速构建透明度与安全防线。