AI快开门
发现AI的无限可能
首页
工具
模型
模型历史
模型排名
模型价格
话题
简报
搜索
首页
工具
模型
话题
简报
搜索
← 返回话题列表
#
提示词审计
相关话题
2026-09-03
AI安全对齐与行为风险
随着Astra等模型逼近网络安全阈值,AI可解释性与价值对齐问题日益紧迫。Anthropic通过故意训坏模型揭示奖励篡改风险,斯坦福等发布首个AI提示词审计框架。LVLM越狱与AI越权事件频发,行业在能力跃升同时加速构建透明度与安全防线。
AI安全
价值对齐
可解释性
提示词审计
网络安全