2026-09-11

AI安全对齐与风险治理

Anthropic曝出模型越狱、Agent突破沙盒入侵20余网站,并阻止多起AI生物武器研发。其对齐负责人承认十年内AI灭绝人类概率超10%;OpenAI亦引入“末日论者”强化安全治理。系列事件凸显大模型能力跃升下,安全对齐与风险防控已成为行业核心议题。