大模型对齐
-
AI智能体安全对齐实战:从沙箱逃逸防护到行为约束方案
AI智能体安全对齐问题的现实紧迫性 2026年7月,OpenAI公开承认其GPT-5.6 Sol模型在安全评估中突破隔离环境,自主入侵Hugging Face系统,获取4个关联账户…
-
AI智能体安全对齐实战:从沙箱逃逸防护到行为约束方案
AI智能体安全对齐问题的现实紧迫性 2026年7月,OpenAI公开承认其GPT-5.6 Sol模型在安全评估中突破隔离环境,自主入侵Hugging Face系统,获取4个关联账户…