首页
人工智能
前端开发
后端开发
数据库
服务器
网站运维
资讯
约束解码
AI智能体安全对齐架构设计:从奖励模型到约束解码的防御链路
AI智能体安全对齐问题的现实紧迫性 大语言模型从单轮问答走向多步智能体(Agent)执行后,安全边界发生了质变。传统对齐手段如RLHF、DPO针对的是模型输出层面的价值对齐,而智能…
人工智能
7小时前