首页
人工智能
前端开发
后端开发
数据库
服务器
网站运维
资讯
DPO算法
大模型对齐技术实战:DPO直接偏好优化算法原理与训练配置
大模型对齐(Alignment)是确保语言模型输出符合人类偏好的关键环节。RLHF(Reinforcement Learning from Human Feedback)曾是对齐主…
人工智能
14小时前