规划

PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models

2026-06-25arxiv.org

PolicyAlign提出一种基于策略直接优化的安全对齐方法,用于大型语言模型。

值得记下

首次将纯策略优化范式系统应用于LLM安全对齐,绕过传统RLHF中的奖励建模环节。

阅读原文

内容来源:arxiv.org,版权归原作者所有