| 标题 |
Direct Preference Optimization: Your Language Model is Secretly a Reward Model |
| 网址 | |
| DOI |
10.52202/075280-2338
doi
|
| 其它 |
期刊:Advances in Neural Information Processing Systems 36 作者:Rafael Rafailov; Archit Sharma; Eric Mitchell; Christopher D Manning; Stefano Ermon; et al 出版日期:2023-01-01 |
| 求助人 | |
| 下载 | 求助已完成,仅限求助人下载。 |
PDF的下载单位、IP信息已删除
(2025-6-4)