| 标题 |
Direct Preference Optimization: Your Language Model is Secretly a Reward Model |
| 网址 | |
| DOI |
10.48550/arxiv.2305.18290
doi
|
| 其它 |
期刊:Cornell University - arXiv 作者:Rafael Rafailov; Archit Sharma; Eric Mitchell; Stefano Ermon; Christopher D. Manning; et al 出版日期:2023-01-01 |
| 求助人 | |
| 下载 | 该求助完结已超 24 小时,文件已从服务器自动删除,无法下载。 |
PDF的下载单位、IP信息已删除
(2025-6-4)