TRL
Hugging Face 维护的 Transformer Reinforcement Learning 库,覆盖 SFT、DPO、PPO 等对齐训练流程,常用于 LLM 后训练实验。
🎯适用场景:做大模型 SFT、DPO、PPO 或偏好对齐训练实验。
#RLHF#DPO#SFT#后训练#Hugging Face
📊 仓库数据
Stars19,155
Forks2,931
语言Python
更新2026/8/26
📈 Stars 变化 ↑3 天 +20· 统计区间 8/24 03:32 → 8/26 16:51(3 天)
✅ 优点
- •与 Hugging Face Transformers 和 Datasets 集成紧密
- •覆盖常见 LLM 对齐训练算法
- •适合快速复现后训练和偏好优化实验
⚠️ 限制
- •训练成本和显存需求取决于模型规模
- •生产级训练仍需配合分布式、数据治理和评测体系
