Hugging Face Blog·· 2026-03-31
Hugging Face 发布 TRL v1.0 后训练库
TRL v1.0: Post-Training Library Built to Move with the Field
AI 导读
Hugging Face 发布 TRL v1.0,将该后训练代码库明确定位为面向生产使用的稳定库,并采用稳定核心与实验层并行的模式:核心遵循语义化版本,实验接口则不承诺稳定。该版本覆盖超过 75 种后训练方法,稳定部分包括 SFT、DPO、奖励建模、RLOO 和 GRPO 等训练器;官方称从最后一个 0.x 版本迁移改动很少。
来源:Hugging Face Blog · huggingface.co