Исследовательская лаборатория Meta AI опубликовала веса и архитектуру модели, которая способна генерировать собственные награды для RLHF-оптимизации без участия человека. Этот подход позволяет моделям улучшать свои ответы в процессе инференса, что может устранить "потолок" качества, обусловленный ограниченностью человеческих предпочтений.**
**Meta* открывает исходный код Self-Rewarding Language Model для самообучающихся ассистентов
6 авг. 2026 г. · Hacker News