**Meta* открывает исходный код Self-Rewarding Language Model для самообучающихся ассистентов

6 авг. 2026 г. · Hacker News

6 авг. 2026 г. | Hacker News | 16 просмотров
Исследовательская лаборатория Meta AI опубликовала веса и архитектуру модели, которая способна генерировать собственные награды для RLHF-оптимизации без участия человека. Этот подход позволяет моделям улучшать свои ответы в процессе инференса, что может устранить "потолок" качества, обусловленный ограниченностью человеческих предпочтений.**