RLHF
RLHF (Reinforcement Learning from Human Feedback) — это метод обучения моделей ИИ с использованием обратной связи от людей.
Что это такое
В RLHF люди оценивают ответы модели, и эти оценки используются как сигнал награды. Модель обучается выбирать более полезные, точные и безопасные ответы.
Особенности
- использует человеческую обратную связь
- улучшает качество ответов
- комбинирует обучение с подкреплением и разметку данных
- применяется в языковых моделях
Связанные термины
Reinforcement Learning
GPT