Задать вопрос
BitNeBolt
@BitNeBolt

Существует ли подобные методы обучения с подкреплением?

Возможно, вопрос будет звучать глупо или странно.

Для вознаграждения создать функцию, которая будет поощрять или наказывать агента. Можно ли обучать агента методом, в целом схожим с градиентным спуском, но "двигаться" в направлении роста функции награды и изменять веса в целом также, как и при спуске?
  • Вопрос задан
  • 31 просмотр
Подписаться 1 Простой Комментировать
Помогут разобраться в теме Все курсы
  • Нетология
    ИИ в медицине: как использовать в работе каждый день
    8 недель
    Далее
  • Академия Эдюсон
    Нейросети в строительстве
    2 месяца
    Далее
  • Бруноям
    ИИ-агенты и n8n
    2 месяца
    Далее
Решения вопроса 1
@dmshar
Градиентный спуск от "градиентного подъема" отличается только знаком целевой функции. Все это - методы численного поиска экстремума функций, которые не отличаются при поиске минимума и максимума.
Ответ написан
Пригласить эксперта
Ваш ответ на вопрос

Войдите, чтобы написать ответ

Похожие вопросы