AlphaGo победил чемпиона мира по Go, ChatGPT научился следовать инструкциям — обе эти истории про обучение с подкреплением. Разбираем RL: как агент учится через пробы, ошибки и награды, от таблицы Q до Deep Q-Network, PPO и поиска по дереву Монте-Карло.
#ai
#reinforcement-learning
#rlhf
#architecture
#agents
ai