Agents
$ ls -la ./tags
Как ИИ научился играть: обучение с подкреплением от Q-learning до AlphaGo
→
AlphaGo победил чемпиона мира по Go, ChatGPT научился следовать инструкциям — обе эти истории про обучение с подкреплением. Разбираем RL: как агент учится через пробы, ошибки и награды, от таблицы Q до Deep Q-Network, PPO и поиска по дереву Монте-Карло.
Как LLM выбирает инструменты: от function calling к Model Context Protocol
→
Как языковая модель «понимает», что у неё есть инструменты, и выбирает нужный? Разбираем function calling, механизм выбора и зачем нужен Model Context Protocol (MCP).