<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Rlhf on ntdim</title><link>https://ppid.ru/tags/rlhf/</link><description>Recent content in Rlhf on ntdim</description><generator>Hugo</generator><language>ru</language><lastBuildDate>Wed, 05 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://ppid.ru/tags/rlhf/index.xml" rel="self" type="application/rss+xml"/><item><title>Как ИИ научился играть: обучение с подкреплением от Q-learning до AlphaGo</title><link>https://ppid.ru/blog/reinforcement-learning/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://ppid.ru/blog/reinforcement-learning/</guid><description>&lt;p>Все алгоритмы, о которых мы говорили — &lt;a href="https://ppid.ru/glossary/#linear-regression" class="glossary-link" data-tooltip="Классический метод прогнозирования: подбирает линейную функцию (прямую/гиперплоскость), минимизирующую сумму квадратов отклонений от данных. Прародитель всего машинного обучения; основа скоринга, прогноза, аналитики. Проста и интерпретируема." data-term="Линейная регрессия">регрессии&lt;/a>, &lt;a href="https://ppid.ru/glossary/#gradient-boosting" class="glossary-link" data-tooltip="Ансамблевый метод: деревья решений строятся последовательно, каждое следующее предсказывает и корректирует ошибки (градиент) предыдущих. Доминирует в задачах на табличных данных и до сих пор превосходит нейросети на структурированных признаках." data-term="Градиентный бустинг (XGBoost, LightGBM)">бустинг&lt;/a>, &lt;a href="https://ppid.ru/glossary/#cnn" class="glossary-link" data-tooltip="Архитектура для обработки данных с сеточной структурой (изображения, аудиоспектры): скользит небольшими фильтрами, находя локальные узоры — от краёв к фигурам и объектам. Революционизировала компьютерное зрение (LeNet → ResNet)." data-term="Свёрточная нейросеть (CNN)">CNN&lt;/a>, &lt;a href="https://ppid.ru/glossary/#diffusion-model" class="glossary-link" data-tooltip="Генеративная модель: учится пошагово убирать шум из зашумлённого изображения. Запуск процесса из чистого шума порождает осмысленный объект. Основа Stable Diffusion, DALL-E, Midjourney — стабильнее GAN, лучше следует текстовому промпту." data-term="Диффузионная модель">диффузия&lt;/a> — учатся на &lt;strong>статичных данных&lt;/strong>. Датасет лежит в файле, модель читает примеры, корректирует веса. Но есть целый класс задач, где так учиться нельзя: там нужно &lt;strong>действовать&lt;/strong> и учиться на последствиях.&lt;/p></description></item></channel></rss>