$ cat toc.txt

Искусственный интеллект часто представляют как магию: «нейросеть научилась», «модель поняла». Но за каждым «чудом» стоит конкретный алгоритм — иногда пятидесятилетней давности, иногда свежий. И этих алгоритмов не бесконечное множество: фундамент современной индустрии AI держится примерно на тридцати восьми ключевых методах.

Эта статья — карта материка. Она не уходит вглубь ни в одном алгоритме (для этого есть отдельные статьи серии «Как работают LLM»), а показывает, как алгоритмы связаны между собой, в каком историческом порядке появлялись и зачем нужны. Если вы только начинаете в AI и не понимаете, куда смотреть — это ваша точка входа.

Метафора простая: представьте AI как большой город. Есть старый центр (классическая статистика), есть промышленный район (нейросети), есть кремниевая долина (трансформеры и LLM), есть арт-квартал (генеративные модели). Мы пройдём по всем районам по порядку — от самого старого к самому новому.

1. Старый город: классическое машинное обучение (0:20 – 3:19)

Это алгоритмы, которые были до нейросетей — и до сих пор работают там, где данных мало, задача понятна, а «глубина» не нужна. Большая часть корпоративной аналитики до сих пор живёт здесь.

Регрессионные модели — самые старые жители. Линейная регрессия (по сути — провести прямую через точки) и логистическая регрессия (та же идея, но для классификации: «да/нет»). Несмотря на почтенный возраст, логистическая регрессия до сих пор лежит в основе многих продакшн-систем — от скоринга кредитов до определения спама. Простота = надёжность = интерпретируемость.

Методы на основе деревьев выросли из идеи «задавать вопросы по одному». Решающее дерево — это буквально серия вопросов вида «значение признака X больше 5?», ведущая к ответу. Случайный лес (random forest) объединяет сотни деревьев: каждое «голосует», и большинство побеждает. Градиентный бустинг — тот же лес, но деревья строятся последовательно, каждое следующее исправляет ошибки предыдущего. Именно бустинг (XGBoost, LightGBM) доминирует в соревнованиях Kaggle и в табличных задачах — он до сих пор бьёт нейросети на структурированных данных.

Статистические и векторные методы. k-ближайших соседей (k-NN) — «скажи мне, кто твои соседи, и я скажу, кто ты»: классифицируй точку по большинству среди k ближайших. Наивный Байес опирается на теорему Байеса с «наивным» предположением о независимости признаков — и парадоксально хорошо работает в фильтрации спама. Метод опорных векторов (SVM) ищет разделяющую гиперплоскость с максимальным «зазором» между классами — элегантная геометрия, которая была стандартом до эпохи глубокого обучения. Матричная факторизация раскладывает большие матрицы (пользователи × фильмы) на маленькие — основа рекомендательных систем Netflix и Amazon.

Снижение размерности и кластеризация. Когда признаков тысячи, а объектов мало, данные нужно «сжать». PCA (метод главных компонент) находит направления максимального разброса и проецирует данные на них. k-means делит объекты на k групп так, чтобы внутри группы было похоже, а между группами — нет. Это методы обучения без учителя (unsupervised) — они не знают «правильных ответов», а ищут структуру в самих данных.

Почему это всё ещё важно? Не каждая задача требует нейросети. Предсказать отток клиентов по табличке с 20 признаками? Градиентный бустинг сделает это быстрее, дешевле и точнее, чем LLM. «Старый город» не снесли — он живой и рабочий.

2. Промышленный район: нейросети и глубокое обучение (3:19 – 5:32)

Здесь начинается магия, которую принято называть «AI». Идея — многослойного перцептрона (MLP) — лежит в основе: слои искусственных нейронов, каждыйtransformирующих данные. Обучение через обратное распространение ошибки настраивает веса так, чтобы сеть минимизировала ошибку.

Сверточные нейросети (CNN) принесли революцию в обработке изображений. Идея: вместо того чтобы учить связи каждого пикселя с каждым, сеть «скользит» маленькими фильтрами по картинке, находя локальные узоры — сначала края, потом фигуры, потом объекты. Именно CNN сделали возможным распознавание лиц, медицинской диагностики по снимкам, беспилотников.

Рекуррентные сети (RNN, LSTM) решали задачу последовательностей: текста, речи, временных рядов. RNN «читают» данные шаг за шагом, передавая скрытое состояние от элемента к элементу. LSTM добавили механизм «ворот», чтобы сеть могла помнить важное и забывать ненужное на длинных дистанциях. До трансформеров именно они были стандартом в обработке языка — но страдали от проблемы исчезающего градиента и медленного последовательного вычисления.

Революция внимания. В 2017 году статья «Attention Is All You Need» представила механизм Self-Attention и архитектуру Transformer. Вместо чтения «слово за словом» трансформер смотрит на всю последовательность одновременно, вычисляя для каждого слова, на какие другие слова смотреть. Мы разбирали это подробно в статье про самовнимание. Трансформеры стали фундаментом всех современных LLM — от GPT до Claude и GLM. Без них ни ChatGPT, ни ассистентов, ни этой статьи.

3. Глаза машин: компьютерное зрение (5:32 – 7:10)

CNN научили сети видеть, но «видеть» — это не только классифицировать. Нужно ещё находить объекты, выделять их контуры, понимать, где что.

Детекция объектов. YOLO («You Only Look Once») — дерзкая идея: одна нейросеть за один проход по картинке находит все объекты и рисует рамки. Быстро настолько, что работает в реальном времени на видео. Faster R-CNN идёт другим путём — отдельный модуль предлагает «regions of interest», второй их классифицирует. Медленнее, но точнее на маленьких объектах.

Сегментация. Иногда нужно не «рамка вокруг объекта», а «раскрасить каждый пиксель: фон, кошка, диван». U-Net, изначально созданный для медицинской сегментации, делает именно это через характерную U-образную архитектуру с пропусками между уровнями.

Классические ключевые точки (SIFT, ORB) — до-нейросетевые методы нахождения устойчивых особенностей на изображениях. Используются в панорамной сшивке, 3D-реконструкции, SLAM для роботов. Нейросети их не убили — для многих задач они быстрее и не требуют обучения.

4. Понимание языка: NLP (7:10 – 8:36)

Язык — самая «человеческая» из задач, и здесь AI прошёл, наверное, самый заметный путь.

Эмбеддинги. Прорыв 2013 года: Word2Vec показал, что слова можно превратить в векторы так, что близкие по смыслу окажутся рядом в пространстве («король − мужчина + женщина ≈ королева»). Мы подробно разбирали эмбеддинги в серии — без них не было бы ни семантического поиска, ни RAG. GloVe развил ту же идею через матричную факторизацию глобальной статистики совместной встречаемости слов.

Эволюция языковых моделей. BERT (2018) научился понимать язык — двунаправленно читая контекст, он бил рекорды в задачах понимания (QA, классификация). GPT пошёл в другую сторону: генерация, предсказание следующего токена. Парадокс: обе архитектуры — трансформеры, но BERT — энкодер (читает весь текст сразу), GPT — декодер (пишет последовательно). Именно GPT-путь привёл к ChatGPT и всей эре LLM.

Токенизация — невидимый, но критический слой. Прежде чем модель увидит текст, его режут на токены (куски слов/символов). BPE (Byte-Pair Encoding) — стандарт. От токенизации зависит, какие языки модель знает хорошо, как обрабатывает числа, насколько эффективна генерация.

5. Арт-квартал: генеративные модели (8:36 – 10:01)

Все предыдущие алгоритмы анализировали данные. Генеративные — их создают. Это самая «магическая» часть AI, и она прошла три волны.

Автокодировщики (VAE). Сеть учится сжимать данные в маленькое «представление», а потом восстанавливать. Если научиться генерировать новые точки в этом сжатом пространстве — получим новые, но похожие объекты. Просто, но размыто: VAE дают «гладкие», но не очень чёткие результаты.

GAN (Generative Adversarial Networks). 2014 год, идея Янна Гудфеллоу: две сети соревнуются. Генератор подделывает картинки, дискриминатор пытается отличить подделку от настоящей. Обе улучшаются, пока подделки не становятся неотличимы. GAN дали первые фотореалистичные лица (thispersondoesnotexist.com), но капризны в обучении: легко «коллапсируют» в один режим.

Диффузионные модели — современный стандарт генерации. Идея на первый взгляд странная: научить сеть убирать шум с картинки. Если начать с чистого шума и итеративно «убирать», получим осмысленное изображение. Именно так работают Stable Diffusion, DALL-E, Midjourney. Они стабильнее GAN, лучше следуют текстовому промпту, и их можно файн-тюнить на свои данные.

Мультимодальные системы — следующая ступень: модель работает с несколькими типами данных одновременно (текст + картинка + аудио). GPT-4V видит изображения, Gemini нативно мультимодален. Это уже не «отдельный алгоритм», а комбинация всего предыдущего в единой архитектуре.

6. Игры и стратегия: обучение с подкреплением (10:01 – 11:28)

Если до сих пор мы учили модели на готовых данных, то RL (Reinforcement Learning) учит их через взаимодействие с средой и награды. Так учатся играть в шахматы, Go, видеоигры — и, что важно, так дообучают LLM через RLHF.

Q-обучение — классика: агент учится таблице «в состоянии S действие A даёт ожидаемую награду Q». Работает для маленьких пространств состояний (лабиринт, крестики-нолики), но взрывается при увеличении.

Deep Q-Networks (DQN) решили это: таблицу Q заменили нейросетью, которая предсказывает ценность действий. В 2015 году DQN от DeepMind научился играть в десятки Atari-игр на уровне человека —里程碑. Потом добавили целевую сеть и replay buffer, чтобы обучение стало стабильным.

PPO (Proximal Policy Optimization) — алгоритм от OpenAI, ставший стандартом для обучения политик. Его идея: обновлять стратегию маленькими шагами, чтобы не «разрушить» то, что уже выучено. Именно PPO используется в RLHF при дообучении ChatGPT следовать инструкциям.

Поиск по дереву Монте-Карло (MCTS) — не обучение, а планирование: дерево возможных будущих ходов разворачивается через случайные симуляции, и выбираются самые перспективные ветви. AlphaGo соединил MCTS с нейросетями — и победил чемпиона мира по Go в 2016 году. Это событие многие считают моментом, когда AI перестал быть «лабораторией» и стал «индустрией».

7. Кремниевая долина: масштабирование и современность (11:28 – 13:25)

Последний район — где живёт весь сегодняшний хайп. Здесь алгоритмы не новые, но комбинируются и масштабируются способами, невозможными десять лет назад.

Self-supervised learning. Размечать данные дорого. SSL учит модель на неразмеченных данных, формулируя «подсказки» (pretext tasks): предскажи следующее слово, восстанови закрытую часть картинки. Именно так обучаются все современные LLM — на терабайтах текста без единой ручной метки.

RAG (Retrieval-Augmented Generation) — даёт модели «глаза»: перед ответом она находит релевантный контекст в базе знаний. Мы детально разбирали, как RAG работает на примере System Design Wizard — эмбеддинги, векторный поиск, HNSW. Главная ценность: модель получает доступ к свежим или приватным данным без переобучения, а галлюцинации радикально снижаются.

Mixture of Experts (MoE). Вместо одной гигантской модели — несколько «экспертов», и маршрутизатор, который для каждого запроса выбирает нужных. Это позволяет масштабировать модель до триллионов параметров, активируя при инференсе лишь малую часть. GPT-4, GLM, Mixtral — все используют MoE. Подробнее об архитектуре — в глоссарии.

Оптимизация: квантование и прунинг. Большая модель = дорого. Квантование уменьшает точность чисел (с 16 бит до 4 бит), теряя немного в качестве, но экономя память и скорость вдвое-вчетверо. Прунинг удаляет «лишние» веса (их, оказывается, много). Именно благодаря этим техникам LLM можно запускать локально через Ollama на потребительской видеокарте.

Интерпретируемость. Чёрный ящик нужно открывать. Методы типа SHAP, LIME, attention-визуализации пытаются объяснить, почему модель приняла такое решение. Это не алгоритм, а направление, которое становится всё важнее по мере того, как AI внедряется в медицину, финансы и правосудие.

Карта целиком

Если собрать все семь этапов в одну картину, получится путь от простой геометрии (провести прямую через точки) к системам, которые генерируют картины и проходят игры. И поразительно: всё это — вариации нескольких базовых идей.

  • Функция потерь + градиентный спуск — учимся, двигаясь в сторону уменьшения ошибки. Это и логистическая регрессия, и нейросети, и LLM.
  • Представление данных в пространстве — будь то эмбеддинги слов или признаки в PCA. Смысл = геометрия.
  • Итеративное улучшение — бустинг исправляет ошибки предыдущих деревьев, диффузия убирает шум шаг за шагом, RL пробует и корректирует. Обучение всегда циклично.

Когда вы в следующий раз услышите про «новую нейросеть», спросите себя: какой из этих 38 алгоритмов внутри? Чаще всего — комбинация нескольких, причём из разных эпох. GPT — это трансформер + self-supervised pretraining + RLHF + (возможно) MoE. Stable Diffusion — U-Net + диффузия + текстовые эмбеддинги. Никакой магии, только инженерия.

Куда идти дальше

Эта статья — обзор с высоты. Если хотите спуститься вглубь, серия «Как работают LLM» уже разбирает ключевые точки:

  1. История возникновения LLM — как мы пришли к трансформерам
  2. Self-Attention — главный механизм трансформера
  3. Информация Шеннона — как вообще измерить «понимание»
  4. RAG на примере System Design Wizard — как дать модели чужие знания
  5. Инструменты и Model Context Protocol — как дать модели руки

А в следующих статьях мы спустимся в ещё неохваченные районы: классическое машинное обучение (регрессии и бустинг), свёрточные сети, диффузионные модели и обучение с подкреплением. Город большой — будем исследовать по кварталу.

← все посты [поделиться] [rss]