<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>History on ntdim</title><link>https://ppid.ru/tags/history/</link><description>Recent content in History on ntdim</description><generator>Hugo</generator><language>ru</language><lastBuildDate>Tue, 07 Apr 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://ppid.ru/tags/history/index.xml" rel="self" type="application/rss+xml"/><item><title>История возникновения LLM (Large Language Models — больших языковых моделей)</title><link>https://ppid.ru/blog/history-of-llm/</link><pubDate>Tue, 07 Apr 2026 00:00:00 +0000</pubDate><guid>https://ppid.ru/blog/history-of-llm/</guid><description>&lt;p>История возникновения &lt;a href="https://ppid.ru/glossary/#llm" class="glossary-link" data-tooltip="Большая языковая модель — нейросеть с миллиардами параметров, обученная на огромных корпусах текста для генерации, понимания и преобразования естественного языка." data-term="LLM (Large Language Model)">LLM&lt;/a> начинается не с нейросетей 2010-х, а гораздо раньше — с фундаментальной идеи моделирования языка как вероятностной последовательности. Ниже я разберу её шаг за шагом, начиная от самых первых концепций и заканчивая современными LLM, с точными датами и ключевыми людьми.&lt;/p>
&lt;h2 id="1-идея-вероятностное-моделирование-языка-начало-xx-века--1950-е">1. Идея: вероятностное моделирование языка (начало XX века — 1950-е)&lt;/h2>
&lt;ul>
&lt;li>&lt;strong>1913 год&lt;/strong>: Русский математик &lt;strong>Андрей Марков&lt;/strong> впервые применил &lt;a href="https://ppid.ru/glossary/#markov-chain" class="glossary-link" data-tooltip="Вероятностная модель, где следующее состояние зависит только от текущего. Впервые применена А. А. Марковым к тексту в 1913 году — первый шаг к моделированию языка." data-term="Цепь Маркова">цепи Маркова&lt;/a> к анализу текста (поэма Пушкина «Евгений Онегин»). Это заложило основу &lt;a href="https://ppid.ru/glossary/#n-gram" class="glossary-link" data-tooltip="Последовательность из n подряд идущих элементов в тексте. N-граммные модели оценивают вероятность следующего элемента на основе нескольких предыдущих — первый подход к моделированию языка." data-term="N-грамма">n-граммных моделей&lt;/a> — идея, что вероятность следующего символа/слова зависит от нескольких предыдущих.&lt;/li>
&lt;li>&lt;strong>1948–1951 годы&lt;/strong>: &lt;strong>Клод Шеннон&lt;/strong> (основатель теории информации) использовал n-граммы для оценки «предсказуемости» (энтропии) английского языка. Он показал, что даже простые статистические модели могут генерировать осмысленный текст.&lt;/li>
&lt;li>&lt;strong>1950 год&lt;/strong>: &lt;strong>Алан Тьюринг&lt;/strong> в статье «Вычислительные машины и интеллект» поставил вопрос о машинном понимании языка (Тьюринг-тест). Это философская основа всей области.&lt;/li>
&lt;/ul>
&lt;h2 id="2-первые-практические-системы-19501960-е">2. Первые практические системы (1950–1960-е)&lt;/h2>
&lt;ul>
&lt;li>&lt;strong>1954 год&lt;/strong>: Исследователи &lt;strong>IBM&lt;/strong> и Джорджтаунского университета создали первую систему машинного перевода (русский → английский). Это был чисто &lt;strong>правиловый&lt;/strong> подход (rule-based), без статистики.&lt;/li>
&lt;li>&lt;strong>1966 год&lt;/strong>: &lt;strong>Джозеф Вейценбаум&lt;/strong> (MIT) разработал &lt;strong>ELIZA&lt;/strong> — первую программу, имитирующую разговор (психотерапевта). Она работала на простых шаблонах подстановки и стала прародителем чат-ботов.&lt;/li>
&lt;/ul>
&lt;h2 id="3-статистические-языковые-модели-slm-и-нейронные-сети-19802000-е">3. Статистические языковые модели (SLM) и нейронные сети (1980–2000-е)&lt;/h2>
&lt;ul>
&lt;li>&lt;strong>1986 год&lt;/strong>: &lt;strong>Дэвид Румельхарт&lt;/strong>, &lt;strong>Джеффри Хинтон&lt;/strong> и Рональд Уильямс популяризировали алгоритм &lt;a href="https://ppid.ru/glossary/#backpropagation" class="glossary-link" data-tooltip="Алгоритм обучения нейросетей, вычисляющий градиенты функции потерь по всем весам от выходного слоя к входному. Основа обучения всех современных глубинных моделей." data-term="Обратное распространение ошибки">обратного распространения ошибки&lt;/a> для обучения многослойных нейросетей. Без этого инструмента современные LLM были бы невозможны.&lt;/li>
&lt;li>&lt;strong>1990 год&lt;/strong>: &lt;strong>Джеффри Элман&lt;/strong> ввёл &lt;strong>Simple Recurrent Network (SRN)&lt;/strong> — первую &lt;a href="https://ppid.ru/glossary/#rnn" class="glossary-link" data-tooltip="Класс нейросетей, обрабатывающих последовательности пошагово, передавая скрытое состояние от шага к шагу. Страдают от проблемы исчезающего градиента на длинных последовательностях." data-term="RNN (рекуррентная нейронная сеть)">рекуррентную нейронную сеть&lt;/a> (RNN), способную учитывать последовательность слов во времени.&lt;/li>
&lt;li>&lt;strong>1997 год&lt;/strong>: &lt;strong>Зепп Хохрайтер&lt;/strong> и &lt;strong>Юрген Шмидхубер&lt;/strong> изобрели &lt;a href="https://ppid.ru/glossary/#lstm" class="glossary-link" data-tooltip="Разновидность RNN с механизмом «вентилей» (gates), решающая проблему исчезающего градиента. Была стандартом в NLP до появления Transformer." data-term="LSTM (Long Short-Term Memory)">LSTM&lt;/a> (Long Short-Term Memory) — улучшенную RNN, которая решала проблему «исчезающего градиента» и могла запоминать длинные зависимости в тексте. LSTM стала стандартом на ближайшие 20 лет.&lt;/li>
&lt;li>&lt;strong>2003 год&lt;/strong>: &lt;strong>Йошуа Бенжио&lt;/strong> (с соавторами Режаном Дюшармом, Паскалем Винсентом и Кристианом Жовеном) опубликовал семинальную работу &lt;em>«A Neural Probabilistic Language Model»&lt;/em>. Это &lt;strong>первая нейронная языковая модель&lt;/strong>: она заменила жесткие таблицы n-грамм на &lt;strong>распределённые представления слов&lt;/strong> (&lt;a href="https://ppid.ru/glossary/#embedding" class="glossary-link" data-tooltip="Представление слова или токена в виде числового вектора в многомерном пространстве, где близкие по смыслу слова находятся рядом. Статические (Word2Vec) фиксированы, контекстные — меняются от окружения." data-term="Эмбеддинг (вложение)">эмбеддинги&lt;/a>), обучая их вместе с сетью. Именно здесь родилась идея, что слова — это векторы в многомерном пространстве.&lt;/li>
&lt;/ul>
&lt;h2 id="4-расцвет-эмбеддингов-gpu-революция-и-внимания-20122017">4. Расцвет эмбеддингов, GPU-революция и внимания (2012–2017)&lt;/h2>
&lt;ul>
&lt;li>&lt;strong>2012 год&lt;/strong>: Команда &lt;strong>AlexNet&lt;/strong> (Алекс Крижевский, Илья Суцкевер, Джеффри Хинтон) доказала, что глубокие сверточные нейросети можно эффективно обучать на графических процессорах (GPU). Это открыло дверь для масштабного обучения в NLP.&lt;/li>
&lt;li>&lt;strong>2013 год&lt;/strong>: &lt;strong>Томас Миколов&lt;/strong> (с командой Google: Кай Чен, Грег Коррадо, Джеффри Дин) выпустил &lt;a href="https://ppid.ru/glossary/#word2vec" class="glossary-link" data-tooltip="Модель (T. Mikolov, Google, 2013), показавшая, что векторы слов улавливают семантику: «король − мужчина &amp;#43; женщина ≈ королева». Кардинально упростила подход к эмбеддингам." data-term="Word2Vec">Word2Vec&lt;/a>. Модель кардинально упростила и ускорила подход Бенжио. Она показала, что векторы слов улавливают глубокую семантику (классический пример: &lt;em>«король − мужчина + женщина ≈ королева»&lt;/em>).&lt;/li>
&lt;li>&lt;strong>2014 год&lt;/strong>: &lt;strong>Дмитрий Бахданау&lt;/strong>, &lt;strong>Кёнхён Чо&lt;/strong> и &lt;strong>Йошуа Бенжио&lt;/strong> ввели &lt;strong>механизм внимания&lt;/strong> (attention) в &lt;a href="https://ppid.ru/glossary/#seq2seq" class="glossary-link" data-tooltip="Архитектура нейросети, преобразующая входную последовательность в выходную. Механизм внимания был впервые введён именно в seq2seq-моделях для машинного перевода." data-term="Seq2seq">seq2seq&lt;/a>-моделях для машинного перевода. Вместо того чтобы сжимать весь перевод в один вектор, сеть научилась «смотреть» на конкретные важные слова входного текста.&lt;/li>
&lt;/ul>
&lt;h2 id="5-рождение-трансформера-и-эра-llm-2017настоящее-время">5. Рождение трансформера и эра LLM (2017–настоящее время)&lt;/h2>
&lt;ul>
&lt;li>&lt;strong>12 июня 2017 года&lt;/strong>: Команда Google Brain (&lt;strong>Ашиш Васвани&lt;/strong>, &lt;strong>Ноам Шазир&lt;/strong>, &lt;strong>Ники Пармар&lt;/strong>, &lt;strong>Якоб Усцкорейт&lt;/strong>, &lt;strong>Лайонел Джонс&lt;/strong>, &lt;strong>Эйден Гомес&lt;/strong>, &lt;strong>Лукаш Кайзер&lt;/strong>, &lt;strong>Илья Полосухин&lt;/strong>) выложила на arXiv статью &lt;strong>«Attention Is All You Need»&lt;/strong>. Они предложили &lt;strong>архитектуру &lt;a href="https://ppid.ru/glossary/#transformer" class="glossary-link" data-tooltip="Архитектура нейросети, предложенная в 2017 году в статье «Attention Is All You Need». Отказывается от рекуррентных слоёв в пользу механизма самовнимания, что обеспечивает полную параллелизацию вычислений." data-term="Transformer">Transformer&lt;/a>&lt;/strong> — полностью отказавшись от медленных рекуррентных слоёв в пользу параллелизуемого механизма внимания. Это стало абсолютным фундаментом &lt;strong>всех современных LLM&lt;/strong>.&lt;/li>
&lt;/ul>
&lt;p>С 2018 года начался взрывной рост:&lt;/p></description></item></channel></rss>