# Урок 1: История — от Data Science к LLM (почему это произошло именно сейчас)

> [HTML-версия](https://learnvibecoding.ru/publiclessons/urok-1-istoriya-ot-data-science-k-llm-pochemu-eto-proizoshlo-imenno-seychas) · [Индекс для LLM](https://learnvibecoding.ru/llms.txt) · [Политика использования материалов](https://learnvibecoding.ru/politika-materialov)
> Материалы защищены. Обучение LLM без согласия запрещено. При разрешённом использовании — обязательна прямая ссылка на страницу-источник.

**Курс:** Основы ИИ обновленный

# Урок 1: История — от Data Science к LLM (почему это произошло именно сейчас)

## Контекст

Ты слышал про ChatGPT, видел что люди пишут промпты и получают ответы. Но ты не понимаешь: почему это появилось именно в 2023, а не раньше? Почему Claude, ChatGPT, Llama — это всё произошло одновременно? Это не одна фишка одной компании, а что-то серьёзное?

**Что будешь уметь:** После этого урока ты сможешь объяснить другому человеку: что произошло в 2017, что в 2020, что в 2023. Какие три вещи соединились одновременно, чтобы появились мощные LLM. Почему раньше было невозможно.

**Главное:** Это не магия. Это результат **трёх параллельных прорывов** которые просто совпали по времени.

---

## Блок 0: Когда это нужно знать — а когда можно пропустить

### Если ты просто хочешь использовать ChatGPT...
...то можешь эту историю пропустить. Открыл, написал промпт, получил ответ — работает.

### Но если ты создаёшь продукт, или внедряешь AI в бизнес, или просто хочешь разобраться в технологиях...
...то история критична. Вот почему:

| Ситуация | Почему нужна история |
|----------|-------------------|
| Выбор между моделями (Claude vs GPT-4) | Нужно понимать что улучшилось, когда, почему |
| Оценка "скоро AI будет ещё мощнее" | Нужно знать где предел, какие ограничения физические |
| Решение "нужно ли fine-tuning нашей модели" | Нужно понимать стоимость, требования данных |
| Просто интеллектуальное любопытство | История интереснее чем кажется |

**Если хотя бы одна ситуация про тебя — читай дальше.**

---

## Блок 1: Зачем это нужно

Возьми сегодня: **2026 год**. LLM везде. Школьник пишет эссе через Claude, менеджер в Яндексе генерирует отчёты, разработчик пишет код с помощью Cursor.

Но 15 лет назад этого даже близко не было.

**Вопрос:** Почему не было? 

Потому что нужны были три вещи одновременно:
1. **Правильная архитектура** — алгоритм который работает
2. **Огромные данные** — информация для обучения
3. **Мощные компьютеры** — чтобы это всё обработать

Если бы была только архитектура — не смогли бы обучить.
Если бы были только данные — не хватило бы вычислений.
Если бы был только один компьютер мощный — не работало бы масштабирование.

В 2017-2023 эти три вещи совпали. И взорвалось.

![Three components of LLM: Architecture, Data, Computing](https://nhvwqitwebmmswnjylop.supabase.co/storage/v1/object/public/Pictures%20for%20course/AI%20basics%20new%20course/16_Level_1_Awareness.png)

**Это важно знать** потому что:
- Ты перестанешь удивляться почему именно сейчас
- Ты поймёшь что это не временная фишка
- Ты сможешь оценить что будет дальше (какой потолок, что невозможно)

---

## Блок 2: Что такое Data Science и Machine Learning (старый мир)

### Начало: 1950-е — искусственный интеллект как идея

В 1950-е годы Алан Тьюринг написал статью "Computing Machinery and Intelligence" и спросил: **может ли машина думать?**

Люди были очень оптимистичны. Думали: через 20 лет будут роботы как люди.

Не вышло.

Проблема была простая: **ты можешь дать машине правила, но не можешь дать ей способность УЧИТЬСЯ.**

Пример:
```
Правило для почты: если письмо содержит слово "бесплатно" → спам
Но потом спамеры пишут "б3сплатно" или "free" → система ломается
```

Нужна была машина которая учится на примерах сама.

### 1990-е: Machine Learning рождается

Кто-то понял простую истину: **не надо писать все правила. Дай машине примеры, и пусть она сама найдёт закономерность.**

```
Дай 10000 писем (половина спам, половина нормальные) → машина находит паттерн
"Когда письма содержат X,Y,Z обычно спам"
```

Это и есть **Machine Learning (ML)** — машина обучается на данных, находит закономерности.

**Как это работает:**
```
ДАНО: 10000 писем с меткой "спам" или "нормальное"
АЛГОРИТМ: анализирует слова, стили, адреса
РЕЗУЛЬТАТ: веса, коэффициенты, формула
ПРИМЕНЕНИЕ: новое письмо → формула → ответ "спам" или "нет"
```

Вот что произошло:
- **1990-е**: Первые алгоритмы (decision trees, SVM)
- **2000-е**: Интернет взорвался, данных стало больше, алгоритмы начали работать
- **2010-е**: Данные стали огромны, но алгоритмы не хватало

### Проблема ML в 2010-е

Machine Learning работала, но плохо.

Почему? Потому что людям нужно было **вручную выбирать признаки** (features).

```
Для классификации изображения кошка/собака нужно вручную сказать:
"Смотрите на размер ушей, длину мордочки, цвет шерсти"

Потом добавляем новое изображение где:
- Кошка с необычно большими ушами
- Собака с маленькой мордочкой
Алгоритм ломается.
```

**Человек должен был быть умнее алгоритма.** Это было медленно и неэффективно.

Нужен был прорыв.

![Evolution of AI: Machine Learning, Artificial Intelligence, Deep Learning](https://nhvwqitwebmmswnjylop.supabase.co/storage/v1/object/public/Pictures%20for%20course/AI%20basics%20new%20course/03_Architecture_Intelligence.png)

---

## Блок 3: Deep Learning — нейросети заменяют людей

### Прорыв 2012: ImageNet и GPU

В 2012 году произошло нечто магическое.

На конкурсе ImageNet (классифицировать 1 миллион изображений на 1000 категорий) победила нейросеть под названием AlexNet.

И она **разгромила** все традиционные алгоритмы ML.

Почему это произошло?

Потому что нейросеть **сама выбирала признаки**, не нужно было помогать.

```
TRADITIONAL ML:
  человек → "смотрите на форму ушей" → алгоритм

DEEP LEARNING (нейросеть):
  нейросеть сама видит: "слой 1 - видит края, слой 2 - видит формы, 
  слой 3 - видит уши, слой 4 - решает кошка это или собака"
```

Как это стало возможно? **GPU (графические процессоры).**

GPU раньше использовались для видеоигр. Но они идеальны для математики которую нужно делать нейросетям — перемножение матриц.

**Скорость:**
- Нейросеть на CPU: 10 дней обучения
- Нейросеть на GPU: 1 день обучения

**Это был прорыв.** Наконец люди могут обучать большие сети.

### 2012-2017: Глубокое обучение захватывает мир

После AlexNet люди поняли силу нейросетей и начали строить их для всего:

- **Компьютерное зрение** (распознавание объектов, лиц)
- **Распознавание речи** (Siri, Google Assistant)
- **Игры** (AlphaGo победил чемпиона Go в 2016)

Но была проблема: каждую задачу нужна была **своя нейросеть**.

Нейросеть для кошек не может распознавать речь.
Нейросеть для шахмат не может переводить текст.

**Нужен был способ создать ОДНУ нейросеть которая может работать с текстом в самых разных задачах.**

Это привело к рождению LLM.

---

## Блок 4: Transformer — архитектурный прорыв (2017)

### Что произошло в 2017

В июле 2017 года вышла статья **"Attention Is All You Need"** (авторы из Google и других компаний).

Эта статья изменила всё.

Они предложили новую архитектуру для нейросетей под названием **Transformer**.

### Старая архитектура: RNN и LSTM

Раньше для работы с текстом (переводы, статьи) использовались **RNN (Recurrent Neural Networks)**.

Идея: обрабатывать текст слово за словом, как человек читает.

```
"Кот сидит на стуле"

Слово 1: "Кот" → нейросеть помнит "кот"
Слово 2: "сидит" → нейросеть помнит "кот сидит"
Слово 3: "на" → нейросеть помнит "кот сидит на"
Слово 4: "стуле" → ответ "кот сидит на стуле"
```

Проблема: **когда текст длинный, нейросеть забывает начало.**

Память как телефонная линия — сигнал ослабевает по пути.

```
"Очень длинный текст про одно..."
[100 слов позже]
"...заканчивается словом ЭТОТ"

Какой "ЭТОТ"? Нейросеть забыла о каком слове была речь в начале.
```

### Новая архитектура: Attention (внимание)

Авторы Transformer сказали: "Стоп. Зачем обрабатывать текст линейно? 

Давайте нейросеть сама решит **на какие слова обращать внимание**."

```
"Король ушёл в замок. Он скучал."

Слово "Он" — на какое слово обратить внимание?
На "скучал"? На "замок"? На "король"?

Attention механизм: "Самое важное — 'Король', потом 'замок', потом 'скучал'"
Вероятности: Король (0.8), замок (0.15), скучал (0.05)
Ответ: "Он" = король (с вероятностью 80%)
```

**Почему это круче:**
- Нейросеть может смотреть на **все слова сразу**
- Понимает какие слова связаны друг с другом
- Не теряет информацию из начала текста
- Работает параллельно (быстрее обучается)

![Under the hood: how LLM predicts text and understands context through attention mechanism](https://nhvwqitwebmmswnjylop.supabase.co/storage/v1/object/public/Pictures%20for%20course/AI%20basics%20new%20course/32_Under_Hood_LLM_Text_Context.png)

### Почему Transformer изменил всё

Transformer оказался **универсален**:
- Работает с длинными текстами (статьи, книги)
- Быстро обучается (параллелизм)
- Масштабируется (можно делать больше слоёв)

После 2017 все большие модели используют Transformer.

```
GPT, Claude, Llama, Mistral, Gemini — все используют Transformer
```

**Это был архитектурный прорыв номер 1.**

---

## Блок 5: Три прорыва которые соединились в 2020-2023

![Three breakthroughs creating modern LLM: Algorithms, Data, Computing](https://nhvwqitwebmmswnjylop.supabase.co/storage/v1/object/public/Pictures%20for%20course/AI%20basics%20new%20course/04_Three_Breakthroughs_LLM.png)

Мы разобрали первый прорыв: **Transformer (2017)**.

Но архитектуры недостаточно. Нужны были ещё две вещи.

### Прорыв 2: Взрыв данных (2010-2020)

К 2020 году интернет содержал:
- **Миллиарды статей** (Wikipedia, Medium, блоги)
- **Миллиарды строк кода** (GitHub)
- **Триллионы слов** в книгах, статьях, постах

Google, Meta, OpenAI собрали эти данные и поняли: **можно обучить модель на ВСЕ ЧЕЛОВЕЧЕСТВЕ ЗНАНИЯ.**

Процесс:
```
ДАНО: 5 триллионов слов из интернета
ЗАДАЧА: предсказывать следующее слово
"Кот сидит на ______" → слово "стуле"
"Столица Франции это ______" → слово "Париж"

После миллиардов примеров модель учится:
- Грамматика
- Факты
- Логика
- Даже немного рассуждение
```

**Как много это?**

Если бы ты читал 24/7 по 1000 слов в минуту, чтобы прочитать все эти данные нужно было бы **10 миллионов лет**.

Модель прошла через это за несколько недель. (Потому что компьютер быстрее.)

![From Data to Intelligence: how data transforms into AI predictions and text](https://nhvwqitwebmmswnjylop.supabase.co/storage/v1/object/public/Pictures%20for%20course/AI%20basics%20new%20course/02_Data_to_Intelligence.png)

**Это был прорыв номер 2: данные.**

### Прорыв 3: Вычислительные мощности (GPU, TPU, облако)

Даже с Transformer и данными есть проблема: **как обучить модель на 5 триллионах слов?**

Ответ: **не на одном компьютере, а на тысячах одновременно.**

Google создал TPU (Tensor Processing Unit) — компьютер специально для нейросетей.
NVIDIA сделал более мощные GPU.

И главное: **облачные вычисления** (AWS, Google Cloud, Azure) позволяют арендовать 10000 видеокарт на неделю.

```
Раньше: обучение большой модели = покупка компьютеров на $10 млн = медленно и дорого

Теперь: обучение большой модели = облако на неделю = быстро и "просто" дорого
```

**Это был прорыв номер 3: вычисления.**

---

## Блок 6: Когда это всё соединилось (2020-2023)

### 2018-2019: BERT и первые большие модели

После Transformer люди начали экспериментировать.

Google выпустил **BERT** — модель обученная на всех данных Google. Она была хороша, но не могла писать.

### 2020: GPT-2 and GPT-3 — первые "большие языковые модели"

OpenAI (стартап, основанный Илоном Маском) выпустила **GPT-3** в 2020.

Это была модель с **175 миллиардами параметров** (числовых весов).

Когда люди увидели что это может делать — взорвались умы:

```
"Напиши стихотворение про кота"
GPT-3: 
  Кот сидит на подоконнике,
  Смотрит в ночь со звездой,
  Тает лунный свет в глазах...
  
"Напиши код для калькулятора на Python"
GPT-3:
  def add(a, b):
      return a + b
```

Люди: "Это работает??"

Но GPT-3 была платная, доступа нет, просто API.

### 2021-2022: Конкуренция начинается

Google сказала: "Мы тоже можем!" Выпустила LaMDA, потом Gemini.
Meta сказала: "Мы тоже!" Выпустила Llama (с открытым кодом — революция!).
Microsoft вложила $10 млрд в OpenAI.
Anthropic (компания бывших сотрудников OpenAI) выпустила Claude.

Совпало всё:
- Архитектура Transformer (уже 5 лет в производстве)
- Данные интернета (собрали, очистили)
- Облачные вычисления (дешевле, чем раньше)
- Интерес инвестиций (все вкладывают деньги)

### 2023: Взрыв

ChatGPT вышел в **ноябре 2023** с простым интерфейсом: "напиши что угодно".

За **2 месяца** достигло 100 миллионов пользователей.

Для сравнения: Instagram — 2.5 года, TikTok — 9 месяцев.

Это был момент когда LLM перестали быть "интересным исследованием" и стали **инструментом для всех**.

---

## Блок 7: Почему не раньше? (Законы масштабирования)

### Интересный вопрос: а почему не в 2010? Не в 2015?

Люди пытались! Но не работало.

Почему?

**Потому что нейросеть нужна ОГРОМНАЯ.**

GPT-3 (2020) имела 175 миллиардов параметров.
GPT-4 (2023) имела 1+ триллиона параметров.
Claude 3.5 (2024) имела ещё больше.

Если сделать маленькую нейросеть (1 млн параметров) — не будет понимать.
Если сделать среднюю (1 млрд) — поймёт простое, но будет галлюцинировать.
Только если сделать ОГРОМНУЮ (100+ млрд) — начинает показывать интеллект.

Это называется **Scaling Laws** (законы масштабирования).

```
РАЗМЕР МОДЕЛИ         СПОСОБНОСТИ
100 млн параметров   → может писать короткие фразы
1 млрд               → может писать абзацы
10 млрд              → может писать статьи, простой код
100 млрд             → может писать сложный код, анализировать
1 триллион           → может рассуждать, объяснять, творить
```

**Открытие:** производительность растёт **предсказуемо** с размером модели.

Это значит: если знаешь закон, можешь спланировать что нужна модель с X параметрами для задачи Y.

### Почему раньше не было больших моделей?

**Деньги.** Обучение GPT-3 стоило **$10 млн**.
Обучение GPT-4 стоило **$100+ млн**.

В 2010 году компаниям не было смысла тратить $10 млн на эксперимент.
В 2020 году Google, OpenAI, Meta могли себе позволить.

В 2023 году это окупилось (ChatGPT зарабатывает миллионы в день).

---

## Блок 8: Карта всех прорывов (как всё связано)

```
1950-1980е: ИИ как идея
    ↓
1980-2000е: Machine Learning появляется (люди выбирают признаки)
    ↓
2012: Deep Learning победил (AlexNet) + GPU ускорили вычисления
    ↓
2017: Transformer архитектура (внимание вместо последовательности)
    ↓
2020: Данные интернета собраны, модели обучены на триллионах слов
    ↓
2020-2022: GPT-3, LaMDA, Llama, Claude — большие модели везде
    ↓
Ноябрь 2023: ChatGPT → простой интерфейс → все используют
    ↓
2026: LLM везде (твой IDE, почта, слайды, чат)
```

### Самая важная таблица: что сделало LLM возможными

| Что? | Когда? | Почему критично? | Если бы не было? |
|------|--------|------------------|------------------|
| **Transformer архитектура** | 2017 | Позволяет работать с контекстом | Модели были бы слабыми, забывали информацию |
| **Большие данные интернета** | 2010-2020 | Модель учится на триллионах примеров | Знала бы только то что в её обучающем наборе (мало) |
| **GPU и облако** | 2012-2020 | Можно обучить модель за недели, не за годы | Обучение было бы слишком дорогим и медленным |
| **Инвестиции** | 2020-2023 | Компании потратили $100+ млрд на развитие | Остался бы "интересным исследованием" в лабораториях |
| **Простой интерфейс** | 2023 | ChatGPT, Claude дают доступ всем | LLM была бы только для программистов и исследователей |

### Главное понимание

LLM появились не из ничего, не как одно открытие, а как **совпадение пяти факторов одновременно**.

Убери любой из них — и может не быть LLM даже в 2026:
- Убери Transformer → нет контекста, не масштабируется
- Убери большие данные → модель не знает ничего
- Убери GPU → обучение стоит $1 млрд, нельзя позволить себе
- Убери инвестиции → исследования остаются в лабах
- Убери простой интерфейс → использует только 1% людей

---

## 🌉 Переход: от истории к механике

✅ **Что мы знаем:**
- Как разные поколения AI появлялись (ML → DL → LLM)
- Три прорыва которые соединились (архитектура + данные + вычисления)
- Когда это произошло (2017-2023)

✅ **Что мы НЕ знаем (дальше):**
- Как работает LLM внутри? Что такое нейрон, параметр, слой?
- Как модель генерирует текст? Прямо слово за словом?
- Почему иногда модель галлюцинирует?

**В следующем уроке 2** мы откроем чёрный ящик и посмотрим что внутри.

**Почему это нужно:** Чтобы понимать не просто "это работает", но "ПОЧЕМУ это работает" и "когда это сломается".

---

## ✅ Финальный чеклист

- [ ] Понимаю что случилось в 2017 (Transformer)
- [ ] Понимаю почему нужны большие данные (триллионы слов)
- [ ] Понимаю почему нужны мощные компьютеры (GPU/облако)
- [ ] Понимаю почему не было LLM раньше (экономика, технология)
- [ ] Могу объяснить другому человеку "три прорыва"
- [ ] Знаю что ChatGPT это не одна гениальная идея, а совпадение факторов
- [ ] Понимаю что это не временная фишка, а долгосрочный тренд

[Все уроки](https://learnvibecoding.ru/publiclessons.md) · HTML: https://learnvibecoding.ru/publiclessons