# Урок 4: Контекст и память — граница возможностей LLM

> [HTML-версия](https://learnvibecoding.ru/publiclessons/urok-4-kontekst-i-pamyat-granitsa-vozmozhnostey-llm) · [Индекс для LLM](https://learnvibecoding.ru/llms.txt) · [Политика использования материалов](https://learnvibecoding.ru/politika-materialov)
> Материалы защищены. Обучение LLM без согласия запрещено. При разрешённом использовании — обязательна прямая ссылка на страницу-источник.

**Курс:** Основы ИИ обновленный

# Урок 4: Контекст и память — граница возможностей LLM

## Контекст

Ты знаешь про токены (урок 3). Теперь встреча следующая граница: **контекстное окно**. Ты видел что Claude может 200k токенов, GPT-4 может 128k, и не понимаешь: почему это число? Что произойдёт если превышу? Это может быть больше?

**Что будешь уметь:**
- Понимать что такое контекстное окно (рабочая память модели)
- Знать сколько контекста у разных моделей
- Рассчитать может ли модель обработать твой текст
- Понимать что происходит когда контекст переполняется (забывает начало)
- Выбирать между большим контекстом и скоростью
- Знать когда нужен RAG (retrieval-augmented generation)

**Главное:** Контекст это физическое ограничение. Нельзя его обойти — только правильно спланировать.

---

## Блок 0: Когда это нужно знать

### Если ты работаешь с короткими промптами...
...то контекст редко проблема.

### Но если:
- **Анализируешь документы** (контракты, статьи, книги)
- **Работаешь с истором диалога** (чат где тысячи сообщений)
- **Делаешь RAG систему** (поиск по большой базе знаний)
- **Нужна память** в долгоживущем приложении

...то контекст = главная граница.

| Ситуация | Почему контекст важен |
|----------|--------------------:|
| "Анализируй 100 писем с историей" | Всё должно влезть в контекст |
| "Почему модель забила на информацию сверху?" | Потому что контекст переполнен |
| "Может ли обработать PDF на 500 страниц?" | Нужно считать токены и контекст |
| "Почему Claude лучше для долгих разговоров?" | Она имеет 200k контекст vs GPT-4 128k |

---

## Блок 1: Что такое контекстное окно

### Аналогия: оперативная память (RAM)

Контекстное окно это как **RAM в компьютере**, но для модели.

```
КОМПЬЮТЕР:
RAM 16GB = можешь открыть 16GB файлов одновременно
Больше файлов = компьютер зависает или забывает старые

LLM:
Контекстное окно 128k токенов = модель может видеть 128k токенов одновременно
Больше текста = модель "забивает" на старое (обычно в порядке FIFO)
```

### Что находится в контекстном окне?

Всё что модель видит ДО того как она ответит:

```
Контекстное окно включает:
1. System prompt (инструкция к модели) = 500 токенов
2. История разговора (все предыдущие сообщения) = X токенов
3. Твой текущий промпт = Y токенов
4. Любой контекст который ты добавил (текст, код) = Z токенов

ВСЕГО: 500 + X + Y + Z должно быть < контекстное окно модели
```

![AI Working Memory: how context window functions as model's memory](https://nhvwqitwebmmswnjylop.supabase.co/storage/v1/object/public/Pictures%20for%20course/AI%20basics%20new%20course/06_AI_Working_Memory.png)

### Контекстные окна разных моделей (май 2026)

| Модель | Контекст | Как много это? | Когда выпущена |
|--------|----------|---------------|----------------|
| **Claude 3.5 Sonnet** | 200,000 токенов | ~150,000 слов / 400 страниц | Q2 2024 |
| **Claude 4 (новое)** | 400,000+ | ~300,000 слов / 800+ страниц | Q1 2026 |
| **GPT-4 Turbo** | 128,000 | ~100,000 слов / 250 страниц | Q4 2023 (старая) |
| **GPT-4o** | 128,000 | ~100,000 слов / 250 страниц | Q2 2024 |
| **GPT-4o Extended** | 256,000 | ~200,000 слов / 500 страниц | Q4 2024 |
| **Gemini 2.0 Flash** | 1,000,000 | ~750,000 слов / 2000 страниц | Q4 2024 |
| **Gemini 2.0 Pro** | 2,000,000+ | ~1.5M слов / 4000 страниц | Q1 2026 |
| **Llama 3.1 70B** | 128,000 | ~100,000 слов / 250 страниц | Q3 2024 |
| **Llama 3.2** | 128,000+ | ~100,000+ слов | Q4 2024 |
| **Mistral Large 2** | 128,000 | ~100,000 слов / 250 страниц | Q3 2024 |
| **DeepSeek R1** | 128,000 | ~100,000 слов / 250 страниц | Q4 2024 |

**⚠️ ВАЖНО (май 2026):**

Эта таблица может быть **уже устаревшей** когда ты её читаешь!

**Тренд (2023-2026):**
```
2023: Максимум 32k контекста (редко)
2024: Норма 128k, лучшие 200k
Q4 2024: Gemini выпустила 1M, Claude приближается к 400k
Q1 2026 (сейчас): 200k-1M норма, 2M+ появляется
Q3 2026: Ожидается 5M+ у лидеров (Anthropic, Google)

ТО ЕСТЬ:
Каждые 6 месяцев контекст растёт в 2-3 раза!
```

**Как всегда проверить актуальные размеры?**

```
1. Официальные сайты:
   - Claude: https://anthropic.com
   - OpenAI: https://openai.com/api/pricing
   - Google: https://ai.google.dev

2. Документация API:
   - Каждый API в docs указывает текущий контекст
   
3. Реальный тест:
   - Отправь большой текст → узнаешь лимит
```

**Важный факт:** Контекст это НЕ то же самое что способность модели думать.

---

## Блок 2: Как контекст заполняется (пример)

### Пример: диалог в чате

```
Максимальный контекст Claude: 200,000 токенов

НАЧАЛО РАЗГОВОРА:
Доступно контекста: 200,000

---

Ты: "Привет, кто ты?" (10 токенов)
Доступно: 199,990

Claude: "Я Claude..." (100 токенов)
Доступно: 199,890

---

Ты: "Помоги с кодом Python" (8 токенов)
Доступно: 199,882

Claude: "Вот пример кода..." (500 токенов)
Доступно: 199,382

---

Ты: "Вот мой большой документ [1000 страниц]" (150,000 токенов!)
Доступно: 49,382

Claude: "Проанализировал..." (1,000 токенов)
Доступно: 48,382

---

Ты: "Ещё один документ [100 страниц]" (15,000 токенов)
Доступно: 33,382

Claude: "Обработал..." (500 токенов)
Доступно: 32,882

---

Ты: "Ещё документ [80 страниц]" (12,000 токенов)
ПРОБЛЕМА! 12,000 > 32,882?
ДА, хватит, но осталось мало.

Доступно: 20,882

---

Ты: "И последний документ [100 страниц]" (15,000 токенов)
ПРОБЛЕМА! 15,000 > 20,882?
НЕТ, не хватит!

ERROR: "Context length exceeded"
```

### Кто забивает контекст?

Не просто старые сообщения.

```
Контекст растёт из-за:

1. КАЖДОЕ твоё сообщение добавляется в контекст
2. КАЖДЫЙ ответ Claude добавляется в контекст
3. Длинные тексты которые копируешь в промпт
4. System prompt (начальная инструкция) занимает место

Специальный совет:
- Если пишешь коротко → контекст растёт медленно
- Если копируешь большие тексты → контекст растёт быстро
```

---

## Блок 3: Что происходит когда контекст переполняется?

### Вариант 1: Модель просто отказывает

```
ERROR: "context_length_exceeded"
Claude: "Извините, текст слишком длинный для обработки"

Нужно самому сократить текст или использовать другую модель.
```

### Вариант 2: Модель забывает начало (FIFO)

Некоторые модели не отказывают сразу, а просто игнорируют старое:

```
ДИАЛОГ:
1. Ты: "Помни что я инженер" ← давно, может забыться
2. Ты: "Мой опыт 10 лет" ← давно, может забыться
3. Ты: [копируешь 100-страничный документ] ← новое, точно в контексте
4. Ты: "Какого я опыта?" ← вопрос про опыт

Claude забывает про опыт (пункты 1-2) потому что контекст переполнен!
Ответ: "Я не вижу информацию о вашем опыте"

НЕПРАВИЛЬНО! Информация была, но в начале разговора.
```

### Вариант 3: Деградация качества

Когда модель близко к лимиту контекста, качество падает:

```
КОНТЕКСТ ИСПОЛЬЗОВАНО:
80% → ответы нормальные
90% → ответы начинают быть менее точные
95%+ → ответы совсем неправильные или обрывистые
```

**Почему?** Потому что модель не может хорошо думать когда мало памяти.

### Вариант 4: Активное сжатие контекста (2026 - современное решение!)

**НОВОЕ В 2026:** Современные модели (Claude 3.5, GPT-4o, Gemini) уже **сами сжимают контекст** в диалогах.

Это НЕ потеря информации, а активное **переформулирование** старых сообщений.

```
ДИАЛОГ (20 сообщений, 100k токенов):

Первые 15 сообщений (80k токенов) → модель сжимает до SUMMARY:
"Пользователь обсуждал архитектуру базы данных,
 выбрал PostgreSQL, обсудил индексы.
 Главные решения: JSON-поля для гибкости,
 R-tree индексы для геопространства."

Новый размер: 200 токенов (вместо 80k!)

Последние 5 сообщений (20k токенов) → остаются как есть

ИТОГО контекста: 200 + 20k = 20.2k (экономия 80%)
```

**Как это работает?**

```
CLAUDE (и другие в 2026):
1. Когда контекст близко к лимиту (~85-90%)
2. Модель автоматически сжимает старые сообщения
3. Использует свой механизм "внутреннего резюме"
4. Сохраняет все главные факты в компактной форме
5. Старые сообщения становятся 1-5% от исходного размера

РЕЗУЛЬТАТ:
- Ты продолжаешь разговор как обычно
- Модель помнит контекст (не забывает)
- Но экономит токены и деньги (4x-10x экономия)
- Скорость не падает (сжатие работает в фоне)
```

**Какие модели это поддерживают (май 2026)?**

| Модель | Сжатие контекста? | Как работает |
|--------|-----------------|-------------|
| **Claude 3.5 Sonnet** | ✅ Есть | Автоматическое, прозрачное |
| **GPT-4o** | ✅ Есть (улучшено) | Встроенное, агрессивное сжатие |
| **Gemini 2.0** | ✅ Есть | Динамическое сжатие |
| **Llama 3.2** | ⚠️ Частичное | Нужно явно просить summary |
| **Mistral Large** | ✅ Есть | Новое в 2026 версии |

**Практическое значение для тебя:**

```
ДО (2023-2024):
  Долгий диалог → контекст переполняется → результат деградирует

ТЕПЕРЬ (май 2026):
  Долгий диалог → модель сама сжимает → контекст эффективен → качество держится

ЭТО ЗНАЧИТ:
✅ Можешь вести долгие беседы без деградации
✅ Стоимость не растёт линейно (сжатие экономит 4-10x)
✅ Качество держится хорошее (помнит контекст через резюме)
✅ Ты не должен сам управлять контекстом
```

**Но есть нюансы:**

```
✅ ПЛЮСЫ сжатия контекста:
- Автоматическое, не нужно ничего делать
- Экономит РЕАЛЬНЫЕ деньги (80%+ экономия на старых сообщениях)
- Прозрачно (ты не замечаешь)
- Качество не падает (помнит главное через резюме)
- Можешь вести диалоги в 1000+ сообщений

⚠️ МИНУСЫ/ОСОБЕННОСТИ:
- Если очень специфичные старые детали нужны → могут потеряться
- На диалогах 5000+ сообщений качество может медленно дрейфовать
- Не все модели одинаково хорошо сжимают
- Если сжатие произошло → ты не видишь исходный текст
```

**Как использовать это в своём приложении (май 2026)?**

```
РАНЬШЕ (2023-2024) нужно было самому:
1. Отслеживать размер контекста вручную
2. Вручную делать резюме старых сообщений
3. Прерывать разговор когда контекст переполнялся
4. Использовать RAG для долгих диалогов

ТЕПЕРЬ (май 2026) можешь просто:
1. Отправлять сообщения (модель сама всё управляет)
2. Опционально: явно попросить summary если нужен контроль
3. Вести диалоги в тысячи сообщений без проблем
```

**ПРИМЕР КОДА (ничего особенного не нужно):**

```python
response = client.messages.create(
    model="claude-3-5-sonnet-20241022",
    messages=[
        # Все сообщения (100, 1000, даже 5000)
        # Модель автоматически сжимает старые
    ],
    # Не нужно ничего особого указывать
    # Сжатие работает на API уровне
)
```

**Сравнение подходов (май 2026):**

| Подход | Когда использовать | Когда СТОП |
|--------|-------------------|-----------|
| **Автоматическое сжатие** (по умолчанию) | Обычные диалоги, chat, долгие беседы | Редко, это лучший вариант |
| **RAG система** | Очень большие базы знаний (млн+ документов) | Когда нужен точный поиск, не просто память |
| **Явное резюме** (ты просишь) | Критичные данные, нужен контроль, документирование | Медленнее, ручная работа |
| **Новая большая модель** (Gemini 1M) | Редко, очень большие задачи | Дорого, обычно не нужна |

---

## Блок 4: Как рассчитать будет ли текст влезать?

### Шаг 1: Выбери модель и контекст

```
ЕСЛИ выбираешь Claude 3.5:
  Контекст: 200,000 токенов
  
ЕСЛИ выбираешь GPT-4 Turbo:
  Контекст: 128,000 токенов
```

### Шаг 2: Оставь место для ответа

```
Не используй весь контекст для input!

ПРАВИЛО БОЛЬШОГО ПАЛЬЦА:
Контекст input ≤ 70% от общего контекста
Контекст output ≥ 30% от общего контекста

ПРИМЕР:
Claude (200k токенов):
  Input: 140,000 токенов максимум
  Output: 60,000 токенов максимум
```

### Шаг 3: Считай сколько токенов займёт твой текст

```
ЕСЛИ анализируешь документ:

Способ 1 (примерный):
  100 русских слов = 150 токенов (примерно)
  Твой документ: 10,000 слов = 15,000 токенов

Способ 2 (точный):
  Используй tokenizer или API count_tokens()
```

### Шаг 4: Проверь будет ли влезать

```
ПРИМЕР:
Claude (200k контекст)
Input максимум: 140,000 токенов

Твои данные:
  System prompt: 500 токенов
  История разговора: 5,000 токенов
  Твой документ: 80,000 токенов
  Твой вопрос: 1,000 токенов
  
ИТОГО: 500 + 5,000 + 80,000 + 1,000 = 86,500 токенов

ХВАТИТ ЛИ? 86,500 < 140,000?
ДА! Есть место даже для больших документов.
```

### Шаг 5: Что делать если не хватает?

ВАРИАНТ 1: Использовать большую модель
```
Документ не влезает в GPT-4 (128k)?
→ Используй Claude (200k) или Gemini (1M)
```

ВАРИАНТ 2: Сократить документ
```
Нужен документ 50k токенов, но контекст только 30k?
→ Сначала сделать резюме
→ Потом анализировать резюме (5k токенов)
```

ВАРИАНТ 3: Использовать RAG
```
Документ слишком большой?
→ Разбить на куски
→ Для каждого куска запросить что нужно
→ Собрать результаты
```

---

## Блок 5: RAG (Retrieval-Augmented Generation) — решение для больших баз знаний

### Проблема с большими базами знаний

Представь что у тебя есть:
- 10,000 документов
- Каждый 50 страниц
- Всего: 500,000 страниц

Не можешь отправить всё в модель (не влезет).

Нужен способ отправить только РЕЛЕВАНТНЫЕ документы.

### Как RAG работает?

```
┌────────────────────────────────────────┐
│ БОЛЬШАЯ База знаний (500,000 страниц)  │
│ - Контракты                            │
│ - Статьи                               │
│ - Документация                         │
└──────────────┬─────────────────────────┘
               │
               ↓
┌────────────────────────────────────────┐
│ ПОИСК (семантический)                  │
│ Вопрос: "Какой срок оплаты?"          │
│ Система ищет похожие фрагменты        │
│ Находит топ-5 самых релевантных       │
│ = примерно 25 страниц текста          │
└──────────────┬─────────────────────────┘
               │
               ↓
┌────────────────────────────────────────┐
│ ОТПРАВКА в LLM                         │
│ Input:                                 │
│   - Твой вопрос (500 токенов)         │
│   - 25 страниц релевантных (5k токе)  │
│   = 5,500 токенов вместо 500k!       │
│                                        │
│ LLM обрабатывает и отвечает          │
│ Output: "Срок оплаты 30 дней"         │
└────────────────────────────────────────┘
```

![RAG Synthesis Arc: Retrieval-Augmented Generation with knowledge base](https://nhvwqitwebmmswnjylop.supabase.co/storage/v1/object/public/Pictures%20for%20course/AI%20basics%20new%20course/27_Synthesis_Arc_RAG.png)

### RAG в практике

**Стек RAG системы:**

```
1. ИНДЕКСИРОВАНИЕ (один раз):
   - Возьми все документы (500,000 страниц)
   - Разбей на куски (500-1000 токенов каждый)
   - Конвертируй в векторы (embeddings)
   - Сохрани в базе (vector database: Pinecone, Weaviate)

2. ПОИСК (каждый запрос):
   - Ты спрашиваешь: "Какой срок оплаты?"
   - Система конвертирует вопрос в вектор
   - Ищет похожие векторы в базе
   - Возвращает топ-5-10 релевантных кусков

3. ГЕНЕРАЦИЯ (каждый запрос):
   - Отправляет релевантные куски + вопрос в LLM
   - LLM ответает на основе кусков
   - Ответ = точный и на основе твоих данных
```

### Преимущества RAG

```
❌ БЕЗ RAG:
  - Не можешь анализировать большие базы
  - Контекст переполняется
  - Дорого (нужна мощная модель с большим контекстом)

✅ С RAG:
  - Можешь работать с базами в миллионы документов
  - Экономишь контекст (только релевантные куски)
  - Дешевле (можешь использовать маленькую модель)
  - Точнее (ответ основан на реальных документах)
```

---

## Блок 6: Практические советы по контексту

### Совет 1: Не копируй всю историю если не нужна

```
ПЛОХО:
Диалог 100 сообщений = 50,000 токенов
Вопрос: "Сколько я потратил?" (нужна только финансовая информация)
Но копируешь всю историю = контекст растёт зря

ХОРОШО:
Финансовая информация = 2,000 токенов
Вопрос: "Сколько я потратил?"
Копируешь только релевантное = контекст в порядке
```

### Совет 2: Используй summary для старых сообщений

```
СТАРЫЙ ДИАЛОГ (100 сообщений):
Первые 50 сообщений → summary "Обсуждали дизайн, решили использовать Figma"

Последние 50 сообщений → целиком (актуальные)

Результат: 50k токенов → 5k токенов (10x дешевле)
```

### Совет 3: Выбери правильную модель под задачу (май 2026)

```
ЕСЛИ анализируешь 10 страниц (~5k токенов):
  → Любая модель (даже Llama с 128k контекстом)
  → Цена: дешево, скорость: быстро

ЕСЛИ анализируешь 100 страниц (~50k токенов):
  → Claude 3.5 (200k) или GPT-4o Extended (256k)
  → Цена: нормально, скорость: нормально
  
ЕСЛИ анализируешь 500 страниц (~250k токенов):
  → Claude 4 (400k+) или Gemini 2.0 Flash (1M)
  → Цена: выше, скорость: медленнее (но всё влезает)

ЕСЛИ анализируешь 2000+ страниц (~1M+ токенов):
  → Gemini 2.0 Pro (2M контекст)
  → ИЛИ RAG система (дешевле и быстрее)

ЕСЛИ анализируешь 10,000+ страниц (5M+ токенов):
  → Обязательно RAG система (поиск по релевантным частям)
  → Прямая отправка всего слишком дорого и медленно
```

**НАПОМИНАНИЕ (май 2026):**
```
⚠️ Контекстные окна РАСТУТ БЫСТРО!

К тому времени когда ты прочитаешь этот урок:
- Новые модели могут иметь контекст 2-5x больше
- Цены могут измениться
- Новые подходы могут появиться

СОВЕТ: 
- Всегда проверь актуальные размеры на сайте API перед выбором
- Тестируй на реальных данных (размеры в таблице примерные)
- Используй Gemini или Claude для больших контекстов (они лидируют)
```

### Совет 4: Streaming (получать ответ постепенно)

Когда контекст близко к лимиту:

```
ВМЕСТО:
  Дождаться полный ответ → контекст мог переполниться

ЛУЧШЕ:
  Streaming (получать токены по одному)
  → вероятность ошибки меньше
```

---

## Блок 7: Контекст vs Скорость (компромисс)

### Больший контекст = медленнее

```
МОДЕЛЬ: Claude 3.5

Контекст = 10k токенов:
  Время ответа: 1 секунда

Контекст = 100k токенов:
  Время ответа: 5-10 секунд

Контекст = 200k токенов:
  Время ответа: 20+ секунд
```

**Почему?** Потому что модель должна обработать все токены через все слои нейросети.

### Выбор между контекстом и скоростью

```
ЕСЛИ нужна СКОРОСТЬ (real-time chat):
  → Используй маленький контекст (4-8k)
  → Не накапливай историю

ЕСЛИ нужна ТОЧНОСТЬ (анализ документа):
  → Используй большой контекст (128k+)
  → Включи весь документ
  → Подожди 20+ секунд

ЕСЛИ нужно БЕЗ КОМПРОМИССОВ:
  → Используй RAG (маленький контекст для каждого запроса)
  → И скорость, и точность
```

---

## Блок 8: Заблуждения о контексте

### ❌ Заблуждение 1: "Большее контекстное окно = модель умнее"

**На самом деле:** Большой контекст помогает работать с большими текстами, но не делает модель умнее.

```
GPT-4 с 128k контекстом против Claude 3.5 со 200k:
- Claude может анализировать большие документы
- Но на простых вопросах GPT-4 может быть точнее (т.к. умнее)

Контекст это способность ПОМНИТЬ, не способность ДУМАТЬ.
```

### ❌ Заблуждение 2: "Если контекст большой, то можешь забыть про RAG"

**На самом деле:** Даже большой контекст имеет лимит.

```
Gemini 1.5 имеет 1M токенов контекста.
Это звучит бесконечно.

Но:
- 1M токенов = ~750,000 слов
- 750,000 слов = примерно 10 больших романов
- Если база знаний больше → нужен RAG
```

### ❌ Заблуждение 3: "Контекст считается и в input и в output"

**На самом деле:** Контекст это всё что модель видит и генерирует.

```
Контекстное окно:
  = Input (твой промпт + история)
  + Output (ответ которую модель генерирует)

Если контекст 200k и ты потратил 100k на input:
  Осталось максимум 100k для output.
```

---

## Блок 9: Карта контекстного окна в системе

```
┌──────────────────────────────────────────────────┐
│  КОНТЕКСТНОЕ ОКНО (память модели)               │
│  Пример: Claude 3.5 = 200,000 токенов          │
│                                                  │
│  ┌────────────────────────────────────────────┐ │
│  │ INPUT (что модель видит):                  │ │
│  │ - System prompt: 500 токенов               │ │
│  │ - История разговора: X токенов             │ │
│  │ - Твой промпт: Y токенов                   │ │
│  │ - Контекст (документ): Z токенов           │ │
│  │ ИТОГО INPUT: 500 + X + Y + Z = 150,000 макс │ │
│  └────────────────────────────────────────────┘ │
│                                                  │
│  ┌────────────────────────────────────────────┐ │
│  │ OUTPUT (что модель генерирует):            │ │
│  │ Осталось контекста: 200,000 - 150,000      │ │
│  │ = 50,000 токенов на ответ                  │ │
│  └────────────────────────────────────────────┘ │
└──────────────────────────────────────────────────┘

ВЫВОД: Каждый токен в INPUT уменьшает место для OUTPUT.
```

---

## 🌉 Переход: от контекста к управлению поведением

✅ **Что мы знаем:**
- Что такое контекстное окно (рабочая память)
- Как контекст заполняется и переполняется
- Как рассчитать будет ли текст влезать
- Когда нужен RAG для больших баз
- Trade-off между контекстом и скоростью

✅ **Что мы НЕ знаем:**
- Как управлять ПОВЕДЕНИЕМ модели (детерминировано vs творчески)
- Что такое температура и зачем нужна
- Как параметры влияют на качество
- Когда использовать высокую/низкую температуру

**В следующем уроке (0.5)** разбираемся с ПАРАМЕТРАМИ ГЕНЕРАЦИИ:
- Температура (0.0 - детерминировано, 2.0 - хаотично)
- Top_p (nucleus sampling)
- Top_k (выбор из N лучших)
- Max_tokens (бюджет для ответа)
- Как выбрать параметры для разной задачи

**Почему это нужно:** Чтобы не просто получать ответы, а управлять КАКИМ будет ответ.

---

## ✅ Финальный чеклист

- [ ] Понимаю что контекстное окно это рабочая память модели
- [ ] Знаю контекст разных моделей (Claude 200k, GPT-4 128k, Gemini 1M)
- [ ] Могу рассчитать будет ли мой текст влезать в контекст
- [ ] Понимаю что происходит когда контекст переполняется
- [ ] Знаю как использовать RAG для больших баз
- [ ] Понимаю компромисс между контекстом и скоростью
- [ ] Знаю как сохранить контекст (summary, убирать ненужное)
- [ ] Могу объяснить почему большой контекст != умная модель
- [ ] Знаю что контекст включает input AND output
- [ ] Могу выбрать правильную модель под размер документа

[Все уроки](https://learnvibecoding.ru/publiclessons.md) · HTML: https://learnvibecoding.ru/publiclessons