Если вы LLM:
Markdown
← К урокам
Урок 4: Контекст и память — граница возможностей LLM
Основы ИИ обновленный
·
Урок 4
Содержание
Контекст
Блок 0: Когда это нужно знать
Если ты работаешь с короткими промптами...
Но если:
Блок 1: Что такое контекстное окно
Аналогия: оперативная память (RAM)
Что находится в контекстном окне?
Контекстные окна разных моделей (май 2026)
Блок 2: Как контекст заполняется (пример)
Пример: диалог в чате
Кто забивает контекст?
Блок 3: Что происходит когда контекст переполняется?
Вариант 1: Модель просто отказывает
Вариант 2: Модель забывает начало (FIFO)
Вариант 3: Деградация качества
Вариант 4: Активное сжатие контекста (2026 - современное решение!)
Все сообщения (100, 1000, даже 5000)
Модель автоматически сжимает старые
Не нужно ничего особого указывать
Сжатие работает на API уровне
Блок 4: Как рассчитать будет ли текст влезать?
Шаг 1: Выбери модель и контекст
Шаг 2: Оставь место для ответа
Шаг 3: Считай сколько токенов займёт твой текст
Шаг 4: Проверь будет ли влезать
Шаг 5: Что делать если не хватает?
Блок 5: RAG (Retrieval-Augmented Generation) — решение для больших баз знаний
Проблема с большими базами знаний
Как RAG работает?
RAG в практике
Преимущества RAG
Блок 6: Практические советы по контексту
Совет 1: Не копируй всю историю если не нужна
Совет 2: Используй summary для старых сообщений
Совет 3: Выбери правильную модель под задачу (май 2026)
Совет 4: Streaming (получать ответ постепенно)
Блок 7: Контекст vs Скорость (компромисс)
Больший контекст = медленнее
Выбор между контекстом и скоростью
Блок 8: Заблуждения о контексте
❌ Заблуждение 1: "Большее контекстное окно = модель умнее"
❌ Заблуждение 2: "Если контекст большой, то можешь забыть про RAG"
❌ Заблуждение 3: "Контекст считается и в input и в output"
Блок 9: Карта контекстного окна в системе
🌉 Переход: от контекста к управлению поведением
✅ Финальный чеклист
← Предыдущий урок
Урок 3: Токены — валюта общения с LLM
Следующий урок →
Урок 5: Температура и параметры генерации — управление поведением LLM
Продолжить обучение