Context window
Сколько текста LLM может «помнить» в одном диалоге. У Claude Sonnet 4.6 — 200K токенов (~150 000 слов). У GPT-4 — 128K. Превысил лимит — модель забывает начало.
Развёрнутое объяснение
Context window — максимальное количество токенов, которые LLM может обработать в одном запросе. Туда входит и system prompt, и история диалога, и retrieved chunks, и текущий вопрос, и место под ответ.
Современные размеры: Claude Sonnet 4.6 — 200K (~150K слов), Claude Opus — 1M, GPT-4-Turbo — 128K, GPT-5 — 256K, Gemini 2.5 — 2M.
Большой context window не панацея: чем больше контекста, тем сложнее модели «найти иголку в стоге сена». На практике 100-200K — sweet spot.
Где это в услугах WRAW
- В RAG-ботах ограничиваем context window до 8-16K (баланс качества и цены)
Частые вопросы
Можно ли «обойти» context window?
Через RAG (искать только релевантные куски), summarization (сжимать историю), prompt caching (кешировать system prompt).
Дороже ли использовать большой context?
Да. Цена линейно зависит от input tokens. 200K input — в 100 раз дороже 2K input.
Связанные термины
Large Language Model — большая языковая модель. ChatGPT, Claude, Gemini — это всё LLM. Обучены на миллиардах текстов и у…
Читать →Retrieval-Augmented Generation — архитектура AI-бота, которая ищет ответ в твоей базе документов перед тем, как сгенерир…
Читать →Преобразование текста (или картинки) в вектор чисел, который представляет смысл. Похожие смыслы = похожие векторы. Основ…
Читать →