Длинный контекст в 1 млн токенов: как загрузить весь проект
31 мая 2026 г. · 11 мин чтения · Максим Космов

Содержание
- TL;DR
- Проблема, которую он решает
- Цифры, которые стоит померить
- Как структурировать проект для загрузки
- Какие задачи режимом 1М решаются красиво
- Где 1М не нужен и даже мешает
- Практический рецепт на каждый день
- Что выбрать новичку
- FAQ
- Как загружать целые проекты в Claude
- Проблема, которую он решает
- Сколько это стоит
- Как структурировать проект
- Какие задачи режутся красиво
- Где не нужен
- Пайплайн на каждый день
- Что выбрать новичку
TL;DR
Два месяца практики с Claude Opus 4.7 в режиме 1 миллиона токенов контекста показывают любопытную картину. Загружаешь целые репозитории, читаешь длинные документы, прогоняешь аудит legacy-кода, и экономика начинает работать по-другому.
Главное: один большой контекст обычно дешевле, чем десять маленьких. Один запрос с полным репо на 200к токенов стоит $0.05-0.10. Десять уточняющих запросов без контекста, $0.20-0.40. Разница в 4 раза в пользу одного большого вопроса.
В тексте: как структурировать проект для загрузки, какие задачи режимом 1М решаются красиво, где он не нужен и где даже мешает. С реальными цифрами по стоимости и скорости, и с правилом, когда переключаться обратно на короткий контекст.
Проблема, которую он решает
До 1М-контекста рабочий процесс выглядит так. Большой проект, значит, режешь его на куски: контроллеры отдельно, модели отдельно, миграции отдельно. К каждому вопросу прикладываешь те куски, которые кажутся релевантными.
В итоге две беды. Первая: часто промахиваешься, какие куски нужны. Спрашиваешь про логин, забыл приложить middleware, модель отвечает мимо. Уточняешь, докидываешь файлы, платишь за лишний раунд.
Вторая: модель не видит связей. Она знает про модель User, но не знает, как с ней работает Token. Догадывается, иногда правильно, иногда нет. На сложных задачах нагадывания накапливаются, и результат получается средним.
С 1М-контекстом думать, что куда положить, не нужно. Грузишь весь репо. Модель сама находит, что ей пригодится. И главное: видит связи целиком.
Цифры, которые стоит померить
Тарифы Anthropic у Claude Opus 4.7 на 1М-режиме: $6 за миллион input-токенов с прайм-кэшем (если повторяешь контекст подряд), $15 без кэша, $75 за миллион output.
На практике типовой день: грузишь 200к токенов кода один раз с утра. Это $1.20 на input, и платится только в первом запросе. Дальше работа идёт с кэшем, каждый следующий запрос, $0.05-0.10.
За день получается 30-50 запросов к этому контексту. Итого: $1.20 + 40 × $0.07 = $4. Это меньше, чем чашка кофе в офисном кафе.
Для сравнения модель «грузить по кускам». Один запрос с десятью файлами, $0.30. Три уточнения, ещё $0.90. Если ошибся с куском и пришлось ещё раз, $1.20. На большой задаче за день уходит $30-50 без кэша.
Один контекст 1М экономит примерно $25 в день для активного дня. За месяц это $750. За эти деньги покрывается Claude Code Max и плюс остаётся.
Как структурировать проект для загрузки
Тупо склеить все файлы через cat в один txt и грузить не нужно. Получится 500к токенов мусора, и модель будет хуже отвечать.
Правильный способ. Начни с README-структуры:
- Что это за проект (2-3 предложения)
- Как запустить (команды)
- Архитектура (компоненты и связи)
- Ключевые файлы (5-10 штук с одной строкой описания каждого)
Дальше прилагай только эти ключевые файлы целиком. Остальное, спецификации, миграции, утилиты, подгружай по необходимости отдельными вопросами.
Для FastAPI-сервиса набирается так:
- README с архитектурой, 2к токенов
- main.py + конфиг, 5к
- routers/ (4 файла), 25к
- models/ (5 моделей), 15к
- services/ (3 сервиса), 30к
- tests/conftest.py, 3к
Итого 80к токенов. Модель видит весь сервис, понимает связи, отвечает быстро. Лезть в 200к приходится только на legacy-монолитах.
Какие задачи режимом 1М решаются красиво
Первое, рефакторинг. «Перепиши все хендлеры с callbacks на async/await», модель видит весь репо, делает консистентно, не забывает ни одного файла. На обычном контексте такая задача растягивается на два дня. На 1М за полчаса получаешь список из 23 файлов и diff на каждый.
Второе, аудит. «Найди все места, где могут утечь токены». Модель прогоняет весь код, выдаёт список с цитатами и номерами строк. На обычной модели приходится делать это grep-ом, ловить половину.
Третье, онбординг. Заходишь в чужой репо, грузишь полностью, спрашиваешь «как тут устроена обработка платежей». Через минуту получаешь краткое описание, а не недельное чтение исходников.
Четвёртое, миграции. «Прогони план перевода со старого Pydantic на новый». Модель смотрит на все use-cases в репо, выдаёт пошаговый план, где что менять и в каком порядке.
Где 1М не нужен и даже мешает
Простые вопросы. «Помоги придумать имя переменной», не нужно грузить 100к контекста. Модель справится за $0.001 без контекста.
Сильно изолированные задачи. Если пишешь новую утилитку, которая не зависит от существующего кода, контекст репо только размажет внимание модели. Лучше дать ей чистый лист и ТЗ.
Чрезмерно большие контексты. Загружать миллион токенов целиком пробовать стоит аккуратно. Модель работает, но иногда теряет точность на задачах, где нужно быть прицельной. Оптимально получается 200-400к. Дальше идёт деградация.
И очевидное: если проект на 50к токенов, никаких 1М не нужно вообще. Грузишь всё и работаешь.
Практический рецепт на каждый день
Выработанный пайплайн выглядит так:
- Утром один раз грузится основной контекст проекта (80-200к токенов)
- Все запросы в течение дня идут с кэш-хитом
- Если работа с другим проектом, открывается отдельная сессия
- Если задача простая, без 1М, через короткий контекст
- К концу дня смотришь расход в дашборде Anthropic, корректируешь
Дашборд Anthropic показывает, сколько потрачено по дням и по моделям. Раз в неделю смотришь свою статистику и понимаешь, где переплачиваешь.
Лайфхак про кэш: prime-cache живёт 5 минут. Если между запросами проходит больше времени, кэш сбрасывается, и следующий запрос идёт по полной цене. Поэтому стоит держать сессию активной: задаёшь вопросы подряд, не отвлекаешься на 20-минутный обед. Если знаешь, что отвлечёшься надолго, делай один маленький запрос «привет, всё ли видно» перед перерывом, это продлевает кэш ещё на 5 минут.
Второй лайфхак: разные проекты в разные сессии. Если в одной сессии переключаешься между двумя репо, кэш ломается на каждом свитче. Открывай две независимые сессии Claude Code, и каждая будет держать свой контекст.
И третий: не путай 1М-режим со стандартным 200к. Stylistically они работают похоже, но цены и квоты разные. 1М-режим включается отдельным флагом или моделью. Если случайно работаешь в 1М на маленьком проекте, переплачиваешь без пользы.
Что выбрать новичку
Если ты только подходишь к Claude и не уверен, нужен ли тебе 1М, не парься. Начни с обычного 200к-контекста на Sonnet 4.6. Этого хватит для большинства проектов до 100к токенов кода. Стоит копейки и работает быстро.
На 1М переходи, когда стабильно упираешься в потолок: «репо на 500к, не помещается». Тогда есть смысл. До этого, оверкилл.
И ещё: 1М-контекст не делает модель умнее. Он даёт ей больше материала для размышлений. Если задача плохо сформулирована, миллион токенов не спасёт, ответ будет таким же мутным, как на 10к. Качество промпта важнее размера контекста.
FAQ
На каких моделях есть 1М-контекст? Сейчас на Claude Opus 4.7 в специальном режиме. У Sonnet 4.6 стандартно 200к. У Haiku, 200к. У OpenAI GPT-5 заявленный лимит 128к, у Gemini 2 Pro, 1М аналогично Claude, но цены и качество на длинном контексте систематически сравнивать сложно.
Какой проект слишком большой даже для 1М? 500к-600к токенов, граница, после которой модель чувствительно тормозит и точность падает. Если репо больше, режь на модули и работай с каждым отдельно. Параллельно можно держать несколько сессий, по одной на модуль.
Можно ли использовать 1М на свободном тарифе? Нет, только на Pro и Max. И там есть лимиты по числу запросов в день. На Pro лимит срабатывает примерно через 25 запросов с большим контекстом. Max существенно щедрее, но и стоит в десять раз дороже.
Как считать токены заранее? Простое правило: одно слово, примерно 2 токена для русского, 1.3 для английского. Точнее посчитать можно через tiktoken или через API Anthropic. Там есть отдельный эндпоинт для подсчёта без отправки модели.
Что выгоднее: один большой запрос или несколько маленьких? Один большой с кэшем. Если кэша нет (первый раз), сопоставимо. Если задаёшь 10+ вопросов подряд по одному контексту, большой выигрывает в разы. Обычно выходит 30-50 запросов с одного утреннего контекста за день.
Что делать, если кэш сбросился? Просто пересоздать. Платится один раз за input. Если работаешь активно, цена кэширования размазывается между десятками запросов и становится копейкой. Кэшируй в начале каждой сессии и не парься.
Подходит ли 1М для не-кодовых задач? Да, и часто там даже выгоднее. Длинные документы, контракты, исследовательские отчёты, базы знаний. Один раз залил, спрашиваешь весь день без подгрузки кусков. Особенно хорошо работает на материалах, где важны связи между разделами: например, юридические тексты со ссылками друг на друга.
📌 Dzen (~900 слов)
Как загружать целые проекты в Claude
Два месяца практики с Claude Opus 4.7 в режиме 1 миллиона токенов контекста дают понятную картину. Грузишь целые репозитории, читаешь длинные документы, прогоняешь аудит legacy-кода.
Главное наблюдение: один большой контекст обычно дешевле, чем десять маленьких. Один запрос с полным репо на 200к токенов стоит $0.05-0.10. Десять уточняющих запросов без контекста, $0.20-0.40. Разница в 4 раза в пользу одного большого.
Проблема, которую он решает
До 1М-контекста процесс выглядит так. Большой проект режется на куски: контроллеры отдельно, модели отдельно, миграции отдельно. К вопросу прикладываются те куски, которые кажутся релевантными.
В итоге две беды. Первая: часто промахиваешься, какие куски нужны. Спрашиваешь про логин, забыл приложить middleware, модель отвечает мимо. Уточняешь, докидываешь, платишь за лишний раунд. Вторая: модель не видит связей между файлами. Догадывается, иногда правильно, иногда нет.
С 1М-контекстом думать, что куда положить, не нужно. Грузишь весь репо. Модель сама находит, что нужно. И главное: видит связи целиком, без догадок.
Сколько это стоит
Тарифы Claude Opus 4.7 на 1М: $6 за миллион input-токенов с кэшем, $15 без кэша, $75 за миллион output.
На практике типовой день: грузишь 200к токенов кода один раз с утра. Это $1.20, и платится только в первом запросе. Дальше работа с кэшем, каждый следующий запрос, $0.05-0.10.
За день 30-50 запросов. Итого $4 в день. Меньше, чем кофе в офисном кафе.
Сравни с «грузить по кускам». Один запрос с десятью файлами, $0.30. Три уточнения, ещё $0.90. На большой задаче за день уходит $30-50. Один контекст 1М экономит примерно $25 в день. За месяц $750.
Как структурировать проект
Склеивать все файлы скопом в один txt не нужно. Получится 500к мусора, модель будет хуже отвечать.
Правильный способ: начни с README-структуры. Что это за проект, как запустить, архитектура, ключевые файлы. Дальше прилагай только ключевые файлы целиком. Остальное подгружай по необходимости.
Для FastAPI-сервиса получается около 80к токенов: README, main, роутеры, модели, сервисы, conftest. Модель видит весь сервис, понимает связи, отвечает быстро.
Какие задачи режутся красиво
Рефакторинг. «Перепиши все хендлеры с callbacks на async/await», модель видит весь репо, делает консистентно. На 1М за полчаса получаешь список из 23 файлов и diff на каждый.
Аудит. «Найди все места, где могут утечь токены». Модель прогоняет код, выдаёт список с цитатами.
Онбординг. Заходишь в чужой репо, грузишь полностью, спрашиваешь «как тут устроена обработка платежей». Через минуту получаешь описание, а не недельное чтение исходников.
Миграции. «План перевода со старого Pydantic на новый», модель видит use-cases в репо, выдаёт пошаговый план.
Где не нужен
Простые вопросы. «Помоги придумать имя переменной», не нужно грузить 100к. Модель справится за $0.001 без контекста.
Изолированные задачи. Если пишешь новую утилитку без зависимостей, контекст репо размажет внимание. Лучше чистый лист и ТЗ.
Слишком большие контексты. Загружать миллион токенов целиком можно, работает, но точность падает на прицельных задачах. Оптимально 200-400к.
Пайплайн на каждый день
Утром один раз грузится основной контекст. Запросы идут с кэш-хитом. Другой проект, отдельная сессия. Простая задача, короткий контекст без 1М. К концу дня смотришь расход в дашборде Anthropic, корректируешь.
Лайфхак: prime-cache живёт 5 минут. Если между запросами больше, кэш сбрасывается, следующий запрос по полной цене. Поэтому держи сессию активной. Знаешь, что отвлечёшься надолго, сделай маленький «пинг»-запрос перед перерывом, продлишь кэш ещё на 5 минут.
Второй лайфхак: разные проекты в разные сессии. Свитч между двумя репо в одной сессии ломает кэш на каждом переключении.
Что выбрать новичку
Не уверен, нужен ли тебе 1М, не парься. Начни с обычного 200к-контекста на Sonnet 4.6. Этого хватит для проектов до 100к токенов кода. Стоит копейки и работает быстро.
На 1М переходи, когда стабильно упираешься: «репо на 500к, не помещается». Тогда есть смысл. До этого, оверкилл.
1М-контекст не делает модель умнее. Он даёт ей больше материала. Если задача плохо сформулирована, миллион токенов не спасёт, ответ будет таким же мутным, как на 10к. Качество промпта важнее размера контекста.
Если 1М-режим ещё не пробовал, а проект большой, попробуй неделю. Один контекст в день, проверь свою экономику. Окупается обычно сразу, в первый же активный день рефакторинга. Возвращаться к нарезке репо на куски после этого не хочется: это плохая модель работы, просто альтернатива не была известна.
И последнее. 1М-контекст работает не только для кода. Длинные документы, контракты, исследовательские отчёты, всё это можно держать в одном контексте. Один раз залил, спрашиваешь весь день. Особенно удобно для юридических текстов со ссылками друг на друга и для академических статей с десятками источников.
📲 TG (600-900 символов)
Claude Opus 4.7 в 1М-режиме: грузишь весь репо один раз и дальше работаешь с кэшем.
Цифры. Input 200к токенов на старте, $1.20. Каждый следующий запрос с прайм-кэшем, $0.05-0.10. День из 30-50 запросов выходит в $4. Без кэша, по кускам, $30-50 за тот же объём.
Где режим тащит: рефакторинг по всему репо, аудит на утечки, онбординг в чужой код, миграции типа Pydantic v1 на v2. Модель видит связи целиком, не догадывается.
Где не нужен: имя переменной, изолированная утилита, проект меньше 50к токенов. И помни про 5-минутный TTL кэша: пауза дольше, плати заново.
Оптимальная зона, 200-400к токенов. Дальше точность плывёт.
Читайте дальше
RAG или fine-tuning: когда какой выбрать на реальных задачах
Есть 500 документов компании и одна задача: научить LLM отвечать на вопросы по ним. Стандартная корпоративная история, инструкции, регламенты, FAQ по продукту, технические доки на
Локальная LLM на одной видеокарте: что работает, что нет
Полгода тестирования локальных моделей на домашней машине с GTX 1080 на борту показывают вполне рабочий расклад. Восемь гигабайт VRAM, не самая свежая карта, типичный игровой вариа
Как собрать SMM-машину на n8n и LLM: реальный кейс 60 постов в месяц за $5
Полгода назад картина выглядела так: пять Telegram-каналов и хроническое чувство вины. Каждый день нужно выкатывать по два поста в каждом, итого десять постов в сутки. Кто-то пишет