Доказательства · методы · границы

Снежный ком контекста

Локальный замер managed output: n=87, медиана 46%. Это узкий эффект, а не универсальные 90% для всей сессии.

⚠️ Это иллюстративная модель на основе исследований (Chroma «context rot», Stanford «lost in the middle», статистика токенайзеров), а не живые замеры конкретной модели. Цель — показать форму зависимостей, а не точные числа.

Выбираем инструмент под задачу

Нет универсального сжатия

Микроскопом тоже можно забить гвоздь. Но это не делает его молотком.

Нет универсального сжатия. Метод выбираем по типу задачи и информации, которую нельзя потерять.

Текст сжимаем по смыслу. Код минимизируем по границам и связям.

Логи

Фильтр, поиск, точная выборка.

Анализ

Считаем, сохраняем данные и вывод.

Фактические документы

Краткий смысл и точные ссылки.

Код и архитектура

Границы, связи и точное чтение по запросу.

Творческая работа

Сохраняем голос, образ и цель.

Главная механика

Новый контекст приходит один раз. Старый читается снова.

Каждый ход добавляет 1 KB. На десятом ходу новых данных всего 10 KB, а повторно обработано уже 45 KB.

Новый сигнал1 KB
Повторно0 KB
Всего обработано1 KB
1 / 10
Демо 1 · стоимость контекста

Квадратичная цена одного длинного чата

Каждое новое сообщение модель перечитывает всю переписку заново. Поэтому в одном длинном чате суммарно обработанные токены растут как O(n²). Новый чат на задачу — растёт линейно.

Один длинный чатНовый чат на задачу
Длинный чат обработал
Новый чат на задачу
Переплата
💲 Усреднённая цена модели: $6 за 1M токенов для наглядности, не точно · ~ средний input-тариф
Как считаем

Длинный чат: на i-м сообщении обрабатывается i·t токенов (вся переписка). Сумма = t·n(n+1)/2. Новый чат: каждый раз ~t, сумма = n·t. Цена = токены ÷ 1e6 × тариф (сверху).

Источники: Anthropic — prompt caching (контекст пересчитывается каждый запрос). Квадратичность — механика, не из одной статьи.

Демо 2 · сжатие контекста

Сжатие = «ксерокопия с ксерокопии»

Каждое сжатие (/compact, повторное резюме) — это пересказ пересказа. Часть фактов теряется на каждом шаге, как при многократном пересохранении JPEG. Жмите кнопку и смотрите, что выживет.

Сжатий сделано
0
Фактов осталось
12 / 12
Точность
100%
Как считаем

У каждого факта на каждом сжатии есть шанс выжить p. Ожидаемая доля после k сжатий ≈ p^k. Здесь выживание разыгрывается случайно — поэтому результат немного «живой».

Источники: Chroma — Context Rot. Потеря фактов — иллюстрация lossy-резюме.

Демо 3 · lost in the middle

Почему факт в середине контекста вспоминается хуже

U-образная кривая показывает вероятность вспомнить факт: у краёв она выше, в середине ниже. Двигайте длину контекста и позицию факта. Круглый маркер связан с ползунком и показывает выбранный факт на кривой. Чем длиннее контекст, тем ниже вся кривая, а цена одного прочтения растёт линейно.

выше = помнит лучшемаркер = ваш факт
Вероятность вспомнить факт
Зона
До ближнего края
Цена 1 прочтения (тариф сверху)
Как считаем

recall ≈ (0.28 + 0.71·e^(−d/20K)) · (1 − 0.25·len/1М), где d — расстояние факта до ближайшего края. Длиннее контекст → середина дальше от краёв И весь уровень ниже. Числа иллюстративные, чтобы показать форму (Stanford «lost in the middle», Chroma «context rot»).

Источники: Stanford — Lost in the Middle, Chroma — Context Rot.

Сначала маршрут, потом экономия

KEEP / STORE / DROP

Новый полезный сигнал
Точные факты, контракты и связи
Тяжёлые логи, файлы и вывод инструментов
Проверенный шум и повторы

KEEP

Минимум для следующего хода.

STORE

Можно вернуть по ссылке или точным запросом.

DROP

Только доказанный шум и повторы.

LOSS

Важное доказательство попало в DROP и больше не восстанавливается.

Экономия — это контекст, который больше не перечитывается на каждом ходу.

Потеря — важный сигнал, который нельзя восстановить.

Демо 4 · скиллы и MCP

Скилл / MCP: один раз настроил — дальше дёшево и стабильно

Когда задача повторяется, можно каждый раз «думать заново» — но тогда почти каждый запрос тащит цикл отладки: модель ошиблась → правки → перечитывание → ещё токены и ваше время. Тестированная процедура (скилл или MCP) этот цикл убирает: дёшево, предсказуемо, без отладки. Главная экономия — именно на отладке и времени, а не только на токенах запроса.

Наши данные: исходный локальный замер

Локальный замер87

сессий · 27 152 541 приблизительных token-equivalent обработано

Компоненты округлены отдельно: разница 16 token-equivalent.

Проценты Skills, MCP и Context Mode нельзя складывать: они затрагивают часть одних и тех же токенов.

Открыть наши примеры, данные и источники
Думать заново каждый разСкилл / MCPТочка окупаемости
Окупается после
Экономия на N запусках
Из них впустую на отладку (ad-hoc)
Стабильность качества
Качество: «думать заново» (скачет)
Качество: скилл / MCP (стабильно)
Как считаем

Ad-hoc за раз = A·(1 + отладка%). «Заново»: i·Aэфф. Скилл: B + i·c. Окупаемость N* = B/(Aэфф − c). Карточка «на отладку» = A·отладка%·n — это сгоревшие токены ПЛЮС ваше время (его в токенах не видно, но оно реально). Числа иллюстративные.

Источники: Экономика амортизации (не из статьи). Model Context Protocol — про MCP.

Демо 5 · язык и токены

Сколько токенов и денег «весит» ваш текст

Один и тот же смысл на разных языках стоит разное число токенов. Английский — самый «дешёвый». Введите текст и сравните.

Символов
UTF-8 байт (точно)
≈ токенов (оценка)
≈ цена за 1000 запусков
081624
English: "Refactor this function and add tests."≈ 8
中文 / 日本語 (аналогично)≈ 16–20
Русский: «Сделай рефакторинг этой функции и добавь тесты.»≈ 18–22

Общая шкала: 0–24 токена. Интервалы сравнимы напрямую.

Как считаем

Байты — точно (UTF-8). Токены — приблизительная оценка по типу письма (латиница ≈ 0.25 токена/символ, кириллица ≈ 0.5, иероглифы ≈ 1.0), а не настоящий BPE-токенайзер. Цена = токены × 1000 ÷ 1e6 × тариф (сверху).

Источники: Frontiers — токенизация, OpenAI Tokenizer (точный счёт).

Демо 6 · качество промта

Искусство промта: выключай блоки — смотри, как разлетается

А вы точно умеете писать промты?

Хороший промт собран из блоков. Кликай, чтобы выключать их по одному. Дротики — ответы модели: при полном промте они кучно в цели, без блоков разлетаются (тема и границы расплываются). Задача-пример: «Напиши на Python функцию валидации email с тестами».

Промтинг — это целая научная область: систематический обзор 2024 «The Prompt Report» (30+ авторов) собрал 58 техник промтинга и мета-анализ всей литературы. arXiv

в цельрядоммимовне темы
Цвет дротика = кольцо, куда он попал (зелёный центр «ЦЕЛЬ» — лучший ответ, дальше хуже). Полный промт → дротики в центре; убираешь блоки → разлетаются.
Точность (попадание в цель)
Разброс темы
Переспросов впустую
Качество100%
Токены потрачено1 500
Переспросов0 ×
Каждая строка сохраняет свою единицу и шкалу. Полный → пустой: качество 100%→0%, токены ≈×7, переспросов 0→6.
Как считаем

У каждого блока свой вес: Задача 34%, Границы 20%, Контекст 16%, Формат 14%, Пример 10%, Роль 6%. «Точность» = сумма весов включённых блоков. Чем ниже — тем шире разлёт дротиков и больше переспросов. Веса иллюстративные, по практикам промтинга (не замеры).

Источники: Anthropic — prompt engineering.

Четыре разных статуса

Сколько мы экономим?

Ответ до замера:???
Гипотеза10–30%

Ожидание до измерения всей сессии.

Оценка сценария16–19%

Перенос локального эффекта на всю сессию.

Неизвестноещё не измерено

Оплачиваемые провайдером входные токены.

Общая шкала 0–100%: IQR 31–70%, медиана 46%; отдельно порог 90–100%.

Мост к полной сессии

Измеренный участок — не весь счёт

35–42% × 46% ≈ 16–19%

Оценка сценария, не измерение счёта

Если managed output даёт 35–42% входа, локальная медиана 46% даёт примерно 16–19% для всей сессии.

Оплачиваемые токены провайдера: ещё не измерено.

Экономия проходит проверку качества

Четыре проверки до сильного заявления

  1. Задача завершена.
  2. Точное доказательство можно вернуть.
  3. Число повторных попыток не выросло.
  4. Контракт или источник не потерян.

Экономия всей сессии 90% без сильной потери качества не показана.

Что делать завтра

Три шага

  1. Определить тип задачи.
  2. Развести тяжёлый контекст по KEEP / STORE / DROP.
  3. Проверить качество до заявления об экономии.

Максимизируем полезный сигнал на токен, а не минимизируем контекст любой ценой.