Логи
Фильтр, поиск, точная выборка.
Локальный замер managed output: n=87, медиана 46%. Это узкий эффект, а не универсальные 90% для всей сессии.
Выбираем инструмент под задачу
Микроскопом тоже можно забить гвоздь. Но это не делает его молотком.
Текст сжимаем по смыслу. Код минимизируем по границам и связям.
Фильтр, поиск, точная выборка.
Считаем, сохраняем данные и вывод.
Краткий смысл и точные ссылки.
Границы, связи и точное чтение по запросу.
Сохраняем голос, образ и цель.
Главная механика
Каждый ход добавляет 1 KB. На десятом ходу новых данных всего 10 KB, а повторно обработано уже 45 KB.
Каждое новое сообщение модель перечитывает всю переписку заново. Поэтому в одном длинном чате суммарно обработанные токены растут как O(n²). Новый чат на задачу — растёт линейно.
Длинный чат: на i-м сообщении обрабатывается i·t токенов (вся переписка). Сумма = t·n(n+1)/2. Новый чат: каждый раз ~t, сумма = n·t. Цена = токены ÷ 1e6 × тариф (сверху).
Источники: Anthropic — prompt caching (контекст пересчитывается каждый запрос). Квадратичность — механика, не из одной статьи.
Каждое сжатие (/compact, повторное резюме) — это пересказ пересказа. Часть фактов теряется на каждом шаге, как при многократном пересохранении JPEG. Жмите кнопку и смотрите, что выживет.
У каждого факта на каждом сжатии есть шанс выжить p. Ожидаемая доля после k сжатий ≈ p^k. Здесь выживание разыгрывается случайно — поэтому результат немного «живой».
Источники: Chroma — Context Rot. Потеря фактов — иллюстрация lossy-резюме.
U-образная кривая показывает вероятность вспомнить факт: у краёв она выше, в середине ниже. Двигайте длину контекста и позицию факта. Круглый маркер связан с ползунком и показывает выбранный факт на кривой. Чем длиннее контекст, тем ниже вся кривая, а цена одного прочтения растёт линейно.
recall ≈ (0.28 + 0.71·e^(−d/20K)) · (1 − 0.25·len/1М), где d — расстояние факта до ближайшего края. Длиннее контекст → середина дальше от краёв И весь уровень ниже. Числа иллюстративные, чтобы показать форму (Stanford «lost in the middle», Chroma «context rot»).
Источники: Stanford — Lost in the Middle, Chroma — Context Rot.
Сначала маршрут, потом экономия
Минимум для следующего хода.
Можно вернуть по ссылке или точным запросом.
Только доказанный шум и повторы.
Важное доказательство попало в DROP и больше не восстанавливается.
Экономия — это контекст, который больше не перечитывается на каждом ходу.
Потеря — важный сигнал, который нельзя восстановить.
Когда задача повторяется, можно каждый раз «думать заново» — но тогда почти каждый запрос тащит цикл отладки: модель ошиблась → правки → перечитывание → ещё токены и ваше время. Тестированная процедура (скилл или MCP) этот цикл убирает: дёшево, предсказуемо, без отладки. Главная экономия — именно на отладке и времени, а не только на токенах запроса.
сессий · 27 152 541 приблизительных token-equivalent обработано
Компоненты округлены отдельно: разница 16 token-equivalent.
Проценты Skills, MCP и Context Mode нельзя складывать: они затрагивают часть одних и тех же токенов.
Открыть наши примеры, данные и источникиAd-hoc за раз = A·(1 + отладка%). «Заново»: i·Aэфф. Скилл: B + i·c. Окупаемость N* = B/(Aэфф − c). Карточка «на отладку» = A·отладка%·n — это сгоревшие токены ПЛЮС ваше время (его в токенах не видно, но оно реально). Числа иллюстративные.
Источники: Экономика амортизации (не из статьи). Model Context Protocol — про MCP.
Один и тот же смысл на разных языках стоит разное число токенов. Английский — самый «дешёвый». Введите текст и сравните.
Общая шкала: 0–24 токена. Интервалы сравнимы напрямую.
Байты — точно (UTF-8). Токены — приблизительная оценка по типу письма (латиница ≈ 0.25 токена/символ, кириллица ≈ 0.5, иероглифы ≈ 1.0), а не настоящий BPE-токенайзер. Цена = токены × 1000 ÷ 1e6 × тариф (сверху).
Источники: Frontiers — токенизация, OpenAI Tokenizer (точный счёт).
А вы точно умеете писать промты?
Хороший промт собран из блоков. Кликай, чтобы выключать их по одному. Дротики — ответы модели: при полном промте они кучно в цели, без блоков разлетаются (тема и границы расплываются). Задача-пример: «Напиши на Python функцию валидации email с тестами».
Промтинг — это целая научная область: систематический обзор 2024 «The Prompt Report» (30+ авторов) собрал 58 техник промтинга и мета-анализ всей литературы. arXiv
У каждого блока свой вес: Задача 34%, Границы 20%, Контекст 16%, Формат 14%, Пример 10%, Роль 6%. «Точность» = сумма весов включённых блоков. Чем ниже — тем шире разлёт дротиков и больше переспросов. Веса иллюстративные, по практикам промтинга (не замеры).
Источники: Anthropic — prompt engineering.
Четыре разных статуса
Ожидание до измерения всей сессии.
Managed output в байтах · n=87 · P25 31% · P75 70%
11/87 при 90%+Перенос локального эффекта на всю сессию.
Оплачиваемые провайдером входные токены.
Общая шкала 0–100%: IQR 31–70%, медиана 46%; отдельно порог 90–100%.
Мост к полной сессии
Оценка сценария, не измерение счёта
Если managed output даёт 35–42% входа, локальная медиана 46% даёт примерно 16–19% для всей сессии.
Оплачиваемые токены провайдера: ещё не измерено.
Экономия проходит проверку качества
Экономия всей сессии 90% без сильной потери качества не показана.
Что делать завтра
Максимизируем полезный сигнал на токен, а не минимизируем контекст любой ценой.