Главная / Дневник / № 11
· эссе · AI · август 2026 ·

Вечер резал инструкции. Одно чтение файла съело результат шесть раз

Все советы по экономии токенов бьют в 2% расхода: они про ответ модели, а горит контекст. Посчитал на своих замерах, где деньги на самом деле — и почему скилл для экономии контекста стоит дороже, чем экономит.

Олег Мифтахов 19 августа 2026 · 5 мин · № 11

Позавчера вечером я потратил пару часов на то, чтобы ужать файлы инструкций для агента. Вынес что можно в отдельные модули, срезал дубли, развёл противоречия. Экономия — три тысячи токенов на каждой сессии. Был собой доволен.

На следующий день замерил, сколько весит одно чтение обычного рабочего файла. Файл оркестратора, 62 тысячи символов: 18 795 токенов.

То есть весь мой вечер — это 0,16 одного чтения. Одно неосторожное открытие большого файла съедает результат шести таких вечеров.

Работа была правильная: стартовый вес платится в каждой сессии, его надо резать. Но узкое место было не там — и осталось незакрытым ещё на сутки.

Все советы бьют в два процента расхода

Дальше я сел считать, куда вообще уходят деньги в рабочей сессии.

Соотношение вход/выход — примерно 50:1 и хуже. Полмиллиона токенов контекста уезжает на вход каждый ход, ответ — пять-десять тысяч.

А теперь посмотрите на список того, что обычно советуют. «Отвечай коротко». «Пиши компактный код». «Убирай комментарии». «Сокращай промпты». Всё это — про выход. Про те самые два процента.

Экономия на спичках при работающем на полную отоплении.

Шесть советов, которые не работают

«Отвечай коротко, без предисловий». Экономит выход. При этом само правило висит в файле инструкций постоянно — 200-500 токенов в каждой сессии, навсегда, — чтобы срезать пару сотен токенов ответа. Точка окупаемости недостижима математически. Плюс терсость режет качество: пропущенная деталь стоит часа разбирательства.

«Пиши компактный код, убирай комментарии». Код пишется один раз по цене выхода ($25 за миллион токенов) и читается десятки раз по цене входа ($5, а из кэша — 50 центов). Сэкономил 500 токенов при генерации — платишь за нечитаемость при каждом следующем чтении. Удалённый комментарий это удалённый контекст: в следующей сессии агент задаст про него вопрос, который обойдётся дороже самого комментария.

«Сокращай слова, пиши телеграфным стилем». Токенайзер не линеен по символам: сокращения и рубленый синтаксис часто дробятся на большее число токенов, чем целые слова. Но даже в идеальном случае — срезать пять тысяч символов промпта это примерно полторы тысячи токенов, то есть $0,00075. Три четверти десятой цента.

«Не подключай сторонние инструменты, они жрут контекст». Полуправда, устаревшая. Схемы инструментов действительно весили десятки тысяч токенов — но появилась отложенная загрузка: в контекст попадают только имена, а схема подтягивается, когда инструмент реально понадобился. В сессии, где я собирал эти замеры, так отложено около двухсот инструментов. Правильный ход — не выключать, а включить отложенную загрузку.

«Поставь скилл для экономии контекста». Вот это моё любимое. Скилл — это файл, который грузится. Правило про экономию стоит дороже, чем экономит.

Живой пример из моих проектов: четыре правила, у которых не было указано, к каким файлам они относятся, грузились в каждую сессию целиком. 37 тысяч токенов на сессию, двадцать пять дней подряд. По всем проектам суммарно под 87 тысяч. Нашлось случайно, а не проверкой.

Мораль обратная общепринятой: опасность не в том, что у тебя мало правил про экономию, а в том, что они есть и грузятся всегда.

«Бери модель поменьше». Экономия примерно пятикратная. Отбивается ровно до первой пропущенной ошибки: час моего разбирательства — это $200, то есть около восьмисот ходов на старшей модели.

Что работает на самом деле

По убыванию эффекта.

Не читать файлы в главный контекст. Разведку «где что лежит» отдавать субагенту: он возвращает вывод, а не дамп файла. Замер: чтение вчерашнего рабочего журнала целиком — 4410 токенов; те же данные, взятые двумя точечными выборками, — около 1600. В 2,8 раза меньше. Если бы хватило одних заголовков — сотня токенов, то есть в 44 раза.

Границы задач: чистить контекст и держать журнал. Стоит ноль. Работает потому, что суть работы лежит на диске, а не в контексте.

Условная загрузка правил — та самая, которой у меня не было и которая стоила 37 тысяч токенов на сессию.

Отложенная загрузка инструментов.

Не ломать префикс кэша. Чтение из кэша стоит десятую долю обычного входа, поэтому накопленный багаж в живой сессии почти бесплатен. Ломает кэш любое изменение в начале контекста: таймстемп в системном промпте, несортированный JSON, меняющийся набор инструментов.

И только потом — резать статику инструкций. Делать надо, но это единицы тысяч токенов. Последняя строчка списка, а не первая.

Отдельно: стоит ли сжигать контекст

Интуиция такая: в раздутой сессии даже короткий вопрос тащит за собой весь багаж, значит надо чаще его схлопывать.

Механически верно, экономически — нет. Считаем.

Отсюда два вывода, которые мне были неочевидны.

Схлопывание контекста — это два обычных хода, заплаченных авансом. Оно окупается с третьего-четвёртого хода после. Сделать его ради одного короткого вопроса — заплатить пятьдесят центов, чтобы сэкономить двадцать три. Просто спроси.

Очистка плюс журнал — это бесплатная версия того же самого. Схлопывание покупает ровно одно: детали, которых в журнале нет. Если суть работы дописана на диск, платить за неё второй раз незачем.

Кстати, вот почему схлопывание думает две-три минуты. Это полноценный запрос с генерацией текста. Медленно не потому, что жжёт вход, а потому что пишет выход — самый дорогой вид токенов.

Единица измерения — не токен

Час моего времени стоит $200. Ход в раздутой сессии — двадцать пять центов. Ошибка из-за урезанного ответа — час.

Отсюда правило, обратное всей экономящей литературе: когда сомневаешься — читай больше, проверяй больше, думай дольше. Сжечь в десять раз больше токенов, чтобы сэкономить себе час, — это двести долларов выигрыша за доллар расхода.

И последнее, про доверие к цифрам

Сегодня, добавляя в инструкции новое правило, я оценил его на глаз в девяносто токенов. Замерил — двести десять. Ошибка в 2,3 раза на тексте из одиннадцати строк.

Ещё две цифры в этом посте я тоже сначала назвал на глаз, а потом правил после проверки. Каждый раз мимо в два-четыре раза.

Так что когда в следующий раз увидите гайд по экономии контекста — спросите первым делом, чем замерено. Свои цифры я считал по символам с калибровкой 3,3 символа на токен, потому что точного счётчика под рукой не было. Погрешность около десяти процентов, на выводы не влияет: там разы и порядки, а не проценты. Цены — за старшую модель, на середину августа 2026.

#AI #вайбкодинг #Claude Code #экономика
Обсудить в Telegram →