Счёт, которого вы не ожидаете
Большинство людей, которые каждый день используют Claude или ChatGPT в работе, ни разу не смотрели, за что именно платят. Есть ежемесячная подписка или ключ API с балансом, который незаметно уменьшается, а цифра меняется - иногда медленнее, чем ожидаешь, иногда намного быстрее. Если вы когда-нибудь задавались вопросом, почему «лёгкая» неделя работы с AI обошлась дороже напряжённой, ответ почти никогда не в том, что AI «дорогой». Обычно дело в том, что именно вы отправляете, а не только в том, что вы спрашиваете.
В этой статье разбирается реальная математика - простым языком, без жаргона, - чтобы вы увидели, откуда на самом деле берётся стоимость и почему решение не в том, чтобы «меньше пользоваться AI», а в том, чтобы «перестать платить за повторное объяснение себя в каждом сообщении».
Токены простыми словами
Каждое отправленное вами сообщение и каждый полученный вами ответ разбиваются на небольшие фрагменты, называемые токенами. Если говорить очень приблизительно, один токен - это около трёх четвертей слова, поэтому 1 000 слов текста - это примерно 1 300-1 400 токенов. Короткие слова, распространённые фразы и код часто сжимаются до меньшего числа токенов на слово; редкие слова, форматирование и неанглоязычный текст могут использовать больше токенов.
Когда люди впервые задумываются об этом, их обычно сбивают с толку две вещи:
- Учитываются оба направления. И слова, которые набираете вы (входные данные), и слова, которые пишет в ответ AI (выходные данные), тарифицируются или учитываются в расходе. Подробный длинный ответ стоит дороже, чем ответ в одну строку, даже на один и тот же вопрос.
- Каждое сообщение повторно отправляет весь разговор. Именно этого почти никто не осознаёт, пока не увидит всё наглядно. У чат-моделей AI нет постоянной памяти между сообщениями, как у коллеги-человека. Чтобы сгенерировать ответ, который имеет смысл в контексте, системе приходится перечитывать весь разговор на данный момент - ваше первое сообщение, первый ответ системы, ваше второе сообщение, второй ответ системы и так далее - каждый раз, когда вы нажимаете кнопку отправки.
Почему «просто общаться» становится дороже по мере роста разговора
Вот что действительно важно. Представьте разговор, который начинается коротко и постепенно естественным образом разрастается, как это бывает в реальных рабочих обсуждениях:
- Сообщение 1: вы отправляете 200 слов контекста и получаете в ответ 150 слов.
- Сообщение 2: теперь система должна обработать сообщение 1 и ваше новое сообщение, а затем снова ответить.
- Сообщение 3: система повторно обрабатывает сообщения 1 и 2, а также ваше новое сообщение.
К десятому сообщению вы платите уже не за «один новый вопрос». Вы каждый раз платите за повторную передачу всего, что было до него. История разговора накапливается - она не сбрасывается и не сжимается сама по себе. Разговор из 20 сообщений не вдвое дороже разговора из 10 сообщений; из-за эффекта повторной отправки он может обойтись в несколько раз дороже, даже если фактический объём «нового» содержимого в каждом сообщении оставался примерно одинаковым.
Это расчёт для иллюстрации направления, а не таблица цен - провайдеры устанавливают и меняют собственные тарифы за токен, поэтому для получения точных цифр по вашему тарифу всегда проверяйте актуальные опубликованные цены на сайте провайдера (anthropic.com или openai.com). Но механизм работает независимо от тарифа: даже небольшая стоимость токена, умноженная на растущую историю разговора, быстро накапливается. Тариф - не главный рычаг. Главное - объём повторно отправляемого текста.
Где на самом деле возникает перерасход
А теперь добавим то, как большинство людей на самом деле работает. Обычный специалист интеллектуального труда, выполняющий задачи с AI - составляющий письма, резюмирующий звонки, анализирующий электронную таблицу, пишущий краткое описание или проверяющий пункт договора, - не начинает каждую задачу с чистого листа. Он каждый раз заново объясняет:
- «Ты опытный специалист в области [role]. Выступай как старший специалист по [X]. Вот голос нашего бренда / контекст нашей команды / наши предпочтения по форматированию...»
- Информация о компании, проекте, аудитории и ограничениях.
- Те же инструкции о тоне и стиле, которые человек вводил вчера и позавчера.
Ничто из этого не является «новой» информацией для текущей задачи - это шаблонный текст. Но поскольку его заново вводят в окно чата (или, что ещё хуже, постепенно накапливают в одном длинном бессвязном разговоре), он учитывается, повторно отправляется и снова оплачивается каждый раз.
Наглядный пример: 10 задач в день, два разных подхода
Сравним два подхода к одному рабочему дню - 10 задач с AI, в каждой из которых AI должен выступать в роли конкретного специалиста (например, маркетингового аналитика, изучающего показатели кампании, или операционного менеджера, совершенствующего документ с описанием процесса).
Подход A: разовые повторно введённые prompts
Каждая из 10 задач начинается с того, что человек заново вводит (или копирует из старого документа) абзац или два с описанием роли: «Ты старший маркетинговый аналитик, специализирующийся на атрибуции и окупаемости кампаний. Проанализируй следующие данные и предоставь мне структурированное резюме с рекомендациями...» Затем идёт сама задача. После этого часто следует пара уточняющих сообщений в той же ветке, каждое из которых повторно отправляет весь предыдущий текст. Если повторить такую схему с шаблонными инструкциями и уточнениями для 10 отдельных задач, получается, что вы снова и снова платите за практически одни и те же инструкции - десятки раз в течение каждого дня.
Подход B: лаконичная настройка на основе файла навыка
Роль, тон, стандарты и метод работы один раз тщательно оформляются в компактный системный prompt - «файл навыка» - и загружаются в начале сессии вместо повторного ввода. Эти инструкции задаются заранее, остаются лаконичными (без многословия и повторов) и используются в каждой задаче для этой роли. Человек просто формулирует задачу. Не нужно заново объяснять, кем должен быть AI, как форматировать ответы и что считается «хорошим результатом» - всё это уже кратко зафиксировано в начале.
Разница в подсчёте токенов связана не с тем, что AI «работает усерднее» в подходе B, а с тем, что повторяющаяся шаблонная часть каждого сообщения значительно сокращается. Меньше шаблонного текста повторно отправляется с каждым сообщением, в каждой задаче, каждый день - и это быстро накапливается, как и проблема роста беседы, только в противоположном направлении.
Готовый системный prompt, который превращает Claude или ChatGPT в старшего маркетингового аналитика: ROI кампаний, атрибуция и стандарты отчётности фиксируются один раз, поэтому вам не приходится каждый раз заново объяснять роль при добавлении новых цифр.
Посмотреть Rafa - специалист по маркетинговой аналитике →Почему хорошо составленный файл Skill лучше ситуативного prompt
Не все «многоразовые prompts» решают эту проблему. Раздутый, слишком общий системный prompt - пять страниц расплывчатых инструкций «на всякий случай» - может быть столь же расточительным, как и повторный набор текста, потому что это всё равно шаблонный текст, который повторно отправляется в каждом сообщении; просто он вставляется один раз вместо того, чтобы каждый раз набираться заново. На самом деле важна краткость: файл Skill, в котором точно указано, какова роль, как именно форматировать результат и что именно означает «готово», - и больше ничего; он задаётся в начале один раз за сессию.
В этом и заключается настоящее отличие файла Skill от свободного prompt, который приходится постоянно переписывать: дело не только в удобстве, а в том, что повторяющаяся часть каждого отправляемого вами сообщения навсегда сокращается на протяжении всей рабочей сессии.
Настраивает Claude или ChatGPT как старшего менеджера по операционной деятельности: встроенные SOP, аудиты процессов и фреймворки приоритизации позволяют начинать каждую новую задачу без лишних объяснений рабочего контекста с нуля.
Посмотреть Owen - менеджер по операционной деятельности →Практические привычки, которые действительно дают результат
Независимо от того, каким инструментом или планом вы пользуетесь, несколько привычек снижают «скрытый налог на повторную отправку» эффективнее всего остального:
- Начинайте новые задачи в новых беседах, а не складывайте всё в одну постоянно растущую ветку. В новой сфокусированной беседе история повторно отправляется с каждым сообщением в гораздо меньшем объёме.
- Один раз кратко задайте роль и контекст в начале, вместо того чтобы каждый раз заново объяснять их внутри самой задачи.
- Делайте инструкции в начале сообщения краткими. Длинный и расплывчатый системный prompt всё равно повторно отправляется - сократите его до того, что действительно меняет результат.
- Запрашивайте именно ту длину ответа, которая вам нужна. Выходные токены тоже учитываются, поэтому «дай мне структурированное резюме» обычно стоит дешевле, чем открытый запрос «расскажи мне всё об этом».
- Проверяйте текущие опубликованные цены напрямую у своего провайдера, если хотите точно рассчитать собственные расходы: тарифы и модели меняются, поэтому точные цифры лучше подтверждать у первоисточника, а не брать из сторонних оценок.
Настроенный навык agent для операционных задач, рассчитанный на регулярную структурированную работу - он помогает сохранять инструкции компактными и единообразными, вместо того чтобы они разрастались с каждым новым запросом.
Посмотреть Arthur - AI Operations Agent →Укажите, как вы (или ваша команда) на самом деле используете чаты с AI, и получите реальную оценку ежемесячных потерь токенов и расходов в долларах при повторном вводе промптов по сравнению с постоянным файлом навыка. Регистрация и электронная почта не нужны - только расчёт по вашей ситуации на основе данных из этой публикации.
Попробуйте калькулятор →ЧАСТО ЗАДАВАЕМЫЕ ВОПРОСЫ
Я действительно плачу за ответы AI, а не только за свои сообщения?
Да. Учитываются и отправленные вами данные, и полученный ответ. Модель, которая по умолчанию пишет длинные, подробные ответы, использует больше выходных токенов, чем модель, которая отвечает кратко и по существу, - даже на один и тот же вопрос.
Почему длинный диалог обходится гораздо дороже короткого при одинаковой задаче?
Потому что большинство чат-сервисов с AI сами по себе не сохраняют память между сообщениями - чтобы осмысленно ответить на сообщение 20, системе приходится заново обрабатывать первые 19 сообщений (и свои первые 19 ответов) вместе с ним. История диалога каждый раз отправляется целиком, поэтому расходы обычно растут гораздо быстрее, чем сама длина диалога.
Файл навыка - это просто красивое название для сохранённого промпта?
Функционально - да, это системный промпт или инструкция проекта, которую вы пишете один раз и используете повторно. Хороший файл навыка отличается от промпта, набранного на ходу, дисциплиной: в нём точно и кратко указаны роль, стандарты и формат вывода, поэтому доля «шаблонного» текста, повторно отправляемого с каждым сообщением, остаётся минимальной и при этом выполняет свою задачу.
Стоит ли мне беспокоиться о точных суммах в долларах или достаточно сосредоточиться на подходе?
Сначала сосредоточьтесь на самом подходе - сокращение повторяющегося контекста и начало новых диалогов для новых задач снизят ваше использование независимо от того, какой окажется стоимость токена в этом месяце. Если вы хотите точно рассчитать расходы для своего объёма, возьмите актуальные опубликованные тарифы на странице с ценами вашего провайдера и сопоставьте их со своим обычным количеством сообщений.
Кратко:
Стоимость токенов при ежедневной работе с AI гораздо сильнее зависит от постоянно повторяющегося шаблонного контекста, чем от самой тарификации за токен - каждое сообщение повторно отправляет весь диалог, поэтому промпты, набранные на ходу, быстро увеличивают расходы. Краткий, продуманно составленный файл навыка, такой как Rafa или Owen, сокращает эти потери, загружая роль один раз и в сжатом виде, вместо того чтобы заново объяснять её в каждом сообщении.


