Цена токена действительно быстро падает, но из этого не следует, что агентная автоматизация стала пропорционально дешевле или автоматически выгодна. Это две разные экономические величины. Один чат-ответ — короткая операция «прочитал — ответил». Агент же планирует, вызывает поиск и корпоративные системы, читает результаты инструментов, хранит и снова передаёт контекст, рассуждает, исправляет ошибки и иногда передаёт работу человеку. Поэтому управлять нужно не ценой миллиона токенов, а стоимостью успешно завершённой бизнес-задачи (cost per completed task).

Это не отрицание прогресса. Независимые данные Artificial Analysis и Epoch AI фиксируют резкое удешевление инференса при сопоставимом качестве. Но сами исследователи Epoch отдельно предупреждают: число токенов, необходимое для результата, существенно различается между моделями и задачами; динамика цены токена не тождественна динамике стоимости оценки или работы. Artificial Analysis, Epoch AI.

1. Две разные кривые: удельная стоимость токена против стоимости агентной работы

$/1M токенов — тариф поставщика на вход, выход и иногда кэш. Он нужен для прогноза API-счёта, но не измеряет ценность и даже не описывает полный расход одной задачи.

Cost per completed task — полная стоимость попыток, закончившихся корректным и принятым бизнес-результатом. В знаменателе должны быть именно принятые задачи, а не все запуски, ответы модели или «закрытые» ею тикеты. Иначе ретраи, эскалации и ошибочные действия искусственно улучшают картину.

Полезная операционная формула:

CPCT = (C_API + C_tools + C_runtime + C_quality + C_HITL + C_failures) ÷ N_принятых завершённых задач

Здесь C_failures включает стоимость повторов, откатов и исправления последствий, а не только повторный вызов модели. Для сравнения поставщиков следует фиксировать один и тот же harness: набор задач, права инструментов, лимит шагов, модель проверки, критерий приёмки и правила эскалации. Сравнение только прайсов смешивает разные уровни интеллекта, длины контекста и доли вывода.

Громкий тезис «токены подешевели на 80%» допустим лишь с оговоркой: это может быть верно для конкретного диапазона качества, периода и смешанного соотношения input/output. Это не единый индекс рынка и не прогноз экономии агентного проекта. Флагманские модели не следует помещать в одну ценовую строку с дешёвыми моделями с открытыми весами.

2. Тарифная карта осени 2026 года

Ниже — публичные стандартные цены API на дату обновления, USD за 1 млн текстовых токенов. Это снимок тарифов, а не рекомендация выбирать модель по цене: прайсы меняются, а качество и количество токенов на результат различаются.

Уровень

Примеры

Ввод / вывод

Что важно для бюджета

Флагманы

xAI Grok 4.6

$2 / $6

200 тыс. токенов

Флагманы

OpenAI GPT-5.6 Sol; GPT-6 Astra

$4 / $20; $10 / $50

Sol — временная промо-ставка; Astra на момент обновления доступна в ограниченном enterprise-доступе.

Флагманы

Claude Opus

Проверять в актуальном прайсе Anthropic

Это дорогой класс для задач, где выигрыш в вероятности успеха оправдывает стоимость.

Рабочие

OpenAI GPT-5.6 Terra

$2 / $12

Сбалансированный уровень; reasoning и tool-loop по-прежнему могут дать высокий расход.

Рабочие

Claude Sonnet; Gemini Flash

Проверять регион и версию

У Gemini стоимость search/grounding вынесена отдельно; у Claude есть отдельная цена записи и чтения кэша.

Эконом-класс

DeepSeek; открытые веса

Не единый тариф

Цена DeepSeek зависит от версии, cache hit/miss и peak/off-peak. У открытых весов API-прайс заменяется стоимостью GPU, сети, эксплуатации и резерва мощности.

Ставки Grok 4.6 и его long-context порог опубликованы в документации xAI; модельная страница подтверждает $2 за ввод и $6 за вывод. Для OpenAI ориентиром служат каталог моделей и тарифная карта. Актуальные условия Claude — в прайсе Anthropic, Gemini — в прайсе Google, DeepSeek — в прайсе API.

Prompt caching: скидка не равна скидке на запрос

Кэш снижает цену только для той части входного контекста, которая реально совпала с допустимым префиксом, попала в срок жизни кэша и была маршрутизирована к нужному кэшу. Выход, reasoning-токены, новый хвост промпта, поисковые запросы и вызовы инструментов от этого не становятся бесплатными.

Поставщик

Экономика cache hit

Важные условия

OpenAI

Скидка на кэшированный ввод зависит от модели: 50–90%; у GPT-5.6 — 90%

Нужны повторяющийся префикс и попадание; cache write для GPT-5.6 тарифицируется с коэффициентом 1,25 к обычному вводу.

Anthropic

Чтение кэша — 10% базовой цены ввода, то есть скидка 90%

Запись дороже базового ввода: 1,25× для 5 минут и 2× для часа.

xAI Grok 4.6

$0,50 вместо $2 за 1M короткого входа — скидка 75%

prompt_cache_key

x-grok-conv-id

DeepSeek

До 90% на cache hit

Автоматический кэш не обещает 100% попаданий; miss оплачивается по полной входной ставке.

Например, если агент передаёт 100 тыс. входных токенов, но в кэш попало 70 тыс., скидка применяется к 70 тыс., а не ко всему запросу. Финансовая модель должна считать фактические cached_input_tokens, cache writes и misses из usage-логов, а не применять «90%» ко всему входу. Подробнее: OpenAI, Anthropic, xAI, DeepSeek.

3. Парадокс Джевонса в агентной инженерии

Парадокс Джевонса здесь проявляется так: более дешёвый токен делает рациональными более длинные и сложные цепочки — и общий расход растёт. Падение цены единицы может расширить объём потребления быстрее, чем снизится цена.

Типичный агент расходует в 10–50 раз больше токенов, чем одиночный ответ, когда выполняет несколько ReAct-циклов: планирует, получает результат инструмента, переосмысливает план и действует снова. Это проектный диапазон для нагрузочного профилирования, а не универсальная константа. В сложной агентной разработке ПО разница с коротким чат-запросом может исчисляться сотнями и тысячами раз: контекст репозитория, тестовые логи, повторные патчи и запуск среды кратно увеличивают счёт. Его нельзя переносить на FAQ или классификацию документов.

Основные механизмы роста:

  • инструментные циклы: один пользовательский запрос превращается в серию model → tool → model;
  • раздувание и повторная передача контекста: результаты поиска, документы, логи и история беседы становятся новым входом;
  • reasoning-токены и параллельные/подагентные ветки;
  • ретраи из-за таймаутов, недетерминированных инструментов, ошибок формата и неуспешной проверки;
  • цена внешнего действия: поиск, браузер, CRM, база данных, кодовая песочница и человеческая эскалация.

Gartner называет это Inference Paradox: для агентной reasoning-задачи затраты провайдера на инференс по сравнению с базовым чат-ботом возрастают как минимум в пять раз и часто сильнее с ростом сложности; к 2028 году Gartner ожидает рост inference cost на агентный workflow более чем в пять раз. Аналитик также рекомендует переходить от cost per request к cost per result. Gartner, август 2026, Gartner, cost-per-result.

Следовательно, формулировки «5–30× токенов» или «до 150× дороже» нельзя использовать как гарантированную норму без первичной методики: цена зависит от модели, harness, длины истории, ставок инструментов и доли успешных попыток. Их место — в диапазоне сценариев sensitivity analysis, а не в обещании ROI.

4. Полная структура TCO агентной системы

Для периода t совокупная стоимость владения удобна в следующем виде:

TCO(t) = C_model + C_tools + C_runtime + C_data/security + C_observability/evals + C_HITL + C_change + C_incidents

Блок

Что включить в расчёт

Модель

Ввод, кэшированные входы, cache writes, вывод, reasoning, ретраи, длинный контекст, квоты и надбавки сервиса.

Инструменты и grounding

Платный web/search, запросы к корпоративным API, лицензии на данные, комиссии провайдеров. Не все tool calls входят в стоимость токена.

Runtime

Песочницы, контейнеры/microVM, CPU/GPU, хранилище, сеть, очереди, секреты и резерв мощности.

Надёжность и контроль

Трейсинг, логи, мониторинг, eval-наборы, red teaming, тестовая среда, аудит и защита от prompt injection.

HITL

Разметка, выборочная проверка, утверждение, обработка исключений, обучение и время риск-/функциональных экспертов.

Ошибки и изменения

Ретраи, rollback, компенсации клиентам, расследования, обновление промптов/интеграций и управление изменениями.

HITL — не сноска к TCO. В анализе McKinsey для agentic workflows человеческий надзор составляет 70–75% переменных затрат; доля зависит от процесса и в регулируемых сценариях может быть особенно высокой. Это не означает, что каждый проект имеет именно такую долю, но означает, что исключать экспертов из модели недопустимо. McKinsey: economics of agentic workflows.

5. Когда агент окупается: условия положительного ROI и риск закрытия пилотов

Финансовая формула должна опираться на реализованный, а не номинальный эффект:

ROI = (B_realized − TCO) ÷ TCO × 100%B_realized = избежанные затраты + маржинальная выручка − стоимость ухудшений

«Сэкономленные часы» становятся выгодой только если организация действительно сокращает внешний расход, увеличивает пропускную способность с подтверждённой маржой или направляет высвобождённое время на измеримую ценность. Нельзя одновременно записать одну и ту же экономию в снижение ФОТ и в рост выручки.

Признаки положительного кейса

Признаки дорогого/хрупкого пилота

Высокий объём повторяемых, стандартизированных задач; чёткое определение «готово».

Непредсказуемый процесс, много исключений, расплывчатая приёмка.

Роутинг 80/20: большинство запросов решает дешёвая модель, флагман — только сложную долю.

Каждая задача без разбора идёт на самый дорогой reasoning-маршрут или к команде подагентов.

Стабильный общий префикс, измеренный высокий cache-hit rate, ограниченный контекст.

История бесконтрольно растёт; кэш не попадает; каждый шаг заново читает документы.

Низкая цена ошибки, обратимые действия, ограниченные права, прозрачная эскалация к человеку.

Необратимые финансовые/правовые действия, дорогая ошибка, отсутствие владельца исключений.

Базовый процесс измерен до запуска; есть holdout и стоп-правила.

ROI считают по демо, без baseline, без стоимости проверки и поддержки.

Практический критерий полезности: ожидаемый выигрыш от успешной задачи должен превосходить CPCT и ожидаемый ущерб от ошибок. McKinsey формулирует проверку ещё строже: агент добавляет ценность, когда вероятность успеха выше отношения времени проверки человеком ко времени самостоятельного выполнения человеком. McKinsey: cost versus value.

Универсальных «ROI 420%» для поддержки, кода или счетов не существует: без объёма, периода, базы сравнения, acceptance rate, стоимости контроля и методики атрибуции это маркетинговые числа. Более трезвый ориентир — исследование IBM 2023 года: средний ROI enterprise AI initiatives составлял 5,9%, а лидеры — 13%; это не оценка именно агентов и не прогноз на 2026 год. В более свежем опросе IBM лишь 25% инициатив достигли ожидаемого ROI, а 16% масштабировали AI по предприятию. IBM, 5,9%, IBM, 2026. McKinsey также сообщает, что большинство компаний остаются в эксперименте или пилоте, а enterprise EBIT-эффект наблюдают не все. State of AI 2025.

Перед масштабированием нужны: baseline CPCT и качества, недельный/месячный лимит бюджета, распределение стоимости по маршрутам, cache-hit rate, доля ретраев, процент HITL, acceptance rate, стоимость инцидента и заранее согласованные критерии остановки. Так риск непредвиденного opex становится измеримым, а не сюрпризом после пилота.

Корпоративный дашборд аналитики автономных агентов и метрики ROI

6. Аппаратные драйверы: Groq LPU и Cerebras WSE-3 — это задержка, а не бесплатные вычисления

Специализированные ускорители меняют прежде всего latency per token и предсказуемость инференса. В GroqChip заявлены 230 МБ SRAM на кристалле и до 80 ТБ/с пропускной способности памяти на кристалле; это полезно для детерминированной, низколатентной генерации. GroqChip Product Brief.

Cerebras WSE-3 объединяет вычисления и 44 ГБ памяти на пластине; Cerebras указывает до 21 ПБ/с агрегированной пропускной способности. Но для моделей, которые не помещаются на одной пластине, компания сама описывает разбиение по слоям на несколько CS-3 систем. Cerebras. Это иллюстрирует важное ограничение: SRAM/память на кристалле конечна, а большие веса, KV-cache, отказоустойчивость и пропускная способность требуют кластеров.

Поэтому Groq LPU и WSE-3 не отменяют доминирующую роль GPU в масштабном обучении и во многих гибких inference-нагрузках. Они могут улучшить пользовательскую задержку, но не обнуляют стоимость модели, инструментов, песочниц, контроля качества или человеческого участия. Выбор железа следует сравнивать по SLA, throughput при реальной смеси запросов, цене успешной задачи и стоимости кластера — не по одному показателю токенов в секунду.

Вывод

Дешёвый токен — хорошая новость для единицы вычисления, но слабый прокси для экономики агента. Рентабельность появляется там, где есть дисциплина маршрутизации, кэш с измеряемыми попаданиями, ограниченный и воспроизводимый workflow, недорогая ошибка и доказуемо снижающаяся стоимость завершённой задачи. Там, где агент бесконечно читает контекст, повторяет инструменты и всё равно требует дорогой проверки, снижение API-тарифа может лишь позволить системе тратить больше.

Первичные источники и методологические ориентиры