На момент проверки официальный тариф Kimi K3 составляет 3 доллара за 1 000 000 входных токенов без кеша и 15 долларов за 1 000 000 выходных, а у GPT-5.5 — 5 и 30 долларов соответственно. Значит, Kimi K3 дешевле на 40% по обычному вводу и на 50% по выводу, но это только сравнение прайс-листов: реальный счёт зависит от кеша, длины контекста, повторов и количества успешных задач. (официальный тариф Kimi K3)
Кому стоит читать: командам AI SaaS с растущим числом запросов и необходимостью контролировать расходы на рассуждения. Техническим руководителям, выбирающим основную модель между Kimi K3 и GPT-5.5. Разработчикам Agent-систем, которые хотят использовать кеширование, маршрутизацию моделей и пакетную обработку.
Последнее обновление: 1 августа 2026 года. Цены и доступность сверены с официальными страницами моделей. GPT-5.5 следует рассматривать с учётом актуального статуса API: опубликованный тариф подходит для предварительного бюджета, но до появления стабильной производственной статистики его нельзя приравнивать к подтверждённому счёту в вашем проекте.
Цена API Kimi K3 и GPT-5.5: что именно сравнивается
Главная ошибка в подобных расчётах — складывать вход, кешированный ввод и вывод в одну «цену токена». Это разные категории начисления, и каждая должна считаться отдельно.
По опубликованным тарифам:
- Kimi K3: 3 доллара за 1 000 000 входных токенов без кеша;
- Kimi K3: 0,30 доллара за 1 000 000 входных токенов при попадании в кеш;
- Kimi K3: 15 долларов за 1 000 000 выходных токенов;
- GPT-5.5: 5 долларов за 1 000 000 входных токенов;
- GPT-5.5: 0,50 доллара за 1 000 000 кешированных входных токенов;
- GPT-5.5: 30 долларов за 1 000 000 выходных токенов.
Цены относятся к объёму токенов, а не к числу запросов. У Kimi K3 заявлено окно контекста в 1 000 000 токенов без отдельной ступени тарифа за длину контекста. Для GPT-5.5 при вводе свыше 272 000 токенов применяется повышающий коэффициент: полный сеанс тарифицируется по цене, увеличенной в 2 раза для ввода и в 1,5 раза для вывода. (официальная документация GPT-5.5)
Расчёт разницы выглядит так:
- обычный ввод:
(5 − 3) / 5 × 100 = 40%; - вывод:
(30 − 15) / 30 × 100 = 50%; - кешированный ввод:
(0,50 − 0,30) / 0,50 × 100 = 40%.
Поэтому ответ на вопрос о том, насколько Kimi K3 дешевле GPT-5.5, зависит от категории начисления. Утверждение «Kimi K3 в два раза дешевле» корректно только для выходных токенов при одинаковом объёме и сопоставимом результате. Для обычного входа разница составляет 40%, а для кешированного ввода — также 40%.
Почему одинаковое число токенов даёт разный счёт
Даже при одинаковом количестве запросов итог будет разным. Для оценки используйте формулу:
Стоимость вызова = (новые входные токены × цена ввода + кешированные токены × цена кеша + выходные токены × цена вывода) / 1 000 000
Эта формула не включает повторы, вызовы инструментов и ручную проверку. Их нужно добавлять отдельно, если вы считаете стоимость завершённой задачи, а не одного обращения к модели.
Вход преобладает
Допустим, на условный объём в 1 000 000 токенов приходится 900 000 входных и 100 000 выходных.
Для Kimi K3:
0,9 × 3 + 0,1 × 15 = 4,20 доллара
Для GPT-5.5:
0,9 × 5 + 0,1 × 30 = 7,50 доллара
Разница составляет 3,30 доллара на такой условный объём, или 44% относительно GPT-5.5. Она выше базовых 40%, потому что в сценарии присутствует 10% дорогого вывода, где разница тарифов достигает 50%.
Такой профиль характерен для классификации документов, извлечения полей, поиска по базе знаний и коротких ответов на длинный контекст. Здесь Kimi K3 обычно выглядит особенно привлекательно именно по прайс-листу.
Вывод преобладает
Теперь предположим 300 000 входных и 700 000 выходных токенов.
Для Kimi K3:
0,3 × 3 + 0,7 × 15 = 11,40 доллара
Для GPT-5.5:
0,3 × 5 + 0,7 × 30 = 22,50 доллара
В этом профиле Kimi K3 дешевле примерно на 49%. Такой расчёт важен для генерации больших отчётов, кода, многошаговых планов и Agent-ответов, где модель выдаёт значительный объём рассуждений или промежуточных результатов.
Но здесь нельзя ограничиваться тарифом. Увеличьте стоимость каждого варианта на число повторных попыток. Если Kimi K3 чаще возвращает неполный результат и требует дополнительной проверки, экономия на одном вызове будет уменьшаться.
Длинный диалог с повторяемым контекстом
В многошаговом Agent-сценарии системные инструкции, описание инструментов, структура репозитория и история задачи отправляются снова и снова. Если эта часть действительно попадает в кеш, ставка на повторяемый ввод снижается с 3 до 0,30 доллара у Kimi K3. Официальные материалы описывают кеширование как способ снизить расходы на повторно используемый контекст, но не обещают, что любой похожий запрос автоматически станет попаданием в кеш. (документация кеширования Kimi)
Предположим, из 1 000 000 входных токенов 800 000 пришли из кеша, а 200 000 были новыми. При 200 000 выходных токенов стоимость Kimi K3 составит:
0,8 × 0,30 + 0,2 × 3 + 0,2 × 15 = 3,84 доллара
Для GPT-5.5 при тех же долях:
0,8 × 0,50 + 0,2 × 5 + 0,2 × 30 = 7,40 доллара
Это уже не универсальная экономия «в десять раз»: дешёвая ставка применяется только к части входа. Итоговая разница зависит от объёма вывода, который у обеих моделей остаётся самым дорогим компонентом.
Когда кеширование действительно снижает расходы
Кеш имеет смысл, когда последовательные запросы сохраняют стабильный префикс. Например:
- системный промпт не меняется между вызовами;
- описание инструментов передаётся в том же порядке;
- кодовая база добавляется одинаковыми блоками;
- Agent продолжает одну сессию, а не создаёт новый контекст;
- промежуточная история не пересобирается каждый раз в другом формате.
Кеш почти не помогает, если приложение каждый раз меняет начало промпта, добавляет случайные инструкции, пересортировывает документы или обрезает историю с разных границ. В таком случае вы можете видеть большой объём входных токенов, но малую долю попаданий в кеш.
Для производственной оценки разделяйте в логах минимум четыре поля:
- новые входные токены;
- кешированные входные токены;
- выходные токены;
- количество повторных вызовов до успешного результата.
Не используйте среднюю теоретическую скидку вместо фактического распределения. Если кеширование даёт 70% попаданий, это не означает, что вся входная часть тарифицируется по низкой ставке. Оставшиеся 30% по-прежнему оплачиваются как обычный ввод, а каждый дополнительный вызов может повторно отправлять часть контекста.
Для длинных Agent-сессий полезно установить отдельный бюджет на контекст. Когда команда видит только сумму выходных токенов, она часто пропускает повторную передачу репозитория, схем API и истории действий. Именно эта часть способна сделать счёт заметно выше первоначальной оценки.
Стоимость успешной задачи важнее цены одного вызова
Тариф показывает цену использования модели, но бизнес платит за результат. Для сравнения применяйте другую формулу:
Стоимость успешной задачи = сумма всех вызовов + инструменты + повторные попытки + проверка человеком
В неё следует включить:
- первый запрос;
- вызовы функций и внешних инструментов;
- исправление неверного JSON или структуры ответа;
- повтор после тайм-аута;
- дополнительную генерацию, если ответ оказался слишком коротким;
- ручную проверку критичных результатов;
- расходы на маршрутизацию и мониторинг.
OpenAI указывает, что для GPT-5.5 поддерживаются Chat Completions, Responses API, function calling и структурированные ответы. Kimi K3 также заявляет поддержку ToolCalls, JSON Mode, структурированного вывода и автоматического кеширования контекста. Но одинаковый список возможностей не означает идентичное поведение: названия параметров, формат ошибок, ограничения инструментов и требования к схеме нужно проверять тестами. (возможности GPT-5.5 в API)
Не переносите результаты официальных тестов качества напрямую в финансовую модель. OpenAI публикует собственные оценки GPT-5.5 по программированию, инструментам и длинному контексту, однако эти тесты не являются прямым сравнением с Kimi K3 на вашем наборе задач. Без одинакового набора данных, одинаковых инструментов и одинакового лимита повторов нельзя честно заявлять, что одна модель дешевле «за готовый результат». (официальный анонс GPT-5.5)
Пример для AI SaaS
Представьте сервис, который анализирует обращение клиента, извлекает поля, вызывает внутренний инструмент и формирует ответ.
Если Kimi K3 делает задачу за один вызов, а GPT-5.5 также укладывается в один вызов, сравнивайте их по формуле токенов. Если одна модель требует два дополнительных вызова для исправления схемы или неверного аргумента инструмента, преимущество прайс-листа уже не отражает фактические расходы.
Для этого теста зафиксируйте:
- одинаковый набор входных обращений;
- одинаковые инструкции;
- одинаковые инструменты;
- одинаковый лимит выходных токенов;
- одинаковое число разрешённых повторов;
- одинаковый критерий успешного результата.
Только после этого сравнивайте стоимость одной принятой системой задачи. Это особенно важно для кода, финансовых документов, маршрутизации и других сценариев, где ошибка вызывает не просто новый запрос, а работу оператора.
Миграция между API: скрытая часть бюджета
Смена модели не сводится к замене строки с идентификатором. Перед переходом проверьте пять технических зон.
Формат запроса
Сравните поддержку Chat Completions и Responses API, структуру сообщений, системных инструкций, параметров генерации и обработки потокового ответа. GPT-5.5 официально доступен через оба основных текстовых интерфейса. Для Kimi K3 нужно проверить актуальный формат прямого API и совместимость используемой библиотеки.
Инструменты и функции
Проверьте имена функций, формат tool_choice, обязательность идентификаторов вызова и обработку нескольких инструментов в одном ответе. Даже если схема выглядит совместимой, различия могут проявиться при ошибке инструмента или частичном потоковом ответе.
Структурированный вывод
Сделайте отдельный набор тестов на обязательные поля, перечисления, вложенные объекты и отказ от лишнего текста. Для AI SaaS ошибка в JSON может привести к повторному вызову и увеличить стоимость токенов сильнее, чем небольшая разница в базовой цене.
Ограничения и лимиты
Сверьте размер контекста, максимальный вывод, ограничения частоты запросов и правила длинного ввода. У GPT-5.5 официально указано окно примерно в 1 050 000 токенов и максимум 128 000 выходных токенов, но ввод свыше 272 000 токенов тарифицируется по повышенной ставке. Такие условия должны быть отражены в маршрутизаторе, иначе длинные запросы неожиданно превысят бюджет.
План отката
Не удаляйте прежнюю интеграцию сразу. Оставьте возможность отправлять часть запросов на вторую модель, записывайте причины переключения и сравнивайте долю успешных задач. На практике короткий период двойного прогона дешевле, чем массовая миграция с последующим восстановлением производственной логики.
Для рабочих сценариев сначала вынесите провайдерские параметры в конфигурацию:
MODEL_PRIMARY
MODEL_FALLBACK
API_BASE_URL
MAX_OUTPUT_TOKENS
RETRY_LIMIT
CACHE_POLICY
Затем добавьте единый слой нормализации ответа. Он должен возвращать вашей бизнес-логике одинаковый формат независимо от выбранной модели. Это уменьшает стоимость обратного отката и позволяет оценивать каждую модель на одних и тех же метриках.
Чек-лист выбора модели
Перед изменением основного маршрута отметьте каждый пункт, который уже подтверждён вашими логами:
- [ ] Разделены новые входные, кешированные входные и выходные токены.
- [ ] Для каждого сценария рассчитана стоимость одного вызова.
- [ ] Отдельно посчитано количество повторов до успешного результата.
- [ ] Проверена фактическая доля попаданий в кеш, а не только заявленная цена кеша.
- [ ] Тестовый набор одинаков для Kimi K3 и GPT-5.5.
- [ ] Инструменты, структурированный вывод и ошибки JSON проверены на обеих моделях.
- [ ] Учтены длинные запросы, включая порог 272 000 входных токенов для GPT-5.5.
- [ ] Оставлен резервный маршрут на вторую модель.
- [ ] Определено правило переключения при превышении бюджета или доли ошибок.
- [ ] Стоимость сравнивается на одну успешную задачу, а не только на один API-вызов.
Решение принимайте по итогам списка:
- Если отмечены первые пять пунктов и Kimi K3 показывает меньшую стоимость успешной задачи, переводите на него ограниченную долю трафика.
- Если цена вызова ниже, но повторов или ошибок заметно больше, оставляйте двухмодельную схему и сначала исправляйте промпты, схемы инструментов и обработку ошибок.
- Если большая часть запросов использует длинный контекст, пересчитайте оба варианта с кешем и повышающими коэффициентами до утверждения бюджета.
- Если критичные пункты не проверены, не делайте полную миграцию: текущих данных недостаточно для безопасного решения.
Решение по типу проекта
Используйте следующие условия выбора, а не ориентируйтесь только на цену миллиона токенов.
-
Если у вас много входного контекста, короткий ответ и высокая повторяемость промпта — начните с Kimi K3. Потенциальное преимущество дают более дешёвый обычный ввод, низкая цена кеша и отсутствие отдельной ступени тарифа за длину контекста. Сначала подтвердите фактическую долю попаданий в кеш.
-
Если основная нагрузка — длинная генерация кода или документов — протестируйте обе модели на одинаковом лимите вывода. По тарифу Kimi K3 дешевле на 50%, но итог сравнивайте по числу принятых результатов и повторов.
-
Если Agent часто использует инструменты и критична стабильность схемы — не делайте полную миграцию до завершения регрессионного теста. Оставьте GPT-5.5 или текущую модель как резервный маршрут, пока не измерите ошибки функций, JSON и тайм-ауты.
-
Если большая часть запросов превышает 272 000 входных токенов — отдельно пересчитайте GPT-5.5 с повышающим коэффициентом. В таком профиле простое сравнение 3 против 5 долларов будет неверным.
-
Если вам нужна стабильная производственная служба с жёсткими требованиями к доступности — сравните не только тариф, но и лимиты, региональную обработку, мониторинг и процедуру отката. Дополнительные требования к региону обработки или уровню обслуживания должны быть включены в финансовую модель.
-
Если нагрузка пока непредсказуема — запускайте небольшой процент трафика на обеих моделях. После накопления логов принимайте решение по стоимости успешной задачи, а не по разнице между тарифными строками.
Пошаговая проверка перед миграцией
-
Соберите реальные логи за репрезентативный период. Разделите запросы по типам: короткий ответ, длинный контекст, код, инструменты, повторная попытка. Не смешивайте их в одну среднюю стоимость.
-
Посчитайте токены по категориям. Для каждого сценария сохраните вход, кешированный ввод, вывод и число вызовов. У Kimi есть отдельный инструмент расчёта токенов, который можно использовать до фактического запуска запроса. (инструмент расчёта токенов Kimi)
-
Подставьте данные в формулу. Сначала рассчитайте тарифную стоимость без повторов, затем добавьте среднее число вызовов до успешного результата.
-
Сделайте одинаковый тестовый набор. Используйте те же промпты, инструменты, ограничения вывода и критерии приёмки. Не сравнивайте результаты разных наборов задач.
-
Проверьте кеш отдельно. Зафиксируйте стабильный префикс, повторите вызовы и посмотрите фактическое соотношение кешированных и новых токенов. Не переносите теоретическую цену 0,30 доллара на весь ввод.
-
Проверьте длинный контекст. Отдельно прогоните запросы ниже и выше порога 272 000 токенов для GPT-5.5, чтобы увидеть влияние повышенного тарифа.
-
Запустите двойной маршрут. Отправляйте небольшой процент одинаковых задач двум моделям, но не раскрывайте команде только итоговую сумму. Сравнивайте качество, повторы, задержку, ошибки инструментов и стоимость принятого результата.
-
Зафиксируйте правило переключения. Например: если модель превышает установленную долю неуспешных задач или стоимость успешного результата выше бюджета, запрос уходит на резервную модель.
-
Пересмотрите бюджет после первых реальных данных. Предварительная оценка нужна для планирования, но решение о полной миграции принимайте только после появления фактических логов.
Если текущий вариант — локальная разработка на личном компьютере, у него есть три заметных минуса: окружение трудно воспроизводить для всей команды, фоновые Agent-тесты зависят от доступности конкретной машины, а долгие прогоны конкурируют с обычной разработкой. Покупка отдельного оборудования решает часть проблем, но добавляет первоначальные капитальные затраты и обслуживание.
Для короткого периода двойного тестирования можно рассмотреть аренду Mac mini для разработки или вариант Mac mini для удалённой работы в Kvmzen. Это не заменяет постоянную серверную инфраструктуру, но позволяет не привязывать проверку API к одному рабочему месту.
FAQ
Сколько стоит миллион токенов у Kimi K3 и GPT-5.5?
У Kimi K3 миллион входных токенов без кеша стоит 3 доллара, кешированный ввод — 0,30 доллара, вывод — 15 долларов. У GPT-5.5 официальная цена составляет 5 долларов за миллион входных и 30 долларов за миллион выходных токенов. Поэтому Kimi дешевле на 40% по обычному вводу и на 50% по выводу.
Насколько кеш снижает расходы на Kimi K3?
Теоретическая цена кешированного ввода Kimi K3 в десять раз ниже обычного: 0,30 вместо 3 долларов за миллион токенов. Но это не означает автоматическую экономию для каждого проекта. Сначала нужно измерить долю попаданий в кеш: повторяемый системный промпт, стабильный контекст репозитория и история Agent-сессии должны действительно переиспользоваться.
Что выгоднее при большом объёме вывода — Kimi K3 или GPT-5.5?
При одинаковом количестве выходных токенов Kimi K3 выгоднее по тарифу: 15 долларов против 30 долларов за миллион. Однако длинный ответ часто сопровождается дополнительными вызовами инструментов, проверками и повторными попытками. Если GPT-5.5 решает задачу с меньшим числом повторов, итоговые расходы на успешный результат могут оказаться ближе к цене Kimi, чем показывает тариф.
Можно ли заранее заложить бюджет GPT-5.5 до масштабного запуска?
Да, если считать бюджет как сценарную оценку, а не как подтверждённый счёт. Используйте опубликованные цены, затем добавьте кеш, длинный контекст, инструменты и повторы. После появления реальных логов пересчитайте стоимость успешной задачи и обновите финансовую модель.
Для практического решения сначала подставьте собственные объёмы в две формулы из статьи: стоимость токенов и стоимость успешной задачи. Затем проведите ограниченный двойной прогон Kimi K3 и GPT-5.5, прежде чем менять основной маршрут.
Если вам нужно регулярно запускать такие тесты и Agent-сценарии в отдельной среде, можно дополнительно оценить каталог удалённых Mac-сред Kvmzen.
Часто задаваемые вопросы
Сколько стоит миллион токенов у Kimi K3 и GPT-5.5?
У Kimi K3 миллион входных токенов без кеша стоит 3 доллара, кешированный ввод — 0,30 доллара, вывод — 15 долларов. У GPT-5.5 официальная цена составляет 5 долларов за миллион входных токенов, 0,50 доллара за кешированный ввод и 30 долларов за вывод. Поэтому Kimi дешевле на 40% по обычному вводу и на 50% по выводу.
Насколько кеш снижает стоимость Kimi K3?
Теоретическая цена кешированного ввода Kimi K3 в десять раз ниже обычного: 0,30 вместо 3 долларов за миллион токенов. Но это не означает автоматическую экономию для каждого проекта. Сначала нужно измерить долю cache hit в логах: повторяемый системный промпт, стабильный контекст репозитория и история Agent-сессии должны действительно переиспользоваться.
Что выгоднее при большом объёме вывода — Kimi K3 или GPT-5.5?
При одинаковом количестве выходных токенов Kimi K3 выгоднее по тарифу: 15 долларов против 30 долларов за миллион. Однако длинный ответ часто сопровождается дополнительными вызовами инструментов, проверками и повторными попытками. Если GPT-5.5 решает задачу с меньшим числом повторов, итоговая стоимость успешного результата может оказаться ближе к цене Kimi, чем показывает тариф.
Можно ли заранее заложить бюджет GPT-5.5 до начала масштабного запуска?
Да, если считать его бюджет как сценарную оценку, а не как подтверждённый счёт. Используйте опубликованные цены 5 долларов за миллион входных и 30 долларов за миллион выходных токенов, затем добавьте кеш, длинный контекст, инструменты и повторы. После появления реальных логов пересчитайте стоимость успешной задачи и обновите финансовую модель.
