Я отправил одни и те же задачи по программированию в Kimi K2.7 Code и Claude Opus 4.8 через один API и измерил результаты. По корректности они сравнялись: оба успешно разобрали ловушку с приоритетом SemVer и скрытую ошибку при слиянии интервалов. Но Opus отвечал в 3–9 раз быстрее, используя в четыре раза меньше выходных токенов, тогда как Kimi стоил примерно на 46% дешевле за задачу по базовому прайсу. Так что выбор не в том, какая модель «умнее». Если вы выполняете чувствительную к стоимости или пакетную работу по коду, Kimi K2.7 выигрывает по цене. Если вам нужна низкая задержка, контекст на 1M токенов или модель для финальной проверки, которой вы доверяете, Opus 4.8 стоит переплаты, и многие команды в итоге распределяют задачи между ними.
Практика: я прогнал одни и те же задачи по программированию через обе системы
Как я тестировал: ID моделей kimi-k2.7-code и claude-opus-4-8, вызванные через одну конечную точку шлюза, совместимого с OpenAI, 2026-07-13, по одному запросу на задачу с параметрами по умолчанию и без кэширования промптов. Задержка измерялась на стороне клиента по реальному времени, поэтому она включает сетевое время и время в очереди, а не только генерацию. Перед оценкой я попросил каждую модель идентифицировать себя для проверки корректности: Kimi ответила «made by Moonshot AI», Opus — Anthropic; это проверка маршрутизации, а не доказательство версии. Это выборка из двух задач, а не бенчмарк. Она показывает поведение, которое можно ощутить; она не может измерить многоходовую agentic-производительность.
Задание 1 попросило каждую модель реализовать функцию compare_semver() в соответствии со спецификацией SemVer 2.0.0, включая ту часть, в которой ошибается большинство реализаций: приоритет pre-release, где 1.0.0-alpha.1 < 1.0.0-alpha.beta, числовые идентификаторы ранжируются ниже буквенно-цифровых, и beta.11 > beta.2 сравнивается численно, а не по строковому порядку. Я оценивал каждый ответ по матрице из 72 сравнений, построенной на каноническом порядке спецификации. Задание 2 передало с багом функцию merge_intervals(), реальный дефект которой заключался в last[1] = cur[1] вместо max(...), строке, которая незаметно проглатывает полностью вложенный интервал вроде [1,10],[2,3]; я оценивал по 5 случаям, включая этот вложенный интервал.

Метрика | Kimi K2.7 Code | Claude Opus 4.8 |
|---|---|---|
Корректность задачи 1 (72 приоритета + крайние случаи) | 72/72 | 72/72 |
Корректность задачи 2 (5 случаев, включая содержащийся интервал) | 5/5 | 5/5 |
Задержка задачи 1 (на стороне клиента) | 49.1s | 5.3s |
Задержка задачи 2 (на стороне клиента) | 11.5s | 7.6s |
Токены задачи 1 (вход / выход) | 172 / 1,907 | 774 / 418 |
Стоимость задачи 1 (родная розничная цена) | $0.0078 | $0.0143 |
Стоимость рассчитывается по приведённым выше количествам токенов по базовым прайс-листовым ценам (Kimi $0.95/$4 за миллион входных/выходных, Opus $5/$25): Kimi = 172×$0.95/M + 1,907×$4/M ≈ $0.0078; Opus = 774×$5/M + 418×$25/M ≈ $0.0143. Количество входных токенов различается (172 против 774) потому, что токенизатор каждой модели и учёт на шлюзе по-разному подсчитывают один и тот же запрос, а не потому, что задачи были разными. Обе модели выдали полностью корректный код по обеим задачам. Разница была в том, как они к этому пришли. Opus был кратким и быстрым, вернув 418 токенов за 5,3 секунды в Задаче 1. Kimi потребовалось 49,1 секунды, и он выдал 1 907 токенов, значительная часть которых представляла собой пошаговую цепочку рассуждений, возвращённую вместе с кодом. Однако, поскольку токены Kimi примерно в 6× дешевле, более многословный запуск всё равно обошёлся дешевле.
Что доказывает и чего не доказывает дуэль
Это доказывает, что на ограниченных, хорошо определённых задачах по программированию Kimi K2.7 Code достигает того же правильного ответа, что и frontier model. Это не доказывает, что Kimi сопоставим с Opus в длительных, многошаговых agentic-сессиях, которые нельзя проверить двумя одноразовыми задачами. Собственное самое сильное утверждение Kimi как раз относится к этой agentic-области, которую приведённые ниже бенчмарки напрямую оценивают.
Бенчмарки: что является сторонним, а что — собственной таблицей Moonshot
Вот разбивка, где каждое число помечено по источнику. Самооценочная таблица Moonshot — это место, где Kimi выглядит наиболее сильным; независимая оценка менее полная, поскольку модель появилась недавно, а там, где пока нет стороннего числа для K2.7, ближайшая опубликованная величина — для K2.6 (обозначено ниже).
Бенчмарк | Kimi K2.7 Code | Claude Opus 4.8 | Источник |
|---|---|---|---|
MCPMark Verified (tool use) | 81.1 | 76.4 | Moonshot, self-reported |
SWE-bench Verified | 60.4% | не опубликовано в том же формате | Moonshot, self-reported |
Intelligence Index | 35 (K2.6 proxy) | 56 | Artificial Analysis, third-party |
Output speed | ~45 tok/s (K2.6 proxy) | 59 tok/s | Artificial Analysis, third-party |
Единственная цифра, на которой держится это сравнение, MCPMark Verified 81.1 против 76.4, взята из собственной таблицы Moonshot, а не из независимой лаборатории. Это не повод отвергать её, поскольку использование инструментов в стиле MCP — именно та область, под которую Kimi настраивали. Но заголовок «Kimi beats Opus» стоит читать как заявление вендора о бенчмарке, оптимизированном под этого же вендора. В единственном прямом сравнении, измеренном сторонней организацией, Artificial Analysis ставит Opus 4.8 заметно выше по своему Intelligence Index (56 против 35), хотя в этой строке используется K2.6 как прокси, потому что K2.7 на момент написания ещё не был независимо оценён.
Разрыв в окне контекста скрывают бенчмарки
Opus 4.8 имеет контекстное окно в 1M токенов; у Kimi K2.7 максимум 256K. В бенчмарках это редко заметно, но именно это решает реальные задачи. Окно 256K с запасом вмещает репозиторий среднего размера и длинный трасс агентa, и этого вполне достаточно для большинства сеансов кодинга. Вы упираетесь в потолок, когда загружаете в один prompt целый большой monorepo, длинные наборы документов или многочасовые agent transcripts. В этом случае окно Opus, в 4× большее, — это практическая разница, а не просто точка на графике.
Цены: разрыв в 5–6× и рычаг кэша
По базовым ценам API, Kimi K2.7 Code стоит $0.95 за миллион входных токенов и $4.00 за миллион выходных; Claude Opus 4.8 — $5 и $25. Это разница в 5–6 раз по цене на выходе, и именно поэтому команды вообще рассматривают Kimi.
Главный рычаг, который упускают большинство таблиц с ценами, — это кеширование. Kimi берет $0.19 за миллион токенов при попадании в кеш, то есть скидка 80% на ввод, который вы уже отправляли. В agentic loop, который перечитывает одну и ту же codebase на каждом шаге, кешированный ввод доминирует в счете, поэтому фактическая стоимость падает значительно ниже заявленного диапазона. Philip Kiely из Baseten сообщил примерно о 82% экономии на тестовой нагрузке после перехода с Opus 4.8 на Kimi 2.7 Code — именно в таких задачах с большим объемом кеша и ввода ценовая модель Kimi дает кумулятивный эффект. Ваш показатель будет меняться в зависимости от соотношения входных и выходных данных, но направление остается тем же: чем чаще вы перечитываете контекст по сравнению с тем, что генерируете, тем сильнее Kimi выигрывает по стоимости.
Opus окупает свою цену на стороне вывода. Для моего Task 1 он сгенерировал лишь четверть токенов по сравнению с Kimi, так что на задачах с интенсивной генерацией, таких как написание больших файлов или многословные рефакторинги, разрыв в стоимости за токен в реальных расходах сокращается, а скорость Opus уменьшает общее время ожидания, за которое вы платите инженеру.
Обещание открытых весов vs реальность 577 ГБ
Kimi K2.7 поставляется как open weights под модифицированной лицензией MIT, так что вы можете развернуть его у себя и дообучать. Opus 4.8 доступен только через API; ваш код и трассировки рассуждений уходят в Anthropic. На бумаге это даёт Kimi решающее преимущество в приватности и отсутствии привязки к поставщику. На практике сначала проверьте счет за оборудование.
Kimi K2.7 — это модель Mixture-of-Experts с 1 триллионом параметров (32B активных на токен, 384 эксперта). Независимые обозреватели оценивают полноценное развертывание в INT4 примерно в 577GB VRAM, если учитывать веса, KV cache и накладные расходы runtime, что делает минимально практичную конфигурацию примерно 8× H100 80GB или сервер уровня DGX Spark. Одна RTX 4090 (24GB) не может запускать полную модель на пригодных для использования настройках. Для всех, кроме нескольких хорошо финансируемых команд, «open weights» означает свободу направлять запросы к hosting provider или дообучать на арендованных GPU, а не модель, которую вы разворачиваете у себя. Если ваша причина выбора Kimi — контроль данных on-prem, оцените стоимость кластера до принятия решения; для большинства команд self-hosting остаётся теорией.
Что выбрать
Подбирайте модель под рабочую нагрузку, а не выбирайте победителя:
Выберите Kimi K2.7 Code, если важны низкая стоимость, большой объём запросов или agentic coding, когда вы многократно перечитываете codebase, задержка не критична, а контекста 256K достаточно. Скидка за кэширование будет работать вам на пользу.
Выберите Claude Opus 4.8, когда вам нужна низкая задержка, контекст на 1M-token для больших репозиториев или длительных сессий, более лаконичный вывод, либо модель для финальной проверки, которой можно доверять при важных изменениях, где особенно важен его отрыв в оценках independent reasoning.
Гибридный подход: дешёвая модель делает черновики, передовая модель завершает
Самый распространённый подход среди команд, использующих обе системы, — не выбирать одну, а маршрутизировать запросы. Позвольте Kimi K2.7 дешево выполнять основную генерацию и итерации, а затем передавайте результат в Opus 4.8 для финальной проверки или тех частей, где требуется передовое суждение. Kimi нативно поддерживает формат OpenAI, тогда как Opus использует собственный API Anthropic, поэтому практичный способ маршрутизации между ними — шлюз, который объединяет оба решения за единым OpenAI-совместимым endpoint; на платформе вроде AIReiter, например, оба находятся под одним ключом, и переключение с Kimi на Opus сводится к изменению model-string, а не к повторной интеграции. Указанная выше экономия в 82% была достигнута именно благодаря такому маршрутизированию, а не за счёт полного отказа от Opus.
FAQ
Является ли Kimi K2.7 лучше, чем Claude Opus 4.8 для программирования?
В ограниченных, четко определённых задачах они равны; в моём тесте обе модели выдали полностью корректный код. Преимущество Kimi — агентное использование инструментов (MCPMark 81.1 против 76.4, по данным Moonshot); Opus лидирует в общем рассуждении, скорости и работе с длинным контекстом.
Насколько Kimi K2.7 дешевле, чем Opus 4.8?
Примерно в 5–6 раз дешевле по прайс-листу ($0.95/$4 за миллион против $5/$25). При попаданиях в cache ($0.19/M input) в повторяющихся нагрузках реальная экономия может достигать 80% и более.
Каков размер контекстного окна у Kimi K2.7 по сравнению с Opus 4.8?
Kimi K2.7 обрабатывает 256K токенов; Opus 4.8 — 1M, что в четыре раза больше.
Могу ли я запускать Kimi K2.7 локально?
Только на серьезном оборудовании. Сообщается, что для полноценного развертывания INT4 требуется около 577 ГБ VRAM (примерно 8× H100 или DGX Spark). Один потребительский GPU, такой как RTX 4090, не может запустить полную модель.
Является ли Kimi K2.7 открытым исходным кодом?
Он поставляется с открытыми весами по модифицированной лицензии MIT, поэтому вы можете развернуть его самостоятельно и дообучать. Opus 4.8 закрыт и доступен только через API.
Итог
Если ваше узкое место — бюджет, по умолчанию выбирайте Kimi K2.7 Code и позвольте кэшированию сделать остальное. Если дело в задержке, длине контекста или изменении, которое вы не можете позволить себе сделать неправильно, платите за Opus 4.8. Рассматривайте лицензию open-weights как бонус, который вы сможете использовать только если у вас есть GPU. И если вы не уверены, подключите оба решения и маршрутизируйте по задаче вместо того, чтобы делать ставку на один вариант, который потом придется разбирать.
