Чек-лист

Kimi K3 убил Claude? Хайп против реальности

Правда ли китайская Kimi K3 обошла Codex и Claude в разработке: разбираю бенчмарки, стоимость токенов, скорость и реальные ограничения модели.

Содержание10 глав
  1. 01Хайп против реальности
  2. 02Что за зверь Kimi K3 и почему все сходят с ума
  3. 03«Открытые веса» не значит «запущу дома»
  4. 04Здесь он действительно #1 — фронтенд-арена
  5. 05На фронтенде — король. По уму и фактам — один из худших
  6. 06«В три раза дешевле» — цена за токен, а не за задачу
  7. 07Расплата №1. Многословность: дешёвый токен × куча токенов
  8. 08Расплата №2. Доверие и время — вот где настоящий счёт
  9. 09Кому брать Kimi K3, а кому нет
  10. 10Итог: где правда, а где маркетинг

Хайп против реальности

16 июля китайский Kimi K3 вышел на первое место в кодинг-арене. Весь ютуб кричит: в три раза дешевле и умнее всех. Я пишу код в Claude Code каждый день — поэтому сел и пересчитал счёт сам.

ЮТУБ КРИЧИТ
«в 3 раза дешевле»
«умнее всех»
«#1
выше Claude во всём»

Главную цену за Kimi K3 ты платишь вообще не в долларах. Разложу по цифрам, где он реально порвал Claude, а где тебя разводят на хайпе. — Рома Райт

Что за зверь Kimi K3 и почему все сходят с ума

Kimi K3 — модель китайской Moonshot AI, вышла 16 июля 2026. Считает она не всей махиной сразу: это MoE — модель думает не целиком, а включает под задачу только 16 экспертов из 896, около 50 миллиардов параметров на токен. Плюс миллион токенов контекста и нативная мультимодальность в одной модели.

думает не целиком
16 из 896
активных экспертов
на токен
≈ 1,8% модели
около 50 млрд параметров

«Открытые веса» не значит «запущу дома»

Слово «открытые» кружит голову: качай и запускай локально. На деле это около 1,4 терабайта весов даже в сжатии. Это датацентр, а не твой ноутбук.

твой ПК / ноутбук
1,4 ТБ весов
не потянет — ни памяти, ни весов
по сути
Открытые веса — это про аудит, приватность и свой инференс на серьёзном железе. Не про то, что ты завтра поднимешь модель на своём ноуте.

Здесь он действительно #1 — фронтенд-арена

На арене WebDev люди вслепую голосуют, чей результат лучше. 16 июля Kimi K3 набрал рейтинг Elo 1679 и встал на первое место — выше Claude Fable 5 и GPT-5.6 Sol. Плюс он лидер в 6 из 7 фронтенд-доменов, а его прошлая версия была лишь на 18-м месте.

Kimi K3 · #11679
Claude Fable 51631
GPT-5.6 Sol1618
арена WebDev · рейтинг Elo из слепых голосов людей · 16.07
Честная оговорка
Это слепые голоса людей и снапшот одного дня. Лидер на арене меняется.

На фронтенде — король. По уму и фактам — один из худших

Сводный балл ума по всем тестам расставляет иначе: Claude Fable впереди, GPT следом, Kimi K3 — только третий-четвёртый. А главный разворот — на знаниях и галлюцинациях.

Claude Fable 5~60
GPT-5.6 Sol~59
Kimi K3 · #3–4~57
сводный балл ума по всем тестам
точность у K3
33% → 46%
стал точнее
галлюцинации у K3
39% → 51%
и врёт чаще — одновременно

«В три раза дешевле» — цена за токен, а не за задачу

На бумаге токен K3 и правда дешёвый: вход и выход — примерно 30% от тарифа дорогого Claude Fable. Отсюда и «в три раза». Но платишь ты не за токен, а за решённую задачу. А там картина другая.

Kimi K3$3 / $15
GPT-5.6 Sol$5 / $30
Claude Fable 5$10 / $50
цена за 1 млн токенов · вход / выход — вот отсюда «в 3 раза дешевле»
образ
Тариф-то копеечный. Но счётчик мотает дольше — как такси, что стоит в пробке: цена за километр смешная, а по итогу поездки платишь как за весь город.

Расплата №1. Многословность: дешёвый токен × куча токенов

Kimi K3 прожорлив на токены. На одном прогоне тестов он выдал вдвое больше токенов, чем в среднем выдают модели. Дешёвый токен, умноженный на такое количество, и даёт обычный счёт.

среднее по моделям~63 млн
Kimi K3 · ×2~130 млн
объём токенов на прогоне тестов
образ
Он многословный, как коллега, который на короткий вопрос отвечает тремя страницами. Вроде и толково — но читать до вечера.
Kimi K3
21,5 млн токенов
1 ч 33 мин
Fable 5
3,5 млн токенов
17 мин
Codex (5.6)
5,6 млн токенов
25 мин

личный замер одного автора — для иллюстрации, не бенчмарк

Беру только как наглядную иллюстрацию, до чего K3 многословный — не как точную цифру.

Расплата №2. Доверие и время — вот где настоящий счёт

Цена №1 — галлюцинации. K3 врёт в половине сложных вопросов, Claude Fable — в шестой части. Цена №2 — время, но тут важный нюанс: это не тупое «медленнее».

Kimi K3
51%
врёт в сложных вопросах
Claude Fable 5
16%
врёт в сложных вопросах

по шкале знаний это +18 против +40 — K3 среди самых врущих во фронтире

Fable — токенов в секунду66,6
K3 — токенов в секунду62,0
GPT-5.6 — токенов в секунду55,0
скорость — не тупое «медленнее». K3 быстрее GPT на токен
время до первого ответа
1,99 с
Kimi K3 — почти мгновенно
время до первого ответа
131,30 с
GPT-5.6 Sol — в пике, худший случай
точная формулировка
Медленный он только по общему времени на всю задачу — потому что многословный. По скорости токена и по старту он GPT обгоняет.

Кому брать Kimi K3, а кому нет

  • НЕ БРАТЬ: где цена ошибки высокая — юр., мед., цифры, данные: 51% галлюцинаций
  • НЕ БРАТЬ: когда важен быстрый результат по времени, а не цена токена
  • НЕ БРАТЬ: если ты соло без датацентра — «открытые веса» лично тебе не про локальный запуск
МОЙ ВЕРДИКТ
Claude Code остаётся дефолтом на ежедневку — за надёжность. Kimi K3 беру вторым пилотом: на фронтенд и черновики.

Не выбирай модель по одной цифре из твиттера. Считай свою задачу, а не чужой график.

Итог: где правда, а где маркетинг

01
Open-weight-модель впервые догнала фронтир по коду — это правда, а не «китай-хайп».
02
«Дёшево и быстро» — маркетинг
Против GPT он не дешевле в разы, а по времени на задачу дольше

Настоящая цена Kimi K3 — не доллары. Это доверие. Он врёт в половине сложных вопросов, и это не чинится дешёвым токеном.