Source
FUTURE × SIMPLE ⛩ | Про Kimi K3, GLM-5.2 та ще один сиквел «DeepSeek-moment» (або ні)За ос...
1 080 Views/Reach
2026-07-20 11:32
Message №786
🤑 Про Kimi K3, GLM-5.2 та ще один сиквел «DeepSeek-moment» (або ні)
За останні п'ять тижнів китайські АІ-лабораторії видали два релізи, які, як на мене, варто розглянути, при цьому обидві разом.
🔻 13 червня Zhipu випустили GLM-5.2 — кодинг-модель з контекстом у мільйон токенів.
🔻
А 16 липня Moonshot AI показали Kimi K3, яка практично вперше в історії опенсорсу постукала у двері топ-3.
Почати думаю варто з K3, бо вона наразі «свіжіша» і зробила більше інфо-шуму.
• За версією Moonshot: 2.8 трлн параметрів — найбільша відкрита модель в історії, приблизно вдвічі більша за будь-яку до неї, ~на 75% більша за DeepSeek V4 Pro (1.6T).
Контекст — мільйон токенів, нативна мультимодальність: на вхід приймає не тільки текст, а й зображення.
😎 Технічного звіту станом на момент написання допису нема, тож архітектурні цифри — це поки самозвіт компанії, але масштаб зрозумілий.
• Якщо говорити про результати, то на Artificial Analysis Index K3 набирає 57 — третя позиція у світі: позаду лише Claude Fable 5 (60) та GPT-5.6 Sol (59), і на один пункт вище за Opus 4.8 (56).
Щоб було зрозуміло, наскільки це серйозно: жодна модель з (ну, майже) відкритими вагами ніколи не наближалась до топу настільки близько.
🤯 Розрив із абсолютним фронтиром настільки мінімальний, що різниця між Fable 5 і Opus 4.8 більша, ніж між Fable 5 і китайським опенсорсом.
Тепер про GLM-5.2 — її реліз теж був доволі гучний, але з іншої причини: він ідеально вписався в таймінг.
😁 Модель вийшла 13 червня — буквально наступного ранку після того, як уряд США наказав Anthropic вимкнути Fable 5 і Mythos 5.
Загалом обидва релізи направду важливі для АІ-комʼюніті, але тепер плавненько перейдемо до нюансів.
І перший, дуже цікавий момент — галюцинації.
• У Kimi K3 частка галюцинацій на незалежних тестах AA-Omniscience — 51%. У попередника, щоб ви розуміли, було 39%.
При цьому точність зросла з 33% до 46%.
→ Тобто на кожен пункт нових знань модель отримала приблизно один пункт впевнених галюцинацій.
Це рівно те, як виглядає вхід у фронтир-клас:
• Claude Opus 4.8 — 36%
• Claude Fable 5 — ~48% (Anthropic свідомо пожертвувала калібровкою заради рекордної точності у 61%)
• Kimi K3 — 51%
• GPT-5.5 — 86%
• GPT-5.6 — чистого показника ще нема, але Artificial Analysis прямо пише: галюцинацій стало більше, ніж у 5.5
→ При цьому, що дуже цікаво, GLM-5.2 має 28% — це за показниками найкраще калібрування серед УСІХ моделей фронтир-класу — китайських, американських, відкритих, закритих.
• Але повертаючись до K3 — загалом, якщо дивитись на заголовки та поверхневі матеріали ЗМІ, у не дуже обізнаного читача (але точно не в тебе пімписник!) може скластись враження, що Kimi K3 — це ледве не топ-1 модель у світі.
Чому так?
😂 Бо заголовки зроблені з одного бенчмарку: K3 дійсно взяла перше місце на Frontend Code Arena — і саме цей замір розійшовся пресою.
Але це один лідерборд із 35 тестів, які прогнав сам Moonshot: у сумі K3 виграла приблизно сім, а більшість забрав Fable 5.
🤨 Чи є це насправді безпрецедентно в плані результатів, як для опенсорсу? Абсолютно точно так.
Одна невеличка зірочка-приміточка для контексту: станом на зараз K3 — відкрита модель скоріше тільки за пресрелізом.
• Вагів у публічному доступі поки нема — Moonshot обіцяє викласти їх до 27 липня, а поки К3 доступна тільки через закритий API компанії.
🥂 У GLM-5.2, до слова, ця історія прозоріша: ваги затримались на три дні після анонсу, але з 16 червня лежать на Hugging Face під MIT.
Тепер про ґроші й геополітику.
😱 1.5 роки тому DeepSeek влаштував паніку приблизно у форматі «ого, моделька в 10 разів дешевша + майже таке ж розумна», і всі чекають сиквелу.
Але я вас, можливо, трішки розчарую: його не буде — принаймні не в цьому жанрі та форматі.
💵
K3 коштує $3/$15 за мільйон токенів — один в один з Claude Sonnet 5, аж до однакової ціни кешу ($0.30).
Якщо брати вартість виконання типової задачі: K3 — $0.94, GPT-5.6 — $1.04.
Проте це ще не означає, що Китай «перестав демпінгувати» — GLM-5.2 робить ту саму задачу за $0.32, а DeepSeek V4 Pro — взагалі за $0.04.
🤵 Це трішки про інше, бо демпінг — це коли ти дешевший, бо інакше тебе не куплять, а Moonshot вперше зафіксувала на китайський фронтир західний цінник — і риночєк це сприйняв цілком позитивно.
• І «позитивно» — це ще м'яко кажучи, бо наступного дня після релізу API K3 пролежав майже шість годин, а самі Moonshot офіційно призупинили можливість оформлення нових підписок — бо, цитую, попит за 48 годин «підійшов впритул до меж наших потужностей».
Тому й розглядати ці релізи варто разом: окремо це просто два сильні продукти, а разом — індикатор того, що китайський опенсорс дуже успішно виконує свою основну функцію — наздогнати.
😠 Він тепер може коштувати як західний, галюцинує як західний і, дуже ймовірно, регулюватиметься як західний.
В Пекіні вже обговорюють власні експортні обмеження на АІ-моделі, схожі на ті, що були в червні від США.
🚬 І тут навіть неважливо, чи дійдуть ці обговорення до реальних обмежень — відкритість в АІ ніколи не була ідеологією.
Це завжди була стратегія того, хто позаду.
OpenAI, наприклад, публікувала все, поки їй не було чого втрачати — і «закрилась» рівно тоді, коли вирвалась вперед.
• Китайські лабораторії теж роздавали ваги не з любові до комʼюніті, а тому, що це найдешевший інструмент проти лідера, з яким не можеш конкурувати напряму.
💻 Тож питання не в тому, чи закриються китайські лабораторії. Питання в тому, скільки ще пунктів AA Index у них лишилось до цього — і, судячи з K3, десь ± три.
За останні п'ять тижнів китайські АІ-лабораторії видали два релізи, які, як на мене, варто розглянути, при цьому обидві разом.
🔻 13 червня Zhipu випустили GLM-5.2 — кодинг-модель з контекстом у мільйон токенів.
🔻
А 16 липня Moonshot AI показали Kimi K3, яка практично вперше в історії опенсорсу постукала у двері топ-3.
Почати думаю варто з K3, бо вона наразі «свіжіша» і зробила більше інфо-шуму.
• За версією Moonshot: 2.8 трлн параметрів — найбільша відкрита модель в історії, приблизно вдвічі більша за будь-яку до неї, ~на 75% більша за DeepSeek V4 Pro (1.6T).
Контекст — мільйон токенів, нативна мультимодальність: на вхід приймає не тільки текст, а й зображення.
😎 Технічного звіту станом на момент написання допису нема, тож архітектурні цифри — це поки самозвіт компанії, але масштаб зрозумілий.
• Якщо говорити про результати, то на Artificial Analysis Index K3 набирає 57 — третя позиція у світі: позаду лише Claude Fable 5 (60) та GPT-5.6 Sol (59), і на один пункт вище за Opus 4.8 (56).
Щоб було зрозуміло, наскільки це серйозно: жодна модель з (ну, майже) відкритими вагами ніколи не наближалась до топу настільки близько.
🤯 Розрив із абсолютним фронтиром настільки мінімальний, що різниця між Fable 5 і Opus 4.8 більша, ніж між Fable 5 і китайським опенсорсом.
Тепер про GLM-5.2 — її реліз теж був доволі гучний, але з іншої причини: він ідеально вписався в таймінг.
😁 Модель вийшла 13 червня — буквально наступного ранку після того, як уряд США наказав Anthropic вимкнути Fable 5 і Mythos 5.
Загалом обидва релізи направду важливі для АІ-комʼюніті, але тепер плавненько перейдемо до нюансів.
І перший, дуже цікавий момент — галюцинації.
• У Kimi K3 частка галюцинацій на незалежних тестах AA-Omniscience — 51%. У попередника, щоб ви розуміли, було 39%.
При цьому точність зросла з 33% до 46%.
→ Тобто на кожен пункт нових знань модель отримала приблизно один пункт впевнених галюцинацій.
Це рівно те, як виглядає вхід у фронтир-клас:
• Claude Opus 4.8 — 36%
• Claude Fable 5 — ~48% (Anthropic свідомо пожертвувала калібровкою заради рекордної точності у 61%)
• Kimi K3 — 51%
• GPT-5.5 — 86%
• GPT-5.6 — чистого показника ще нема, але Artificial Analysis прямо пише: галюцинацій стало більше, ніж у 5.5
→ При цьому, що дуже цікаво, GLM-5.2 має 28% — це за показниками найкраще калібрування серед УСІХ моделей фронтир-класу — китайських, американських, відкритих, закритих.
• Але повертаючись до K3 — загалом, якщо дивитись на заголовки та поверхневі матеріали ЗМІ, у не дуже обізнаного читача (але точно не в тебе пімписник!) може скластись враження, що Kimi K3 — це ледве не топ-1 модель у світі.
Чому так?
😂 Бо заголовки зроблені з одного бенчмарку: K3 дійсно взяла перше місце на Frontend Code Arena — і саме цей замір розійшовся пресою.
Але це один лідерборд із 35 тестів, які прогнав сам Moonshot: у сумі K3 виграла приблизно сім, а більшість забрав Fable 5.
🤨 Чи є це насправді безпрецедентно в плані результатів, як для опенсорсу? Абсолютно точно так.
Одна невеличка зірочка-приміточка для контексту: станом на зараз K3 — відкрита модель скоріше тільки за пресрелізом.
• Вагів у публічному доступі поки нема — Moonshot обіцяє викласти їх до 27 липня, а поки К3 доступна тільки через закритий API компанії.
🥂 У GLM-5.2, до слова, ця історія прозоріша: ваги затримались на три дні після анонсу, але з 16 червня лежать на Hugging Face під MIT.
Тепер про ґроші й геополітику.
😱 1.5 роки тому DeepSeek влаштував паніку приблизно у форматі «ого, моделька в 10 разів дешевша + майже таке ж розумна», і всі чекають сиквелу.
Але я вас, можливо, трішки розчарую: його не буде — принаймні не в цьому жанрі та форматі.
💵
K3 коштує $3/$15 за мільйон токенів — один в один з Claude Sonnet 5, аж до однакової ціни кешу ($0.30).
Якщо брати вартість виконання типової задачі: K3 — $0.94, GPT-5.6 — $1.04.
Проте це ще не означає, що Китай «перестав демпінгувати» — GLM-5.2 робить ту саму задачу за $0.32, а DeepSeek V4 Pro — взагалі за $0.04.
🤵 Це трішки про інше, бо демпінг — це коли ти дешевший, бо інакше тебе не куплять, а Moonshot вперше зафіксувала на китайський фронтир західний цінник — і риночєк це сприйняв цілком позитивно.
• І «позитивно» — це ще м'яко кажучи, бо наступного дня після релізу API K3 пролежав майже шість годин, а самі Moonshot офіційно призупинили можливість оформлення нових підписок — бо, цитую, попит за 48 годин «підійшов впритул до меж наших потужностей».
Тому й розглядати ці релізи варто разом: окремо це просто два сильні продукти, а разом — індикатор того, що китайський опенсорс дуже успішно виконує свою основну функцію — наздогнати.
😠 Він тепер може коштувати як західний, галюцинує як західний і, дуже ймовірно, регулюватиметься як західний.
В Пекіні вже обговорюють власні експортні обмеження на АІ-моделі, схожі на ті, що були в червні від США.
🚬 І тут навіть неважливо, чи дійдуть ці обговорення до реальних обмежень — відкритість в АІ ніколи не була ідеологією.
Це завжди була стратегія того, хто позаду.
OpenAI, наприклад, публікувала все, поки їй не було чого втрачати — і «закрилась» рівно тоді, коли вирвалась вперед.
• Китайські лабораторії теж роздавали ваги не з любові до комʼюніті, а тому, що це найдешевший інструмент проти лідера, з яким не можеш конкурувати напряму.
💻 Тож питання не в тому, чи закриються китайські лабораторії. Питання в тому, скільки ще пунктів AA Index у них лишилось до цього — і, судячи з K3, десь ± три.