Вхід Реєстрація
Реклама
Ваше рекламне місце
Забронюйте цей слот без конкуренції на обраний період.
Купити рекламу →
Логотип телеграм спільноти - FUTURE × SIMPLE ⛩
Додано 14 лип 2024 🌐 UK

FUTURE × SIMPLE ⛩

@thats_ai_samurai
Кількість підписників: 2 390
Фото: 493
Відео: 96
Посилання: 321
Опис:
👨💻 Авторське медіа про штучний інтелект: новини, тренди, український контекст, факапи, дрібка мемів та офтопчик. 👾 Для зв'язку: @thats_not_ai_samurai 📝 Підтримка: base.monobank.ua/3Ai2pY7W6vWm6G
Джерело

FUTURE × SIMPLE ⛩ | Про Kimi K3, GLM-5.2 та ще один сиквел «DeepSeek-moment» (або ні)За ос...

Логотип телеграм спільноти - FUTURE × SIMPLE ⛩ FUTURE × SIMPLE ⛩ @thats_ai_samurai
1 080 Охват/переглядів 2026-07-20 11:32 Повідомлення №786
🤑 Про Kimi K3, GLM-5.2 та ще один сиквел «DeepSeek-moment» (або ні)

За останні п'ять тижнів китайські АІ-лабораторії видали два релізи, які, як на мене, варто розглянути, при цьому обидві разом.

🔻 13 червня Zhipu випустили GLM-5.2 — кодинг-модель з контекстом у мільйон токенів.

🔻

А 16 липня Moonshot AI показали Kimi K3, яка практично вперше в історії опенсорсу постукала у двері топ-3.

Почати думаю варто з K3, бо вона наразі «свіжіша» і зробила більше інфо-шуму.

• За версією Moonshot: 2.8 трлн параметрів — найбільша відкрита модель в історії, приблизно вдвічі більша за будь-яку до неї, ~на 75% більша за DeepSeek V4 Pro (1.6T).

Контекст — мільйон токенів, нативна мультимодальність: на вхід приймає не тільки текст, а й зображення.

😎 Технічного звіту станом на момент написання допису нема, тож архітектурні цифри — це поки самозвіт компанії, але масштаб зрозумілий.

• Якщо говорити про результати, то на Artificial Analysis Index K3 набирає 57 — третя позиція у світі: позаду лише Claude Fable 5 (60) та GPT-5.6 Sol (59), і на один пункт вище за Opus 4.8 (56).

Щоб було зрозуміло, наскільки це серйозно: жодна модель з (ну, майже) відкритими вагами ніколи не наближалась до топу настільки близько.

🤯 Розрив із абсолютним фронтиром настільки мінімальний, що різниця між Fable 5 і Opus 4.8 більша, ніж між Fable 5 і китайським опенсорсом.

Тепер про GLM-5.2 — її реліз теж був доволі гучний, але з іншої причини: він ідеально вписався в таймінг.

😁 Модель вийшла 13 червня — буквально наступного ранку після того, як уряд США наказав Anthropic вимкнути Fable 5 і Mythos 5.

Загалом обидва релізи направду важливі для АІ-комʼюніті, але тепер плавненько перейдемо до нюансів.

І перший, дуже цікавий момент — галюцинації.

• У Kimi K3 частка галюцинацій на незалежних тестах AA-Omniscience — 51%. У попередника, щоб ви розуміли, було 39%.

При цьому точність зросла з 33% до 46%.

→ Тобто на кожен пункт нових знань модель отримала приблизно один пункт впевнених галюцинацій.

Це рівно те, як виглядає вхід у фронтир-клас:

• Claude Opus 4.8 — 36%
• Claude Fable 5 — ~48% (Anthropic свідомо пожертвувала калібровкою заради рекордної точності у 61%)
• Kimi K3 — 51%
• GPT-5.5 — 86%
• GPT-5.6 — чистого показника ще нема, але Artificial Analysis прямо пише: галюцинацій стало більше, ніж у 5.5

→ При цьому, що дуже цікаво, GLM-5.2 має 28% — це за показниками найкраще калібрування серед УСІХ моделей фронтир-класу — китайських, американських, відкритих, закритих.

• Але повертаючись до K3 — загалом, якщо дивитись на заголовки та поверхневі матеріали ЗМІ, у не дуже обізнаного читача (але точно не в тебе пімписник!) може скластись враження, що Kimi K3 — це ледве не топ-1 модель у світі.

Чому так?

😂 Бо заголовки зроблені з одного бенчмарку: K3 дійсно взяла перше місце на Frontend Code Arena — і саме цей замір розійшовся пресою.

Але це один лідерборд із 35 тестів, які прогнав сам Moonshot: у сумі K3 виграла приблизно сім, а більшість забрав Fable 5.

🤨 Чи є це насправді безпрецедентно в плані результатів, як для опенсорсу? Абсолютно точно так.

Одна невеличка зірочка-приміточка для контексту: станом на зараз K3 — відкрита модель скоріше тільки за пресрелізом.

• Вагів у публічному доступі поки нема — Moonshot обіцяє викласти їх до 27 липня, а поки К3 доступна тільки через закритий API компанії.

🥂 У GLM-5.2, до слова, ця історія прозоріша: ваги затримались на три дні після анонсу, але з 16 червня лежать на Hugging Face під MIT.

Тепер про ґроші й геополітику.

😱 1.5 роки тому DeepSeek влаштував паніку приблизно у форматі «ого, моделька в 10 разів дешевша + майже таке ж розумна», і всі чекають сиквелу.

Але я вас, можливо, трішки розчарую: його не буде — принаймні не в цьому жанрі та форматі.

💵

K3 коштує $3/$15 за мільйон токенів — один в один з Claude Sonnet 5, аж до однакової ціни кешу ($0.30).

Якщо брати вартість виконання типової задачі: K3 — $0.94, GPT-5.6 — $1.04.

Проте це ще не означає, що Китай «перестав демпінгувати» — GLM-5.2 робить ту саму задачу за $0.32, а DeepSeek V4 Pro — взагалі за $0.04.

🤵 Це трішки про інше, бо демпінг — це коли ти дешевший, бо інакше тебе не куплять, а Moonshot вперше зафіксувала на китайський фронтир західний цінник — і риночєк це сприйняв цілком позитивно.

• І «позитивно» — це ще м'яко кажучи, бо наступного дня після релізу API K3 пролежав майже шість годин, а самі Moonshot офіційно призупинили можливість оформлення нових підписок — бо, цитую, попит за 48 годин «підійшов впритул до меж наших потужностей».

Тому й розглядати ці релізи варто разом: окремо це просто два сильні продукти, а разом — індикатор того, що китайський опенсорс дуже успішно виконує свою основну функцію — наздогнати.

😠 Він тепер може коштувати як західний, галюцинує як західний і, дуже ймовірно, регулюватиметься як західний.

В Пекіні вже обговорюють власні експортні обмеження на АІ-моделі, схожі на ті, що були в червні від США.

🚬 І тут навіть неважливо, чи дійдуть ці обговорення до реальних обмежень — відкритість в АІ ніколи не була ідеологією.

Це завжди була стратегія того, хто позаду.

OpenAI, наприклад, публікувала все, поки їй не було чого втрачати — і «закрилась» рівно тоді, коли вирвалась вперед.

• Китайські лабораторії теж роздавали ваги не з любові до комʼюніті, а тому, що це найдешевший інструмент проти лідера, з яким не можеш конкурувати напряму.

💻 Тож питання не в тому, чи закриються китайські лабораторії. Питання в тому, скільки ще пунктів AA Index у них лишилось до цього — і, судячи з K3, десь ± три.