Source
FUTURE × SIMPLE ⛩ | Fugu Ultra, «рівень Fable 5» та підміна понятьКілька днів тому японськ...
849 Views/Reach
2026-06-25 07:52
Message №769
😁 Fugu Ultra, «рівень Fable 5» та підміна понятьКілька днів тому японська Sakana AI показала нову модель — Fugu, і старшу версію Fugu Ultra.→ Подають її доволі сексі: «мультиагентна система, що поводиться як одна модель». Ти використовуєш один API-ендпоінт, а всередині Fugu сама вирішує — впоратися особисто чи зібрати команду моделей, роздати їм підзадачі, перевірити й зшити відповіді докупи.
Якщо дивитись на бенчмарки, то меседж більш ніж амбітний: Fugu Ultra тримається дуже тісно з Fable 5 і Mythos Preview на найжорсткіших інженерних, наукових і reasoning-тестах.💁♂ В прес-релізах є кейси, де Fugu обходить Gemini 3.1 Pro, Opus 4.8 та GPT-5.5 на автоматизованому research, механічному дизайні й навіть розпізнаванні японського рукопису.Нюанс в тому, що цифри Sakana — самозвітні, незалежно не відтворені станом на зараз. 🥃 Але якщо вірити усім красівим графікам та впевненим стрілочкам вгору, то дійсно — навіщо нам з вами цей наднебезпечний та недосяжний Mythos, якщо є прекрасна та надійна тойота, яку не забанить уряд США в рандомний четвер?→ Буду відвертим: особисто я нічого не тестував, але якщо вони дійсно досягають заявлених показників — це може бути робочою альтернативою для тимчасово заблокованих моделей від Anthropic.
Результат є результат, але допис насправді не про це.😠 Sakana ставлять Fugu Ultra в одну бенчмарк-таблицю з фронтир-моделями й заявляють паритет — але це порівняння, якщо трішееееечки подушнити, некоректне по своїй природі. Бо порівнюють різні класи об'єктів.Fable і Mythos — це монолітні моделі. Один набір ваг, навчений end-to-end, який сам тримає всі знання й сам виконує міркування. Звертаєшся до Fable — працює саме Fable.→ Fugu влаштована інакше: це теж мовна модель, але її спеціалізація — оркестрація: коли делегувати, кому делегувати, як зшити чужі відповіді в одну. Важку роботу виконують не її ваги, а пул сторонніх моделей. Прибери цей пул — і фронтир-система миттєво перетворюється на дуже посередню модель.
І щоб одразу закрити очевидне питання: це НЕ Mixture-of-Experts. MoE (умовний Mixtral) — теж моноліт, де експерти живуть усередині одних ваг, навчені разом, маршрутизація внутрішня.Тут маршрутизація зовнішня — між окремими моделями, які тренувались нарізно й не ділять ваги.💁♂ І тут є ще один нюансик, який Sakana делікатно обходить: оцінка оркестратора — це не властивість оркестратора. Це властивість пулу плюс політики маршрутизації.→ Якщо в пулі ті самі Opus, GPT-5.5 та Gemini, проти яких його й порівнюють — то «Fugu Ultra ≈ Fable» означає рівно одне: «Opus + GPT + Gemini ≈ Fable». Тобто виміряли не Fugu, а пул, який вона смикає за ниточки — і героїчно довели, що хороші моделі хороші. Вражає, чесслово.
Оркестратор — це, якщо тупо та доволі грубо спрощувати, хитровиєбаний менеджер, який самостійно робить не так багато, але чудово орієнтується, кому передати фронтенд, кому — безпеку, кому — бекенд, і вміє звести все докупи. 🤨 Але при цьому оркестратор має ступінь свободи, якого в моноліта немає: йому, очевидно, не треба бути найкращим у всьому самому — достатньо знати, хто з пулу що може потягнути, і роздати це все правильно по «руках».Але це, якщо що, не тупо if/else по ключових словах — Sakana навчили окремого координатора (їхні TRINITY/Conductor), який реально працює над тим, кому і що делегувати.→ Іншими словами, Fugu збирає верхню обгортку пулу — під кожен тест знаходить модель, що його виконує найкраще. Жодна модель поодинці так не вміє, а от їхній найкращий зріз — так.
Найкраще це працює там, де профіль задачі передбачуваний — тобто на бенчмарках.На реальній, «брудній» задачі, де незрозуміло, це «код», «продукт» чи «похуй», сигнал для маршрутизації слабшає — і відрив від чесного моноліта тане.Тому оркестратор не = моделі рівня Fable.🚬 Оркестрація загалом — природна відповідь ринку на те, що тренувати все більші моноліти стає все довше й дорожче. Зібрати фронтир із готових шматків банально дешевше, ніж «виростити» свій.Під кінець проговорю ще раз: на практичному рівні різниця цілком може бути малопомітною. 🤵 Ти шлеш запит, отримуєш відповідь, і тобі, поклавши руку на серце, абсолютно всеодно, що відбувалося всередині — чи відпрацював там один Fable, чи естафета з актуальних моделей OpenAI, Google та Anthropic.💻 Але хто я такий, щоб шось засуджувати: в цьому точно є своя краса — Sakana, по суті, підтверджують, що правильний менеджмент чужих ресурсів має цінність.Я вже чекаю з нетерпівнням наступний прес-реліз, де хтось навчить оркестратор оркеструвати оркестратори і нарешті у людства буде цей ваш «AGI».🫥 Загалом, індустрія рухається туди, куди рухається, але це вже тема для наступного разу. Всіх цьом.