Source
Keep calm and grow | SOTA стала тимчасовим ексклюзивомСхоже, SOTA-моделі перейняли бізнес-м...
63 Views/Reach
2026-08-28 10:01
Message №184
💻 SOTA стала тимчасовим ексклюзивом
Схоже, SOTA-моделі перейняли бізнес-модель ігор.
Спочатку day-one реліз доступний лише у хмарі. За найкращу якість платиш преміум просто зараз. А згодом виходить «порт» на локальне залізо - дешевший, приватний і без зовнішніх квот.
Я не збирався перевіряти цю тезу. Просто запустив Qwen3.8-27B у 4-бітній квантизації. 128K контексту повністю вмістився у 24 ГБ VRAM моєї RTX 4090, швидкість - близько 40 токенів за секунду. На моїх задачах із кодом якість нагадує топові хмарні моделі середини-кінця 2025 року. Це не лабораторний бенчмарк, а моя робоча оцінка.
Тобто у моєму випадку «порт» торішнього SOTA-рівня приїхав приблизно за рік.
І навіть не сам. Ollama вже підтримує локально thinking effort, кешування вхідного контексту та speculative decoding - фічі, на яких у моїй голові ще висів бейджик «тільки у хмарі». Граничні витрати на електрику для 1 млн вхідних / кешованих / вихідних токенів вийшли близько €0,039 / €0,0006 / €1,4. Без амортизації: відеокарта й так стоїть у моїй робочій машині.
Хмару ще рано ховати. Сьогоднішні SOTA-моделі першими дають новий рівень якості, і для складних задач ця фора може окупатися. Але їхнє домінування вже не схоже на довічну монополію. Це вікно тимчасової ексклюзивності.
Тому вибір моделі тепер починається не з рейтингу. Він починається з питання: цій задачі справді потрібен day-one рівень? Якщо додаткова якість зменшує ризик, вартість помилки або втрачений час - так. В інших випадках локального «порту» торішнього рівня вже може вистачити.
Можливо, SOTA - це не вершина. Це релізне вікно.
І найдорожчий квиток завжди на прем’єру.
---
🌱 Keep calm and grow | 💬 Обговорити 1-на-1
Схоже, SOTA-моделі перейняли бізнес-модель ігор.
Спочатку day-one реліз доступний лише у хмарі. За найкращу якість платиш преміум просто зараз. А згодом виходить «порт» на локальне залізо - дешевший, приватний і без зовнішніх квот.
Я не збирався перевіряти цю тезу. Просто запустив Qwen3.8-27B у 4-бітній квантизації. 128K контексту повністю вмістився у 24 ГБ VRAM моєї RTX 4090, швидкість - близько 40 токенів за секунду. На моїх задачах із кодом якість нагадує топові хмарні моделі середини-кінця 2025 року. Це не лабораторний бенчмарк, а моя робоча оцінка.
Тобто у моєму випадку «порт» торішнього SOTA-рівня приїхав приблизно за рік.
І навіть не сам. Ollama вже підтримує локально thinking effort, кешування вхідного контексту та speculative decoding - фічі, на яких у моїй голові ще висів бейджик «тільки у хмарі». Граничні витрати на електрику для 1 млн вхідних / кешованих / вихідних токенів вийшли близько €0,039 / €0,0006 / €1,4. Без амортизації: відеокарта й так стоїть у моїй робочій машині.
Хмару ще рано ховати. Сьогоднішні SOTA-моделі першими дають новий рівень якості, і для складних задач ця фора може окупатися. Але їхнє домінування вже не схоже на довічну монополію. Це вікно тимчасової ексклюзивності.
Тому вибір моделі тепер починається не з рейтингу. Він починається з питання: цій задачі справді потрібен day-one рівень? Якщо додаткова якість зменшує ризик, вартість помилки або втрачений час - так. В інших випадках локального «порту» торішнього рівня вже може вистачити.
Можливо, SOTA - це не вершина. Це релізне вікно.
І найдорожчий квиток завжди на прем’єру.
---
🌱 Keep calm and grow | 💬 Обговорити 1-на-1