Source
Продуктивність | Тарас Лукавий | Нова AI-модель, яка взагалі не вміє розмовлятиДля: тих, хто будує прод...
443 Views/Reach
2026-09-18 11:49
Message №2434
Нова AI-модель, яка взагалі не вміє розмовляти
Для: тих, хто будує продукти на AI
TL;DR: Jev від TypeSafe не генерує текст, а приймає типізовані рішення за 70-500 мс і за копійки. Але половина цифр з лаунчу - маркетинг.
15 вересня TypeSafe AI відкрила ранній доступ до Jev і назвала це новою категорією моделей - System One. Засновник Diogo Almeida - один з авторів InstructGPT, методу, на якому зробили ChatGPT. Людина, яка вчила AI говорити, два роки пиляла в стелсі модель, що принципово мовчить.
Шо воно робить
Даєш на вхід неструктурований стан програми - отримуєш типізовану відповідь за один паралельний прохід, не токен за токеном. Вибір з варіантів, оцінка, число. Простір відповідей задаєш ти, максимум 255 варіантів.
Вхідні токени $0.042 за мільйон, вихідні безкоштовні. Заявляють до 193x швидше і до 444x дешевше за LLM. Довгого контексту нема, мультимодальності нема, код не пише, розмову не веде.
Де зірочка
"0% галюцинацій" - це гра слів. Модель структурно не може віддати значення поза схемою: гарантована форма, а не зміст. Помилитись впевнено вона може спокійно, і в лаунч-дописі TypeSafe самі визнають - "our number is not empirical".
Бенчмарки теж домашні: за еталон беруть усереднену відповідь GPT-6 Astra і Fable 5.1, а не перевірену істину. На агрегованому воркфлоу-тесті Jev дає 67.8% проти 74.1% у GPT-5.6 Sol.
Зовні модель ганяли в Every. Mike Taylor прогнав 37 документів: 777 суджень за 0.7 секунди за чверть цента. В окремому тесті Dan Shipper дав Jev і Fable 5.1 однакові перевірки на підроблені дефекти - Jev знайшов 6 з 7, Fable всі 7, але була в ~25 разів повільніша і в ~580 разів дорожча.
А з українською як?
Ніяк не зрозуміло. TypeSafe ніде не пише ні про мультимовність, ні про "тільки англійська", ні про склад тренувальних даних. Бенчмарків на неанглійських мовах не існує. У HN-треді на 491 коментар мовне питання не підняв ніхто.
Єдиний слід - коментар в issue стороннього опенсорсного проєкту: на сучасній побутовій лексиці нібито норм, а на нормативних нюансах просідає і тягне русизми з тренувальних даних. Одна суб'єктивна оцінка без цифр, не доказ.
Тож це не заміна LLM, а окремий інструмент для швидких рішень у проді. І перед українським кейсом його доведеться тестити самому.
Огляд Syntax на ~18 хвилин: https://youtu.be/QbYBRjOaGOo
Для: тих, хто будує продукти на AI
TL;DR: Jev від TypeSafe не генерує текст, а приймає типізовані рішення за 70-500 мс і за копійки. Але половина цифр з лаунчу - маркетинг.
15 вересня TypeSafe AI відкрила ранній доступ до Jev і назвала це новою категорією моделей - System One. Засновник Diogo Almeida - один з авторів InstructGPT, методу, на якому зробили ChatGPT. Людина, яка вчила AI говорити, два роки пиляла в стелсі модель, що принципово мовчить.
Шо воно робить
Даєш на вхід неструктурований стан програми - отримуєш типізовану відповідь за один паралельний прохід, не токен за токеном. Вибір з варіантів, оцінка, число. Простір відповідей задаєш ти, максимум 255 варіантів.
Вхідні токени $0.042 за мільйон, вихідні безкоштовні. Заявляють до 193x швидше і до 444x дешевше за LLM. Довгого контексту нема, мультимодальності нема, код не пише, розмову не веде.
Де зірочка
"0% галюцинацій" - це гра слів. Модель структурно не може віддати значення поза схемою: гарантована форма, а не зміст. Помилитись впевнено вона може спокійно, і в лаунч-дописі TypeSafe самі визнають - "our number is not empirical".
Бенчмарки теж домашні: за еталон беруть усереднену відповідь GPT-6 Astra і Fable 5.1, а не перевірену істину. На агрегованому воркфлоу-тесті Jev дає 67.8% проти 74.1% у GPT-5.6 Sol.
Зовні модель ганяли в Every. Mike Taylor прогнав 37 документів: 777 суджень за 0.7 секунди за чверть цента. В окремому тесті Dan Shipper дав Jev і Fable 5.1 однакові перевірки на підроблені дефекти - Jev знайшов 6 з 7, Fable всі 7, але була в ~25 разів повільніша і в ~580 разів дорожча.
А з українською як?
Ніяк не зрозуміло. TypeSafe ніде не пише ні про мультимовність, ні про "тільки англійська", ні про склад тренувальних даних. Бенчмарків на неанглійських мовах не існує. У HN-треді на 491 коментар мовне питання не підняв ніхто.
Єдиний слід - коментар в issue стороннього опенсорсного проєкту: на сучасній побутовій лексиці нібито норм, а на нормативних нюансах просідає і тягне русизми з тренувальних даних. Одна суб'єктивна оцінка без цифр, не доказ.
Тож це не заміна LLM, а окремий інструмент для швидких рішень у проді. І перед українським кейсом його доведеться тестити самому.
Огляд Syntax на ~18 хвилин: https://youtu.be/QbYBRjOaGOo