Source
Михайло Пацан || Польові нотатки Інвестора | Модель, яка відповідає лише так або ніПро Jev від TypeSafe AI останній...
316 Views/Reach
2026-09-21 04:14
Message №1432
Модель, яка відповідає лише так або ні
Про Jev від TypeSafe AI останній тиждень пишуть усі, я мовчав свідомо: ми одразу поставили модель на реальні продукти і чекали, поки зʼявляться результати, про які варто говорити, а не переказ анонсу. Тепер вони є.
Спочатку про проблему, яку ця модель закриває. У будь-якій фінансовій компанії є задачі, де одне й те саме питання ставиться тисячі разів на день. Служба безпеки перевіряє контрагента і мусить із кількох десятків сторінок реєстрів, судових справ і звітності відповісти на десятки однакових питань: чи є податковий борг, чи компанія відповідач у судових спорах, чи змінювався власник за останній рік, чи є зв'язок із санкційними особами. Кол-центр кредитної чи страхової компанії щодня записує сотні розмов і листувань, і кожне треба перевірити за одним списком: чи клієнт скаржиться, чи менеджер назвав повну вартість, чи прозвучала обіцянка, якої немає в договорі. До появи мовних моделей це читали люди і встигали переглянути вибірково. Останні два роки це читає велика модель, і тут з'явилась інша проблема: вона на кожен дзвінок і кожного контрагента заново перечитує інструкцію на кілька сторінок, думає кілька секунд, коштує реальних грошей, а головне, час від часу впевнено відповідає щось, чого в документі нема. Тому за нею все одно стоїть людина, яка перечитує.
15 вересня TypeSafe AI показала Jev, побудовану саме під це. Заснував компанію Діогу Алмейда, один із людей, які в OpenAI придумали RLHF, метод навчання, що зробив із мовної моделі ChatGPT. Jev тексту не генерує взагалі. Ви даєте їй документ або транскрипт і список питань із наперед відомими варіантами відповідей, а вона за долі секунди відповідає на всі одразу і до кожної відповіді додає впевненість у відсотках. TypeSafe називає це моделлю System One, за Канеманом: швидка інтуїція замість повільного міркування. За їхніми цифрами модель у 40-200 разів швидша за ChatGPT чи Claude на таких задачах, коштує 4 центи за мільйон вхідних токенів, а вихідні безкоштовні. Вигадати відповідь вона фізично неспроможна, бо вибирає лише зі списку варіантів, який дали ви.
У Kontragents. com кожна перевірка проходить по десятках критеріїв ризику, і раніше всі вони йшли через велику модель. Тепер питання так або ні і всі шкали ризику забирає Jev: реєстри, судові справи і зв'язки оцінюються за секунду на компанію, а велика модель пише лише підсумковий висновок для людини, яка ухвалює рішення про угоду. Перевірка стала швидшою в рази, а випадки, коли модель приписувала компанії те, чого в документах нема, зникли, бо варіант поза списком Jev видати неспроможна. У системі контролю якості дзвінків, переписок і листування Jev проганяє кожну розмову за списком контрольних питань, а велика модель робить резюме лише тих, де відповіді насторожили. Керівник відділу отримує рівно ті діалоги, які треба послухати, замість вибірки з десяти відсотків. Ну і аналіз йде 100 із 100 дзвінків, а не лише 5-7%.
Це два приклади, які вже видно назовні, а всередині таких місць набагато більше. Маршрутизація вхідних листів і заявок, відсів спаму й дублікатів, перевірка, чи заповнені всі поля в документі, вибір, яку велику модель запускати під конкретний запит, а яку задачу взагалі закрити без неї, оцінка, чи відповідь агента можна відправляти клієнту або спочатку показати людині. Кожен з цих кроків - питання з відомими варіантами відповіді, і кожен зараз або коштує запуск дорогої моделі, або тримається на людині.
Найкорисніша деталь для нас у цій моделі - впевненість біля кожної відповіді. Я давно пишу, що людина має стояти там, де рухаються гроші. Тут це вбудовано: впевненість вища за 90 відсотків - агент діє сам, нижча - задача летить людині. Раніше цей поріг ми домальовували вручну у кожному впровадженні, тепер він частина моделі. Межі теж видно: Jev нічого не напише, не пояснить і не порозмовляє з клієнтом, тож висновок по контрагенту і звіт по дзвінках лишаються за великими моделями, а Jev працює сортувальником перед ними.
Для кінцевого користувача Jev - це ще один технічний апдейт, а для ШІ-архітектури зміни драматичні.
#шірадар
Про Jev від TypeSafe AI останній тиждень пишуть усі, я мовчав свідомо: ми одразу поставили модель на реальні продукти і чекали, поки зʼявляться результати, про які варто говорити, а не переказ анонсу. Тепер вони є.
Спочатку про проблему, яку ця модель закриває. У будь-якій фінансовій компанії є задачі, де одне й те саме питання ставиться тисячі разів на день. Служба безпеки перевіряє контрагента і мусить із кількох десятків сторінок реєстрів, судових справ і звітності відповісти на десятки однакових питань: чи є податковий борг, чи компанія відповідач у судових спорах, чи змінювався власник за останній рік, чи є зв'язок із санкційними особами. Кол-центр кредитної чи страхової компанії щодня записує сотні розмов і листувань, і кожне треба перевірити за одним списком: чи клієнт скаржиться, чи менеджер назвав повну вартість, чи прозвучала обіцянка, якої немає в договорі. До появи мовних моделей це читали люди і встигали переглянути вибірково. Останні два роки це читає велика модель, і тут з'явилась інша проблема: вона на кожен дзвінок і кожного контрагента заново перечитує інструкцію на кілька сторінок, думає кілька секунд, коштує реальних грошей, а головне, час від часу впевнено відповідає щось, чого в документі нема. Тому за нею все одно стоїть людина, яка перечитує.
15 вересня TypeSafe AI показала Jev, побудовану саме під це. Заснував компанію Діогу Алмейда, один із людей, які в OpenAI придумали RLHF, метод навчання, що зробив із мовної моделі ChatGPT. Jev тексту не генерує взагалі. Ви даєте їй документ або транскрипт і список питань із наперед відомими варіантами відповідей, а вона за долі секунди відповідає на всі одразу і до кожної відповіді додає впевненість у відсотках. TypeSafe називає це моделлю System One, за Канеманом: швидка інтуїція замість повільного міркування. За їхніми цифрами модель у 40-200 разів швидша за ChatGPT чи Claude на таких задачах, коштує 4 центи за мільйон вхідних токенів, а вихідні безкоштовні. Вигадати відповідь вона фізично неспроможна, бо вибирає лише зі списку варіантів, який дали ви.
У Kontragents. com кожна перевірка проходить по десятках критеріїв ризику, і раніше всі вони йшли через велику модель. Тепер питання так або ні і всі шкали ризику забирає Jev: реєстри, судові справи і зв'язки оцінюються за секунду на компанію, а велика модель пише лише підсумковий висновок для людини, яка ухвалює рішення про угоду. Перевірка стала швидшою в рази, а випадки, коли модель приписувала компанії те, чого в документах нема, зникли, бо варіант поза списком Jev видати неспроможна. У системі контролю якості дзвінків, переписок і листування Jev проганяє кожну розмову за списком контрольних питань, а велика модель робить резюме лише тих, де відповіді насторожили. Керівник відділу отримує рівно ті діалоги, які треба послухати, замість вибірки з десяти відсотків. Ну і аналіз йде 100 із 100 дзвінків, а не лише 5-7%.
Це два приклади, які вже видно назовні, а всередині таких місць набагато більше. Маршрутизація вхідних листів і заявок, відсів спаму й дублікатів, перевірка, чи заповнені всі поля в документі, вибір, яку велику модель запускати під конкретний запит, а яку задачу взагалі закрити без неї, оцінка, чи відповідь агента можна відправляти клієнту або спочатку показати людині. Кожен з цих кроків - питання з відомими варіантами відповіді, і кожен зараз або коштує запуск дорогої моделі, або тримається на людині.
Найкорисніша деталь для нас у цій моделі - впевненість біля кожної відповіді. Я давно пишу, що людина має стояти там, де рухаються гроші. Тут це вбудовано: впевненість вища за 90 відсотків - агент діє сам, нижча - задача летить людині. Раніше цей поріг ми домальовували вручну у кожному впровадженні, тепер він частина моделі. Межі теж видно: Jev нічого не напише, не пояснить і не порозмовляє з клієнтом, тож висновок по контрагенту і звіт по дзвінках лишаються за великими моделями, а Jev працює сортувальником перед ними.
Для кінцевого користувача Jev - це ще один технічний апдейт, а для ШІ-архітектури зміни драматичні.
#шірадар