Джерело
llms_ua | Чи тримає українська типізовані судження?Тестую модель Jev від Typesaf...
194 Охват/переглядів
2026-09-18 22:12
Повідомлення №124
Чи тримає українська типізовані судження?
Тестую модель Jev від Typesafe.
Виглядає це так. Даю йому шматок розшифровки дзвінка в тому вигляді, в якому вона реально виходить із транскрибації, без розділових знаків і з суржиком:
«алло да добрий день я дзвоню приводу замовлення там косточка ця впивається ну і взагалі носити невозможно шо мені робити»
І ставлю до цього тексту не одне питання «проаналізуй звернення», а чотири окремі:
клієнт просить повернути гроші 0.04
клієнт просить обміняти товар 0.16
клієнт незадоволений 0.85
скарга на посадку по фігурі 0.93
У відповідь отримую чотири числа, які позначають вірогідність ствердної відповіді. Далі працює звичайний код: поставив поріг і маєш маршрутизацію. Питання я ставив англійською, тут перекладаю для читабельності.
Мене цікавило одне: що станеться з цими числами, коли текст буде українською. У документації сказано рівно стільки, що англійська основна, а решта мов «працює гірше, перевіряйте самі».
⬥ Зібрав вісім однакових звернень трьома мовами і прогнав ту саму батарею. Перший раунд дав 36 правильних відповідей із 36 у кожній мові. Це стеля: приклади були надто прості.
⬥ У другому раунді зібрав навмисно складне. Сарказм: «Супер. Прийшло за три тижні замість двох днів. Дуже задоволена» дало незадоволеність 0.87. Подвійне заперечення: «Не можу сказати, що мені не подобається» дало 0.14. Плюс той суржик вище. Англійська 28/30, українська 28/30. Жодної відповіді, яка перекинулась би на інший бік порогу.
⬥ Обидві помилки припали на ті самі два приклади в обох мовах. Мовна проблема виглядає інакше, вона вилазить в одній мові й не вилазить у другій.
⬥ Пішов перечитувати власні питання. Ось як було сформульовано те, що зламалось:
«Клієнт прямо просить повернути гроші»
А ось звернення, на якому воно зламалось:
«Якщо не підійде, чи зможу я повернути гроші?»
Це питання про умови повернення від людини, яка ще нічого не купила. Але слова про повернення грошей у ньому є, і модель повернула 0.78. Вона відповідала рівно на те, що я написав.
⬥ Переписав так, щоб межа лежала всередині самого питання:
«Клієнт просить назад гроші, які вже заплатив. Якщо він лише цікавиться, чи можливе повернення в принципі, ще не купивши, це не рахується.»
0.78 → 0.27 українською, 0.83 → 0.18 англійською. Контрольне звернення «Пишу втретє. Ніхто не відповідає. Поверніть мені гроші, негайно» як було 0.97, так і лишилось.
Резюме: українською працює, і працює добре. На цих прикладах результат той самий, що й англійською. Середня розбіжність між числами 0.04, і жодна відповідь не перекинулась на інший бік порогу через мову.
А вузьке місце виявилось у формулюванні питання, і воно однакове в обох мовах.
Тестував на восьми прикладах, які я сам написав і сам розмітив. Справжні розшифровки дзвінків довші, брудніші й поки не перевірені.
🐋 @llms_ua
Тестую модель Jev від Typesafe.
Виглядає це так. Даю йому шматок розшифровки дзвінка в тому вигляді, в якому вона реально виходить із транскрибації, без розділових знаків і з суржиком:
«алло да добрий день я дзвоню приводу замовлення там косточка ця впивається ну і взагалі носити невозможно шо мені робити»
І ставлю до цього тексту не одне питання «проаналізуй звернення», а чотири окремі:
клієнт просить повернути гроші 0.04
клієнт просить обміняти товар 0.16
клієнт незадоволений 0.85
скарга на посадку по фігурі 0.93
У відповідь отримую чотири числа, які позначають вірогідність ствердної відповіді. Далі працює звичайний код: поставив поріг і маєш маршрутизацію. Питання я ставив англійською, тут перекладаю для читабельності.
Мене цікавило одне: що станеться з цими числами, коли текст буде українською. У документації сказано рівно стільки, що англійська основна, а решта мов «працює гірше, перевіряйте самі».
⬥ Зібрав вісім однакових звернень трьома мовами і прогнав ту саму батарею. Перший раунд дав 36 правильних відповідей із 36 у кожній мові. Це стеля: приклади були надто прості.
⬥ У другому раунді зібрав навмисно складне. Сарказм: «Супер. Прийшло за три тижні замість двох днів. Дуже задоволена» дало незадоволеність 0.87. Подвійне заперечення: «Не можу сказати, що мені не подобається» дало 0.14. Плюс той суржик вище. Англійська 28/30, українська 28/30. Жодної відповіді, яка перекинулась би на інший бік порогу.
⬥ Обидві помилки припали на ті самі два приклади в обох мовах. Мовна проблема виглядає інакше, вона вилазить в одній мові й не вилазить у другій.
⬥ Пішов перечитувати власні питання. Ось як було сформульовано те, що зламалось:
«Клієнт прямо просить повернути гроші»
А ось звернення, на якому воно зламалось:
«Якщо не підійде, чи зможу я повернути гроші?»
Це питання про умови повернення від людини, яка ще нічого не купила. Але слова про повернення грошей у ньому є, і модель повернула 0.78. Вона відповідала рівно на те, що я написав.
⬥ Переписав так, щоб межа лежала всередині самого питання:
«Клієнт просить назад гроші, які вже заплатив. Якщо він лише цікавиться, чи можливе повернення в принципі, ще не купивши, це не рахується.»
0.78 → 0.27 українською, 0.83 → 0.18 англійською. Контрольне звернення «Пишу втретє. Ніхто не відповідає. Поверніть мені гроші, негайно» як було 0.97, так і лишилось.
Резюме: українською працює, і працює добре. На цих прикладах результат той самий, що й англійською. Середня розбіжність між числами 0.04, і жодна відповідь не перекинулась на інший бік порогу через мову.
А вузьке місце виявилось у формулюванні питання, і воно однакове в обох мовах.
Тестував на восьми прикладах, які я сам написав і сам розмітив. Справжні розшифровки дзвінків довші, брудніші й поки не перевірені.
🐋 @llms_ua