Source
AI no magic | Alibaba випустила Qwen3.8-LiveTranslate — новий рівень синхронного пер...
376 Views/Reach
2026-09-22 05:20
Message №516
🎙 Alibaba випустила Qwen3.8-LiveTranslate — новий рівень синхронного перекладу мови!
Команда Qwen представила передову модель синхронного перекладу в реальному часі, яка суттєво зменшує затримки та покращує якість діалогів.
Головні технологічні фішки релізу:
• 🔄 Архітектура Interleave: Замість класичного каскадного підходу (розпізнавання \rightarrow переклад \rightarrow синтез мови) модель обробляє аудіо, текст та відео в єдиному часовому потоці. Це скоротило середню затримку (LAAL) з 2.8 до 2.3 секунд.
• 👥 Розділення спікерів (Diarization): Модель чітко розуміє, хто саме говорить у багатосторонніх розмовах, та автоматично адаптує переклад під кожного учасника.
• 🗣 Клонування голосу: Зберігається унікальний тембр і характеристики голосу оригінального спікера під час перекладу іншою мовою.
• 📝 Синхронний двомовний вивід: Паралельно з перекладом виводиться вихідний текст, що ідеально підходить для створення субтитрів, аналітики чи моніторингу в реальному часі.
• 🌐 Масштаб: Підтримка 60 мов на вхід та 29 мов із повноцінним голосовим виводом (для решти доступний текст, українська теж тільки текст). Також враховуються контекст і візуальні підказки (наприклад, рухи губ чи жести через відеопотік), що допомагає уникати помилок у складних термінах.
Модель доступна через WebSocket Realtime API (qwen3.8-livetranslate-flash-realtime) для розробників та компаній, які створюють рішення для міжнародних конференцій, стрімів чи онлайн-навчання.
🔗 Детальніше на MarkTechPost.
Команда Qwen представила передову модель синхронного перекладу в реальному часі, яка суттєво зменшує затримки та покращує якість діалогів.
Головні технологічні фішки релізу:
• 🔄 Архітектура Interleave: Замість класичного каскадного підходу (розпізнавання \rightarrow переклад \rightarrow синтез мови) модель обробляє аудіо, текст та відео в єдиному часовому потоці. Це скоротило середню затримку (LAAL) з 2.8 до 2.3 секунд.
• 👥 Розділення спікерів (Diarization): Модель чітко розуміє, хто саме говорить у багатосторонніх розмовах, та автоматично адаптує переклад під кожного учасника.
• 🗣 Клонування голосу: Зберігається унікальний тембр і характеристики голосу оригінального спікера під час перекладу іншою мовою.
• 📝 Синхронний двомовний вивід: Паралельно з перекладом виводиться вихідний текст, що ідеально підходить для створення субтитрів, аналітики чи моніторингу в реальному часі.
• 🌐 Масштаб: Підтримка 60 мов на вхід та 29 мов із повноцінним голосовим виводом (для решти доступний текст, українська теж тільки текст). Також враховуються контекст і візуальні підказки (наприклад, рухи губ чи жести через відеопотік), що допомагає уникати помилок у складних термінах.
Модель доступна через WebSocket Realtime API (qwen3.8-livetranslate-flash-realtime) для розробників та компаній, які створюють рішення для міжнародних конференцій, стрімів чи онлайн-навчання.
🔗 Детальніше на MarkTechPost.