Source
ШІ: Від теорії до практики | Голосом Qwen тепер керують текстом — як актором на репетиціїЩе донедав...
39 Views/Reach
2026-09-26 11:59
Message №13314
Голосом Qwen тепер керують текстом — як актором на репетиції
Ще донедавна керувати інтонацією TTS-моделі означало обирати з десятка готових пресетів. Тут — просто пишеш, що хочеш почути.
Qwen-Audio-3.1-TTS від Alibaba розуміє звичайні текстові інструкції: попроси говорити швидше, тихіше, налякано чи «як ведуча ранкового радіошоу» — і модель відпрацює. Для точнішого контролю є 86 inline-тегів — сміх, зітхання, дихання, кашель, паузи — які можна вставляти прямо всередині тексту в потрібному місці фрази.
Клонування голосу — за одним прикладом, і модель непогано тримається навіть на шумних чи «глухих» записах (телефонна якість, реверберація). При переході на іншу мову тембр голосу зберігається — перевірено на переходах між китайською, англійською, японською, корейською.
Підтримується 16 мов, включно з російською, а до того ж — 20 регіональних китайських діалектів. Одна генерація видає до 3 хвилин мовлення без склеювання, якість — до 48 кГц.
За заявленими бенчмарками модель показує найкращі результати на кількох незалежних оцінках і посідає перше місце в рейтингу Artificial Analysis Text-to-Speech Leaderboard.
Нюанс: посилання — це дослідницька демо-сторінка з прикладом до статті на arXiv, а не сторінка продукту. Сама модель при цьому вже доступна через API — Alibaba Cloud (DashScope/Bailian) та сторонні хостинги на кшталт fal.ai.
👉 Демо-сторінка
#Корисні_нейронки
Підписатись на канал: ШІ: Від теорії до практики
Ще донедавна керувати інтонацією TTS-моделі означало обирати з десятка готових пресетів. Тут — просто пишеш, що хочеш почути.
Qwen-Audio-3.1-TTS від Alibaba розуміє звичайні текстові інструкції: попроси говорити швидше, тихіше, налякано чи «як ведуча ранкового радіошоу» — і модель відпрацює. Для точнішого контролю є 86 inline-тегів — сміх, зітхання, дихання, кашель, паузи — які можна вставляти прямо всередині тексту в потрібному місці фрази.
Клонування голосу — за одним прикладом, і модель непогано тримається навіть на шумних чи «глухих» записах (телефонна якість, реверберація). При переході на іншу мову тембр голосу зберігається — перевірено на переходах між китайською, англійською, японською, корейською.
Підтримується 16 мов, включно з російською, а до того ж — 20 регіональних китайських діалектів. Одна генерація видає до 3 хвилин мовлення без склеювання, якість — до 48 кГц.
За заявленими бенчмарками модель показує найкращі результати на кількох незалежних оцінках і посідає перше місце в рейтингу Artificial Analysis Text-to-Speech Leaderboard.
Нюанс: посилання — це дослідницька демо-сторінка з прикладом до статті на arXiv, а не сторінка продукту. Сама модель при цьому вже доступна через API — Alibaba Cloud (DashScope/Bailian) та сторонні хостинги на кшталт fal.ai.
👉 Демо-сторінка
#Корисні_нейронки
Підписатись на канал: ШІ: Від теорії до практики