Джерело
TechBiz Hub | Новини про технології та бізнес | Qwen оновила аудіомоделі та знизила ціни до 95%Qwen представила Qwen-A...
95 Охват/переглядів
2026-09-24 08:04
Повідомлення №7324
Qwen оновила аудіомоделі та знизила ціни до 95%
Qwen представила Qwen-Audio-3.1 — оновлений набір із п’яти моделей для розпізнавання, генерації та роботи з аудіо в реальному часі. До нього увійшли оновлені ASR, TTS і Realtime, а також нові TTS-Next для створення аудіо та ASR-Next для його розуміння.
ASR покращила розпізнавання мов і діалектів та автоматично прибирає слова-паразити й повтори з транскрипцій. ASR-Next розпізнає кількох спікерів, додає таймкоди та може аналізувати емоції, фонові й машинні звуки. TTS підтримує багатомовну генерацію голосу з керуванням емоціями, швидкістю та стилем, а TTS-Next може в одному проході створювати голос, звукові ефекти та фонове аудіо.
Realtime дозволяє одночасно слухати й говорити з можливістю перебивати співрозмовника. Паралельно Qwen суттєво знизила ціни: TTS приблизно на 70%, Realtime на 85%, а ASR — до 95%.
— Блог: fun-resource-shanghai.oss-cn-shanghai
— Qwen-Audio-3.1-ASR: qwencloud.com/models/qwen-audio-3.1-asr-flash-filetrans
— Qwen-Audio-3.1-Realtime: qwencloud.com/models/qwen-audio-3.1-realtime-plus
Qwen представила Qwen-Audio-3.1 — оновлений набір із п’яти моделей для розпізнавання, генерації та роботи з аудіо в реальному часі. До нього увійшли оновлені ASR, TTS і Realtime, а також нові TTS-Next для створення аудіо та ASR-Next для його розуміння.
ASR покращила розпізнавання мов і діалектів та автоматично прибирає слова-паразити й повтори з транскрипцій. ASR-Next розпізнає кількох спікерів, додає таймкоди та може аналізувати емоції, фонові й машинні звуки. TTS підтримує багатомовну генерацію голосу з керуванням емоціями, швидкістю та стилем, а TTS-Next може в одному проході створювати голос, звукові ефекти та фонове аудіо.
Realtime дозволяє одночасно слухати й говорити з можливістю перебивати співрозмовника. Паралельно Qwen суттєво знизила ціни: TTS приблизно на 70%, Realtime на 85%, а ASR — до 95%.
— Блог: fun-resource-shanghai.oss-cn-shanghai
— Qwen-Audio-3.1-ASR: qwencloud.com/models/qwen-audio-3.1-asr-flash-filetrans
— Qwen-Audio-3.1-Realtime: qwencloud.com/models/qwen-audio-3.1-realtime-plus