Wireva

Alibaba випустила Qwen Audio 3.1 і знизила ціни на аудіо-ШІ до 95%

Команда Qwen представила п'ять моделей для розпізнавання мовлення, синтезу голосу та реального часу. Ціни на API впали до 95%, що робить аудіо-ШІ доступнішим для українських продуктів.

Alibaba випустила Qwen Audio 3.1 — лінійку з п'яти моделей для розпізнавання мовлення (ASR), синтезу голосу (TTS) та взаємодії в реальному часі. Головна новина для ринку: вартість API знижена до 95%, що робить аудіо-ШІ значно доступнішим для стартапів і продуктових команд.

ASR-модель покращує розпізнавання багатомовного мовлення та діалектів, а також автоматично прибирає слова-заповнювачі та повтори. ASR-Next додає ідентифікацію кількох спікерів із часовими мітками, розпізнає емоції, фонові шуми та машинний шум. TTS-модель підтримує багатомовний синтез. Це відкриває нові можливості для створення голосових інтерфейсів, транскрипції дзвінків і автоматизації контенту.

Для українських команд це означає, що інтеграція аудіо-ШІ в продукти стає дешевшою. Наприклад, можна швидше та якісніше транскрибувати дзвінки в CRM, створювати голосових ботів для підтримки клієнтів або озвучувати відео без дорогих студій. Зниження цін до 95% дозволяє тестувати гіпотези з мінімальними витратами.

Конкуренція на ринку аудіо-ШІ загострюється: OpenAI, Google та інші гравці також пропонують подібні рішення. Alibaba відповідає агресивною ціновою політикою та розширенням функцій. Для українського ринку це сигнал, що вартість штучного інтелекту продовжує падати, і локальні розробники можуть експериментувати з новими сценаріями.

Практичний висновок: якщо ваша команда відкладала впровадження голосових функцій через ціну, зараз слушний момент переглянути бюджет і протестувати Qwen Audio 3.1. Моделі доступні через API, а документація дозволяє швидко інтегрувати ASR і TTS у застосунки.