Wireva

Microsoft AI випустила модель розпізнавання мови MAI-Transcribe-2 за 10 центів за годину аудіо

Microsoft AI представила MAI-Transcribe-2, яка перевершує конкурентів за швидкістю та точністю, коштуючи лише 10 центів за годину аудіо. Це на 72% дешевше за попередню модель і суттєво змінює економіку транскрипції для бізнесу.

Матеріал підготовлено за допомогою ШІ під редакційною відповідальністю Haydamax OÜ.

Microsoft AI 20 лютого представила модель розпізнавання мови MAI-Transcribe-2, яку компанія позиціонує як швидшу, точнішу та дешевшу за рішення OpenAI, Google та ElevenLabs. Вартість обробки однієї години аудіо становить лише 10 центів, що на 72% менше порівняно з попередньою версією MAI-Transcribe-1.5, яка коштувала 36 центів за годину. Для підприємства, що обробляє 100 тисяч годин аудіо щороку, наприклад, банку чи телеком-оператора, річні витрати на транскрипцію знизяться з 36 тисяч до 10 тисяч доларів.

Модель підтримує 60 мов, що значно більше, ніж 43 мови у червневій версії та 25 мов у квітневому оригінальному релізі. MAI-Transcribe-2 доступна через Microsoft Foundry, маркетплейс моделей для розробників, та у тестовому середовищі MAI Playground. Компанія стверджує, що модель створена для роботи з «брудним» аудіо, яке реально зустрічається в бізнесі: фоновим шумом, записами низької якості та перекриванням мовців, а не лише з чистими студійними умовами.

Ключова перевага MAI-Transcribe-2 — вбудовані функції, які раніше продавалися окремо спеціалізованими вендорами. До них належать діаризація мовців, що дозволяє визначити, хто і що сказав у багатоголосому записі, таймкоди для кожного слова, що полегшують пошук і редагування, та біасування ключових слів, яке дозволяє розробникам задавати список термінів, наприклад, назв ліків чи продуктів, щоб модель не спотворювала їх. Також реалізовано автоматичне визначення мови, що позбавляє користувачів необхідності вказувати її заздалегідь.

Окремої уваги заслуговують два режими виводу. Режим «verbatim» зберігає всі «ем», хибні початки та заїкання, що критично для юридичних і комплаєнс-відділів, тоді як режим «clean» прибирає зайві слова для створення читабельних субтитрів і нотаток. Модель також підтримує перемикання кодів, тобто обробку розмов, де мовці переходять між мовами в межах одного речення. Microsoft прямо згадує хінгліш та спангліш, що відображає потреби індійського та американського іспаномовного ринків, де в одній розмові з клієнтською підтримкою мова може змінюватися десятки разів.

Microsoft заявляє, що MAI-Transcribe-2 посідає перше місце у бенчмарку FLEURS із середньою частотою помилок у словах 5,2% для 60 мов. FLEURS — це стандартний тест для багатомовного розпізнавання мови, створений дослідниками Google у 2022 році на основі читання носіями мови приблизно 2000 речень кожною з 102 мов. Водночас середній показник моделі зріс порівняно з 3,7% у червневій версії, що, ймовірно, пояснюється ширшим покриттям мов, включно з низькоресурсними, де всі моделі працюють гірше.

За даними незалежного бенчмаркера Artificial Analysis, MAI-Transcribe-2 посідає друге місце у рейтингу частоти помилок і визначає межу Парето між точністю та швидкістю. Це означає, що жоден конкурент не може перевершити модель за точністю, не поступаючись у швидкості, і навпаки. Модель також у 10 разів швидша за OpenAI GPT-Transcribe, у сім разів — за ElevenLabs Scribe v2 та у п’ять разів — за Google Gemini 3.5 Transcribe. Для пакетної транскрипції швидкість означає менші витрати на GPU-години, що дозволяє Microsoft утримувати ціну на рівні 10 центів.

Випуск MAI-Transcribe-2 є частиною стратегії Microsoft AI, яка передбачає поступову заміну технологій OpenAI власними моделями. За п’ять місяців компанія випустила три версії моделі транскрипції, що демонструє прискорений темп розробки. Це також свідчить про намір Microsoft конкурувати в галузі штучного інтелекту, не покладаючись на партнера, у якого компанія інвестувала 13 мільярдів доларів.

Same event, other desks

Story file →