Wireva

Google представила TTS-моделі Gemini 3.8 Flash TTS і Flash-Lite TTS зі створенням голосів за описом

Google випустила дві нові моделі синтезу мовлення — Gemini 3.8 Flash TTS і Flash-Lite TTS. Вони підтримують понад 100 мов, дозволяють створювати нові голоси з текстового опису, додавати режисерські вказівки до окремих реплік і генерувати діалог двох голосів з одного сценарію. Клонування голосу потребує 30-секундного зразка.

Google додала до свого стека генеративного ШІ дві нові моделі синтезу мовлення — Gemini 3.8 Flash TTS і Flash-Lite TTS. Обидві підтримують понад 100 мов, але ключова відмінність у тому, що Flash TTS уміє створювати нові голоси з текстового опису, а не лише відтворювати заздалегідь підготовлені голоси. Для команд, які роблять озвучення продуктів, рекламних роликів чи аудіоверсій контенту, це змінює сам процес роботи з голосом: замість вибору з готового списку достатньо сформулювати, який тембр, темп і манера потрібні.

Друга важлива деталь — підтримка режисерських вказівок. Обидві моделі дозволяють додавати до окремих реплік позначки на кшталт емоції, паузи чи інтонації, тобто керувати подачею не на рівні всього файлу, а на рівні конкретного рядка сценарію. Це саме та гранулярність, якої бракує більшості масових TTS-інструментів, де доводиться або приймати «рівний» голос, або вручну збирати аудіо з фрагментів. Крім того, моделі можуть генерувати діалог двох голосів з одного сценарію — без окремого запису кожної ролі.

Третя функція — клонування голосу. Система будує голосовий профіль із 30-секундного зразка. Це порівняно невеликий обсяг: для якісного клонування раніше часто потрібні були довші записи й окремі етапи обробки. Для агенцій і продакшенів це означає, що створити робочий голос можна швидше, але водночас загострює питання згод і прав на використання голосу диктора — тема, яка в українському digital вже давно болить у роботі з інфлюенсерами та озвученням.

Для українського ринку тут є кілька практичних наслідків. По-перше, підтримка понад 100 мов означає, що українська з великою ймовірністю входить до переліку, але якість саме української вимови треба перевіряти на власних текстах: наголоси, відмінювання числівників і власні назви — типові місця, де синтез спотикається. По-друге, створення голосу з опису відкриває швидкий шлях до аудіоверсій лендингів, подкастів, навчальних курсів і рекламних креативів без студії. По-третє, клонування з 30-секундного зразка спокушає зекономити на дикторі, але саме тут варто заздалегідь узгодити права.

Конкуренція на цьому полі щільна: ElevenLabs, OpenAI та інші гравці вже пропонують схожі функції, тож Google фактично наздоганяє й розширює набір у межах власної екосистеми. Для команд, які вже працюють із Gemini, це може означати менше інтеграцій із сторонніми сервісами. Для тих, хто будує аудіопродукти на кількох мовах, — привід переглянути пайплайн озвучення й перевірити, чи витримує він вимоги до якості української.

Практичний висновок простий: якщо у вас є контент, який довго й дорого озвучувати, варто протестувати Flash TTS на реальному сценарії — з режисерськими вказівками й діалогом. Але перед запуском у продакшен перевірте вимову, права на клонований голос і те, чи не доведеться все одно кликати диктора для фінального дубля.