Текст в говор значи, че пишеш текста и AI го прочита с човешки глас. В genkiki.com това се прави на български и се използва най-често за озвучаване на видео — реклама, обучение, представяне на продукт. Избираш глас, поставяш текста и получаваш звуков файл, който се слага под клипа. Всеки модел приема различна дължина на текста; числата са в таблицата по-долу.
Най-честата поръчка не е „прочети ми книга“, а тридесет секунди говор под рекламен клип. За реклама важат три неща. Първо — енергията: рекламният текст се чете по-бързо и по-високо от обучителния. Второ — дължината: гласът се пише под вече готовия клип, не обратното, за да не се наложи да се реже. Трето — еднаквост: една и съща марка използва един и същ глас във всички клипове, иначе рекламите не се разпознават като нейни. За фирма това значи, че веднъж избраният глас се записва и се ползва за целия поток съдържание — нещо, което с нает диктор излиза много по-скъпо.
Всеки модел има таван на текста за едно пускане — той е в таблицата по-горе, в колоната „Най-дълъг текст“. По-дългият материал се разделя на части и се слепва. Цената тук е за пускане, не на секунда. И едно важно ограничение: гласът на конкретен жив човек не се възпроизвежда без неговото съгласие — това е в правилата за съдържанието. Ако вместо звуков файл ти трябва човек, който говори в кадър, това е друг режим и се прави от снимка.
Видеото, под което върви гласът, се прави на AI видео генератора или направо от текст към видео. Рекламните употреби са на UGC рекламата и на рекламата по индустрии; вертикалният формат — на YouTube Shorts; за брокери — видео за имоти; за магазини за дрехи — AI модел за дрехи. Всичко се прави в AI студиото; редът е на Как работи. Гласовите модели с картите им: всички модели, ElevenLabs, MiniMax Speech, OmniHuman. Цените и кредитите са на цените, а останалите въпроси — на Въпроси и отговори.
Цената в кредити е базовата за модела и стои и на бутона „Генерирай“ преди всяко пускане. При видео тя е за СЕКУНДА — пет секунди струват пет пъти по толкова.
| Modèle | Crédits | Най-дълго | Най-дълъг текст |
|---|---|---|---|
| ElevenLabs v3 | 196 | — | 5000 знака |
| MiniMax 2.8 | 196 | — | 10000 знака |
| Modèle | Crédits | Най-дълго | Най-дълъг текст |
|---|---|---|---|
| VEED Lip-sync | 18 за секунда | 60 s | — |
| Kling Lip-sync | 31 за секунда | 60 s | 2500 знака |
| Sync 2.0 Pro Lip-sync | 164 за секунда | 60 s | — |
| Gemini Omni Flash | 196 за секунда | 10 s | 20000 знака |
| Seedance 2.0 Mini | 304 за секунда | 15 s | 5000 знака |
| OmniHuman (photo → parole) | 314 за секунда | 60 s | — |
| Seedance 2.0 Fast | 475 за секунда | 15 s | 5000 знака |
| Seedance 2.0 Standard | 595 за секунда | 15 s | 5000 знака |
| Seedance 2.5 | 929 за секунда | 30 s | — |
Реални генерации на хората, споделени в Общността — не подбрани картинки.
Последна актуализация: