OmniHuman (photo → speech)
reference→videoSilný v
- Z JEDINÉ fotky a zvuku udělá video, ve kterém člověk mluví nebo zpívá — bez natočeného videa
- Nehýbe jen rty: čte EMOCI ve zvuku a hraje celým tělem — rozrušená řeč dá jiná gesta než tichý zpovědní tón
- Pod tím pracují DVA mozky: jeden čte smysl zvuku a plánuje gesto, druhý ho kreslí snímek po snímku
- Zpěv je počítaný — pauzy, změna nálady i pohyb po jevišti
- Snese v záběru několik hrdinů
- Kromě zvuku přijme i krátký text — tím se zadává pohyb kamery, gesto nebo nálada
Slabý v
- Délka závisí na kvalitě: až 30 sekund zvuku při 1080p a až 60 sekund při 720p
- Nejlepší je pod 15 sekund — nad to se výsledek začíná rozpadat
- Scéna je STATICKÁ: pozadí se nemění, kamera stojí, člověk zůstává zhruba na místě
- Výsledek závisí úplně na fotce — ze špatné fotky vyjde špatné video
- Rychlá a sekaná řeč mu dává míň času usadit se v gestu
Nepoužívej ho na
- Nepodávej fotku z profilu, se zakrytým obličejem nebo s brýlemi, které schovávají oči
- Nedávej mu dlouhou nahrávku najednou — nakrájej ji na části pod 15 sekund
- Nepoužívej ho, když už natočené video máš — tam je synchronizace rtů přesnější
Typické úlohy
- Mluvící avatar z jediné fotky
- Zpívající portrét
- Projev podle zadaného textu a hlasu
- Oživený archivní nebo rodinný portrét
- Moderátor pro krátké video, bez natáčecího dne