OmniHuman (photo → speech)
referencia→videóErős ebben
- EGYETLEN fotóból és hangból készít videót, amelyben az ember beszél vagy énekel — leforgatott videó nélkül
- Nem csak az ajkakat mozgatja: kiolvassa az ÉRZELMET a hangból, és az egész testtel játszik — az izgatott beszéd más gesztusokat ad, mint a halk, vallomásos hang
- Alatta KÉT elme dolgozik: az egyik kiolvassa a hang értelmét, és megtervezi a gesztust, a másik képkockáról képkockára megrajzolja
- Az éneklés be van tervezve — szünetek, hangulatváltás és színpadi mozgás
- Elbír több szereplőt is a képen
- A hang mellett rövid szöveget is fogad — ezzel adható meg a kameramozgás, a gesztus vagy a hangulat
Gyenge ebben
- A hossz a minőségtől függ: 1080p-n legfeljebb 30 másodperc hang, 720p-n pedig legfeljebb 60 másodperc
- 15 másodperc alatt a legjobb — efölött az eredmény kezd szétesni
- A jelenet STATIKUS: a háttér nem változik, a kamera áll, az ember nagyjából egy helyben marad
- Az eredmény teljesen a fotótól függ — rossz fotóból rossz videó lesz
- A gyors, szaggatott beszédnél kevesebb ideje marad, hogy elmélyedjen a gesztusban
Ne használd erre
- Ne adj be profilból készült fotót, takart arcot vagy a szemet elfedő szemüveget
- Ne adj neki hosszú felvételt egyszerre — vágd 15 másodperc alatti részekre
- Ne használd, amikor már van leforgatott videód — ott pontosabb az ajakszinkron
Tipikus feladatok
- Beszélő avatar egyetlen fotóból
- Éneklő portré
- Megszólalás megadott szöveg és hang alapján
- Életre keltett archív vagy családi portré
- Műsorvezető egy rövid videóhoz, forgatási nap nélkül