OmniHuman — oživ fotku člověka hlasem a pohybem

Co je OmniHuman

OmniHuman je generativní model pro video, který vyvinula ByteDance — firma stojící za TikTokem. Vezme jedinou fotku člověka a zvukovou nahrávku (řeč nebo zpěv) a promění je ve video, ve kterém člověk z fotky mluví nebo zpívá. Pohyby rtů, hlavy i těla se synchronizují se zvukem, takže statický obraz přirozeně ožije.

Na rozdíl od modelů, které k fotce jen přidají pohyb, míří OmniHuman právě na lidskou podobu a mluvený projev — cílem je, aby rty přesně sledovaly slyšené a aby výraz a gesta působily živě, ne mechanicky. Proto je to praktická volba, když chceš nechat konkrétní fotku člověka „promluvit“ daným hlasem.

V genkiki.com je model dostupný jako „OmniHuman (fotka → řeč)“ v režimu Video z fotky — nahraješ portrét a zvuk a systém vrátí hotové video.

Verze a možnosti v generiram

OmniHuman se nabízí jako jeden model s jasným úkolem: oživit fotku člověka pomocí hlasu. Níže je shrnuté, co umí.

VariantaRežimyK čemu je
OmniHuman (fotka → řeč)Video z fotkyPromění fotku člověka + zvukovou nahrávku v mluvící nebo zpívající video se synchronizací rtů, hlavy a těla

Video z fotky

Podáš fotku člověka a zvukovou nahrávku. OmniHuman zachová podobu z fotky a přidá pohyb rtů v rytmu řeči i přirozené pohyby hlavy a těla. Výsledkem je video, ve kterém člověk z fotky vypadá, jako by podaný zvuk opravdu vyslovoval nebo zpíval.

K čemu se hodí

  • Oživení portrétu — nech statickou fotku promluvit nebo zazpívat.
  • Mluvící avataři — vytvoř postavu nebo tvář, která předá sdělení daným hlasem.
  • Mluvící fotky — oživ rodinnou, historickou nebo produktovou fotku člověka.
  • Dabing statického snímku — přidej hlas a mimiku k jedinému záběru, bez kamery a natáčení.

Jak začít

Otevři AI studio na genkiki.com, vyber OmniHuman (fotka → řeč), nahraj ostrou fotku člověka a zvukovou nahrávku, kterou chceš slyšet, a spusť generování. Nejlepší výsledek dá fotka, na které je obličej dobře vidět a nasvícený, a čistá nahrávka bez silného hluku v pozadí.

Modely OmniHuman — podrobně

Který se na co hodí, kde je slabý a na co se používat nemá.

OmniHuman (photo → speech)

referencevideo
Poměry stran: 1:1, 9:16, 16:9 Délky: 5 s, 10 s Cena: 311 kreditů

Silný v

  • Z JEDINÉ fotky a zvuku udělá video, ve kterém člověk mluví nebo zpívá — bez natočeného videa
  • Nehýbe jen rty: čte EMOCI ve zvuku a hraje celým tělem — rozrušená řeč dá jiná gesta než tichý zpovědní tón
  • Pod tím pracují DVA mozky: jeden čte smysl zvuku a plánuje gesto, druhý ho kreslí snímek po snímku
  • Zpěv je počítaný — pauzy, změna nálady i pohyb po jevišti
  • Snese v záběru několik hrdinů
  • Kromě zvuku přijme i krátký text — tím se zadává pohyb kamery, gesto nebo nálada

Slabý v

  • Délka závisí na kvalitě: až 30 sekund zvuku při 1080p a až 60 sekund při 720p
  • Nejlepší je pod 15 sekund — nad to se výsledek začíná rozpadat
  • Scéna je STATICKÁ: pozadí se nemění, kamera stojí, člověk zůstává zhruba na místě
  • Výsledek závisí úplně na fotce — ze špatné fotky vyjde špatné video
  • Rychlá a sekaná řeč mu dává míň času usadit se v gestu

Nepoužívej ho na

  • Nepodávej fotku z profilu, se zakrytým obličejem nebo s brýlemi, které schovávají oči
  • Nedávej mu dlouhou nahrávku najednou — nakrájej ji na části pod 15 sekund
  • Nepoužívej ho, když už natočené video máš — tam je synchronizace rtů přesnější

Typické úlohy

  • Mluvící avatar z jediné fotky
  • Zpívající portrét
  • Projev podle zadaného textu a hlasu
  • Oživený archivní nebo rodinný portrét
  • Moderátor pro krátké video, bez natáčecího dne

Vyzkoušej OmniHuman hned teď

Generuj vlastní video s OmniHuman přímo v prohlížeči — bez instalace, v češtině.