OmniHuman — оживи фото людини голосом і рухом

Що таке OmniHuman

OmniHuman — це генеративна модель для відео, розроблена ByteDance — компанією, що стоїть за TikTok. Вона бере одне-єдине фото людини та аудіозапис (мовлення або пісню) і перетворює їх на відео, у якому людина з фото говорить чи співає. Рухи губ, голови й тіла синхронізуються зі звуком, тож статичний образ оживає природно.

На відміну від моделей, які просто додають рух до фото, OmniHuman спрямована саме на людський образ і мовлення — мета в тому, щоб губи точно повторювали почуте, а вираз обличчя та жести виглядали живими, а не механічними. Тому це зручний вибір, коли хочеш змусити конкретне фото людини „заговорити" певним голосом.

У genkiki.com модель доступна як „OmniHuman (фото → мовлення)" у режимі Відео з фото — завантажуєш портрет і аудіо, а система повертає готове відео.

Версії та можливості в generiram

OmniHuman пропонується як одна модель з чітким завданням: оживлення фото людини за допомогою голосу. Нижче коротко про те, що вона робить.

ВаріантРежимиДля чого
OmniHuman (фото → мовлення)Відео з фотоПеретворює фото людини + аудіозапис на відео, де вона говорить або співає, із синхроном губ, голови й тіла

Відео з фото

Подаєш фото людини та аудіозапис. OmniHuman зберігає образ з фото й додає рух губ у такт мовленню, а також природні рухи голови й тіла. Результат — відео, у якому людина з фото виглядає так, ніби справді вимовляє чи виспівує поданий звук.

Для чого підходить

  • Оживлення портрета — зроби так, щоб статичне фото заговорило чи заспівало.
  • Аватари, що говорять — створи персонажа чи обличчя, яке передає повідомлення певним голосом.
  • Фото, що говорять — оживи сімейне, історичне чи продуктове фото людини.
  • Дублювання статичного образу — додай голос і міміку до одного кадру, без камери та зйомки.

Як почати

Відкрий AI Студію genkiki.com, обери OmniHuman (фото → мовлення), завантаж чітке фото людини й аудіозапис, який хочеш почути, і запусти генерацію. Для найкращого результату візьми фото, на якому обличчя добре видно й освітлене, та чистий аудіозапис без гучного фонового шуму.

Моделі OmniHuman — детально

Яка для чого годиться, де слабка й для чого її не варто використовувати.

OmniHuman (photo → speech)

референсвідео
Пропорції: 1:1, 9:16, 16:9 Тривалості: 5 сек, 10 сек Ціна: 311 кредити

Сильні сторони

  • З ОДНОГО фото та звуку робить відео, у якому людина говорить або співає — без знятого відео
  • Рухає не лише губи: зчитує ЕМОЦІЮ у звуці й грає всім тілом — збуджене мовлення дає інші жести, ніж тихий сповідальний тон
  • Під капотом працюють ДВА розуми: один розбирає зміст звуку й планує жест, другий малює його кадр за кадром
  • Спів передбачений — паузи, зміна настрою та сценічний рух
  • Сприймає кількох героїв у кадрі
  • Приймає й короткий текст на додачу до звуку — ним задаються рух камери, жест чи настрій

Слабкі сторони

  • Тривалість залежить від якості: до 30 секунд звуку на 1080p і до 60 секунд на 720p
  • Найкраща вона під 15 секунд — понад це результат починає розсипатися
  • Сцена СТАТИЧНА: фон не змінюється, камера стоїть, людина лишається приблизно на місці
  • Результат цілком залежить від фото — з поганого фото виходить погане відео
  • Швидке й уривчасте мовлення дає їй менше часу, щоб устоятися в жесті

Не використовуй для

  • Не подавай фото в профіль, із закритим обличчям чи в окулярах, що ховають очі
  • Не давай їй довгого запису одразу — ріж його на частини до 15 секунд
  • Не використовуй, коли зняте відео вже є — там синхрон губ точніший

Типові завдання

  • Аватар, що говорить, з одного фото
  • Портрет, що співає
  • Звернення за поданим текстом і голосом
  • Оживлений архівний чи сімейний портрет
  • Ведучий для короткого відео, без знімального дня

Спробуй OmniHuman зараз

Генеруй власні відео з OmniHuman прямо в браузері — без встановлення, українською.