OmniHuman (photo → speech)
референс→відеоСильні сторони
- З ОДНОГО фото та звуку робить відео, у якому людина говорить або співає — без знятого відео
- Рухає не лише губи: зчитує ЕМОЦІЮ у звуці й грає всім тілом — збуджене мовлення дає інші жести, ніж тихий сповідальний тон
- Під капотом працюють ДВА розуми: один розбирає зміст звуку й планує жест, другий малює його кадр за кадром
- Спів передбачений — паузи, зміна настрою та сценічний рух
- Сприймає кількох героїв у кадрі
- Приймає й короткий текст на додачу до звуку — ним задаються рух камери, жест чи настрій
Слабкі сторони
- Тривалість залежить від якості: до 30 секунд звуку на 1080p і до 60 секунд на 720p
- Найкраща вона під 15 секунд — понад це результат починає розсипатися
- Сцена СТАТИЧНА: фон не змінюється, камера стоїть, людина лишається приблизно на місці
- Результат цілком залежить від фото — з поганого фото виходить погане відео
- Швидке й уривчасте мовлення дає їй менше часу, щоб устоятися в жесті
Не використовуй для
- Не подавай фото в профіль, із закритим обличчям чи в окулярах, що ховають очі
- Не давай їй довгого запису одразу — ріж його на частини до 15 секунд
- Не використовуй, коли зняте відео вже є — там синхрон губ точніший
Типові завдання
- Аватар, що говорить, з одного фото
- Портрет, що співає
- Звернення за поданим текстом і голосом
- Оживлений архівний чи сімейний портрет
- Ведучий для короткого відео, без знімального дня