OmniHuman — ζωντάνεψε φωτογραφία ανθρώπου με φωνή και κίνηση

Τι είναι το OmniHuman

Το OmniHuman είναι γενετικό μοντέλο για βίντεο, φτιαγμένο από τη ByteDance — την εταιρεία πίσω από το TikTok. Παίρνει μία και μόνη φωτογραφία ανθρώπου και μια ηχογράφηση (ομιλία ή τραγούδι) και τις μετατρέπει σε βίντεο, όπου ο άνθρωπος της φωτογραφίας μιλάει ή τραγουδάει. Οι κινήσεις των χειλιών, του κεφαλιού και του σώματος συγχρονίζονται με τον ήχο, έτσι ώστε η στατική εικόνα να ζωντανεύει με φυσικό τρόπο.

Σε αντίθεση με μοντέλα που απλώς προσθέτουν κίνηση σε μια φωτογραφία, το OmniHuman στοχεύει ακριβώς στην ανθρώπινη μορφή και την ομιλία — ο στόχος είναι τα χείλη να ακολουθούν πιστά αυτό που ακούγεται, και η έκφραση και οι χειρονομίες να δείχνουν ζωντανές, όχι μηχανικές. Γι' αυτό είναι βολική επιλογή όταν θέλεις να κάνεις μια συγκεκριμένη φωτογραφία ανθρώπου να „μιλήσει" με δεδομένη φωνή.

Στο genkiki.com το μοντέλο είναι διαθέσιμο ως „OmniHuman (φωτογραφία → ομιλία)" στη λειτουργία Βίντεο από φωτογραφία — ανεβάζεις πορτρέτο και ήχο, και το σύστημα επιστρέφει έτοιμο βίντεο.

Εκδόσεις και δυνατότητες στο generiram

Το OmniHuman προσφέρεται ως ένα μοντέλο με ξεκάθαρη δουλειά: να ζωντανεύει φωτογραφία ανθρώπου μέσα από φωνή. Παρακάτω συνοψίζεται τι κάνει.

ΠαραλλαγήΛειτουργίεςΣε τι χρησιμεύει
OmniHuman (φωτογραφία → ομιλία)Βίντεο από φωτογραφίαΜετατρέπει φωτογραφία ανθρώπου + ηχογράφηση σε βίντεο που μιλάει ή τραγουδάει, με συγχρονισμό χειλιών, κεφαλιού και σώματος

Βίντεο από φωτογραφία

Δίνεις φωτογραφία ανθρώπου και ηχογράφηση. Το OmniHuman κρατά τη μορφή από τη φωτογραφία και προσθέτει κίνηση των χειλιών στον ρυθμό της ομιλίας, καθώς και φυσικές κινήσεις του κεφαλιού και του σώματος. Το αποτέλεσμα είναι ένα βίντεο όπου ο άνθρωπος της φωτογραφίας δείχνει σαν να λέει ή να τραγουδάει πραγματικά τον ήχο που έδωσες.

Για τι είναι κατάλληλο

  • Ζωντάνεμα πορτρέτου — κάνε μια στατική φωτογραφία να μιλήσει ή να τραγουδήσει.
  • Avatar που μιλούν — φτιάξε χαρακτήρα ή πρόσωπο που παρουσιάζει ένα μήνυμα με δεδομένη φωνή.
  • Φωτογραφίες που μιλούν — ζωντάνεψε μια οικογενειακή, ιστορική ή προϊοντική φωτογραφία ανθρώπου.
  • Μεταγλώττιση στατικής εικόνας — πρόσθεσε φωνή και μιμική σε ένα μόνο καρέ, χωρίς κάμερα και γύρισμα.

Πώς να ξεκινήσεις

Άνοιξε το AI στούντιο του genkiki.com, διάλεξε OmniHuman (φωτογραφία → ομιλία), ανέβασε καθαρή φωτογραφία ανθρώπου και την ηχογράφηση που θέλεις να ακουστεί, και ξεκίνα τη δημιουργία. Για το καλύτερο αποτέλεσμα χρησιμοποίησε φωτογραφία όπου το πρόσωπο φαίνεται καλά και είναι φωτισμένο, και καθαρή ηχογράφηση χωρίς δυνατό θόρυβο στο φόντο.

Τα μοντέλα του OmniHuman — αναλυτικά

Ποιο για τι κάνει, πού είναι αδύναμο και για τι δεν πρέπει να χρησιμοποιείται.

OmniHuman (photo → speech)

αναφοράβίντεο
Αναλογίες: 1:1, 9:16, 16:9 Διάρκειες: 5 δευτ., 10 δευτ. Τιμή: 311 credits

Δυνατό σε

  • Από ΜΙΑ φωτογραφία και ήχο φτιάχνει βίντεο, στο οποίο ο άνθρωπος μιλάει ή τραγουδάει — χωρίς γυρισμένο βίντεο
  • Δεν κουνάει μόνο τα χείλη: διαβάζει το ΣΥΝΑΙΣΘΗΜΑ μέσα στον ήχο και παίζει με όλο το σώμα — η ενθουσιώδης ομιλία δίνει άλλες χειρονομίες από έναν χαμηλό εξομολογητικό τόνο
  • Από κάτω δουλεύουν ΔΥΟ μυαλά: το ένα αποκωδικοποιεί το νόημα του ήχου και σχεδιάζει τη χειρονομία, το δεύτερο τη ζωγραφίζει καρέ καρέ
  • Το τραγούδι είναι προβλεπόμενο — παύσεις, αλλαγή διάθεσης και σκηνική κίνηση
  • Αντέχει πολλούς ήρωες μέσα στο καρέ
  • Δέχεται και σύντομο κείμενο εκτός από τον ήχο — με αυτό ορίζεται κίνηση της κάμερας, χειρονομία ή διάθεση

Αδύναμο σε

  • Η διάρκεια εξαρτάται από την ποιότητα: έως 30 δευτερόλεπτα ήχου στα 1080p και έως 60 δευτερόλεπτα στα 720p
  • Είναι καλύτερο κάτω από τα 15 δευτερόλεπτα — πάνω από αυτό το αποτέλεσμα αρχίζει να διαλύεται
  • Η σκηνή είναι ΣΤΑΤΙΚΗ: το φόντο δεν αλλάζει, η κάμερα στέκεται, ο άνθρωπος μένει πάνω κάτω στη θέση του
  • Το αποτέλεσμα εξαρτάται εξ ολοκλήρου από τη φωτογραφία — από κακή φωτογραφία βγαίνει κακό βίντεο
  • Η γρήγορη και κομματιασμένη ομιλία του δίνει λιγότερο χρόνο να καθίσει στη χειρονομία

Μην το χρησιμοποιείς για

  • Μη δίνεις φωτογραφία σε προφίλ, με καλυμμένο πρόσωπο ή με γυαλιά, που κρύβουν τα μάτια
  • Μην του δίνεις μεγάλη ηχογράφηση μαζεμένη — κόψ' την σε κομμάτια κάτω από 15 δευτερόλεπτα
  • Μην το χρησιμοποιείς, όταν έχεις ήδη γυρισμένο βίντεο — εκεί ο συγχρονισμός των χειλιών είναι πιο ακριβής

Τυπικές εργασίες

  • Avatar που μιλάει, από μία φωτογραφία
  • Πορτρέτο που τραγουδάει
  • Χαιρετισμός με κείμενο και φωνή που έδωσες
  • Ζωντανεμένο αρχειακό ή οικογενειακό πορτρέτο
  • Παρουσιαστής για σύντομο βίντεο, χωρίς ημέρα γυρίσματος

Δοκίμασε το OmniHuman τώρα

Δημιούργησε δικά σου βίντεο με το OmniHuman κατευθείαν στον browser — χωρίς εγκατάσταση, στα ελληνικά.