Categories: Mobile

Εντυπωσιάζει το νέο AI εργαλείο παραγωγής video της Google


Το νέο μοντέλο Τεχνητής Νοημοσύνης Lumiere της Google για τη δημιουργία βίντεο χρησιμοποιεί ένα νέο σύστημα διάχυσης που ονομάζεται Space-Time-U-Net, ή STUNet, το οποίο υπολογίζει πού βρίσκονται τα πράγματα σε ένα βίντεο (χώρος) και πώς κινούνται και αλλάζουν ταυτόχρονα (χρόνος). Η ιστοσελίδα Ars Technica αναφέρει ότι αυτή η μέθοδος επιτρέπει στο Lumiere να δημιουργήσει το βίντεο με μιας αντί να συνθέτει μαζί μικρότερα σταθερά καρέ.

Το Lumiere ξεκινά με τη δημιουργία ενός βασικού πλαισίου από την προτροπή του χρήστη. Στη συνέχεια, χρησιμοποιεί το STUNet framework για να αρχίσει να προσδιορίζει προσεγγιστικά πού θα κινηθούν τα αντικείμενα μέσα σε αυτό το καρέ, ώστε να παράγει περισσότερα καρέ που εισέρχονται το ένα στο άλλο, δημιουργώντας την εντύπωση μιας απρόσκοπτης κίνησης. Το Lumiere παράγει 80 καρέ σε σύγκριση με τα 25 καρέ του Stable Video Diffusion.

Το Lumiere έχει τη δυνατότητα να εκτελεί διάφορα τρικ, τα οποία παρουσιάζονται με παραδείγματα στη demo σελίδα της Google. Για παράδειγμα, μπορεί να εκτελέσει τη δημιουργία κειμένου σε βίντεο (μετατρέποντας μια γραπτή προτροπή σε βίντεο), να μετατρέψει ακίνητες εικόνες σε βίντεο, να δημιουργήσει βίντεο σε συγκεκριμένα στυλ χρησιμοποιώντας μια εικόνα αναφοράς, να εφαρμόσει συνεκτική επεξεργασία βίντεο χρησιμοποιώντας προτροπές που βασίζονται σε κείμενο, να δημιουργήσει cinemagraphs με animation συγκεκριμένων περιοχών μιας εικόνας και να προσφέρει δυνατότητες video inpainting (για παράδειγμα, μπορεί να αλλάξει τον τύπο του φορέματος που φοράει ένα άτομο).

Στο άρθρο για το Lumiere, οι ερευνητές της Google αναφέρουν ότι το μοντέλο Τεχνητής Νοημοσύνης παράγει βίντεο διάρκειας πέντε δευτερολέπτων σε ανάλυση 1024×1024 , τα οποία χαρακτηρίζουν ως “χαμηλής ανάλυσης”. Παρά τους περιορισμούς αυτούς, οι ερευνητές πραγματοποίησαν μια δοκιμή με χρήστες και ισχυρίζονται ότι προτιμήθηκαν οι παραγωγές του Lumiere σε σύγκριση με τα άλλα υπάρχοντα μοντέλα σύνθεσης βίντεο Τεχνητής Νοημοσύνης.

Όσον αφορά τα δεδομένα εκπαίδευσης, η Google δεν λέει από πού πήρε τα βίντεο που τροφοδότησε το Lumiere, γράφοντας:

Εκπαιδεύουμε το μοντέλο T2V [text to video] σε ένα σύνολο δεδομένων που περιέχει 30 εκατομμύρια βίντεο μαζί με τις λεζάντες τους. Τα βίντεο έχουν διάρκεια 80 καρέ στα 16 fps (5 δευτερόλεπτα). Το βασικό μοντέλο εκπαιδεύεται σε ανάλυση 128×128.

Μπορείτε να ρίξετε μια ματιά στο Lumiere από εδώ.

[via]



Πηγή

iTech News

Leave a Comment
Share
Published by
iTech News

Recent Posts

Το τηλεσκόπιο CHIME χαρτογραφεί το αρχαιότερο υδρογόνο στο Σύμπαν

Σύνοψη Το καναδικό ραδιοτηλεσκόπιο CHIME κατάφερε για πρώτη φορά να ανιχνεύσει την αρχαιότερη λάμψη υδρογόνου…

4 ώρες ago

Ερευνητές συνέδεσαν τρία ανθρώπινα οργανοειδή εγκεφάλου και παρατήρησαν την ανάπτυξη ικανότητας μάθησης

Σύνοψη Ερευνητές από το Πανεπιστήμιο του Τόκιο καλλιέργησαν και συνέδεσαν ανθρώπινα οργανοειδή εγκεφάλου σε ειδικά…

4 ώρες ago

Η Naughty Dog ετοιμάζει νέο παιχνίδι Uncharted!

Σύνοψη Η Naughty Dog αναπτύσσει ένα εντελώς νέο παιχνίδι Uncharted και όχι κάποιο remake των…

5 ώρες ago

Νέος οπτικός AI επεξεργαστής από το UCLA εντοπίζει deepfakes με ακρίβεια 98%

Σύνοψη Οι ερευνητές του Πανεπιστημίου UCLA ανέπτυξαν μια νέα υβριδική αρχιτεκτονική οπτικού-νευρωνικού επεξεργαστή με σκοπό…

5 ώρες ago

Ανθρωποειδή ρομπότ ετοιμάζονται να κατακτήσουν τη Σελήνη

Σύνοψη Η ομάδα Dexterous Robotics της NASA αναπτύσσει προηγμένα ανθρωποειδή ρομπότ τα οποία προορίζονται να…

5 ώρες ago

Dexter: Resurrection – Επίσημο trailer και ημερομηνία πρεμιέρας για τη 2η σεζόν!

Σύνοψη Η δεύτερη σεζόν του Dexter: Resurrection κάνει επίσημη πρεμιέρα στις 30 Οκτωβρίου 2026 μέσα…

13 ώρες ago

Αυτό το site χρησιμοποιεί cookies, για την παροχή των υπηρεσιών της, να προσαρμόσετε τις διαφημίσεις και να αναλύσει την επισκεψιμότητα. Με τη χρήση αυτής της ιστοσελίδας, συμφωνείτε με τη πολιτική χρήση των cookies.