Σύνοψη
Η μηχανική των ανθρωποειδών ρομπότ επικεντρώνεται παραδοσιακά στην κινηματική και την ισορροπία, αφήνοντας τη διαδραστική όψη των μηχανών σε δεύτερη μοίρα.
Η AheadForm, υπό την τεχνική καθοδήγηση του Yuhang Hu —ενός ερευνητή με μακρά θητεία στο Creative Machines Lab του Πανεπιστημίου Columbia— παρουσίασε το Bionic Humanoid Robot: Origin F1. Το συγκεκριμένο μοντέλο εστιάζει αποκλειστικά στην επίλυση του προβλήματος της μη-λεκτικής επικοινωνίας μέσω ενός εξαιρετικά περίπλοκου, βιονικού προσώπου.
Το βίντεο της παρουσίασης καταγράφει το Origin F1 να ανοιγοκλείνει τα μάτια του, να ακολουθεί την κίνηση στον χώρο και να τροποποιεί τις μικρο-εκφράσεις του δυναμικά. Το σύστημα δεν βασίζεται σε προγραμματισμένες, στατικές αντιδράσεις, αλλά σε συνεχή επεξεργασία περιβαλλοντικών δεδομένων που τροφοδοτούν τους κινητήρες του προσώπου.
Το Origin F1 είναι ένα βιονικό ανθρωποειδές ρομπότ της AheadForm που ενσωματώνει τεχνητή νοημοσύνη, μικρο-ενεργοποιητές κάτω από συνθετικό δέρμα και συστήματα μηχανικής όρασης. Απαντά στο πρόβλημα της ρομποτικής αλληλεπίδρασης, παράγοντας ρεαλιστικές εκφράσεις προσώπου και διατηρώντας οπτική επαφή σε πραγματικό χρόνο, γεφυρώνοντας το χάσμα της μη-λεκτικής επικοινωνίας μεταξύ ανθρώπου και μηχανής.
Βασικά τεχνικά στοιχεία
Η κατασκευή ενός προσώπου που πείθει τον ανθρώπινο εγκέφαλο απαιτεί τον συνδυασμό ελαστικών υλικών και άκαμπτων μηχανικών μερών. Στο Origin F1, οι μικρο-ενεργοποιητές εδράζονται σε έναν μεταλλικό/πολυμερικό σκελετό και συνδέονται με το συνθετικό δέρμα μέσω καλωδίων υψηλής αντοχής. Η συγκεκριμένη προσέγγιση επιτρέπει τον έλεγχο των χειλιών, των φρυδιών και των ζυγωματικών.
Κατά τη λειτουργία του, το ρομπότ διατηρεί μια ξεκάθαρη μηχανική υπόσταση. Το βάρος της κεφαλής είναι αυξημένο λόγω της πυκνότητας των κινητήρων. Σε συνθήκες απόλυτης ησυχίας, οι απότομες κινήσεις, όπως το γρήγορο ανοιγόκλεισμα των βλεφάρων, παράγουν έναν ανεπαίσθητο ήχο υψηλής συχνότητας. Επιπλέον, η συνεχής λειτουργία των μηχανισμών αυτών απαιτεί απαγωγή θερμότητας, πράγμα που σημαίνει ότι η περιοχή του κρανίου πίσω από το συνθετικό δέρμα αναπτύσσει μετρήσιμη θερμοκρασία κατά τη διάρκεια παρατεταμένων αλληλεπιδράσεων. Η υφή της σιλικόνης, αν και οπτικά εξαιρετικά αληθοφανής, διατηρεί την τυπική αντίσταση των πολυμερών κατά την αφή, διαχωρίζοντας την εμπειρία από την πραγματική ανθρώπινη επαφή.
Ο τρόπος με τον οποίο το Origin F1 μαθαίνει να κινείται διαφοροποιείται από τις παραδοσιακές μεθόδους hardcoding. Σύμφωνα με τις προηγούμενες έρευνες του Yuhang Hu, η εκπαίδευση αυτών των συστημάτων βασίζεται στο «Visual Self-Modeling». Το ρομπότ τοποθετείται αρχικά μπροστά σε έναν καθρέφτη ή χρησιμοποιεί κάμερες για να παρακολουθεί το ίδιο του το πρόσωπο. Παράγοντας χιλιάδες τυχαίες κινήσεις των κινητήρων του, εκπαιδεύει τα νευρωνικά του δίκτυα να αντιστοιχίζουν τις μηχανικές εντολές με το οπτικό αποτέλεσμα.
Η συγκεκριμένη μέθοδος αυτο-εποπτευόμενης μάθησης επιτρέπει στο ρομπότ να αναγνωρίζει μόνο του πώς πρέπει να μετακινήσει τους κινητήρες του για να αναπαραγάγει, για παράδειγμα, ένα χαμόγελο που μόλις κατέγραψε από τον συνομιλητή του. Το μοντέλο VAE (Variational Autoencoder) αναλύει τον ήχο της ομιλίας και εξάγει αυτόματα τις σωστές τροχιές για την κίνηση των χειλιών (lip-syncing), συγχρονίζοντας τα με τα μεγάλα γλωσσικά μοντέλα (LLMs) όπως το ChatGPT ή το Gemini που τροφοδοτούν τον διάλογο.
Η αποτελεσματικότητα των ρομπότ εξαρτάται σε μεγάλο βαθμό από τον χρονισμό. Οι έρευνες καταδεικνύουν ότι η καθυστερημένη μίμηση προσώπου γίνεται αντιληπτή ως ανειλικρινής ή μηχανική. Το σύστημα του Origin F1 προσπαθεί να προβλέψει την έκφραση του συνομιλητή, αναλύοντας μικρο-κινήσεις των μυών του ανθρώπινου προσώπου, ώστε να εκτελέσει τη δική του έκφραση ταυτόχρονα. Η συνέργεια μεταξύ του Facial Action Transformer και του αλγορίθμου επεξεργασίας φυσικής γλώσσας αποτελεί τη βάση για την ομαλή ροή της αλληλεπίδρασης.
Όταν η ομιλία απαιτεί κινήσεις ακριβείας (π.χ. σύμφωνα που κλείνουν τα χείλη), η καθυστέρηση μεταξύ της αναπαραγωγής του ήχου από το ηχείο και της μηχανικής ανταπόκρισης της σιλικόνης πρέπει να διατηρείται κάτω από τα 200 χιλιοστά του δευτερολέπτου. Αυτός ο αυστηρός περιορισμός απαιτεί ισχυρούς τοπικούς επεξεργαστές και όχι αποκλειστικά εξάρτηση από cloud υποδομές.
Η παρουσίαση του Origin F1 από την AheadForm υπογραμμίζει τη στροφή της ρομποτικής βιομηχανίας από την αμιγή εργονομία στην ψυχολογική ενσωμάτωση. Οι αλγόριθμοι LLM προσέφεραν την ικανότητα άρτιου λόγου στις μηχανές, όμως η απουσία συνοδευτικής γλώσσας σώματος και προσώπου περιόριζε τη χρησιμότητά τους στην απλή διεκπεραίωση εντολών.
Ο Yuhang Hu αποδεικνύει ότι ο αυτόνομος συγχρονισμός χειλιών και η αυτο-εποπτευόμενη εκμάθηση μικρο-εκφράσεων είναι εφικτά τεχνολογικά. Παρόλο που οι υλικοί περιορισμοί (όπως η αντοχή του συνθετικού δέρματος και οι θερμικές απώλειες) παραμένουν, η μετάβαση από το ρομπότ-εργαλείο στο ρομπότ-συνομιλητή αποτελεί πλέον μηχανικό, και όχι θεωρητικό, ζήτημα.
Η εξέλιξη έχει προκαλέσει συζήτηση επειδή ανοίγει ένα νέο κεφάλαιο στη σχέση μεταξύ ανθρώπινης δημιουργικότητας…
Υποδεχόμαστε με μεγάλο ενδιαφέρον το πρώτο επίσημο trailer της ταινίας Wicker, ενός ιδιαίτερου κωμικού παραμυθιού…
Σύνοψη Το ρόβερ Curiosity της NASA κατέγραψε πανοραμικές εικόνες που αποκαλύπτουν μια εξαιρετικά εκτεταμένη περιοχή…
Σύνοψη Επιστήμονες από το ινστιτούτο Wellcome Trust Sanger ανακάλυψαν ότι η πορεία εξέλιξης των χρόνιων…
Σύνοψη Επεκτείνεται παγκοσμίως (εκτός της Κίνας) η διαθεσιμότητα του νέου DJI Osmo Pocket 4P, με…
Η πολυαναμενόμενη live-action κινηματογραφική μεταφορά του θρυλικού franchise παιχνιδιών ξύλου της Capcom εισέρχεται πλέον στην…
Αυτό το site χρησιμοποιεί cookies, για την παροχή των υπηρεσιών της, να προσαρμόσετε τις διαφημίσεις και να αναλύσει την επισκεψιμότητα. Με τη χρήση αυτής της ιστοσελίδας, συμφωνείτε με τη πολιτική χρήση των cookies.
Leave a Comment