Σύνοψη
Η εξέλιξη των μεγάλων γλωσσικών μοντέλων φτάνει σε ένα νέο κατασκευαστικό όριο. Μέχρι σήμερα, τα κορυφαία εμπορικά συστήματα τεχνητής νοημοσύνης περιορίζονται από τη διαδοχική επεξεργασία δεδομένων. Ο χρήστης εισάγει δεδομένα, το σύστημα “παγώνει” την αντίληψή του, επεξεργάζεται την πληροφορία και επιστρέφει το αποτέλεσμα. Η Thinking Machines Lab, υπό την καθοδήγηση της Mira Murati, επιλύει αυτό το τεχνολογικό εμπόδιο με την παρουσίαση των “Interaction Models”.
Αυτά τα μοντέλα είναι σχεδιασμένα εξ αρχής για να διαχειρίζονται τη διαδραστικότητα εγγενώς. Δεν βασίζονται σε εξωτερικά εργαλεία ανίχνευσης φωνητικής δραστηριότητας (Voice Activity Detection – VAD) για να κατανοήσουν πότε ο χρήστης σταματά να μιλάει. Λαμβάνουν συνεχείς ροές ήχου, βίντεο και κειμένου, επιτρέποντας την ταυτόχρονη επικοινωνία.
Η αρχιτεκτονική του TML-Interaction-Small βασίζεται σε χρονικά ευθυγραμμισμένα micro-turns των 200 χιλιοστών του δευτερολέπτου. Αυτή η μηχανική προσέγγιση επιτρέπει τη συνεχή και παράλληλη επεξεργασία ροών εισόδου (input) και εξόδου (output). Το σύστημα καταργεί τα παραδοσιακά όρια μεταξύ των προτροπών, επεξεργάζεται τα δεδομένα ακαριαία και επιτρέπει παρεμβάσεις ακριβώς τη στιγμή που συμβαίνουν.
Σε επίπεδο υποδομής, η Thinking Machines απέρριψε τη χρήση αυτόνομων, μεγάλων κωδικοποιητών (όπως τα μοντέλα Whisper της OpenAI). Εφαρμόζει πρώιμη σύντηξη χωρίς κωδικοποιητή (Encoder-free early fusion). Ο ήχος λαμβάνεται ως αναπαράσταση dMel και μετασχηματίζεται μέσω ενός ελαφρού στρώματος ενσωμάτωσης. Οι εικόνες από βίντεο χωρίζονται σε τμήματα 40×40 pixels, τα οποία κωδικοποιούνται από ένα hMLP δίκτυο, ενώ για την αποκωδικοποίηση ήχου χρησιμοποιείται ένα flow head σύστημα. Αυτή η συμπαγής αρχιτεκτονική μειώνει τον φόρτο εργασίας των διακομιστών. Μάλιστα, για την ελαχιστοποίηση των καθυστερήσεων εξαγωγής αποτελεσμάτων (inference optimization), η εταιρεία ανέπτυξε “streaming sessions” στη βιβλιοθήκη SGLang, αποφεύγοντας τις συχνές ανακατανομές μνήμης στη VRAM της GPU.
Στα benchmarks διαδραστικότητας, το μοντέλο της Thinking Machines καταγράφει μέσο χρόνο απόκρισης 0,40 δευτερόλεπτα. Στο ίδιο πλαίσιο, το GPT-Realtime-2.0 της OpenAI χρειάζεται 1,18 δευτερόλεπτα (στη minimal έκδοση) και 1,63 δευτερόλεπτα στην xhigh έκδοση με εκτεταμένο reasoning. Αντίστοιχα, το Gemini 3.1 Flash-Live της Google απαιτεί 0,57 δευτερόλεπτα.
Η μέτρηση FD-bench V1.5, η οποία εστιάζει στην ποιότητα αλληλεπίδρασης (όπως η ανταπόκριση σε διακοπές και ομιλία παρασκηνίου), δίνει στο TML-Interaction-Small κορυφαία βαθμολογία 77.8. Το σύστημα διατηρεί υψηλό επίπεδο γενικής νοημοσύνης (Audio MultiChallenge score: 48.5), χωρίς να θυσιάζει την ταχύτητα για τη λογική, αφού χρησιμοποιεί ένα υβριδικό σύστημα όπου το βασικό μοντέλο εκτελεί άμεσες λειτουργίες ενώ ένα ασύγχρονο μοντέλο υποβάθρου διαχειρίζεται τα πιο σύνθετα αιτήματα συλλογισμού.
Μια θεμελιώδης διαφοροποίηση του Interaction Model είναι η ικανότητα προληπτικής αντίδρασης σε οπτικά ερεθίσματα. Τα σημερινά εμπορικά APIs πραγματικού χρόνου βασίζονται αποκλειστικά στον ήχο. Το TML-Interaction-Small μπορεί να παρακολουθεί τη ροή του βίντεο και να παρεμβαίνει φωνητικά χωρίς καμία ακουστική εντολή.
Εάν ζητήσετε από το μοντέλο να ελέγξει την άσκησή σας, αρχίζει να μετράει δυνατά τις επαναλήψεις καθώς τις εκτελείτε. Στο benchmark “RepCount-A”, επιτυγχάνει την υψηλότερη ακρίβεια άμεσης καταγραφής. Επιπλέον, το σύστημα επιδεικνύει υψηλή προσαρμοστικότητα στην ανάλυση οπτικών αντικειμένων την ακριβή στιγμή που εμφανίζονται στον φακό. Για παράδειγμα, ένα εξαιρετικά χρήσιμο χαρακτηριστικό είναι η δυνατότητα στιγμιαίας μετατροπής νομισμάτων. Όπως φαίνεται στα δοκιμαστικά αρχεία, το μοντέλο ακούει ποσά και μετατρέπει συναλλαγές, μεταφράζοντας ή μετατρέποντας αξίες σε πραγματικό χρόνο.
*Μπορείτε πλέον να προσθέσετε το Techgear.gr ως Προτιμώμενη Πηγή ενημέρωσης για τις αναζητήσεις σας στο Google Search!
Η διαχείριση ογκωδών ψηφιακών δεδομένων έχει μετατραπεί σε μία από τις σημαντικότερες προκλήσεις που αντιμετωπίζουν…
Σύνοψη Η Alibaba ανακοίνωσε επίσημα το Qwen 3.8-Max, ένα κορυφαίο πολυτροπικό μοντέλο τεχνητής νοημοσύνης με…
Σύνοψη Η Ρωσία προχώρησε στην αποκάλυψη του Volna Kupol Garant, ενός νέου συστήματος ηλεκτρονικού πολέμου…
Όταν αποσυσκευάζει κανείς ένα μηχανικό πληκτρολόγιο στην κατηγορία κάτω των εκατό ευρώ, οι προσδοκίες είναι…
Σύνοψη Η Xiaomi Auto παρουσίασε επίσημα στην αγορά της Κίνας το επταθέσιο SUV SkyNomad N90…
Η αξιοπιστία της Τεχνητής Νοημοσύνης ξεκινά από τα δεδομένα και τους ανθρώπους πίσω από αυτή.…
Αυτό το site χρησιμοποιεί cookies, για την παροχή των υπηρεσιών της, να προσαρμόσετε τις διαφημίσεις και να αναλύσει την επισκεψιμότητα. Με τη χρήση αυτής της ιστοσελίδας, συμφωνείτε με τη πολιτική χρήση των cookies.
Leave a Comment