Η τεχνολογίες τεχνητής νοημοσύνης εξελίσσεται συνεχώς. Μπορεί πολλοί άνθρωποι χρησιμοποιούν AI για να ολοκληρώνουν τις εργασίες τους πιο εύκολα, αυτή η τεχνολογία μπορεί να προσφέρει πολύ περισσότερα. Η Google προσπαθεί εδώ και χρόνια να φτάσει τα όρια της τεχνητής νοημοσύνης και να ξεκλειδώσει όλο το φάσμα των δυνατοτήτων της. Η τελευταία εξέλιξη αυτής της προσπάθειας είναι το AudioPaLM. Πρόκειται για ένα νέο γλωσσικό μοντέλο που μπορεί να ακούσει, να μιλήσει, και να μεταφράσει με πρωτοφανή ακρίβεια.

Πρόκειται για μια πολυτροπική αρχιτεκτονική που συνδυάζει τα πλεονεκτήματα δύο υφιστάμενων μοντέλων, των PaLM-2 και AudioLM. Το PaLM-2 είναι ένα γλωσσικό μοντέλο βασισμένο σε κείμενο που είναι καλό στην κατανόηση της γλωσσικής γνώσης συγκεκριμένων κειμένων. Από την άλλη, το AudioLM είναι εξαιρετικό στη διατήρηση παραγλωσσικών πληροφοριών όπως η ταυτότητα του ομιλητή και ο τόνος.

Συνδυάζοντας αυτά τα δύο μοντέλα, το AudioPaLM εκμεταλλεύεται τη γλωσσική εμπειρογνωμοσύνη του PaLM-2 και τη διατήρηση των παραγλωσσικών πληροφοριών του AudioLM, οδηγώντας σε μια πιο εμπεριστατωμένη κατανόηση και δημιουργία τόσο κειμένου όσο και ομιλίας.

Αυτό το γλωσσικό μοντέλο κάνει χρήση ενός κοινού λεξιλογίου που μπορεί να αναπαραστήσει τόσο ομιλία όσο και κείμενο, με έναν περιορισμένο αριθμό διακριτών tokens. Αυτό επιτρέπει την ενοποίηση εργασιών όπως η αναγνώριση ομιλίας, η σύνθεση κειμένου από ομιλία, και η μετάφραση ομιλίας σε ομιλία, και τη δημιουργία μιας ενιαίας αρχιτεκτονικής και διαδικασίας εκπαίδευσης.

Το AudioPaLM έχει αποδειχθεί ότι ξεπερνά τα υπάρχοντα συστήματα στη μετάφραση ομιλίας. Επιπλέον, μπορεί να εκτελέσει μετάφραση ομιλίας σε κείμενο για γλωσσικούς συνδυασμούς που δεν έχει συναντήσει ποτέ πριν. Επίσης, μπορεί να μεταφέρει φωνές μεταξύ γλωσσών με βάση σύντομες προφορικές οδηγίες και μπορεί να συλλάβει και να αναπαράγει ξεχωριστές φωνές σε διαφορετικές γλώσσες.

Πηγή: MarktechPost.com

Αφήστε ένα Σχόλιο

Το e-mail σας δεν δημοσιεύεται. Τα υποχρεωτικά πεδία σημειώνονται με *

Διαβάστε επίσης

Το Android 14 θα ανανεώσει την λειτουργία Multiple Users

Η λειτουργία Multiple Users του Android μπορεί να είναι πολύ χρήσιμη, ειδικά σε shared συσκευές. Μπορείτε να δημιουργήσετε δευτερεύοντα προφίλ για την εργασία και άλλες περιπτώσεις χρήσης, όπως όταν ο ανιψιός σας θέλει να δανειστεί το τηλέφωνο για παιχνίδια.

Νέο κακόβουλο λογισμικό για Mac, πιθανώς από τη Βόρεια Κορέα, “μεταμφιέζεται” σε πρόγραμμα προβολής PDF

Η επίθεση εκτελείται μέσω μιας λειτουργικής εφαρμογής προβολής PDF, σύμφωνα με την εταιρεία ασφαλείας Jamf.

Microsoft Edge: Εξασφάλισε 4 δισ. δολάρια στους χρήστες και απέτρεψε 127 εκ. επιθέσεις phishing

Η ασφάλεια βρίσκεται επίσης στο προσκήνιο για το πρόγραμμα περιήγησης της Microsoft. Σύμφωνα με την εταιρεία, ο Edge απέτρεψε 127 εκατομμύρια επιθέσεις phishing κατά τη διάρκεια του 2023, γεγονός που ισοδυναμεί με την αποτροπή τεσσάρων επιθέσεων phishing κάθε δευτερόλεπτο κατά μέσο όρο.