Η NVIDIA κυκλοφόρησε το Nemotron 3 Embed, μια ανοιχτή συλλογή μοντέλων ενσωμάτωσης που έχουν σχεδιαστεί για να τροφοδοτούν την επαυξημένη παραγωγή ανάκτησης σε κλίμακα παραγωγής (RAG), την ανάκτηση πράκτορα, την ανάκτηση κώδικα και τη μνήμη παράγοντα. Η κυκλοφορία, η οποία περιγράφεται λεπτομερώς από το MarkTechPost στις 17 Ιουλίου 2026, φτάνει καθώς το επίπεδο που αποφασίζει ποια περάσματα βλέπει ποτέ ένας πράκτορας τεχνητής νοημοσύνης γίνεται ανταγωνιστικό πεδίο μάχης, μια τάση που ακολούθησε το γραφείο [έκτακτες ειδήσεις AI] (https://aibuzzwire.news) αυτής της έκδοσης καθώς οι επιχειρήσεις μετακινούνται από τα chatbots σε συστήματα που λειτουργούν με βάση το retri.
Τα μοντέλα ενσωμάτωσης αποφασίζουν ποια περάσματα θα δει ποτέ ένας πράκτορας, γεγονός που τα καθιστά ένα ήσυχο αλλά αποφασιστικό σημείο ασφυξίας στη γεννήτρια στοίβα AI. Η NVIDIA κατασκεύασε το Nemotron 3 Embed για να ενισχύσει αυτό το επίπεδο. Η συλλογή περιλαμβάνει τρία ανοιχτά σημεία ελέγχου: Nemotron-3-Embed-8B-BF16, μια πρώτη επιλογή για την ακρίβεια. Nemotron-3-Embed-1B-BF16, που φέρει το ίδιο σχέδιο σε μικρότερο αποτύπωμα. και Nemotron-3-Embed-1B-NVFP4, μια παραλλαγή 4-bit βελτιστοποιημένη για την Blackwell. Και οι τρεις είναι κωδικοποιητές μετασχηματιστών εκπαιδευμένοι με αμφίδρομη κάλυψη προσοχής, με την τελική ενσωμάτωση να παράγεται από τη μέση συγκέντρωση σε αναπαραστάσεις σε επίπεδο διακριτικού. Το καθένα υποστηρίζει μέγιστο μήκος ακολουθίας 32.768 διακριτικών.
Στην κορυφή του Leaderboard
Το βασικό αποτέλεσμα είναι ότι το Nemotron-3-Embed-8B-BF16 κατατάσσεται στην πρώτη θέση συνολικά στο RTEB, το σημείο αναφοράς ενσωμάτωσης ανάκτησης, από τις 17 Ιουλίου 2026, στις 16 δημόσιες εργασίες του. Οι βαθμολογίες μετρώνται ως μέσος όρος NDCG@10 σε μήκος ακολουθίας μοντέλου 4.096. Η NVIDIA αξιολόγησε κάθε μοντέλο σε 34 γλώσσες και και τα τρία σημεία ελέγχου κυκλοφορούν βάσει της Άδειας χρήσης OpenMDW έκδοση 1.1, καθιστώντας τα ελεύθερα διαθέσιμα στους προγραμματιστές για λήψη, εκτέλεση και τροποποίηση.
Σημειωτέον, οι βάσεις των μοντέλων αντλούνται από το Mistral. Το σημείο ελέγχου 8B είναι χτισμένο στο Ministral-3-8B-Instruct-2512, ενώ και οι δύο παραλλαγές 1B χρησιμοποιούν Ministral-3-3B-Instruct-2512, σύμφωνα με την αναφορά MarkTechPost. Η απόφαση της NVIDIA να βασιστεί στα θεμέλια του Mistral και όχι σε μια καθαρά εσωτερική αρχιτεκτονική αντανακλά πόσο ρευστή έχει γίνει η ανάπτυξη μοντέλων, με ανοιχτές βάσεις που επαναπροσδιορίζονται και εκπαιδεύονται τακτικά για εξειδικευμένες εργασίες.
Συμπίεση, όχι μικρότερη διαδρομή προπόνησης
Δύο κενά απόδοσης ξεχωρίζουν. Το μοντέλο 1B κερδίζει 10,4 βαθμούς RTEB σε σχέση με τη γραμμή βάσης llama-nemotron-embed-vl-1b-v2 προηγούμενης γενιάς. Ξεχωριστά, το σημείο ελέγχου 4-bit NVFP4 κοστίζει μόνο 0,38 σημεία RTEB έναντι του μητρικού του BF16, διατηρώντας περίπου το 99,5% της ακρίβειας ανάκτησής του. Αυτή η σχεδόν χωρίς απώλειες συμπίεση είναι ιδιαίτερα σημαντική για ομάδες που πρέπει να εκτελέσουν ενσωματώσεις σε κλίμακα, όπου το κόστος μνήμης και συμπερασμάτων συχνά κυριαρχεί.
Αυτές οι βαθμολογίες 1Β επιτεύχθηκαν μέσω ενός αγωγού συμπίεσης αντί μιας μικρότερης διαδρομής εκπαίδευσης. Το μητρικό, nemotron-3-embed-3b, κλαδεύτηκε και αποστάχθηκε σε δύο επαναληπτικούς γύρους. Αρχικά, ο γονέας 3Β κλαδεύτηκε σε 2Β χρησιμοποιώντας την Αναζήτηση NVIDIA ModelOpt mcore_minitron Neural Architecture, η οποία πραγματοποιεί αναζήτηση σε κρυφό πλάτος, μέγεθος FFN, κεφαλές προσοχής και βάθος και, στη συνέχεια, επιλέγει τον καλύτερο υποψήφιο από το μέτωπο των 10 Pareto. Ένα σώμα βαθμονόμησης 50.000 δειγμάτων εντός τομέα βαθμολόγησε αυτούς τους υποψηφίους.
Στη συνέχεια, το μοντέλο 2Β αποστάχθηκε από τον τελειοποιημένο δάσκαλο ενσωμάτωσης 8Β, συνδυάζοντας απώλεια συνημιτόνου απόστασης και μέση τετραγωνική απώλεια σφάλματος σε ένα πολύγλωσσο μείγμα δεδομένων εντός τομέα. Η ίδια διαδικασία επαναλήφθηκε για την παραγωγή του σημείου ελέγχου 1.14B, δείχνοντας ότι οι μικρότερες παραλλαγές κληρονομούν μεγάλο μέρος της ικανότητας του μεγαλύτερου μοντέλου μέσω δομημένης συμπίεσης και όχι ανεξάρτητης εκπαίδευσης.
Κατασκευασμένο για αποτελεσματικότητα Blackwell
Η συμπίεση συνεχίζεται στη μορφή σερβιρίσματος. Η κβαντοποίηση στόχευσε μόνο τα βάρη και τις ενεργοποιήσεις γραμμικών επιπέδων, χρησιμοποιώντας τον τύπο δεδομένων NVFP4, με την ερευνητική ομάδα να βασίζεται στο nvidia-modelopt v0.45.0. Ακολούθησε απόσταξη με επίγνωση κβαντοποίησης, κυρίως για την ανάκτηση της ακρίβειας στις μεγάλες εισροές. Η βαθμονόμηση χρησιμοποίησε 512 δείγματα, χωρίστηκαν σε 256 ερωτήματα και 256 αποσπάσματα από το σύνολο δεδομένων cnn_dailymail, ενώ η εκπαίδευση QAD βασίστηκε σε 20.000 δείγματα.
Το πρακτικό αποτέλεσμα είναι η αποτελεσματικότητα στο πιο πρόσφατο υλικό της NVIDIA. Η ερευνητική ομάδα αναφέρει ότι το NVFP4 στο Blackwell παρέχει έως και 2 φορές υψηλότερη απόδοση από το BF16, ενώ διατηρεί πάνω από το 99% της ακρίβειας ανάκτησης του BF16. Η κάρτα μοντέλου NVFP4 τεκμηριώνει επίσης δυναμικά μεγέθη ενσωμάτωσης, επιτρέποντας στους προγραμματιστές να κόψουν το διάνυσμα 2.048 διαστάσεων σε διαστάσεις 1.024 ή 512 και να κανονικοποιήσουν εκ νέου στη συνέχεια, ανταλλάσσοντας λίγη ακρίβεια για χαμηλότερο κόστος αποθήκευσης. Αυτή η ευελιξία έχει σημασία για τις διανυσματικές βάσεις δεδομένων, όπου η αποθήκευση δισεκατομμυρίων διανυσμάτων υψηλών διαστάσεων είναι ακριβή.
Γιατί οι ενσωματώσεις έχουν σημασία τώρα
Τα μοντέλα ενσωμάτωσης έχουν γίνει ένα ήσυχο σημείο ασφυξίας στη γεννήτρια στοίβα AI. Κάθε πράκτορας που βασίζεται σε ανάκτηση, εργαλείο εταιρικής αναζήτησης και βοηθός κώδικα εξαρτώνται από αυτά για να ανακτήσουν το σωστό πλαίσιο προτού ένα μεγάλο μοντέλο γλώσσας δημιουργήσει μια απάντηση. Ένα ισχυρότερο, φθηνότερο μοντέλο ενσωμάτωσης μπορεί να βελτιώσει άμεσα την ποιότητα των απαντήσεων και να μειώσει το λειτουργικό κόστος, γι' αυτό οι πωλητές από το OpenAI έως το Cohere έως τις συλλογικότητες ανοιχτού κώδικα έσπευσαν να κυκλοφορήσουν νέες οικογένειες.
Ανοίγοντας μια συλλογή κορυφαίας κατάταξης υπό μια επιτρεπτή άδεια και συνδυάζοντάς την με κβαντισμό που έχει ρυθμιστεί με Blackwell, η NVIDIA ενισχύει τη στρατηγική της για την ανάπτυξη του ευρύτερου οικοσυστήματος AI με εργαλεία που λειτουργούν καλύτερα με το δικό της πυρίτιο. Για προγραμματιστές που κατασκευάζουν αγωγούς RAG ή συστήματα μνήμης πράκτορα, το Nemotron 3 Embed προσφέρει μια νέα, ελεύθερα διαθέσιμη επιλογή που ωθεί την τελευταία λέξη της τεχνολογίας σε ένα σημείο αναφοράς που παρακολουθείται ευρέως, ενώ η παραλλαγή NVFP4 δίνει στις ομάδες μια αξιόπιστη διαδρομή για τη μείωση του κόστους συμπερασμάτων χωρίς να θυσιάζει την ποιότητα ανάκτησης από την οποία εξαρτώνται οι εφαρμογές τους.
Μείνετε μπροστά από την τεχνητή νοημοσύνη
Μοντέλα ανοιχτής ενσωμάτωσης όπως το Nemotron 3 Embed αναδιαμορφώνουν αθόρυβα τον τρόπο με τον οποίο οι πράκτορες AI βρίσκουν και χρησιμοποιούν πληροφορίες. Για περισσότερα σχετικά με τα μοντέλα, τις εκδόσεις και την έρευνα που προωθούν το πεδίο, ακολουθήστε τις [τελευταίες εξελίξεις της τεχνητής νοημοσύνης] (https://aibuzzwire.news) καθώς παρουσιάζονται.
Διαβάστε περισσότερα νέα AI ->



