Μια νέα startup τεχνητής νοημοσύνης που ιδρύθηκε από έναν πρώην ερευνητή του OpenAI κυκλοφόρησε αυτό που αποκαλεί μια εντελώς νέα κατηγορία μοντέλων - ένα μοντέλο που δεν μπορεί να σας γράψει ένα δοκίμιο και λέει ότι αυτό είναι ακριβώς το θέμα.

Το TypeSafe AI ανακοίνωσε την Τρίτη την κυκλοφορία του πρώτου "System One Model", που ονομάζεται Jev, διαθέσιμο αμέσως σε πρώιμη πρόσβαση. Η εταιρεία ιδρύθηκε από τον Diogo Almeida, ο οποίος λέει ότι η έρευνα πίσω από την παρακολούθηση των οδηγιών του ChatGPT προέκυψε από δουλειά στην οποία συνέβαλε στο OpenAI. Μετά από δύο χρόνια σε μυστικότητα, υποστηρίζει ότι η προσήλωση της βιομηχανίας στο chat έχει κρύψει τα σημεία που στην πραγματικότητα αποτυγχάνει η αυτοματοποίηση. For more context on this story, see our ongoing AI trends.

"Τα μοντέλα είναι υπεράνθρωποι στο chat εδώ και χρόνια, οπότε πού είναι όλος ο αυτοματισμός;" έγραψε η Αλμέιδα στην ανάρτηση έναρξης. «Αυτή ήταν η ερώτησή μου για την οδήγηση τα τελευταία τέσσερα χρόνια».

Τι είναι στην πραγματικότητα ένα μοντέλο «System One».

Το όνομα δανείζεται από τη διάκριση της ψυχολογίας μεταξύ γρήγορης, ενστικτώδους σκέψης και αργού, σκόπιμου συλλογισμού. Όπου τα μεγάλα γλωσσικά μοντέλα δημιουργούν κείμενο διακριτικό ανά διακριτικό — ευέλικτο, γενικό και επιρρεπές σε περιστασιακές βέβαιες ανοησίες — το Jev του TypeSafe είναι κατασκευασμένο για να κάνει κάτι πιο στενό: να λαμβάνει μη δομημένη κατάσταση ως είσοδο και να επιστρέφει δακτυλογραφημένες, δομημένες αποφάσεις με συνημμένες βαθμονομημένες πιθανότητες.

Η εταιρεία περιγράφει το Jev ως «μια κλήση συνάρτησης συνοριακής νοημοσύνης: μη δομημένη κατάσταση εισόδου, πληκτρολογημένες πιθανοτικές αποφάσεις έξω». Επειδή οι πιθανές έξοδοι καθορίζονται εκ των προτέρων και το μοντέλο δεν δημιουργεί ποτέ συμβολοσειρές ελεύθερης μορφής, το TypeSafe ισχυρίζεται ότι δεν μπορεί να παράγει σφάλματα τύπου - μια ιδιότητα που η εταιρεία λέει ότι είναι μαθηματικά εγγυημένη παρά στατιστικά πιθανή - και δεν μπορεί να έχει παραισθήσεις όπως τα μοντέλα που δημιουργούν κείμενο.

Η αρχιτεκτονική αποκλίνει από την επικρατούσα πρακτική με τρεις τρόπους, σύμφωνα με την ανάρτηση εκκίνησης: μια νέα αρχιτεκτονική μοντέλου, ένας παράλληλος δειγματολήπτης που παράγει όλα τα αποτελέσματα σε ένα μόνο ερώτημα και όχι διαδοχικά και μια μέθοδος εκπαίδευσης που η εταιρεία ονομάζει Reinforcement Learning for Calibrated Decisions (RLCD), η οποία βελτιστοποιεί για γνωσιολογικά ειλικρινείς πιθανότητες αντί για επαληθεύσιμη ανθρώπινη προτίμηση ή πρόγραμμα.

Οι αξιώσεις: 100 φορές πιο γρήγορα, ένα κλάσμα του κόστους

Οι αριθμοί που δημοσιεύει το TypeSafe είναι επιθετικοί. Η εταιρεία λέει ότι το Jev παρέχει ευφυΐα συγκρίσιμη με τα υπάρχοντα σύνορα LLM σε αυτό που ονομάζει εργασίες "System One shaped" - ταξινόμηση, δρομολόγηση, βαθμολόγηση, εξαγωγή και αποφάσεις διακλάδωσης - ενώ ανταποκρίνεται σε 70 έως 500 χιλιοστά του δευτερολέπτου, έναντι χρόνου απόκρισης από άκρο σε άκρο 3 έως 329 δευτερολέπτων για μοντέλα συνόρων. Αυτό λειτουργεί 40 φορές έως 200 φορές πιο γρήγορα, λέει η εταιρεία.

Η τιμολόγηση είναι εξίσου αντισυμβατική: 0,042 $ ανά εκατομμύριο διακριτικά εισόδου, με τα διακριτικά εξόδου δωρεάν, καθώς οι έξοδοι υπολογίζονται παράλληλα αντί να δημιουργούνται διακριτικά ανά διακριτικό. Η εταιρεία αναγνώρισε στην ανάρτησή της ότι δεν μπορεί ακόμη να αποδείξει ότι η τιμολόγηση είναι βιώσιμη σε κλίμακα.

«Οι έκτακτοι ισχυρισμοί απαιτούν έκτακτα αποδεικτικά στοιχεία», αναφέρει η ανάρτηση, προτού προσφέρει τα στοιχεία που διαθέτει.

Οι αποδείξεις — και τι λένε οι σκεπτικιστές

Το TypeSafe δημοσίευσε ένα demo δίπλα-δίπλα συγκρίνοντας το Jev με το GPT-5.6 Terra, το οποίο περιγράφει ως το πιο συγκρίσιμο μοντέλο συνόρων με παρόμοια ευφυΐα και λέει ότι η μόνη διαφωνία στην καταγεγραμμένη σειρά περιλάμβανε μια πραγματικά διφορούμενη κρίση. Εισήγαγε επίσης μια νέα μεθοδολογία "αξιολόγησης ροής εργασιών" που μετρά τα μοντέλα σε σχέση με τη συναίνεση των μεγαλύτερων εξωτερικών μοντέλων - OpenAI's Astra και Anthropic's Fable - μέσα σε ένα σταθερό υπολογιστικό γράφημα και ισχυρίζεται ότι ο Jev "κατέχει τα σύνορα Pareto για σχεδόν 2 τάξεις μεγέθους".

Συγκεκριμένα, η εταιρεία δημοσίευσε μια συνοδευτική ανάρτηση με τίτλο "antibenchmaxxing" εξηγώντας γιατί αποφεύγει τα παραδοσιακά σημεία αναφοράς, υποστηρίζοντας ότι ένα μοντέλο που έχει σχεδιαστεί για δομημένες αποφάσεις εντός των ροών εργασίας λογισμικού αντιστέκεται σε ουσιαστική παγκόσμια σύγκριση.

Η αντίδραση στο Hacker News, όπου η εκτόξευση συγκέντρωσε εκατοντάδες πόντους μέσα σε λίγες ώρες, κυμαινόταν από γνήσιο ενθουσιασμό έως έντονο σκεπτικισμό. Αρκετοί σχολιαστές παρατήρησαν ότι τα δημόσια στοιχεία αποτελούνται σε μεγάλο βαθμό από βίντεο επίδειξης - συμπεριλαμβανομένου ενός που δείχνει το μοντέλο να τροφοδοτεί έναν βρόχο παιχνιδιού Doom - αντί να αναπαραχθούν αξιολογήσεις τρίτων. Άλλοι υποστήριξαν ότι η προσέγγιση γίνεται καλύτερα κατανοητή ως ένας εξαιρετικά γρήγορος ταξινομητής οριακής ποιότητας, χρήσιμος για ένα κομμάτι φόρτου εργασίας παρά ως αντικατάσταση των LLM.

Ακόμη και συμπαθητικοί παρατηρητές πλαισίωσαν το βάρος της απόδειξης ξεκάθαρα. «Ναι, μιλούν ως σκεπτικιστές, αλλά δεν προσφέρουν έναν τόνο αποδεικτικών στοιχείων, εκτός από μερικά βίντεο με επιδείξεις», έγραψε ένας σχολιαστής. "Μια ζωντανή επίδειξη θα ήταν πολύ πιο πειστική."

Γιατί μπορεί να έχει σημασία

Το γήπεδο προσγειώνεται σε ένα πραγματικό σημείο πόνου. Ένα μεγάλο μερίδιο των κλήσεων παραγωγής LLM σε εμπορικό λογισμικό δεν είναι καθόλου παραγωγικό — είναι δυαδικές κρίσεις, εκχωρήσεις κατηγοριών και αποφάσεις δρομολόγησης τυλιγμένες σε πρόζα. Εάν ένα μοντέλο μπορεί να πραγματοποιήσει αυτές τις κλήσεις με βαθμονομημένη σιγουριά στα 70 χιλιοστά του δευτερολέπτου και ουσιαστικά μηδενικό κόστος εξόδου, τα οικονομικά του λογισμικού με τεχνητή νοημοσύνη αλλάζουν σημαντικά: οι διεπαφές χρήστη σε πραγματικό χρόνο γίνονται πρακτικές και τα βήματα που ήταν πολύ ακριβά για να αυτοματοποιηθούν με LLM γίνονται αρκετά φθηνά για να εκτελούνται παντού.

Οι προτεινόμενες περιπτώσεις χρήσης του TypeSafe περιλαμβάνουν ταξινόμηση και δρομολόγηση δεδομένων, επαλήθευση και προστασία των εξόδων LLM, ανίχνευση jailbreak και ανάλυση μείωσης χάρτη σε μεγάλα σύνολα δεδομένων — φόρτους εργασίας όπου ο περιβάλλων κώδικας μπορεί να περιορίσει την ελευθερία του μοντέλου και να εντοπίσει σφάλματα.

Η εταιρεία είναι ειλικρινής σχετικά με τις ανοιχτές ερωτήσεις: οι δημοσιευμένες αξιολογήσεις της εκτελούνταν από φορητούς υπολογιστές στη Δυτική Ακτή των ΗΠΑ και η μακροπρόθεσμη βιωσιμότητα των τιμών παραμένει αναπόδεικτη. Το αν οι ισχυρισμοί του Jev επιβιώνουν από την επαφή με ανεξάρτητες δοκιμές θα καθορίσει εάν τα "System One Models" θα γίνουν κατηγορία ή περιέργεια.

Η πρώιμη πρόσβαση είναι πλέον ανοιχτή μέσω της ιστοσελίδας της εταιρείας.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →