Η Fireworks Research, η ομάδα μοντέλων εντός της startup συμπερασμάτων Fireworks AI, παρουσίασε το Ember-1, ένα εξειδικευμένο μοντέλο που η εταιρεία λέει ότι παράγει τις ίδιες απαντήσεις με το Kimi K3 του Moonshot AI ενώ εκπέμπει περίπου 40% λιγότερα token. Το μοντέλο κυκλοφόρησε στην πλατφόρμα της Fireworks στις 23 Σεπτεμβρίου και τις τελευταίες ημέρες έχει γίνει μια από τις πιο πολυσυζητημένες εκδόσεις στην κοινότητα προγραμματιστών, συγκεντρώνοντας εκατοντάδες θετικές ψήφους στο Hacker News καθώς οι κωδικοποιητές συζητούσαν εάν τα λογιστικά διακριτικά είναι το επόμενο όριο κόστους.

Το γήπεδο έρχεται σε μια στιγμή που οι λογαριασμοί συμπερασμάτων, όχι η ικανότητα μοντέλων, αποφασίζουν όλο και περισσότερο τι μπορούν να αντέξουν οικονομικά οι ομάδες να αποστείλουν. Για τις ομάδες που παρακολουθούν φόρτους εργασίας αντιπροσώπων να καταναλώνουν προϋπολογισμούς, [οι τελευταίες εξελίξεις της τεχνητής νοημοσύνης] (https://aibuzzwire.news) έχουν καταστήσει σαφές ένα πράγμα: η πιο ακριβή συνήθεια του κλάδου αυτή τη στιγμή δεν είναι να εκπαιδεύει μοντέλα αιχμής, αλλά τα χρησιμοποιεί. Το Ember-1 είναι η προσπάθεια της Fireworks να επιτεθεί άμεσα σε αυτό το πρόβλημα και η εταιρεία το υποστήριξε με ένα ασυνήθιστα λεπτομερές σύνολο σημείων αναφοράς και αριθμών παραγωγής.

Τα μοντέλα σκέψης σκέφτονται πάρα πολύ

Η βασική παρατήρηση πίσω από το Ember-1 είναι ότι μοντέλα συλλογισμού όπως το Kimi K3 ξοδεύουν την πλειονότητα των κουπονιών που δημιουργούνται - μερικές φορές περισσότερο από το 90%, σύμφωνα με το Fireworks - στην εσωτερική συλλογιστική και όχι στην ίδια την απάντηση. Με ένα μόνο αίτημα, αυτό είναι ακριβό. Στους φόρτους εργασίας αντιπροσώπων, συνδυάζεται: κάθε στροφή μιας συνομιλίας αντιπροσώπου επαναλαμβάνει όλη την προηγούμενη συλλογιστική πίσω στο μοντέλο, έτσι το περιβάλλον αυξάνεται κατά προσέγγιση τετραγωνικά με τον αριθμό των στροφών και τα μεγάλα ίχνη συλλογισμού από τις πρώτες στροφές διαβάζονται ξανά και χρεώνονται εκ νέου σε κάθε επόμενη κλήση.

Η Fireworks λέει ότι οι πελάτες τους είπαν ότι ήθελαν τη δυνατότητα κωδικοποίησης του Kimi K3 με χαμηλότερο κόστος, αλλά η απλή απόρριψη της συλλογιστικής προσπάθειας του μοντέλου δεν λειτούργησε - οι ρυθμίσεις χαμηλής προσπάθειας άφησαν πολύ υψηλή ποιότητα. Η εναλλακτική ήταν να εκπαιδεύσουμε ένα μοντέλο που να συλλογίζει πιο αποτελεσματικά, διατηρώντας παράλληλα το σκεπτικό που έχει σημασία.

Εκπαίδευση των αποβλήτων

Το Building Ember-1 χρειάστηκε περισσότερα από 50 πειράματα εκπαίδευσης και πάνω από 200 αξιολογήσεις, τα οποία εκτελέστηκαν εξ ολοκλήρου στην πλατφόρμα εκπαίδευσης χωρίς διακομιστή της Fireworks, σύμφωνα με την ανάρτηση ιστολογίου της εταιρείας. Η ομάδα λέει ότι ανέπτυξε νέους αλγόριθμους εκπαίδευσης στην πορεία για να συντομεύσει τη λογική χωρίς να χάσει την ακρίβεια.

Σημειωτέον, η εταιρεία δεν προσπάθησε να εξαλείψει το σκεπτικό χονδρικής. Κάποια από τα φαινομενικά λόγια του Kimi K3 είναι ο παραγωγικός αυτοστοχασμός — η επανεξέταση μιας υπόθεσης, η απάντηση σε σχόλια ή η ανίχνευση ενός αποτελέσματος πίσω σε μια προηγούμενη απόφαση βοηθά το μοντέλο να ανακάμψει από τα λάθη. Το καθεστώς προπόνησης σχεδιάστηκε για να διατηρήσει αυτή την ικανότητα ενώ κόβει μη παραγωγικούς βρόχους.

Τα δεδομένα εκπαίδευσης κάλυπταν τα μαθηματικά, την κωδικοποίηση, την παρακολούθηση οδηγιών, τη συνομιλία, την αναζήτηση, τη χρήση εργαλείων και τη μηχανική λογισμικού, καλύπτοντας τόσο μεμονωμένα προβλήματα όσο και εκτεταμένες αλληλεπιδράσεις πολλαπλών στροφών. Η Fireworks λέει ότι χρησιμοποίησε μόνο δικά της δεδομένα και όχι δεδομένα πελατών.

Σημεία αναφοράς: Επί ή κοντά στα σύνορα Pareto

Για να κάνει το κόστος, η Fireworks υπολόγισε το κόστος ανά σημείο αναφοράς χρησιμοποιώντας τη δημόσια τιμολόγηση API του Kimi K3 — 3 $ ανά εκατομμύριο μη αποθηκευμένα διακριτικά εισόδου, 0,30 $ ανά εκατομμύριο αποθηκευμένα διακριτικά εισόδου και 15 $ ανά εκατομμύριο διακριτικά εξόδου — και συνέκρινε το Ember-1 με το K3 σε χαμηλή, υψηλή και μέγιστη συλλογιστική προσπάθεια. Σε κάθε σημείο αναφοράς με περισσότερα από 50 δείγματα δοκιμής, η εταιρεία αναφέρει ότι το Ember-1 βρίσκεται πάνω ή κοντά στα σύνορα Pareto, ταιριάζοντας με το K3 στη μέγιστη προσπάθεια για ένα κλάσμα του κόστους και κυριαρχώντας αυστηρά στο K3 σε χαμηλή προσπάθεια.

Οι συγκρίσεις των επικεφαλίδων έναντι του K3 στη μέγιστη προσπάθεια, όπως αναφέρεται από το Fireworks:

| Σημείο αναφοράς | Δείγματα | K3 (μέγιστη προσπάθεια) | Ember-1 |
|---|---|---|---|
| Terminal Bench 2.1 | 89 | 80,9% | 82,0% |
| SWE-bench Verified | 500 | 93,2% | 92,2% |
| SWE-Interact | 75 | 21,3% | 20,0% |
| DeepSWE 1.1 | 113 | 66,4% | 75,2% |
| τ²-Bench Airline | 50 | 64% | 66% |

Σχετικά με το κόστος ανά εργασία, η Fireworks αναφέρει ότι το Ember-1 μείωσε τις δαπάνες κατά 51,9% στο Terminal Bench 2.1, 32,5% στο SWE-Interact, 23,7% στο DeepSWE 1.1 και 15,5% στο SWE-bench Verified σε σχέση με το K3 στη μέγιστη προσπάθεια — στην περίπτωση της διαφοράς 6 μονάδων εργασίας DeepSWE, σε περίπτωση που η διαφορά είναι 2 μονάδες εργασίας ανά εταιρεία, ποσοστά.

Η εταιρεία αξιολόγησε επίσης το Ember-1 στο Doximity's Bedside Bench, ένα επικυρωμένο από τους ιατρούς σημείο αναφοράς 500 κλινικών περιπτώσεων σε 10 ειδικότητες που εφαρμόζει η Fireworks μέσω του Ειδικού Δείκτη Νοημοσύνης που κυκλοφόρησε πρόσφατα. Εκεί, η Fireworks λέει ότι το Ember-1 έθεσε νέα όρια Pareto στο κόστος ανά εργασία τόσο σε ανοιχτά όσο και σε κλειστά μοντέλα, συμπεριλαμβανομένων των GPT-5.6 Sol, GPT-6 Astra και Claude Opus 5. Αυτός ο ισχυρισμός προέρχεται από το ευρετήριο της Fireworks και δεν έχει επαληθευτεί ανεξάρτητα.

Ζωντανή επισκεψιμότητα: Λιγότερα διακριτικά, ίδιες βαθμολογίες

Τα σημεία αναφοράς είναι ένα πράγμα. η παραγωγή είναι άλλο. Η Fireworks πραγματοποίησε ζωντανές δοκιμές A/B με δύο πελάτες σχετικά με τον φόρτο εργασίας κωδικοποίησης παραγωγής τους και αναφέρει ότι το Ember-1 χρησιμοποίησε περίπου 35% λιγότερα token ανά εργασία σε συγκρίσιμη ποιότητα. Σε μια μετρημένη σύγκριση, το Kimi K3 σημείωσε 0,751 ενώ δημιούργησε 49.300 μάρκες εξόδου ανά εργασία, έναντι 0,753 για το Ember-1 σε 29.900 μάρκες — μείωση 71,3% στα διακριτικά συλλογιστικής και 39% λιγότερα συνολικά διακριτικά. Μετά τις δοκιμές, ένας πελάτης μετέφερε το Ember-1 σε ζωντανή παραγωγή με σχέδια να το αυξήσει ώστε να αντικαταστήσει πλήρως το βασικό μοντέλο.

Μέσα στο ίδιο το Fireworks, το μοντέλο εναλλάχθηκε αθόρυβα στις ροές εργασιών κωδικοποίησης της εταιρείας πριν από την κυκλοφορία. Το αποτέλεσμα για το οποίο η ομάδα λέει ότι είναι πιο περήφανη: κανείς δεν το παρατήρησε. Οι προγραμματιστές συνέχισαν την εργασία τους χωρίς να ανιχνεύσουν το διακόπτη ενώ καταναλώνουν σημαντικά λιγότερα token.

Η Εξειδικευμένη Νοημοσύνη ως Στρατηγική

Το Ember-1 είναι το πρώτο μοντέλο μιας προγραμματισμένης σειράς από την Fireworks Research και έρχεται μαζί με το Specialized Intelligence Index της εταιρείας, μια προσπάθεια συγκριτικής αξιολόγησης που παρουσιάστηκε νωρίτερα αυτό το μήνα για σύγκριση ανοιχτών, κλειστών και εξειδικευμένων μοντέλων σε εργασίες πραγματικού κόσμου που δημιουργούνται από ειδικούς.

Το στρατηγικό παιχνίδι διαβάζεται εύκολα. Αντί να εκπαιδεύσει ένα μοντέλο προορισμού από το μηδέν, η Fireworks χρησιμοποίησε ένα ισχυρό μοντέλο ανοιχτού βάρους, εκπαίδευσε την αποτελεσματικότητα του token και τώρα πουλά την ίδια ικανότητα με χαμηλότερο κόστος ανά εργασία. Καθώς οι εκδόσεις ανοιχτού βάρους από εργαστήρια όπως το Moonshot συνεχίζουν να κλείνουν το χάσμα δυνατοτήτων, οι πάροχοι συμπερασμάτων ανακαλύπτουν ότι η ανθεκτική διαφοροποίηση μπορεί να έγκειται στο κόστος ανά ολοκληρωμένη εργασία και όχι στη θέση του leaderboard - μια αλλαγή που ευνοεί εταιρείες με ισχυρή υποδομή εκπαίδευσης και εξυπηρέτησης.

Αξίζει να δηλωθούν ξεκάθαρα οι επιφυλάξεις: οι παραπάνω αριθμοί προέρχονται από το blog της Fireworks, τις δικές της αξιολογήσεις και τους δικούς της πελάτες που πληρώνουν. Η ανεξάρτητη αναπαραγωγή της εξοικονόμησης συμβολαίων σε εξωτερικούς φόρτους εργασίας θα είναι η πραγματική δοκιμασία. Αλλά αν τα αποτελέσματα ισχύουν, ο πιο οικονομικός τρόπος για να εκτελέσετε ένα ανοιχτό μοντέλο συνοριακής κατηγορίας μπορεί να μην είναι πλέον να το κάνετε να σκέφτεται λιγότερο - μπορεί να είναι να εκτελέσετε ένα μοντέλο που έμαθε να σκέφτεται αποτελεσματικά.
---

Μείνετε μπροστά από την τεχνητή νοημοσύνη

Λάβετε τα τελευταία νέα, αναλύσεις και ανακαλύψεις AI — όλα σε ένα μέρος.

Διαβάστε περισσότερα νέα AI →