Το κινεζικό εργαστήριο τεχνητής νοημοσύνης DeepSeek απέστειλε αθόρυβα το deepseek-v4-flash-vision-exp, μια πειραματική έκδοση του μοντέλου V4-Flash που μπορεί να δεχθεί εικόνες μαζί με κείμενο, κλείνοντας ένα από τα πιο κραυγαλέα κενά στη ναυαρχίδα της οικογένειας μοντέλων. Η κυκλοφορία, που τεκμηριώνεται στις επίσημες σελίδες API της εταιρείας, έρχεται λίγες εβδομάδες μετά την ανανέωση των V4-Flash-0731 και V4-Pro-0813 και δίνει στους προγραμματιστές έναν από καιρό ζητούμενο τρόπο να τροφοδοτούν στιγμιότυπα οθόνης, γραφήματα και φωτογραφίες απευθείας σε ένα από τα φθηνότερα μοντέλα οριακής βαθμίδας του κλάδου. Για τις ομάδες που παρακολουθούν [τις πιο πρόσφατες εξελίξεις στην τεχνητή νοημοσύνη] (https://aibuzzwire.news), είναι άλλο ένα μήνυμα ότι το DeepSeek σκοπεύει να ανταποκριθεί στους ανταγωνιστές της Δύσης χαρακτηριστικό-για-χαρακτηριστικό, ενώ τους υποτιμά επιθετικά ως προς την τιμή.
Τι κάνει το νέο μοντέλο
Σύμφωνα με την τεκμηρίωση του API του DeepSeek, το «deepseek-v4-flash-vision-exp» επιτρέπει στους χρήστες «να ζητούν από το μοντέλο να περιγράψει εικόνες, να διαβάσει κείμενο από στιγμιότυπα οθόνης, να αναλύσει γραφήματα και πολλά άλλα». Το μοντέλο δέχεται αρχεία JPEG, PNG, GIF και WebP, με τη μορφή που εντοπίζεται από το πραγματικό περιεχόμενο του αρχείου και όχι από το όνομα του αρχείου ή τον δηλωμένο τύπο MIME — μια μικρή αλλά προσεκτική λεπτομέρεια που αποτρέπει σφάλματα ασυμφωνίας επεκτάσεων.
Οι προγραμματιστές μπορούν να μεταβιβάζουν εικόνες με τρεις τρόπους: ενσωματωμένες διευθύνσεις URL δεδομένων με κωδικοποίηση base64 (υπόκειται σε όριο σώματος αιτήματος 48 MiB), εξωτερικές διευθύνσεις URL προσβάσιμες στο κοινό (έως 8.192 χαρακτήρες, 32 MiB ανά εικόνα, με παράθυρο λήψης 60 δευτερολέπτων) ή μέσω του API αρχείων. Τα πάντα χρησιμοποιούν την τυπική μορφή Συμβατών με OpenAI Ολοκληρώσεις συνομιλίας και το μοντέλο είναι επίσης προσβάσιμο μέσω του συμβατού με Anthropic endpoint του DeepSeek — που σημαίνει ότι ο υπάρχων κώδικας Claude SDK μπορεί να αλλάζει backend με ελάχιστες αλλαγές.
Τιμολόγηση: οριακό όραμα σε τιμές εμπορευμάτων
Το πειραματικό μοντέλο κληρονομεί το επιθετικό δελτίο τιμών του V4-Flash. Τα διακριτικά εισόδου κοστίζουν 0,22 $ ανά εκατομμύριο εκτός αιχμής και 0,44 $ στην αιχμή για αποτυχίες κρυφής μνήμης, πέφτοντας σε μόλις 0,007 $ ανά εκατομμύριο σε επισκέψεις στην κρυφή μνήμη κατά τις ώρες εκτός αιχμής. Οι μάρκες εξόδου κοστολογούνται στα 0,66 $ ανά εκατομμύριο εκτός αιχμής και 1,32 $ ανά εκατομμύριο στην αιχμή. Οι εικόνες μετατρέπονται σε διακριτικά με βάση τις διαστάσεις τους και χρεώνονται μαζί με διακριτικά κειμένου.
Αυτή η τιμολόγηση έχει σημασία επειδή υποβαθμίζει δραματικά τις συγκρίσιμες πολυτροπικές προσφορές από μεγάλους παρόχους των ΗΠΑ, συνεχίζοντας τον πόλεμο τιμών που διεξάγει η DeepSeek όλο το χρόνο. Το μοντέλο φέρει επίσης τις βασικές προδιαγραφές της οικογένειας: ένα παράθυρο περιβάλλοντος 1 εκατομμυρίου token, έως και 384K διακριτικά μέγιστης απόδοσης, υποστήριξη για τρόπους σκέψης και μη σκέψης, έξοδο JSON, κλήσεις εργαλείων και όριο ταυτόχρονης λειτουργίας 2.500 — προδιαγραφές που το τοποθετούν ως γνήσιο εργατικό δυναμικό για παραγωγή υψηλού όγκου εργασίας.
Γιατί οι προγραμματιστές ήταν απελπισμένοι για αυτό
Η εκτόξευση προσγειώθηκε στο Hacker News, όπου συγκέντρωσε γρήγορα περισσότερους από 450 πόντους — και ο ενθουσιασμός έχει μια συγκεκριμένη ιστορία προέλευσης. Το V4-Flash-0731 του DeepSeek μόνο για κείμενο είχε αποκτήσει τη φήμη ότι πίστευε ότι μπορούσε να δει. Πολλοί προγραμματιστές ανέφεραν ότι το μοντέλο θα υπέθετε ότι είχε δυνατότητες όρασης και μετά θα αυτοσχεδίαζε περίπλοκους τρόπους αντιμετώπισης όταν ανακάλυψε ότι δεν μπορούσε - συμπεριλαμβανομένης της εφεύρεσης εργαλείων ανάλυσης εικόνας βάσει κειμένου και τραβώντας στιγμιότυπα οθόνης από συνδεδεμένες συσκευές πριν συνειδητοποιήσει ότι δεν είχε τρόπο να τα δει.
"Έχω ακούσει ότι το DeepSeek v4 Flash 0731 έχει συχνά υποθέσει ότι έχει δυνατότητες όρασης και στη συνέχεια καταφεύγει στην εφεύρεση εργαλείων ανάλυσης εικόνας που βασίζονται σε κείμενο όταν διαπιστώνει ότι στην πραγματικότητα δεν μπορεί να δει", έγραψε ένας σχολιαστής, επαναλαμβάνοντας αναφορές από πολλούς άλλους. Για οποιονδήποτε χρησιμοποιεί το μοντέλο ως πράκτορα σε αγωγούς κωδικοποίησης ή αυτοματισμού, η νέα παραλλαγή του οράματος θα πρέπει να εξαλείψει μια ολόκληρη κατηγορία αστοχιών λόγω σύγχυσης.
Το πιάσιμο 800x800
Η κυκλοφορία δεν είναι χωρίς περιορισμούς και η πιο έντονη κριτική στο Hacker News στόχευε έναν αριθμό: την ανάλυση εικόνας. Η τεκμηρίωση αναφέρει ότι πριν από την εξαγωγή συμπερασμάτων, κάθε εικόνα αλλάζει αυτόματα το μέγεθος, έτσι ώστε ο συνολικός αριθμός pixel να ταιριάζει κατά προσέγγιση με μια εικόνα 800x800, διατηρώντας τον λόγο διαστάσεων.
"Είναι χρήσιμο, αλλά για το OCR και πολλές άλλες εφαρμογές πρέπει να είναι λίγο υψηλότερο (π.χ.: τοποθέτηση μιας πλήρους σελίδας μεγέθους A4 / Letter)", υποστήριξε ένας προγραμματιστής, ενώ ένας άλλος απαντά ωμά ότι το καπάκι 800x800 "σκοτώνει πολλές περιπτώσεις χρήσης". Για πυκνά έγγραφα, σαρώσεις πλήρους σελίδας ή λεπτομερή εντοπισμό σφαλμάτων διεπαφής χρήστη, το ανώτατο όριο ανάλυσης θα μπορούσε να ωθήσει τους προγραμματιστές σε εναλλακτικές λύσεις υψηλότερης – και πιο ακριβής – ανάλυσης. Μια δημοφιλής λύση που προτείνεται στο νήμα: χωρίστε μεγάλες σελίδες σε πλακίδια και τροφοδοτήστε τις ξεχωριστά.
Το άλλο ανοιχτό ερώτημα είναι η διαφάνεια. Η DeepSeek έχτισε τη φήμη της με την απελευθέρωση ανοιχτών βαρών, αλλά η εταιρεία δεν έχει πει εάν θα ακολουθήσει η παραλλαγή του οράματος. Οι σχολιαστές υπέθεσαν ότι μπορεί να προέρχεται από την πρόσφατη έρευνα της εταιρείας "Thinking with Visual Primitives", για την οποία φέρεται να υποσχέθηκαν βάρη, αλλά τίποτα δεν έχει επιβεβαιωθεί. Συγκεκριμένα, το μοντέλο αναφέρεται ως πειραματικό - το επίθημα "-exp" - σηματοδοτώντας ότι το DeepSeek αναμένει να επαναληφθεί.
Μια ήσυχη αλλά στρατηγική κυκλοφορία
Η πτώση της όρασης συνεχίζει μια πολυάσχολη έκταση για το εργαστήριο που εδρεύει στο Hangzhou, το οποίο πέρασε τον Αύγουστο στέλνοντας σταθερές ενημερώσεις: V4-Flash-0731, το προσανατολισμένο σε πράκτορες πλαίσιο DeepSeek Harness, την ανανέωση V4-Pro-0813 και τώρα εισαγωγή πολλαπλών μεταφορών. Αντί για μια μόνο επιτυχημένη κυκλοφορία, το DeepSeek εκτελεί μια σειρά από γρήγορες, σταδιακές εκδόσεις που κρατούν τα μοντέλα του μέσα σε αλυσίδες εργαλείων προγραμματιστών - την ίδια στρατηγική αρπαγής γης που ακολουθούν τα δυτικά εργαστήρια με τους πράκτορες κωδικοποίησης.
Για τον κλάδο της τεχνητής νοημοσύνης γενικά, το μήνυμα είναι οικείο, αλλά εξακολουθεί να είναι άβολο για τους κατεστημένους: οι δυνατότητες που κάποτε δικαιολογούσαν την τιμολόγηση premium - κατανόηση εικόνας σε ένα πλαίσιο εκατομμυρίων διακριτικών - φτάνουν τώρα σε λίγα σεντς ανά εκατομμύριο μάρκες. Η πειραματική ετικέτα δίνει στο DeepSeek χώρο για να βελτιώσει το μοντέλο, αλλά οι προγραμματιστές έχουν ήδη αρχίσει να το ενώνουν σε ροές εργασίας που βασίζονται σε στιγμιότυπα οθόνης. Το ερώτημα δεν είναι πλέον αν το DeepSeek μπορεί να ταιριάξει με το σύνολο των πολυτροπικών χαρακτηριστικών των αντιπάλων του, αλλά πόσο γρήγορα προσαρμόζεται η υπόλοιπη αγορά στις τιμές του.
Μείνετε μπροστά από την τεχνητή νοημοσύνη
Για τις πιο πρόσφατες εκδόσεις μοντέλων τεχνητής νοημοσύνης, μάχες συγκριτικής αξιολόγησης και ανάλυση βιομηχανίας, προσθέστε σελιδοδείκτη AI Buzz Wire.
Διαβάστε περισσότερα νέα AI →