DeepSeek telah mengeluarkan DSpark, rangka kerja penyahkodan spekulatif sumber terbuka yang dikatakan syarikat itu mempercepatkan inferens model bahasa besar (LLM) sehingga 85% di bawah trafik langsung, tanpa kehilangan kualiti output. Diterangkan dalam kertas baharu daripada DeepSeek-AI dan Universiti Peking, sistem itu sudah pun berjalan di dalam infrastruktur perkhidmatan DeepSeek-V4 yang mengendalikan permintaan pengguna sebenar.
Kerja ini menangani salah satu masalah paling degil dalam pengeluaran AI: inferens adalah perlahan kerana model menjana teks satu token pada satu masa, setiap satu memerlukan laluan penuh melalui rangkaian. Penyahkodan spekulatif ialah ubat popular di mana model "draf" yang kecil dan pantas mencadangkan blok token yang kemudian disahkan oleh model bersaiz penuh dalam satu laluan, menerima awalan betul yang paling lama. Oleh kerana pengesahan adalah selari dan tepat secara matematik, ia mempercepatkan perkara sambil mengekalkan pengedaran model asal. DSpark, dikeluarkan bersama repositori latihan DeepSpec di GitHub, dengan cepat menjadi salah satu cerita kejuruteraan AI yang paling banyak dibincangkan di Berita Hacker. For more context on this story, see our ongoing AI trends.
Mengapa Penyahkodan Spekulatif Sedia Ada Menghentam Dinding
Penyelidikan penyahkodan spekulatif baru-baru ini telah bergerak ke arah "penggubal selari" yang menjana keseluruhan blok token calon dalam pas hadapan tunggal, menjadikan kependaman draf hampir bebas daripada saiz blok. Kertas DSpark mengenal pasti dua kesesakan yang telah menghalang kaedah ini daripada memenuhi janji mereka pada skala.
Yang pertama ialah masalah kualiti. Oleh kerana penggubal selari meramalkan setiap kedudukan secara bebas, mereka tidak boleh memodelkan cara token dalam blok bergantung antara satu sama lain. Para penyelidik menunjukkan ini membawa kepada "perlanggaran berbilang modal" dan pereputan penerimaan yang cepat pada kedudukan kemudian dalam blok draf, fenomena yang mereka panggil pereputan akhiran. Semakin panjang bongkah selari, semakin besar kemungkinan ekornya salah.
Yang kedua ialah masalah peringkat sistem. Walaupun menjana blok draf panjang adalah murah, mengesahkan secara membuta tuli setiap token yang dicadangkan membazirkan kapasiti kelompok yang terhad pada token yang mungkin ditolak. Di bawah keselarasan tinggi sistem penyajian sebenar, panjang pengesahan yang ideal berbeza-beza di sepanjang dua paksi: permintaan berstruktur seperti kod mengekalkan kadar penerimaan yang lebih tinggi daripada sembang terbuka, dan mengesahkan token tambahan adalah hampir percuma di bawah beban ringan tetapi mahal apabila sistem tepu.
Model Draf Separa Autoregresif
Untuk membetulkan pereputan akhiran, DSpark menggunakan apa yang penulis panggil sebagai seni bina separa autoregresif. Ia menggandingkan tulang belakang selari yang berat secara pengiraan, yang boleh mencadangkan banyak token sekaligus, dengan modul jujukan ringan yang memperkenalkan pemodelan pergantungan intra-blok. Reka bentuk ini bertujuan untuk menggabungkan kapasiti tinggi model selari pada kedudukan awal dengan koheren akhiran penggubal autoregresif tradisional, yang menjana token satu demi satu dan secara semula jadi menghormati kebergantungan.
Pada penanda aras luar talian terkawal yang merangkumi penaakulan matematik, penjanaan kod dan sembang harian, pasukan melaporkan bahawa DSpark meningkatkan dengan ketara tempoh yang diterima bagi setiap kitaran pengesahan berbanding garis dasar yang kukuh. Secara khusus, kertas itu menyatakan DSpark meningkatkan panjang yang diterima berbanding penggubal Eagle3 autoregresif sebanyak 30.9%, 26.7% dan 30.0% merentas tiga tetapan, dan ke atas penggubal DFlash selari sebanyak 16.3%, 18.4% dan 18.3%.
Pengesahan Berjadual Keyakinan, Sedar Beban
Separuh DSpark yang lebih baru ialah pendekatannya terhadap pengesahan. Daripada mengesahkan bilangan token draf yang tetap untuk setiap permintaan, DSpark merumuskan pemilihan panjang pengesahan sebagai masalah pemaksimuman pemprosesan global. Ia menggandingkan anggaran yang ditentukur tentang berapa lama awalan draf berkemungkinan bertahan, apa yang disebut oleh kertas itu sebagai kebarangkalian kelangsungan hidup, dengan penjadual peka perkakasan yang membaca beban enjin masa nyata.
Hasilnya ialah pengesahan berjadual keyakinan: sistem secara dinamik menyesuaikan bilangan token yang disahkan untuk setiap permintaan berdasarkan kedua-dua kandungan permintaan dan keadaan semasa enjin penyajian. Di bawah beban yang ringan ia mampu untuk mengesahkan dengan murah hati, manakala di bawah keselarasan berat ia mengarahkan belanjawan pengesahan model sasaran hanya ke arah token dengan jangkaan pulangan tertinggi, mengelakkan keruntuhan daya pemprosesan yang datang daripada perbelanjaan kapasiti kelompok pada token berkemungkinan rendah.
Keputusan Di Bawah Trafik Pengguna Langsung
Nombor yang paling berbangkit datang daripada pengeluaran. Pasukan itu menggunakan DSpark di dalam sistem penyajian DeepSeek-V4 yang menyediakan trafik pengguna secara langsung dan membandingkannya dengan garis dasar pengeluaran syarikat sebelum ini, kaedah ramalan berbilang token yang dikenali sebagai MTP-1.
Menurut kertas itu, DSpark secara konsisten mempercepatkan kelajuan penjanaan setiap pengguna sebanyak 60% hingga 85% untuk DeepSeek-V4-Flash dan sebanyak 57% hingga 78% untuk DeepSeek-V4-Pro pada daya pengeluaran agregat yang sepadan. Di bawah perjanjian peringkat perkhidmatan yang ketat di mana kapasiti garis dasar merosot teruk, bersamaan dengan 120 token sesaat untuk Flash dan 50 token sesaat untuk Pro, DSpark mengurangkan overhed pengesahan untuk mengekalkan daya pemprosesan yang mantap. Dengan mengatasi tebing prestasi itu, penulis berpendapat ia membuka kunci tahap interaktiviti yang ketat yang sebelum ini tidak dapat dicapai, dengan berkesan mengalihkan sempadan Pareto bagi LLM yang berkhidmat ke luar.
Perbezaan itu penting bagi pengendali. Kelajuan setiap pengguna yang lebih pantas pada jumlah pemprosesan yang sama bermakna pembantu yang lebih responsif dan aliran kerja agen yang lebih responsif tanpa membeli lebih banyak perkakasan, sementara mengekalkan SLA kependaman yang ketat di bawah beban ialah perkara yang memisahkan demo penyelidikan daripada sistem yang boleh bertahan semasa lonjakan trafik.
Sumber Terbuka untuk Komuniti
DeepSeek sedang mengeluarkan pusat pemeriksaan DSpark terlatih untuk model pratonton DeepSeek-V4-Flash dan DeepSeek-V4-Pro. Repositori DeepSpec yang disertakan, diterbitkan di bawah lesen MIT yang permisif, digambarkan sebagai pangkalan kod latihan dan penilaian yang didorong oleh algoritma timbunan penuh untuk penyahkodan spekulatif. Ia termasuk utiliti penyediaan data, pelaksanaan model draf, skrip latihan dan abah-abah penilaian, dan dihantar dengan tiga algoritma model draf: DSpark, DFlash dan Eagle3.
Keluaran itu merendahkan halangan untuk makmal dan pasukan infrastruktur lain untuk melatih dan menanda aras model draf mereka sendiri terhadap saluran paip piawai. Suite penilaian DeepSpec meliputi penanda aras yang telah ditetapkan termasuk GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval dan Arena-Hard-v2.
Mengapa Ia Penting
Kos inferens dan kependaman kini merupakan antara kekangan yang menentukan industri AI, membentuk segala-galanya daripada cara agresif syarikat menggunakan ejen AI kepada sama ada penyedia yang lebih kecil boleh bersaing dengan hyperscaler dalam ekonomi unit. Sumbangan DSpark bukanlah satu algoritma baharu berbanding demonstrasi yang mereka bentuk bersama model draf dan penjadual pengesahan dengan teliti, dan menganggap panjang pengesahan sebagai fungsi keadaan sistem langsung, boleh menggerakkan jarum secara bermakna dalam penggunaan sebenar.
Untuk DeepSeek, yang telah membina reputasinya pada sistem yang cekap dan dikeluarkan secara terbuka, DSpark ialah satu lagi titik data dalam hujah yang makmal telah buat selama lebih setahun: bahawa prestasi perkhidmatan gred sempadan boleh dicapai melalui kejuruteraan yang lebih bijak dan bukannya hanya melalui pengiraan mentah. Hakikat bahawa keuntungan diukur di bawah trafik langsung, dan bukannya dalam penanda aras sintetik, menjadikan keputusan lebih mudah bagi pengendali lain untuk mengambil serius apabila komuniti sumber terbuka mencerna kertas dan mula menghasilkan semula nombor.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →

