DeepSeek פרסמה את DSpark, מסגרת פענוח ספקולטיבית בקוד פתוח שלדבריה מאיצה מסקנות של מודל שפה גדול (LLM) בעד 85% תחת תעבורה חיה, ללא כל הפסד באיכות הפלט. המתואר במאמר חדש של DeepSeek-AI ואוניברסיטת פקינג, המערכת כבר פועלת בתוך תשתית השירות של DeepSeek-V4 המטפלת בבקשות משתמש אמיתיות.

העבודה מתמודדת עם אחת הבעיות העקשניות ביותר בייצור בינה מלאכותית: ההסקה היא איטית מכיוון שמודלים מייצרים טקסט אחד בכל פעם, כל אחד דורש מעבר מלא ברשת. פענוח ספקולטיבי הוא תרופה פופולרית שבה מודל "טיוטה" קטן ומהיר מציע גוש אסימונים שהדגם בגודל מלא מאמת לאחר מכן במעבר אחד, ומקבל את הקידומת הנכונה הארוכה ביותר. מכיוון שהאימות מקביל ומדויק מבחינה מתמטית, הוא מאיץ דברים תוך שמירה על התפלגות המודל המקורי. DSpark, ששוחרר לצד מאגר ההדרכה של DeepSpec ב-GitHub, הפך במהירות לאחד מסיפורי הנדסת הבינה המלאכותית הנדונים ביותר ב-Hacker News. For more context on this story, see our ongoing more AI stories.

מדוע פענוח ספקולטיבי קיים פוגע בקיר

מחקר הפענוח הספקולטיבי האחרון עבר לכיוון "מנסחים מקבילים" שמייצרים בלוק שלם של אסימונים מועמדים במעבר אחד קדימה, מה שהופך את השהיית הטיוטה כמעט ללא תלות בגודל הבלוק. נייר DSpark מזהה שני צווארי בקבוק שמנעו משיטות אלו לקיים את הבטחתן בקנה מידה.

הראשון הוא בעיית איכות. מכיוון שמנסחים מקבילים חוזים כל עמדה באופן עצמאי, הם לא יכולים לדגמן כיצד אסימונים בתוך בלוק תלויים זה בזה. החוקרים מראים שהדבר מוביל ל"התנגשויות רב-מודאליות" ולדעיכת קבלה מהירה בעמדות מאוחרות יותר בבלוק טיוטה, תופעה שהם קוראים לסיומת ריקבון. ככל שהגוש המקביל ארוך יותר, כך גדל הסיכוי שהזנב שלו לא בסדר.

השני הוא בעיה ברמת המערכת. אמנם יצירת בלוקי טיוטה ארוכים היא זולה, אך אימות עיוור של כל אסימון מוצע מבזבז קיבולת אצווה מועטה באסימונים שעלולים להידחות. תחת ההתאמה הגבוהה של מערכת הגשה אמיתית, אורך האימות האידיאלי משתנה לאורך שני צירים: בקשות מובנות כמו קוד מחזיקות בשיעורי קבלה גבוהים יותר מצ'אט פתוח, ואימות אסימונים נוספים הוא כמעט בחינם בעומס קל אך יקר כאשר המערכת רוויה.

דגם טיוטה חצי אוטורגרסיבי

כדי לתקן את דעיכת הסיומת, DSpark מאמצת את מה שהכותבים מכנים ארכיטקטורה סמי-אוטורגרסיבית. זה משלב עמוד שדרה מקביל כבד מבחינה חישובית, שיכול להציע אסימונים רבים בבת אחת, עם מודול רציף קל משקל שמציג מודל תלות תוך-בלוק. העיצוב נועד לשלב את הקיבולת הגבוהה של דגמים מקבילים במיקומים מוקדמים עם קוהרנטיות הסיומת של מנסחים אוטורגרסיביים מסורתיים, המייצרים אסימונים בזה אחר זה ומכבדים באופן טבעי תלות.

על מדדים לא מקוונים מבוקרים המתפרשים על חשיבה מתמטית, יצירת קוד וצ'אט יומי, הצוות מדווח כי DSpark משפר באופן משמעותי את האורך המקובל לכל מחזור אימות על פני קווי בסיס חזקים. באופן ספציפי, המאמר מציין ש-DSpark משפר את האורך המקובל על פני ה-Eagle3 המנסח האוטו-רגרסיב ב-30.9%, 26.7% ו-30.0% בשלוש הגדרות, ומעל ה-DFlash המקביל ב-16.3%, 18.4% ו-18.3%.

אימות מתוזמן לביטחון, מודע לטעינה

החצי החדש יותר של DSpark הוא הגישה שלו לאימות. במקום לאמת מספר קבוע של אסימוני טיוטה עבור כל בקשה, DSpark מנסחת בחירת אורך אימות כבעיית מקסום תפוקה גלובלית. הוא משלב הערכות מכוילות לגבי משך הזמן שהקידומת של טיוטה צפויה לשרוד, מה שהעיתון מכנה הסתברויות הישרדות, עם מתזמן מודע לחומרה שקורא עומס מנוע בזמן אמת.

התוצאה היא אימות מתוזמן לביטחון: המערכת מתאימה באופן דינמי כמה אסימונים היא מאמתת עבור כל בקשה בהתבסס הן על תוכן הבקשה והן על המצב הנוכחי של מנוע ההגשה. בעומסים קלים היא יכולה להרשות לעצמה לאמת בנדיבות, בעוד שבמקבילות כבדה היא מנתבת את תקציב האימות של מודל היעד רק לכיוון אסימונים עם התשואה הצפויה הגבוהה ביותר, תוך מניעת קריסת התפוקה הנובעת מהוצאת קיבולת אצווה על אסימונים בעלי סבירות נמוכה.

תוצאות תחת תנועת משתמשים חיה

המספרים הנובעים ביותר מגיעים מייצור. הצוות פרס את DSpark בתוך מערכת ההגשה DeepSeek-V4 המשרתת תעבורת משתמשים חיה והשווה אותה מול קו הייצור הקודם של החברה, שיטת חיזוי מרובה אסימונים הידועה בשם MTP-1.

לפי העיתון, DSpark מאיץ באופן עקבי את מהירויות הדור לכל משתמש ב-60% עד 85% עבור DeepSeek-V4-Flash וב-57% עד 78% עבור DeepSeek-V4-Pro בתפוקה מצטברת תואמת. תחת הסכמי רמת שירות קפדניים שבהם הקיבולת של קו הבסיס מתדרדרת בצורה חמורה, שווה ערך ל-120 אסימונים לשנייה עבור Flash ו-50 אסימונים לשנייה עבור Pro, DSpark מפחית את תקרת האימות כדי לשמור על תפוקה חזקה. על ידי התגברות על צוק ביצועים זה, המחברים טוענים שזה פותח רמות אינטראקטיביות קפדניות שבעבר לא היו ניתנות להשגה, ובעצם מעביר את גבול פארטו של שירות LLM כלפי חוץ.

ההבחנה הזו חשובה למפעילים. מהירות מהירה יותר לכל משתמש באותה תפוקה כוללת פירושה עוזרים מגיבים יותר וזרימות עבודה סוכניות מבלי לקנות יותר חומרה, בעוד ששרידות SLAs קפדנית של זמן השהייה תחת עומס היא מה שמפריד בין הדגמת מחקר למערכת שיכולה להחזיק מעמד במהלך עליות תנועה.

קוד פתוח לקהילה

DeepSeek משחררת את מחסומי ה-DSpark המיומנים הן לדגמי התצוגה המקדימה של DeepSeek-V4-Flash והן לדגמי DeepSeek-V4-Pro. מאגר ה-DeepSpec הנלווה, שפורסם תחת רישיון MIT המתיר, מתואר כבסיס קוד הדרכה והערכה מלא, מונע על ידי אלגוריתמים, עבור פענוח ספקולטיבי. הוא כולל כלי עזר להכנת נתונים, הטמעות של מודל טיוטה, סקריפטים לאימון ורתמות הערכה, ונשלח עם שלושה אלגוריתמים של מודל טיוטת: DSpark, DFlash ו-Eagle3.

השחרור מוריד את המחסום עבור מעבדות וצוותי תשתית אחרים לאמן ולהשוות את המודלים הטיוטים שלהם מול צינור סטנדרטי. חבילת ההערכה של DeepSpec מכסה אמות מידה מבוססות כולל GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval ו-Arena-Hard-v2.

למה זה חשוב

עלות ההסקה והשהייה הם כעת בין האילוצים המגדירים את תעשיית הבינה המלאכותית, ומעצבים הכל, החל מאופן אגרסיביות של חברות לפרוס סוכני בינה מלאכותית ועד לשאלה האם ספקים קטנים יותר יכולים להתחרות עם היפר-סקאלרים בכלכלת יחידה. התרומה של DSpark היא פחות אלגוריתם חדש בודד מאשר הדגמה שתכנון משותף בקפידה של הטיוטה ושל מתזמן האימות, והתייחסות לאורך האימות כפונקציה של מצב המערכת החיה, יכול להזיז בצורה משמעותית את המחט בפריסות אמיתיות.

עבור DeepSeek, שבנתה את המוניטין שלה על מערכות יעילות, שפורסמו בגלוי, DSpark היא נקודת מידע נוספת בויכוח שהמעבדה מעלה כבר יותר משנה: שניתן להשיג ביצועי שירות ברמה גבולית באמצעות הנדסה חכמה יותר ולא רק באמצעות מחשוב גולמי. העובדה שהרווחים נמדדו תחת תעבורה חיה, ולא בהשוואה סינתטית, מקלה על מפעילים אחרים לקחת את התוצאה ברצינות כאשר קהילת הקוד הפתוח מעכלת את הנייר ומתחילה לשחזר את המספרים.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →