NVIDIA פרסמה את Nemotron 3 Embed, אוסף פתוח של דגמי הטמעה שנועדו להפעיל ייצור בקנה מידה של אחזור מוגבר (RAG), אחזור סוכן, אחזור קוד וזיכרון סוכן. המהדורה, שפורטה על ידי MarkTechPost ב-17 ביולי, 2026, מגיעה כשהשכבה שמחליטה אילו קטעים סוכן בינה מלאכותית יראה הופכת לשדה קרב תחרותי, מגמה שדסק חדשות הבינה המלאכותית של הפרסום הזה עקב אחריו כאשר ארגונים עוברים מצ'אטבוטים למערכות הפועלות לפי ידע שאוחזר.
דגמי הטבעה מחליטים אילו קטעים סוכן יראה אי פעם, מה שהופך אותם לנקודת חנק שקטה אך מכרעת בערימת הבינה המלאכותית היצירתית. NVIDIA בנתה את Nemotron 3 Embed כדי לחזק את השכבה הזו. האוסף כולל שלושה מחסומים פתוחים: Nemotron-3-Embed-8B-BF16, אפשרות דיוק ראשונה; Nemotron-3-Embed-1B-BF16, הנושא את אותו עיצוב לתוך טביעת רגל קטנה יותר; ו-Nemotron-3-Embed-1B-NVFP4, גרסת 4 סיביות מותאמת ל-Blackwell. שלושתם הם מקודדי שנאים מאומנים עם מיסוך קשב דו-כיווני, כאשר ההטמעה הסופית מופקת על ידי איגום ממוצע על ייצוגים ברמת האסימון. כל אחד מהם תומך באורך רצף מרבי של 32,768 אסימונים.
בראש טבלת הלידרבורד
התוצאה הראשית היא שנמוטרון-3-Embed-8B-BF16 מדורגת במקום הראשון ב-RTEB, מדד הטמעת האחזור, נכון ל-17 ביולי 2026, על פני 16 המשימות הציבוריות שלו. הציונים נמדדים כממוצע NDCG@10 באורך רצף מודל של 4,096. NVIDIA העריכה כל דגם ב-34 שפות, וכל שלוש נקודות הבידוק משוחררות תחת הסכם הרישיון של OpenMDW גרסה 1.1, מה שהופך אותם לזמינים באופן חופשי למפתחים להורדה, הפעלה ושינוי.
יש לציין שבסיסי הדגם נשאבים מ-Mistral. המחסום 8B בנוי על Ministral-3-8B-Instruct-2512, בעוד ששתי גרסאות 1B משתמשות ב-Ministral-3-3B-Instruct-2512, על פי דוח MarkTechPost. ההחלטה של NVIDIA להתבסס על הבסיס של Mistral ולא על ארכיטקטורה פנימית גרידא משקפת את האופן שבו הפך פיתוח מודלים זורמים, עם בסיסים פתוחים המותאמים באופן שגרתי ומוכשרים מחדש למשימות מיוחדות.
דחיסה, ריצת אימון לא קטנה יותר
שני פערי ביצועים בולטים. מודל 1B זוכה ל-10.4 נקודות RTEB בהשוואה לקו הבסיס של ה-lama-nemotron-embed-vl-1b-v2 מהדור הקודם. בנפרד, נקודת המחסום NVFP4 4-bit עולה רק 0.38 נקודות RTEB מול האב BF16 שלה, ושומרת על כ-99.5% מדיוק האחזור שלה. הדחיסה הזו כמעט ללא אובדן היא משמעותית במיוחד עבור צוותים שצריכים להפעיל הטמעות בקנה מידה, שבו לרוב עלויות הזיכרון וההסקת שולטים.
ציוני 1B אלה הושגו באמצעות צינור דחיסה ולא ריצת אימון קטנה יותר. ההורה, nemotron-3-embed-3b, נגזם וזוקק בשני סבבים איטרטיביים. ראשית, האב 3B נגזם ל-2B באמצעות חיפוש הארכיטקטורה העצבית של NVIDIA ModelOpt mcore_minitron, אשר מחפש על פני רוחב נסתר, גודל FFN, ראשי תשומת לב ועומק, ולאחר מכן בוחר את המועמד הטוב ביותר מחזית ה-Pareto המובילה. קורפוס כיול של 50,000 דגימות בדומיין השיג את המועמדים הללו.
לאחר מכן, מודל ה-2B זוקק מהמורה להטמעת 8B המכווננת היטב, המשלב אובדן מרחק קוסינוס ואובדן שגיאה ממוצעת בריבוע על פני שילוב נתונים רב-לשוני בדומיין. אותו הליך חזר על עצמו כדי לייצר את מחסום 1.14B, מה שהוכיח שהגרסאות הקטנות יותר יורשות הרבה מהיכולת של הדגם הגדול יותר באמצעות דחיסה מובנית ולא אימון עצמאי.
נבנה עבור יעילות Blackwell
הדחיסה ממשיכה לפורמט ההגשה. משקלים ממוקדי קוונטיזציה והפעלות של שכבות ליניאריות בלבד, תוך שימוש בסוג הנתונים NVFP4, כאשר צוות המחקר מסתמך על nvidia-modelopt v0.45.0. בעקבות ה-Quantization-Aware Distillation, בעיקר כדי לשחזר דיוק בכניסות ארוכות. הכיול השתמש ב-512 דגימות, מפוצלות בין 256 שאילתות ו-256 קטעים ממערך הנתונים של cnn_dailymail, בעוד שההכשרה ל-QAD נעזרה ב-20,000 דגימות.
התמורה המעשית היא היעילות בחומרה העדכנית ביותר של NVIDIA. צוות המחקר מדווח כי NVFP4 ב-Blackwell מספק תפוקה גבוהה עד פי 2 מ-BF16 תוך שמירה על יותר מ-99% מדיוק האחזור של BF16. כרטיס הדגם NVFP4 מתעד גם גדלי הטמעה דינמיים, מה שמאפשר למפתחים לחתוך את הווקטור של 2,048 ממדים ל-1,024 או 512 ממדים ולנרמל מחדש לאחר מכן, תוך מסחר במעט דיוק תמורת עלות אחסון נמוכה יותר. הגמישות הזו חשובה עבור מסדי נתונים וקטוריים, שבהם אחסון מיליארדי וקטורים בעלי מימדים גבוהים הוא יקר.
מדוע הטבעות חשובות עכשיו
דגמי הטבעה הפכו לנקודת חנק שקטה בערימת הבינה המלאכותית היצירתית. כל סוכן מבוסס אחזור, כלי חיפוש ארגוני ועוזר קוד תלויים בהם כדי להביא את ההקשר הנכון לפני שמודל שפה גדול יוצר תגובה. מודל הטמעה חזק יותר וזול יותר יכול לשפר באופן ישיר את איכות התשובה ולצמצם עלויות תפעול, וזו הסיבה שספקים מ-OpenAI ועד Cohere ועד לקולקטיבים של קוד פתוח מיהרו לשחרר משפחות חדשות.
על ידי העברת מקורות פתוחים לאוסף בדירוג העליון תחת רישיון מתירני ושילובו עם קוונטיזציה מכווננת ב-Blackwell, NVIDIA מחזקת את האסטרטגיה שלה של זריעה של מערכת ה-AI הרחבה יותר עם כלים הפועלים בצורה הטובה ביותר על הסיליקון שלה. למפתחים הבונים צינורות RAG או מערכות זיכרון של סוכנים, Nemotron 3 Embed מציע אפשרות רעננה, זמינה באופן חופשי, שדוחפת את המצב העכשווי על רף צפייה נרחב, בעוד שגרסת NVFP4 מעניקה לצוותים דרך אמינה לצמצום עלויות ההסקות מבלי לוותר על איכות האחזור בה תלויים היישומים שלהם.
הישאר לפני AI
דגמי הטבעה פתוחים כמו Nemotron 3 Embed מעצבים מחדש בשקט את האופן שבו סוכני AI מוצאים מידע ומשתמשים בו. למידע נוסף על הדגמים, הגרסאות והמחקרים שמניעים את התחום קדימה, עקוב אחר פיתוחי הבינה המלאכותית האחרונים כשהם פורצים.
קרא עוד חדשות AI ->



