דוח שטח של OpenAI ומשתפי פעולה אקדמיים מצא שסוכני קידוד AI יכולים להאיץ באופן דרמטי את המודרניזציה של תוכנות מדעיות מזדקנות, לשכתב כלים בשפות מהירות יותר ולקצץ את זמני הריצה בסדרי גודל. המלכוד: אותם סוכנים אינם יכולים לשפוט באופן אמין אם עבודתם נכונה מבחינה מדעית, ולרוב מציגים קוד באגי בביטחון מלא.
הדו"ח, שפורסם ב-1 באוגוסט 2026 ותועד על ידי The Decoder, בחן שמונה מקרי מקרה - בעיקר בביולוגיה - שבהם קבוצות מחקר השתמשו בסוכני קידוד כמו Codex וClaude Code כדי להציל, לייעל ולשכתב תוכנות קריטיות. לדיווח שוטף על הכלים המעצבים מחדש את המדע והתעשייה, עקוב אחר [חדשות הבינה המלאכותית האחרונות] שלנו (https://aibuzzwire.news).
משבר שקט בתוכנה מדעית
חלק גדול מהתוכנות העומדות בבסיס המחקר המודרני החלו כקוד תומך למאמר בודד. צוותים אקדמיים קטנים בנו את הכלים הללו ללא משאבים לבדיקות, תחזוקה או אופטימיזציה נאותים. התוצאה היא בסיס שביר: תוכניות שנותרו קריטיות לתחומים שלמים אך דורשות תיקון מתמיד. דו"ח השדה של OpenAI מציע שסוכני קידוד AI יכולים לעזור לסגור את הפער ארוכת השנים הזה.
הפרויקטים נעו בין תחזוקה שוטפת לשכתובים מלאים בשפות תכנות מודרניות, וכמה מהם סיפקו הישגים מושכים את העין.
בנייה מחדש של STAR בחלודה
אחד הפרויקטים היותר שאפתניים, rustar-aligner, שנבנה מחדש STAR מאפס ב-Rust. STAR הוא כלי בשימוש נרחב הממפה קריאת רצף מהתאים למיקומים המתאימים להם בגנום. התוכנית המקורית מכילה יותר מ-20,000 שורות של C ו-C++ ואינה מתוחזקת עוד באופן פעיל, למרות שהיא נותרה משובצת בצינורות מחקר רבים.
כדי לאמת את השכתוב, הצוות בדק את שני הכלים ב-10,000 קריאות רצף קצרות מתאי שמרים. עבור קריאה חד-קצה, Rustar-aligner הפיק את אותה תוצאה כמו STAR ב-99.815 אחוז מהמקרים. עבור קריאות קצה זוגיות, שיעור ההסכם היה 99.883 אחוז. ההשוואה התרחבה מעבר למיקומים ממופים וכללה כמה שדות מפתח אחרים ששתי התוכנות מייצרות עבור כל קריאה, ואף אחד מהכלים לא מיפה קריאות שהשני לא הצליח למפות.
Speedup של פי 60
RustQC סיפקה את המהירות הגדולה ביותר על ידי שילוב של 15 כלי בקרת איכות נפרדים לתוכנית אחת. במערך נתונים גדול, זמן הריצה צנח מ-15 שעות ו-34 דקות ל-14 דקות ו-54 שניות בלבד - מהירות של יותר מ-60 פעמים.פרויקט אחר, HelixForge, החליף כלי להפקת נתונים גנומיים סינתטיים בגרסה מואצת של GPU. בבדיקה שעשתה שימוש בנתונים מתורם אחד ומקטע של עשרה מיליון זוג בסיסים של הגנום, HelixForge השלימה את הצינור המלא 59.6 מהר יותר מה-BamSurgeon המקורי, כאשר שלב המחשוב הראשי לבדו רץ פי 98.6 מהר יותר.
במודרניזציה קונבנציונלית יותר, GPT-5.5 החליף את תהליך הבנייה וההתקנה המיושן של cyvcf2, ספריית Python לקריאת נתונים גנטיים. ההגירה המעורבת יותר של MHCflurry ראתה את קלוד קוד וקודקס מחליפים בין תפקידי המפתח והסוקר תוך העברה של כ-10,000 שורות קוד מ-TensorFlow ל-PyTorch. MHCflurry הוא מודל אימונולוגי שמנבא אילו מטרות יזהו תאי חיסון.
'שגוי בביטחון'
ממצא הכותרת, לעומת זאת, היה מפוכח. על פני מקרי המקרה, סוכנים השלימו משימות מוגדרות היטב במהירות, אך לא יכלו לשפוט באופן אמין אם עבודתם נכונה מבחינה מדעית. גם כשהקוד שלהם הכיל שגיאות, המערכות הציגו אותו לרוב בביטחון מלא.
ברנט פדרסן, המפתח של cyvcf2, לכד את המתח בדו"ח: "עם סוכני קידוד, זה די קל ללכת מהר; לעת עתה, כדי להגיע רחוק במדע, עדיין יש צורך בהדרכה, הבנה, טעם וטיפול של מומחים."
פיליפ אולס, שהוביל את פרויקט RustQC, היה בוטה יותר. הוא תיאר את הסוכנים כ"רהוטים, משכנעים ושגויים בביטחון בדרכים שקל לפספס". Ewels מעולם לא אפשרה לדוגמניות לשפוט את הדיוק של העבודה שלהם, במקום זאת בנה רתמת מבחן עצמאית כדי לתפוס את הטעויות שלהם.
שגיאות מסתתרות לעין
תיאור המקרה של bayesm המחיש עד כמה קשה לתפוס את השגיאות הללו. שכתוב ה-Rust שלה רץ בין פי שניים לעשרים מהר יותר מהמקור, אבל הגרסאות הראשונות של שתי שיטות מתקדמות הכילו פגמים עדינים. באחד, הסוכן הפך פרמטר בקרה מרכזי, מה שגרם לתוכנית להשתמש בהדדיות של הערכים המיועדים. באג נפרד השפיע על החישוב עצמו. חוקרים גילו את שתי הבעיות רק לאחר שהריצו בדיקת כיול מפורטת מול אלפי מערכי נתונים סינתטיים עם תוצאות ידועות.
הפרק מדגיש שינוי מבני באופן שבו מדענים עשויים לעבוד לצד AI: במקום לכתוב קוד בעצמם, המשימה המרכזית שלהם הופכת לאימות קפדנית של התוצאות - תפקיד שדורש מומחיות עמוקה בתחום שהסוכנים עצמם לא יכולים לספק.
מה זה אומר על המדע
הממצאים נוחתים ברגע של ויכוח אינטנסיבי לגבי מידת האוטונומיה של מערכות בינה מלאכותית שיש להעניק בתחומים בעלי סיכון גבוה. העלאות המהירות הן באמת משנות - הפחתה של פי 60 בזמן הריצה יכולה להפוך עבודה בין לילה להפסקת קפה. אבל התרומה החשובה ביותר של הדו"ח עשויה להיות הכנות שלו לגבי הגבולות. סוכנים מהירים, שוטפים ומשכנעים, אך אינם מסוגלים להעריך את התוקף המדעי בעצמם, הם כלי רב עוצמה רק בידי מומחים שיודעים בדיוק מה לבדוק.
עבור החוקרים המעורבים, הלקח ברור: בינה מלאכותית יכולה לבנות מחדש את הפיגומים של המדע במהירות יוצאת דופן, אבל שיקול הדעת האנושי נשאר נושא עומס.
הישאר לפני AI
מפריצות דרך מחקריות ועד פריסות ארגוניות, קצב השינוי הוא בלתי פוסק. סימנייה AI Buzz Wire לסיקור מתמשך ונבדק על האופן שבו בינה מלאכותית מעצבת מחדש את המדע, העסקים והחברה.
קרא עוד חדשות מחקר AI →