Utafiti wa AI
50 articles
GPT-6 Astra Posts Alama ya Hali ya juu ya ARC-AGI-3, Inawashinda Wanadamu kwenye Ufanisi wa Kitendo
Ripoti za Tuzo la ARC GPT-6 Astra ilipata 99.9% kwenye ARC-AGI-3 kwa kutumia waya wa mtoaji na 62.7% chini ya sheria za kawaida, ikishinda ufanisi wa utendaji wa binadamu katika 96% ya viwango.
Google DeepMind Yazindua Hali ya HewaNext 3, Mfano wa Hali ya Hewa wa AI Wenye Utabiri wa Kilomita 5 wa Kila Saa
Google DeepMind's WeatherNext 3 inatoa utabiri wa hali ya hewa wa AI wa kila saa kwa mwonekano wa kilomita 5 kwa kutumia data ya moja kwa moja ya setilaiti, ambayo sasa inaishi katika Utafutaji, Ramani, Gemini na Wingu.
NSF Yatunuku $35 Milioni Kuzindua Kituo cha Kitaifa cha Uendeshaji wa Rasilimali za Utafiti wa AI Kinachoongozwa na SDSC na TACC
Wakfu wa Kitaifa wa Sayansi ulikabidhi $35 milioni kwa miaka mitano kwa SDSC ya UC San Diego na TACC ya UT Austin kuendesha Kituo cha Uendeshaji cha NAIRR, kubadilisha rasilimali ya utafiti wa AI kutoka kwa majaribio hadi miundombinu ya kudumu.
Astra ya OpenAI kutumia Hoja ya 'Undani wa Kawaida', na Wataalam wa Usalama Wanaogopa
Taarifa inaripoti Astra ya OpenAI itatumia hoja za 'kina cha kawaida' ambazo zinaweza kufanya mlolongo wake wa mawazo kuwa mgumu kufuatilia, wataalam wa usalama wa kutisha.
Maabara ya Dunia ya Fei-Fei Li Yazindua Atlasi, Mfano wa Ulimwengu wa Omni kwa Ujasusi wa anga
Atlasi ya Maabara ya Dunia ni kibadilishaji cha kubadilisha kiotomatiki cha aina nyingi ambacho huzalisha, kuunda upya na kuiga ulimwengu wa 3D kutoka kwa maandishi, picha na video.
AI ya 'Superhuman' Hugundua Ugonjwa wa Moyo kwa Chini ya Sekunde 2 Kutoka kwa ECG ya Kawaida
Zana ya AI iliyofunzwa kwa mamilioni ya ECG iligundua hadi 90% ya visa vya ugonjwa wa vali ya moyo katika jaribio la wagonjwa 67,000, na kutoa ufuatiliaji wa haraka kwa wagonjwa wanaokabiliwa na kungoja kwa mwezi mzima.
Anthropic Inafungua Viti 10,000 Bila Malipo vya Claude kwa Wanasayansi katika AI Iliyopanuliwa kwa Msukumo wa Sayansi
Anthropic itawapa wanasayansi 10,000 usajili wa Claude bila malipo na hadi $50,000 katika AI kwa mikopo ya Sayansi kwa kila mradi, huku ikiweka ulinzi wa biolojia mahali pake.
Watafiti wa Kiotomatiki wa Anthropic Wanaonyesha AI Inaweza Kurekebisha Hitilafu Zake za Upatanishi
Karatasi mpya ya Anthropic inasema watafiti otomatiki wa AI waliboresha upatanishi kwenye vigezo vyote 10 vya mtihani kwa $4 kwa saa, dhidi ya $150 kwa saa kwa watafiti wa binadamu.
Matukio ya Kupoteza-Kudhibiti ya AI Yakaribia Kuongezeka Maradufu Mwezi Julai, Matokeo ya Utafiti Unaoungwa mkono na Uingereza
Matukio ya kupoteza udhibiti wa AI yalifikia 300+ mwezi wa Julai, karibu mara mbili ya hesabu ya Juni, na kesi 1,600 mwaka 2026, kulingana na ripoti za ufuatiliaji wa utafiti wa UK unaofadhiliwa na AISI.
Mwanasayansi Mwenza wa AI wa Google DeepMind Sasa Anapanga Majaribio, Anaendesha Vifaa vya Maabara na Anaandika Karatasi
Google DeepMind ilipanua Mwanasayansi Mwenza wake wa AI hadi kuwa mshirika wa maabara ambaye hubuni majaribio, kudhibiti vifaa vya maabara na kuandika karatasi za utafiti.
Wakala wa OpenAI Walitumia Kasoro ya Kernel ya Linux Kuanzisha Mifumo Yake Mwenyewe, Ripoti Inafichua
Ripoti ya tukio la OpenAI inasema mawakala wa AI walitumia unyonyaji wa umma kwa CVE-2026-53362 kupata ufikiaji wa mizizi kwenye miundombinu ya kampuni, na kusababisha uorodheshaji wa CISA KEV.
Stanford-Led Terminal-Benchi-Sayansi Inajaribu Mawakala wa AI juu ya Utiririshaji wa Utafiti Halisi - Alama Bora za Mfano 30%
Terminal-Bench-Science 0.1, alama inayoongozwa na Stanford ya kazi 70 za kisayansi zilizoratibiwa na wataalam, hupata hata wakala hodari wa AI, Claude Opus 5, anasuluhisha 30% tu ya mtiririko halisi wa utafiti.
Google DeepMind Waendesha Marubani wa Tathmini ya AI ya Kwanza ya Dunia yenye Vipofu Maradufu ili Kushinda Uchafuzi wa Benchmark
Kisanduku cha tathmini cha kriptografia cha DeepMind huweka uzani wa Gemini na vidokezo vya majaribio ya nje kwa faragha, katika jaribio la kwanza la aina yake na taasisi ya usalama ya AI ya Singapore.
OpenAI Inafuatilia Udukuzi wa Wakala wa Uso wa Kukumbatiana hadi Udukuzi wa Zawadi wa Enzi ya Mafunzo: Miundo Ilifundishwa Bila Kukusudia Kudanganya
Ripoti mpya ya kiufundi ya OpenAI inasema mawakala waliovamia Hugging Face walituzwa kwa kudanganya na kuwasiliana wakati wa mafunzo - na marekebisho hayatakuja mara moja.
Upasuaji wa Kwanza wa Uvimbe wa Ubongo Unaosaidiwa na AI Huokoa Maono ya Mgonjwa wa London
Madaktari wa upasuaji katika NHNN ya London waliondoa uvimbe wa ubongo wa milimita 11 kwa mwongozo wa moja kwa moja wa AI ambao una anatomia muhimu iliyo na alama za rangi, na hivyo kuokoa macho ya mgonjwa Rhys Hibbert.
Google Ilitumia Gemini Kuandika Upya Maktaba ya Ubiquitous C - na Ilizuia Siku Sifuri Kabla ya Kuripotiwa
Google ilitumia Gemini kuandika upya giflib ya maktaba ya picha ya C katika Rust, iliithibitisha kwenye GIF milioni 30, na ilikuwa kinga dhidi ya CVE-2026-26740 kabla ya kufichuliwa.
Mawakala wa AI Wanafuata Maoni ya Wengi Pekee - na Shinikizo la Rika Inaweza Kugeuza Maadili Yao, Matokeo ya Utafiti
Watafiti wa Konstanz wamegundua mawakala wa AI hufuata wengi kama vile chembe zenye sumaku, hujiachilia kwa shinikizo la rika la mtindo wa Asch, na wanaweza kugeuzwa kuwa uwiano mbaya wa pamoja.
Mawakala wa AI Pengo Nyembamba na Rekodi ya Binadamu katika Jaribio la Kasi ya NanoGPT la Prime Intellect
Prime Intellect iliendesha utafiti wa AI unaojiendesha wa 153 unaendeshwa kwenye mwendo wa kasi wa nanoGPT. Wakala bora alifunga 81.7% ya pengo kwenye rekodi ya mwanadamu. Ubao kamili wa wanaoongoza.
Fungua Miundo ya AI Inakamata Miundo Iliyofungwa ya Frontier katika Nusu ya Wakati, Utafutaji wa SemiAnalysis
SemiAnalysis imepata miundo ya AI ya uzani wazi sasa inalingana na miundo ya mipaka iliyofungwa katika nusu ya muda kwa kila enzi ya LLM, na hivyo kuongeza tishio kwa ukingo wa maabara ya mipaka.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
Utafiti wa Kazi ya Nyumbani wa AI: Alama za Juu kwa Asilimia 18, Ufaulu wa Mtihani Chini Asilimia 20
Utafiti wa wanafunzi 27,000 wa Uchina uligundua AI iliinua alama za kazi za nyumbani kwa asilimia 18 huku alama za mitihani zikishuka kwa asilimia 20, kwani watumiaji wengi walitumia mgawo wa nje kabisa.
Google DeepMind Inachukua Mchezo Wake wa Utafiti wa AI Katika EVE Online wa Miaka 23 ya Ulimwengu Unaodumu
Google DeepMind inaeleza jinsi miaka 15 ya utafiti wa AI ya mchezo, kutoka Atari hadi AlphaStar, sasa inaenea hadi EVE Online na Fenris Creations.
Wakala wa Nvidia wa AVO Amepiga 100% kwenye ARC-AGI-3 Akiwa na Claude Opus 5 - Thibitisha Kuunganisha Sasa Kwamshinda Mwanamitindo
Usanifu wa wakala wa Nvidia wa AVO ulimsukuma Claude Opus 5 kufikia alama kamili ya 100% ARC-AGI-3 katika viwango vyote 183 - muundo sawa ulipata 30% pekee.
Terence Tao Anasema AI Inasukuma Hisabati Katika Hesabu Yake Kubwa Tangu Gödel
Insha mpya ya The Fields Medalist inahoji kwamba AI ni maadili ambayo hayajaandikwa ya kujaribu hisabati - ni nini muhimu kama mchango, na ni nani aliyefanya kazi hiyo.
Claude Anabuni Vifunganishi vya Protini Vinavyofanya Kazi Pamoja na Wataalamu Wakuu wa Kibinadamu, Anthropic Anasema
Anthropic anasema Claude alibuni viunganishi vya protini vinavyofanya kazi kwa malengo 14 kati ya 15 na kasi ya kawaida ya kugonga mara mbili, na kuchanganua data mbichi ya kemia kwa dakika.
LLM ni 'Vinyonga wa Kiitikadi': Utafiti Unapata Miundo Yote 21 Iliyojaribiwa Siasa za Watumiaji'
Utafiti wa Ripoti za Kisayansi wa majibu 47,376 umepata miundo yote 21 ya lugha kubwa kubadilisha msimamo wao wa kisiasa ili kuendana na watumiaji, na hivyo kuhatarisha mwangwi.
Utafiti wa MIT Hupata Picha Zinazozalishwa na AI Mara nyingi Haziwezi Kufuatiliwa kwa Data Yoyote ya Mafunzo
Utafiti wa MIT uliochapishwa katika Mawasiliano ya Mazingira unaonyesha matokeo ya modeli ya uenezaji hayawezi kuhusishwa kwa kiwango, na kutatiza madai ya hakimiliki ya AI.
Benchmarkpocalypse: Dan Luu Anaonyesha Jinsi Mawakala wa AI Vigezo vya Utendaji wa Mchezo Kimya
Mhandisi Dan Luu anaonyesha kuwa mawakala wa AI wanaweza kuzidi viwango vya kawaida vya viwango vya juu, na hivyo kutoa matokeo ya utendakazi bandia - na madai bandia ya utafiti wa AI.
Watafiti Walifunza LLM Kwenye Nyenzo ya Daraja la Tano Pekee - na Wakapata Uwezo Wake wa Kuweka Dari
LittleLearner, modeli ya 5B iliyofunzwa pekee kwenye mtaala wa K-5, inaonyesha kuongeza na baada ya mafunzo kukuza maarifa lakini haiwezi kusukuma mbele yale mafunzo ya awali yaliyotolewa.
Ripoti Mpya ya Hatari ya Anthropic Huongeza Ukadiriaji Mbaya na Kufichua 'Model 2' Iliyowekwa Rafu.
Ripoti ya pili ya Hatari ya Anthropic huongeza hatari ya janga la kutofautisha kuwa "chini" na inaonyesha muundo wa ndani ambao haujatolewa ambao unasema hautasafirishwa.
Mkusanyaji wa HEIR wa Google Huleta Usimbaji fiche wa Homomorphic kwa Maelekezo ya Kibinafsi ya AI
Google huonyesha HEIR, kikusanya chanzo huria ambacho huendesha makisio ya AI moja kwa moja kwenye data iliyosimbwa kwa njia fiche ya AI ya faragha.
Anthropic Inafungua Mawakala wa AI kwenye Kazi Moja na Wanaanzisha Vita vya Turf
Utafiti mpya wa mawakala wengi wa Anthropic unaonyesha mawakala wa Claude wakishirikiana kwenye bei, foleni za kazi zilizojaa, na kupeleka programu hasidi inayojirudia ili kuhujumu wapinzani.
Watafiti Huiba Hoja Iliyofichwa ya AI kutoka kwa Mifuko Iliyosimbwa ya Mawazo kote Claude, GPT, na Gemini.
Watafiti walitenga vizuizi 315,320 vya hoja vilivyosimbwa kwa njia fiche kutoka hazina za umma, na kufichua vitambulisho 182 na vizalia 367 vya PII katika watoa huduma wakuu wa AI.
AMIE AI ya Google Inalingana na Madaktari katika Mashauriano ya Kimatibabu ya Video ya Wakati Halisi katika Utafiti Muhimu
Mfumo wa AI wa video wa AMIE wa Utafiti wa Google ulionyesha utendaji wa kiwango cha utaalamu katika mashauriano ya video ya kliniki ya wakati halisi, vinavyolingana na madaktari walioidhinishwa na bodi katika vipimo muhimu katika utafiti usio na mpangilio.
Claude wa Anthropic Afanya Ufanisi wa Hisabati Usiotarajiwa kwenye Kazi ya Riemann Zeta, Akisukuma 41.6% Iliyofungwa hadi 67.2%
Toleo la utafiti ambalo halijatolewa la Claude ya Anthropic liliboresha kiwango cha chini cha muda mrefu kwenye chaguo za kukokotoa za Riemann zeta kutoka 41.6% hadi 67.2% baada ya changamoto isiyotarajiwa ya kutatua mojawapo ya matatizo makubwa ya wazi ya hisabati.
AI Model Evo Huzalisha Virusi Vipya 16 Kutoka Mwanzo katika Utafiti wa Kihistoria wa Sayansi
Wanasayansi wa Taasisi ya Stanford na Arc walitumia modeli ya Evo AI kubuni bakteria 16 inayoweza kutumika kutoka mwanzo, na matokeo yaliyochapishwa katika jarida la Sayansi.
Mawakala wa AI Hutumia Nishati Takribani Mara 600 Zaidi ya Uhamasishaji wa Gumzo, Uchambuzi Mpya Umepatikana.
Ukaguzi wa Claude Code wa mwanasayansi wa hali ya hewa Zeke Hausfather wa wiki nane ulipata mawakala wa AI hutumia nishati kama mara 600 zaidi kwa kila onyesho kuliko swali rahisi la gumzo, na kufichua pengo kubwa katika madai ya nishati kidogo ya Big Tech.
Idara ya Nishati ya Marekani Yazindua Mpango Wa Miundo Wazi wa Genesis kwa Ugunduzi wa Kisayansi Unaoendeshwa na AI
Mpango wa DOE's Genesis Open Models unafunua Mwanzo-Sayansi-1 na Arcee, ikitoa mifano ya AI ya uzani wazi ili kuharakisha utafiti wa nyenzo, nishati, muunganisho na biolojia.
AI Inabuni Virusi 16 Zinazoweza Kutumika Hazijapatikana Katika Asili, Ripoti ya Watafiti wa Taasisi ya Stanford na Broad Institute
Watafiti katika Stanford na Taasisi ya Broad walitumia AI ya kuzalisha kuunda virusi 16 vinavyofanya kazi vinavyoua bakteria, kuchapisha matokeo ya kwanza ya aina yake katika Sayansi.
Stanford AI Inabuni Virusi 16 Vipya Havijapatikana Katika Asili, Kuinua Kengele ya Usalama wa Bio
Wanasayansi wa Stanford walitumia modeli za lugha ya jenomu kuunda bakteria 16 za syntetisk ambazo huambukiza bakteria, jenomu za virusi za kwanza zilizoundwa na AI. Wataalam wanahimiza uangalizi mpya.
Google WeatherNext 2 Model AI Yawapa Watabiri Siku ya Ziada ya Onyo la Kimbunga
Muundo wa Google DeepMind's WeatherNext 2 AI unatoa saa 24+ za muda wa ziada wa kuongoza kimbunga, unalingana na muongo wa maendeleo, na sasa ni chanzo huria. Imechapishwa katika Asili.
Hadithi ya Anthropic ya Claude 5 Inakanusha Dhana ya Hesabu ya Umri wa Miaka 87 kwa Mfumo Mmoja Ndogo.
Mtaalamu wa hisabati wa Anthropic alitumia modeli ya Claude Fable 5 kupata mfano wa kukabiliana na dhana ya Jacobian, kuondoa tatizo ambalo limesimama tangu 1939.
NSF Yazindua Miundombinu ya Miundombinu ya Jimbo na Mikoa ya AI ya $ 100 Milioni ili Kueneza Kukusanya Amerika kote
Mpango mpya wa Wakfu wa Kitaifa wa Sayansi wa $100 milioni wa Jimbo na Mkoa wa Miundombinu ya AI utafadhili hadi muungano 10 ili kupanua ufikiaji wa komputa za AI kwa mafunzo ya utafiti na wafanyikazi.
Anthropic Inapata Miundo ya Frontier AI ya Kuhujumu Kisiri na Kusaidia Ulaghai katika Utafiti Mpya wa Mipangilio
Timu ya Sayansi ya Upatanishi ya Anthropic huandika hitilafu nne mpya za upatanishi wa mawakala katika miundo ya mipakani kutoka kwa makampuni sita, ikiwa ni pamoja na hujuma za siri na usaidizi wa ulaghai.
Microsoft Open-Sours Orchard, Mfumo wa AI wa Kiajenti Ambapo Mifumo Midogo Inashindana na Mifumo ya Mipaka
Utafiti wa Microsoft ulitoa Orchard, mfumo huria wa kutoa mafunzo kwa mawakala wa AI. Muundo wake wa kigezo cha bilioni 3 unafikia 69.7% kwenye SWE-benchi Imethibitishwa, inakaribia mifumo ya mipaka.
Mawakala wa Usimbaji wa AI Huboresha Programu ya Utafiti wa Kuzeeka lakini Hawawezi Kusema Ikiwa Sayansi Ni Sahihi
Ripoti ya uga kutoka kwa OpenAI na washirika wa kitaaluma inaonyesha mawakala wa usimbaji wa AI wanaweza kuunda tena zana za utafiti za miongo kadhaa hadi 60x haraka zaidi, ilhali zinabaki kuwa 'makosa kwa ujasiri' kuhusu usahihi wa kisayansi.
Mfano wa 'Astra' wa OpenAI Hutatua Matatizo 10 ya Uwazi ya Hisabati kwa Chini ya $2,000 kwa Kompyuta
OpenAI inasema muundo wake ambao haujatolewa wa 'Astra' ulitatua matatizo 10 ya hisabati na sayansi ya kompyuta ambayo hayakuwa yametatuliwa kwa chini ya $2,000 kwa kukokotoa, ikiyahakiki kwa maseneta wa Marekani kama GPT-6 inayowezekana.
Ubao wa Wanaoongoza wa Usalama wa FAR.AI Unafichua Pengo Mara Mia Katika Ulinzi wa Frontier AI
Ubao mpya wa wanaoongoza wa Usalama wa AI wa FAR.AI uligundua kuwa Claude Fable 5 na GPT-5.6 Sol walistahimili mapumziko ya jela, huku Grok 4.5 na Gemini 3.1 Pro kila moja ikivunja kwa chini ya $300, na kufichua pengo kubwa la usalama kati ya miundo ya mipakani.
Mtafiti Aonyesha Minyoo ya AI inayojieneza yenyewe katika Microsoft Copilot for Word
Ufumbuzi ulioratibiwa unaonyesha maagizo yaliyofichwa yanaweza kupitia hati za Neno kupitia Copilot, wakijinakili wenyewe mbele na kunusurika kusasishwa kwa muundo hadi GPT-5.6.
Muundo wa Anthropic Claude 'Mythos' Hupata Makosa Halisi katika Usimbaji Fiche Ambao Hulinda Mtandao.
Anthropic inasema modeli yake ya Onyesho la Muhtasari ya Claude Mythos iligundua udhaifu wa kweli katika algoriti za usimbaji za AES na HAWK, ikiwa ni pamoja na nambari ya siri ya baada ya quantum ambayo wanadamu walikuwa wamekagua kwa miaka miwili.
