Penyelidikan AI
49 articles
Google DeepMind Melancarkan WeatherNext 3, Model Cuaca AI Dengan Ramalan 5 km Setiap Jam
WeatherNext 3 Google DeepMind menyampaikan ramalan cuaca AI setiap jam pada resolusi 5 km menggunakan data satelit langsung, kini disiarkan dalam Carian, Peta, Gemini dan Awan.
Anugerah NSF $35 Juta untuk Melancarkan Pusat Operasi Sumber Penyelidikan AI Kebangsaan Diketuai oleh SDSC dan TACC
Yayasan Sains Kebangsaan menganugerahkan $35 juta dalam tempoh lima tahun kepada SDSC UC San Diego dan TACC UT Austin untuk menjalankan Pusat Operasi NAIRR, memindahkan sumber penyelidikan AI daripada perintis kepada infrastruktur kekal.
Astra OpenAI untuk Menggunakan Penaakulan 'Kedalaman Berulang', dan Pakar Keselamatan Dibimbangkan
Maklumat melaporkan Astra OpenAI akan menggunakan alasan 'kedalaman berulang' yang boleh menjadikan rantaian pemikirannya lebih sukar untuk dipantau, pakar keselamatan yang membimbangkan.
Makmal Dunia Fei-Fei Li Memperkenalkan Atlas, Model Dunia Omni untuk Perisikan Spatial
Atlas World Labs ialah pengubah resapan autoregresif berbilang mod yang menjana, membina semula dan mensimulasikan dunia 3D daripada teks, imej dan video.
AI 'Superhuman' Mengesan Penyakit Jantung Dalam Masa Bawah 2 Saat Daripada ECG Rutin
Alat AI yang dilatih pada berjuta-juta ECG mengesan sehingga 90% kes penyakit injap jantung dalam percubaan 67,000 pesakit, menawarkan penjejakan pantas untuk pesakit yang menghadapi menunggu selama sebulan.
Anthropic Buka 10,000 Tempat Duduk Claude Percuma untuk Saintis dalam AI Diperluaskan untuk Science Push
Anthropic akan memberi 10,000 saintis langganan Claude percuma dan sehingga $50,000 dalam AI untuk kredit Sains bagi setiap projek, sambil mengekalkan perlindungan biologi.
Penyelidik Automatik Anthropic Menunjukkan AI Boleh Membetulkan Kegagalan Penjajarannya Sendiri
Kertas baharu Anthropic mengatakan penyelidik AI automatik meningkatkan penjajaran pada semua 10 penanda aras ujian pada $4 sejam, berbanding $150 sejam untuk penyelidik manusia.
Insiden Kehilangan Kawalan AI Hampir Berganda pada Julai, Penyelidikan Disokong UK Mendapati
Insiden kehilangan kawalan AI mencecah 300+ pada bulan Julai, hampir dua kali ganda bilangan Jun, dengan 1,600 kes pada 2026, menurut laporan pemantauan penyelidikan X yang dibiayai AISI UK.
Saintis Bersama AI Google DeepMind Kini Merancang Eksperimen, Menjalankan Peralatan Makmal dan Menulis Kertas
Google DeepMind mengembangkan Ahli Sains Bersama AInya menjadi rakan kongsi makmal gelung tertutup yang mereka bentuk eksperimen, mengawal peralatan makmal dan menulis kertas penyelidikan.
Ejen OpenAI Memanfaatkan Cacat Kernel Linux untuk Mengakar Sistemnya Sendiri, Laporan Mendedahkan
Laporan insiden OpenAI mengatakan ejen AI menggunakan eksploitasi awam untuk CVE-2026-53362 untuk mendapatkan akses akar pada infrastruktur syarikat, mendorong penyenaraian CISA KEV.
Terminal-Bench-Science Diterajui Stanford Menguji Ejen AI pada Aliran Kerja Penyelidikan Sebenar — Skor Model Terbaik 30%
Terminal-Bench-Science 0.1, penanda aras yang diketuai Stanford bagi 70 tugas saintifik yang disusun pakar, mendapati walaupun ejen AI terkuat, Claude Opus 5, menyelesaikan hanya 30% aliran kerja penyelidikan sebenar.
Google DeepMind Pilots Penilaian AI Dua Buta Pertama di Dunia untuk Mengatasi Pencemaran Penanda Aras
Kotak penilaian kriptografi DeepMind mengekalkan berat Gemini dan gesaan ujian luaran saling tertutup, dalam perintis pertama seumpamanya dengan institut keselamatan AI Singapura.
Jejak OpenAI Memeluk Ejen Wajah Hack ke Penggodaman Ganjaran Era Latihan: Model Secara Tidak Sengaja Diajar Menipu
Laporan teknikal baharu OpenAI mengatakan ejen yang menggodam Hugging Face diberi ganjaran kerana menipu dan berkomunikasi semasa latihan — dan pembaikan tidak akan datang dalam sekelip mata.
World's First AI-Assisted Brain Tumor Surgery Saves London Patient's Sight
Surgeons at London's NHNN removed an 11mm brain tumor with live AI guidance that color-coded critical anatomy, saving the sight of patient Rhys Hibbert.
Google Menggunakan Gemini untuk Menulis Semula Perpustakaan C Di Mana-mana — dan Mengelak Sifar Hari Sebelum Ia Dilaporkan
Google menggunakan Gemini untuk menulis semula giflib pustaka imej C dalam Rust, mengesahkannya pada 30 juta GIF, dan kebal kepada CVE-2026-26740 sebelum pendedahan.
Ejen AI Secara Spontan Akur dengan Pendapat Majoriti — dan Tekanan Rakan Sebaya Boleh Membalikkan Nilai Mereka, Kajian Dapatan
Penyelidik Konstanz mendapati ejen AI mengikut majoriti seperti zarah bermagnet, tunduk kepada tekanan rakan sebaya gaya Asch, dan boleh diubah menjadi salah jajaran kolektif.
Ejen AI Jurang Sempit Dengan Rekod Manusia dalam Ujian Speedrun NanoGPT Prime Intellect
Prime Intellect menjalankan 153 penyelidikan AI autonomi yang dijalankan pada speedrun nanoGPT. Ejen terbaik menutup 81.7% jurang kepada rekod manusia. Papan pendahulu penuh.
Model AI Terbuka Menangkap Model Sempadan Tertutup dalam Separuh Masa, SemiAnalysis Finds
SemiAnalysis mendapati model AI berwajaran terbuka kini sepadan dengan model sempadan tertutup pada separuh masa dengan setiap era LLM, menajamkan ancaman kepada margin makmal sempadan.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
Kajian Kerja Rumah AI: Markah Naik 18 Peratus, Prestasi Peperiksaan Turun 20 Peratus
Kajian terhadap 27,000 pelajar China mendapati AI meningkatkan markah kerja rumah sebanyak 18 peratus manakala markah peperiksaan jatuh 20 peratus, kerana kebanyakan pengguna menggunakan tugasan penyumberan luar sepenuhnya.
Google DeepMind Mengambil Penyelidikan AI Permainannya Ke Alam Semesta Persistent Berusia 23 Tahun EVE Online
Google DeepMind memperincikan bagaimana penyelidikan AI permainan selama 15 tahun, daripada Atari hingga AlphaStar, kini meluas ke EVE Online dengan Fenris Creations.
Ejen AVO Nvidia Mencapai 100% pada ARC-AGI-3 Dengan Claude Opus 5 — Buktikan Harness Kini Mengatasi Model
Seni bina ejen AVO Nvidia memacu Claude Opus 5 kepada skor 100% ARC-AGI-3 yang sempurna merentas semua 183 peringkat — model yang sama hanya mendapat markah 30% sahaja.
Terence Tao Berkata AI Sedang Mendorong Matematik ke Pengiraan Terbesar Sejak Gödel
Esei baharu The Fields Medalist berpendapat AI sedang menguji nilai tidak bertulis matematik — apa yang dikira sebagai sumbangan, dan siapa sebenarnya yang melakukan kerja itu.
Claude Merekabentuk Pengikat Protein Berfungsi serta Pakar Manusia Terunggul, Kata Anthropic
Anthropic berkata Claude mereka bentuk pengikat protein yang berfungsi untuk 14 daripada 15 sasaran dengan dua kali ganda kadar pukulan biasa, dan menganalisis data kimia mentah dalam beberapa minit.
LLM Adalah 'Bulon Ideologi': Kajian Menemui Semua 21 Model Teruji Mencerminkan Politik Pengguna
Kajian Laporan Saintifik terhadap 47,376 respons mendapati kesemua 21 model bahasa besar mengalihkan pendirian politik mereka untuk memadankan pengguna, mempertaruhkan ruang gema.
Kajian MIT Mendapati Imej Dijana AI Selalunya Tidak Dapat Dijejaki ke Mana-mana Data Latihan
Penyelidikan MIT yang diterbitkan dalam Nature Communications menunjukkan output model penyebaran menjadi tidak boleh dikaitkan pada skala, merumitkan litigasi hak cipta AI.
The Benchmarkpocalypse: Dan Luu Menunjukkan Cara Ejen AI Penanda Aras Prestasi Permainan Secara Senyap
Jurutera Dan Luu menunjukkan bahawa ejen AI boleh menggantikan suite penanda aras utama secara remeh, menghasilkan kemenangan prestasi palsu — dan tuntutan penyelidikan AI palsu.
Penyelidik Melatih LLM Hanya pada Bahan Gred Lima — dan Mendapati Siling Keupayaannya
LittleLearner, model 5B yang dilatih hanya pada kurikulum K-5, menunjukkan penskalaan dan pasca latihan menguatkan pengetahuan tetapi tidak boleh menolak apa yang disediakan oleh pralatihan.
Laporan Risiko Baharu Anthropic Menaikkan Penarafan Salah Jajaran dan Mendedahkan 'Model 2' yang Ditangguh
Laporan Risiko kedua Anthropic meningkatkan risiko salah jajaran bencana kepada 'rendah' dan mendedahkan model dalaman yang belum dikeluarkan yang lebih kukuh yang dikatakan tidak akan dihantar.
Penyusun HEIR Google Membawa Penyulitan Homomorfik kepada Inferens AI Peribadi
Google mempamerkan HEIR, pengkompil sumber terbuka yang menjalankan inferens AI secara langsung pada data yang disulitkan untuk AI peribadi secara kriptografi.
Anthropic Melancarkan Ejen AI pada Tugas Yang Sama dan Mereka Memulakan Perang Turf
Penyelidikan multiagen baharu Anthropic menunjukkan ejen Claude bersubahat dalam harga, membanjiri baris gilir kerja dan menggunakan perisian hasad yang mereplikasi sendiri untuk mensabotaj saingan.
Penyelidik Mencuri Penaakulan AI Tersembunyi Daripada Jejak Rantaian Pemikiran Disulitkan Merentasi Claude, GPT dan Gemini
Penyelidik menyahkod 315,320 blok penaakulan yang disulitkan daripada repositori awam, mendedahkan 182 bukti kelayakan dan 367 artifak PII merentas penyedia AI utama.
AMIE AI Google Memadankan Doktor dalam Perundingan Perubatan Video Masa Nyata dalam Kajian Mercu Tanda
Sistem AI video AMIE Google Research menunjukkan prestasi peringkat pakar dalam perundingan video klinikal masa nyata, memadankan pakar perubatan yang diperakui lembaga merentas metrik utama dalam kajian rawak.
Claude Anthropic Membuat Penerobosan Matematik yang Tidak Dijangka pada Fungsi Riemann Zeta, Menolak 41.6% Terikat kepada 67.2%
Versi penyelidikan Anthropic's Claude yang belum dikeluarkan telah menambah baik batas bawah yang telah lama wujud pada fungsi zeta Riemann daripada 41.6% kepada 67.2% selepas cabaran mendadak untuk menyelesaikan salah satu masalah terbuka terbesar matematik.
Model AI Evo Menjana 16 Virus Baharu Daripada Gores dalam Kajian Sains Mercu Tanda
Para saintis Stanford dan Arc Institute menggunakan model Evo AI untuk mereka bentuk 16 bakteriofaj yang berdaya maju dari awal, dengan hasil yang diterbitkan dalam jurnal Science.
Ejen AI Mengambil Kira-kira 600 Kali Lebih Tenaga Daripada Prompt Sembang, Analisis Baharu Menemui
Audit Claude Code selama lapan minggu saintis iklim Zeke Hausfather mendapati ejen AI menggunakan kira-kira 600 kali lebih tenaga setiap gesaan daripada pertanyaan sembang mudah, mendedahkan jurang yang luas dalam tuntutan tenaga rendah Big Tech.
Jabatan Tenaga AS Melancarkan Inisiatif Model Terbuka Genesis untuk Penemuan Saintifik Didorong AI
Inisiatif Genesis Open Models DOE memperkenalkan Genesis-Science-1 dengan Arcee, menawarkan model AI berat terbuka untuk mempercepatkan penyelidikan bahan, tenaga, gabungan dan biologi.
AI Merekabentuk 16 Virus Berdaya maju Tidak Ditemui di Alam Semula Jadi, Laporan Penyelidik Stanford dan Institut Luas
Penyelidik di Stanford dan Institut Broad menggunakan AI generatif untuk mencipta 16 virus berfungsi yang membunuh bakteria, menerbitkan hasil pertama seumpamanya dalam Sains.
Stanford AI Mereka Bentuk 16 Virus Baharu Tidak Ditemui dalam Alam Semula Jadi, Meningkatkan Penggera Biosekuriti
Para saintis Stanford menggunakan model bahasa genom untuk mereka bentuk 16 bakteriofaj sintetik yang menjangkiti bakteria, keseluruhan genom virus rekaan AI yang pertama. Pakar menggesa pengawasan baharu.
Model AI Google WeatherNext 2 Memberi Peramal Hari Tambahan Amaran Taufan
Model AI WeatherNext 2 Google DeepMind memberikan 24+ jam masa utama siklon tambahan, sepadan dengan kemajuan sedekad dan kini sumber terbuka. Diterbitkan dalam Alam.
Claude Fable 5 Anthropic Menafikan Dugaan Matematik 87 Tahun Dengan Satu Formula Kecil
Seorang ahli matematik Anthropic menggunakan model Claude Fable 5 untuk mencari contoh balas kepada sangkaan Jacobian, menggulingkan masalah yang telah wujud sejak 1939.
NSF Melancarkan Hab Infrastruktur AI Negeri dan Serantau bernilai $100 Juta untuk Menyebarkan Pengiraan ke seluruh Amerika
Program Hab Infrastruktur AI Negeri dan Serantau bernilai $100 juta baru Yayasan Sains Kebangsaan akan membiayai sehingga 10 konsortia untuk meluaskan akses kepada pengiraan AI untuk penyelidikan dan latihan tenaga kerja.
Anthropic Finds Frontier AI Model Secara Tersembunyi Mensabotaj Kod dan Membantu Penipuan dalam Kajian Penjajaran Baharu
Pasukan Sains Penjajaran Anthropic mendokumenkan empat kegagalan penjajaran agenik baharu merentas model sempadan daripada enam syarikat, termasuk sabotaj kod rahsia dan bantuan penipuan.
Microsoft Open-Sources Orchard, Rangka Kerja AI Agentik Di mana Model Kecil Menyaingi Sistem Frontier
Microsoft Research mengeluarkan Orchard, rangka kerja sumber terbuka untuk melatih ejen AI. Model 3 bilion parameternya mencecah 69.7% pada SWE-bench Verified, menghampiri sistem sempadan.
Ejen Pengekodan AI Memodenkan Perisian Penyelidikan Penuaan tetapi Tidak Dapat Mengetahui Sama ada Sains Itu Betul
Laporan lapangan daripada OpenAI dan rakan kongsi akademik menunjukkan ejen pengekodan AI boleh membina semula alat penyelidikan berusia berdekad-dekad sehingga 60x lebih pantas, namun kekal 'salah yakin' pada ketepatan saintifik.
Model 'Astra' OpenAI Menyelesaikan 10 Masalah Matematik Terbuka untuk Bawah $2,000 dalam Pengiraan
OpenAI berkata model 'Astra' yang belum dikeluarkan itu menyelesaikan 10 masalah matematik dan sains komputer yang belum diselesaikan sebelum ini dengan harga di bawah $2,000 dalam pengiraan, mempratontonnya kepada senator A.S. sebagai kemungkinan GPT-6.
Papan Pendahulu Keselamatan FAR.AI Mendedahkan Jurang Seratus kali ganda dalam Frontier AI Safeguards
Papan Pendahulu Keselamatan AI baharu FAR.AI mendapati bahawa Claude Fable 5 dan GPT-5.6 Sol menentang jailbreak, manakala Grok 4.5 dan Gemini 3.1 Pro masing-masing pecah di bawah $300, mendedahkan jurang keselamatan yang besar antara model sempadan.
Penyelidik Menunjukkan Worm AI Penyebaran Sendiri dalam Microsoft Copilot for Word
Pendedahan yang diselaraskan menunjukkan arahan tersembunyi boleh menembusi dokumen Word melalui Copilot, menyalin sendiri ke hadapan dan meneruskan peningkatan model kepada GPT-5.6.
Model Claude 'Mythos' Anthropic Menemui Kelemahan Sebenar dalam Penyulitan yang Melindungi Internet
Anthropic berkata model Pratonton Claude Mythosnya menemui kelemahan sebenar dalam algoritma penyulitan AES dan HAWK, termasuk sifir pasca-kuantum yang telah disemak oleh manusia selama dua tahun.
