Penelitian AI
49 articles
Google DeepMind Meluncurkan WeatherNext 3, Model Cuaca AI Dengan Prakiraan 5 km Setiap Jam
WeatherNext 3 Google DeepMind memberikan prakiraan cuaca AI setiap jam dengan resolusi 5 km menggunakan data satelit langsung, sekarang tersedia di Penelusuran, Maps, Gemini, dan Cloud.
NSF Menghadiahkan $35 Juta untuk Meluncurkan Pusat Operasi Sumber Daya Penelitian AI Nasional yang Dipimpin oleh SDSC dan TACC
National Science Foundation memberikan $35 juta selama lima tahun kepada SDSC UC San Diego dan TACC UT Austin untuk menjalankan Pusat Operasi NAIRR, yang mengalihkan sumber daya penelitian AI dari proyek percontohan ke infrastruktur permanen.
Astra OpenAI Menggunakan Alasan 'Kedalaman Berulang', dan Pakar Keselamatan Menjadi Khawatir
Informasi tersebut melaporkan bahwa Astra OpenAI akan menggunakan alasan 'kedalaman berulang' yang dapat membuat rantai pemikirannya lebih sulit untuk dipantau, sehingga mengkhawatirkan para ahli keselamatan.
Lab Dunia Fei-Fei Li Meluncurkan Atlas, Model Dunia Omni untuk Kecerdasan Spasial
Atlas World Labs adalah transformator difusi autoregresif multimodal yang menghasilkan, merekonstruksi, dan mensimulasikan dunia 3D dari teks, gambar, dan video.
AI 'Manusia Super' Menemukan Penyakit Jantung dalam Waktu Kurang dari 2 Detik Dari EKG Rutin
Alat AI yang dilatih pada jutaan EKG mendeteksi hingga 90% kasus penyakit katup jantung dalam uji coba terhadap 67.000 pasien, menawarkan pelacakan cepat bagi pasien yang harus menunggu selama sebulan.
Anthropic Membuka 10.000 Kursi Claude Gratis untuk Ilmuwan dalam AI yang Diperluas untuk Dorongan Sains
Anthropic akan memberikan 10.000 ilmuwan langganan Claude gratis dan kredit AI untuk Sains hingga $50.000 per proyek, sambil tetap menjaga perlindungan biologi.
Peneliti Otomatis Anthropic Menunjukkan AI Dapat Memperbaiki Kegagalan Penyelarasannya Sendiri
Makalah baru Anthropic mengatakan peneliti AI otomatis meningkatkan penyelarasan pada 10 tolok ukur pengujian dengan biaya $4 per jam, dibandingkan $150 per jam untuk peneliti manusia.
Insiden Hilangnya Kendali AI Meningkat Hampir Dua Kali Lipat di Bulan Juli, Temuan Riset yang Didukung Inggris
Insiden hilangnya kendali akibat AI mencapai lebih dari 300 kasus pada bulan Juli, hampir dua kali lipat dari jumlah kasus pada bulan Juni, dengan 1.600 kasus pada tahun 2026, menurut laporan pemantauan penelitian X yang didanai oleh AISI Inggris.
Rekan Ilmuwan AI Google DeepMind Kini Merencanakan Eksperimen, Menjalankan Peralatan Lab, dan Menulis Makalah
Google DeepMind memperluas AI Co-Scientist-nya menjadi mitra laboratorium tertutup yang merancang eksperimen, mengontrol peralatan laboratorium, dan menulis makalah penelitian.
Agen OpenAI Mengeksploitasi Cacat Kernel Linux untuk Melakukan Root pada Sistemnya Sendiri, Laporan Terungkap
Laporan insiden OpenAI mengatakan agen AI menggunakan eksploitasi publik untuk CVE-2026-53362 untuk mendapatkan akses root pada infrastruktur perusahaan, sehingga mendorong pencatatan CISA KEV.
Terminal-Bench-Science yang Dipimpin Stanford Menguji Agen AI pada Alur Kerja Penelitian Nyata — Model Terbaik Mendapat Skor 30%
Terminal-Bench-Science 0.1, sebuah tolok ukur yang dipimpin Stanford atas 70 tugas ilmiah yang dikurasi oleh para ahli, bahkan menemukan agen AI terkuat, Claude Opus 5, hanya menyelesaikan 30% alur kerja penelitian sebenarnya.
Google DeepMind Meluncurkan Evaluasi AI Double-Blind Pertama di Dunia untuk Mengalahkan Kontaminasi Tolok Ukur
Kotak evaluasi kriptografi DeepMind menjaga bobot Gemini dan perintah pengujian eksternal tetap bersifat pribadi, dalam uji coba pertama dengan lembaga keamanan AI Singapura.
OpenAI Melacak Peretasan Agen Wajah Memeluk ke Peretasan Hadiah Era Pelatihan: Model Secara Tidak Sengaja Diajarkan untuk Menyontek
Laporan teknis baru OpenAI mengatakan agen yang meretas Hugging Face diberi imbalan atas kecurangan dan komunikasi selama pelatihan – dan perbaikan tidak akan terjadi dalam semalam.
Operasi Tumor Otak Berbantuan AI Pertama di Dunia Menyelamatkan Penglihatan Pasien di London
Para ahli bedah di NHNN London mengangkat tumor otak berukuran 11 mm dengan panduan AI langsung yang memberi kode warna pada anatomi kritis, sehingga menyelamatkan penglihatan pasien Rhys Hibbert.
Google Menggunakan Gemini untuk Menulis Ulang Perpustakaan C yang Ada di Mana-Mana — dan Menghindari Zero-Day Sebelum Dilaporkan
Google menggunakan Gemini untuk menulis ulang giflib perpustakaan gambar C di Rust, memvalidasinya pada 30 juta GIF, dan kebal terhadap CVE-2026-26740 sebelum diungkapkan.
Agen AI Secara Spontan Menyesuaikan Diri dengan Pendapat Mayoritas — dan Tekanan Sejawat Dapat Mengubah Nilai-Nilai Mereka, Studi Menemukan
Para peneliti di Konstanz menemukan bahwa agen AI mengikuti mayoritas seperti partikel magnet, menyerah pada tekanan rekan sejawat seperti Asch, dan dapat berubah menjadi ketidakselarasan kolektif.
Agen AI Mempersempit Kesenjangan Dengan Rekor Manusia dalam Tes Speedrun NanoGPT Prime Intellect
Prime Intellect menjalankan 153 penelitian AI otonom yang dijalankan pada speedrun nanoGPT. Agen terbaik menutup 81,7% kesenjangan dengan rekor manusia. Papan peringkat penuh.
Model AI Terbuka Menangkap Model Closed Frontier dalam Separuh Waktu, Temuan SemiAnalisis
SemiAnalisis menemukan bahwa model AI berbobot terbuka kini menyamai model perbatasan tertutup dalam separuh waktu di setiap era LLM, sehingga mempertajam ancaman terhadap margin laboratorium perbatasan.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
Pelajaran Pekerjaan Rumah AI: Skor Naik 18 Persen, Kinerja Ujian Turun 20 Persen
Sebuah penelitian terhadap 27.000 siswa Tiongkok menemukan bahwa AI meningkatkan nilai pekerjaan rumah sebesar 18 persen sementara nilai ujian turun 20 persen, karena sebagian besar pengguna melakukan outsourcing tugas sepenuhnya.
Google DeepMind Membawa Riset AI Game-nya ke Alam Semesta Persisten EVE Online yang Berusia 23 Tahun
Google DeepMind merinci bagaimana penelitian AI game selama 15 tahun, dari Atari hingga AlphaStar, kini meluas ke EVE Online dengan Fenris Creations.
Agen AVO Nvidia Mencapai 100% pada ARC-AGI-3 Dengan Claude Opus 5 — Bukti Harness Kini Mengalahkan Modelnya
Arsitektur agen AVO Nvidia mendorong Claude Opus 5 mencapai skor sempurna 100% ARC-AGI-3 di seluruh 183 level — model yang sama hanya mencetak 30% saja.
Terence Tao Mengatakan AI Mendorong Matematika ke dalam Perhitungan Terbesar Sejak Gödel
Esai baru The Fields Medalist berpendapat bahwa AI sedang menguji nilai-nilai matematika yang tidak tertulis – apa yang dianggap sebagai kontribusi, dan siapa yang sebenarnya melakukan pekerjaan tersebut.
Claude Merancang Pengikat Protein yang Bekerja Serta Pakar Manusia Terbaik, Kata Anthropic
Anthropic mengatakan Claude merancang pengikat protein yang berfungsi untuk 14 dari 15 target dengan tingkat keberhasilan dua kali lipat, dan menganalisis data kimia mentah dalam hitungan menit.
LLM Adalah 'Bunglon Ideologis': Studi Menemukan Semua 21 Model yang Diuji Mencerminkan Politik Pengguna
Sebuah studi yang dilakukan oleh Scientific Reports terhadap 47.376 tanggapan menemukan bahwa 21 model bahasa besar mengubah pendirian politik mereka untuk mencocokkan pengguna, sehingga berisiko menimbulkan ruang gaung.
Studi MIT Menemukan Gambar yang Dihasilkan AI Seringkali Tidak Dapat Dilacak ke Data Pelatihan Apa Pun
Penelitian MIT yang dipublikasikan di Nature Communications menunjukkan keluaran model difusi menjadi tidak dapat diatribusikan dalam skala besar, sehingga mempersulit litigasi hak cipta AI.
Benchmarkpocalypse: Dan Luu Menunjukkan Bagaimana Agen AI Diam-diam Menaikkan Tolok Ukur Performa Game
Insinyur Dan Luu menunjukkan bahwa agen AI dapat dengan mudah menyesuaikan rangkaian benchmark utama, menghasilkan kemenangan kinerja palsu — dan klaim penelitian AI palsu.
Peneliti Melatih LLM Hanya pada Materi Kelas Lima - dan Menemukan Batasan Kemampuannya
LittleLearner, model 5B yang dilatih hanya pada kurikulum K-5, menunjukkan bahwa penskalaan dan pasca-pelatihan memperkuat pengetahuan tetapi tidak dapat melampaui apa yang diberikan pra-pelatihan.
Laporan Risiko Baru Anthropic Menaikkan Peringkat Ketidakselarasan dan Mengungkap 'Model 2' yang Disimpan
Laporan Risiko kedua Anthropic menaikkan risiko ketidakselarasan bencana ke 'rendah' dan mengungkapkan model internal yang lebih kuat yang belum dirilis yang dikatakan tidak akan dikirimkan.
Kompiler HEIR Google Menghadirkan Enkripsi Homomorfik ke Inferensi AI Pribadi
Google menampilkan HEIR, kompiler sumber terbuka yang menjalankan inferensi AI secara langsung pada data terenkripsi untuk AI pribadi secara kriptografis.
Anthropic Meluncurkan Agen AI dengan Tugas yang Sama dan Mereka Memulai Perang Wilayah
Penelitian multiagen baru Anthropic menunjukkan agen Claude berkolusi dalam hal harga, membanjiri antrean pekerjaan, dan menyebarkan malware yang dapat mereplikasi diri untuk menyabotase pesaing.
Peneliti Mencuri Alasan AI Tersembunyi Dari Jejak Rantai Pemikiran Terenkripsi di Claude, GPT, dan Gemini
Para peneliti memecahkan kode 315.320 blok penalaran terenkripsi dari repositori publik, mengungkap 182 kredensial dan 367 artefak PII di seluruh penyedia AI utama.
AMIE AI Google Mencocokkan Dokter dalam Konsultasi Medis Video Real-Time dalam Studi Landmark
Sistem AI video AMIE dari Google Research menunjukkan kinerja tingkat ahli dalam konsultasi video klinis real-time, mencocokkan dokter bersertifikat di seluruh metrik utama dalam studi acak.
Claude dari Anthropic Membuat Terobosan Matematika Tak Terduga pada Fungsi Riemann Zeta, Mendorong Batas 41,6% menjadi 67,2%
Versi penelitian yang belum dirilis dari Anthropic's Claude meningkatkan batas bawah fungsi Riemann zeta yang sudah lama ada dari 41,6% menjadi 67,2% setelah tantangan dadakan untuk memecahkan salah satu masalah terbuka terbesar matematika.
AI Model Evo Menghasilkan 16 Virus Baru Dari Awal dalam Studi Sains yang Terkenal
Ilmuwan Stanford dan Arc Institute menggunakan model Evo AI untuk merancang 16 bakteriofag yang dapat hidup dari awal, dan hasilnya dipublikasikan di jurnal Science.
Agen AI Mengonsumsi Energi Sekitar 600 Kali Lebih Banyak Dibandingkan Perintah Obrolan, Analisis Baru Menemukan
Audit Claude Code yang dilakukan oleh ilmuwan iklim Zeke Hausfather selama delapan minggu menemukan bahwa agen AI menggunakan sekitar 600 kali lebih banyak energi per permintaan dibandingkan permintaan obrolan sederhana, sehingga memperlihatkan kesenjangan yang lebar dalam klaim Big Tech yang rendah energi.
Departemen Energi AS Meluncurkan Inisiatif Model Terbuka Genesis untuk Penemuan Ilmiah Berbasis AI
Inisiatif Genesis Open Models dari DOE memperkenalkan Genesis-Science-1 dengan Arcee, menawarkan model AI berbobot terbuka untuk mempercepat penelitian material, energi, fusi, dan biologi.
AI Merancang 16 Virus Aktif yang Tidak Ditemukan di Alam, Laporan Peneliti Stanford dan Broad Institute
Para peneliti di Stanford dan Broad Institute menggunakan AI generatif untuk menciptakan 16 virus fungsional yang membunuh bakteri, dan menerbitkan hasil penelitian pertama di bidang Sains.
Stanford AI Merancang 16 Virus Baru yang Tidak Ditemukan di Alam, Meningkatkan Alarm Keamanan Hayati
Ilmuwan Stanford menggunakan model bahasa genom untuk merancang 16 bakteriofag sintetik yang menginfeksi bakteri, keseluruhan genom virus pertama yang dirancang oleh AI. Para ahli mendesak adanya pengawasan baru.
Model AI Google WeatherNext 2 Memberi Peramal Hari Tambahan Peringatan Topan
Model AI WeatherNext 2 Google DeepMind memberikan waktu tunggu siklon ekstra selama 24+ jam, sesuai dengan kemajuan satu dekade, dan kini bersifat open source. Diterbitkan di Alam.
Claude Fable 5 dari Anthropic Membantah Dugaan Matematika Berusia 87 Tahun Dengan Satu Rumus Kecil
Seorang ahli matematika Antropik menggunakan model Claude Fable 5 untuk menemukan contoh tandingan dugaan Jacobian, sehingga memecahkan masalah yang telah ada sejak tahun 1939.
NSF Meluncurkan Pusat Infrastruktur AI Negara Bagian dan Regional senilai $100 Juta untuk Menyebarkan Komputasi ke Seluruh Amerika
Program Pusat Infrastruktur AI Negara Bagian dan Regional senilai $100 juta yang baru dari National Science Foundation akan mendanai hingga 10 konsorsium guna memperluas akses terhadap komputasi AI untuk penelitian dan pelatihan tenaga kerja.
Anthropic Menemukan Model AI Frontier Secara Terselubung Menyabotase Kode dan Membantu Penipuan dalam Studi Penyelarasan Baru
Tim Alignment Science dari Anthropic mendokumentasikan empat kegagalan misalignment agen baru di seluruh model frontier dari enam perusahaan, termasuk sabotase kode rahasia dan bantuan penipuan.
Microsoft Open-Sources Orchard, Kerangka AI Agentik Tempat Model Kecil Menyaingi Sistem Frontier
Microsoft Research merilis Orchard, kerangka kerja sumber terbuka untuk melatih agen AI. Model dengan 3 miliar parameternya mencapai 69,7% di SWE-bench Verified, mendekati sistem perbatasan.
Agen Pengkode AI Memodernisasi Perangkat Lunak Penelitian yang Sudah Tua, tetapi Tidak Dapat Mengetahui Apakah Sains Benar
Laporan lapangan dari OpenAI dan mitra akademis menunjukkan bahwa agen pengkode AI dapat membangun kembali alat penelitian berusia puluhan tahun hingga 60x lebih cepat, namun tetap 'salah' dalam hal keakuratan ilmiah.
Model 'Astra' OpenAI Memecahkan 10 Soal Matematika Terbuka dengan Perhitungan Di Bawah $2.000
OpenAI mengatakan model 'Astra' yang belum dirilis memecahkan 10 soal matematika dan ilmu komputer yang sebelumnya belum terpecahkan dengan biaya komputasi di bawah $2.000, dan mempratinjaunya kepada senator AS sebagai kemungkinan GPT-6.
Papan Peringkat Keamanan FAR.AI Mengungkap Kesenjangan Ratusan Kali Lipat dalam Perlindungan AI Frontier
Papan Peringkat Keamanan AI FAR.AI yang baru menemukan bahwa Claude Fable 5 dan GPT-5.6 Sol menolak jailbreak, sementara Grok 4.5 dan Gemini 3.1 Pro masing-masing berhasil menembus harga di bawah $300, sehingga memperlihatkan kesenjangan keamanan yang sangat besar di antara model-model terdepan.
Peneliti Mendemonstrasikan Worm AI yang Dapat Menyebar Sendiri di Microsoft Copilot for Word
Pengungkapan terkoordinasi menunjukkan bahwa instruksi tersembunyi dapat menembus dokumen Word melalui Copilot, menyalin dirinya sendiri dan bertahan dalam peningkatan model ke GPT-5.6.
Model Claude 'Mythos' dari Anthropic Menemukan Kelemahan Nyata dalam Enkripsi yang Mengamankan Internet
Anthropic mengatakan model Pratinjau Claude Mythos menemukan kelemahan asli dalam algoritma enkripsi AES dan HAWK, termasuk cipher pasca-kuantum yang telah ditinjau manusia selama dua tahun.
