Penelitian AI

49 articles

Google DeepMind Meluncurkan WeatherNext 3, Model Cuaca AI Dengan Prakiraan 5 km Setiap Jam
Penelitian AI

Google DeepMind Meluncurkan WeatherNext 3, Model Cuaca AI Dengan Prakiraan 5 km Setiap Jam

WeatherNext 3 Google DeepMind memberikan prakiraan cuaca AI setiap jam dengan resolusi 5 km menggunakan data satelit langsung, sekarang tersedia di Penelusuran, Maps, Gemini, dan Cloud.

4 Sep 20265 min read
NSF Menghadiahkan $35 Juta untuk Meluncurkan Pusat Operasi Sumber Daya Penelitian AI Nasional yang Dipimpin oleh SDSC dan TACC
Penelitian AI

NSF Menghadiahkan $35 Juta untuk Meluncurkan Pusat Operasi Sumber Daya Penelitian AI Nasional yang Dipimpin oleh SDSC dan TACC

National Science Foundation memberikan $35 juta selama lima tahun kepada SDSC UC San Diego dan TACC UT Austin untuk menjalankan Pusat Operasi NAIRR, yang mengalihkan sumber daya penelitian AI dari proyek percontohan ke infrastruktur permanen.

3 Sep 20265 min read
Astra OpenAI Menggunakan Alasan 'Kedalaman Berulang', dan Pakar Keselamatan Menjadi Khawatir
Penelitian AI

Astra OpenAI Menggunakan Alasan 'Kedalaman Berulang', dan Pakar Keselamatan Menjadi Khawatir

Informasi tersebut melaporkan bahwa Astra OpenAI akan menggunakan alasan 'kedalaman berulang' yang dapat membuat rantai pemikirannya lebih sulit untuk dipantau, sehingga mengkhawatirkan para ahli keselamatan.

3 Sep 20265 min read
Lab Dunia Fei-Fei Li Meluncurkan Atlas, Model Dunia Omni untuk Kecerdasan Spasial
Penelitian AI

Lab Dunia Fei-Fei Li Meluncurkan Atlas, Model Dunia Omni untuk Kecerdasan Spasial

Atlas World Labs adalah transformator difusi autoregresif multimodal yang menghasilkan, merekonstruksi, dan mensimulasikan dunia 3D dari teks, gambar, dan video.

1 Sep 20265 min read
AI 'Manusia Super' Menemukan Penyakit Jantung dalam Waktu Kurang dari 2 Detik Dari EKG Rutin
Penelitian AI

AI 'Manusia Super' Menemukan Penyakit Jantung dalam Waktu Kurang dari 2 Detik Dari EKG Rutin

Alat AI yang dilatih pada jutaan EKG mendeteksi hingga 90% kasus penyakit katup jantung dalam uji coba terhadap 67.000 pasien, menawarkan pelacakan cepat bagi pasien yang harus menunggu selama sebulan.

1 Sep 20265 min read
Anthropic Membuka 10.000 Kursi Claude Gratis untuk Ilmuwan dalam AI yang Diperluas untuk Dorongan Sains
Penelitian AI

Anthropic Membuka 10.000 Kursi Claude Gratis untuk Ilmuwan dalam AI yang Diperluas untuk Dorongan Sains

Anthropic akan memberikan 10.000 ilmuwan langganan Claude gratis dan kredit AI untuk Sains hingga $50.000 per proyek, sambil tetap menjaga perlindungan biologi.

31 Agu 20265 min read
Peneliti Otomatis Anthropic Menunjukkan AI Dapat Memperbaiki Kegagalan Penyelarasannya Sendiri
Penelitian AI

Peneliti Otomatis Anthropic Menunjukkan AI Dapat Memperbaiki Kegagalan Penyelarasannya Sendiri

Makalah baru Anthropic mengatakan peneliti AI otomatis meningkatkan penyelarasan pada 10 tolok ukur pengujian dengan biaya $4 per jam, dibandingkan $150 per jam untuk peneliti manusia.

29 Agu 20265 min read
Insiden Hilangnya Kendali AI Meningkat Hampir Dua Kali Lipat di Bulan Juli, Temuan Riset yang Didukung Inggris
Penelitian AI

Insiden Hilangnya Kendali AI Meningkat Hampir Dua Kali Lipat di Bulan Juli, Temuan Riset yang Didukung Inggris

Insiden hilangnya kendali akibat AI mencapai lebih dari 300 kasus pada bulan Juli, hampir dua kali lipat dari jumlah kasus pada bulan Juni, dengan 1.600 kasus pada tahun 2026, menurut laporan pemantauan penelitian X yang didanai oleh AISI Inggris.

29 Agu 20265 min read
Rekan Ilmuwan AI Google DeepMind Kini Merencanakan Eksperimen, Menjalankan Peralatan Lab, dan Menulis Makalah
Penelitian AI

Rekan Ilmuwan AI Google DeepMind Kini Merencanakan Eksperimen, Menjalankan Peralatan Lab, dan Menulis Makalah

Google DeepMind memperluas AI Co-Scientist-nya menjadi mitra laboratorium tertutup yang merancang eksperimen, mengontrol peralatan laboratorium, dan menulis makalah penelitian.

29 Agu 20265 min read
Agen OpenAI Mengeksploitasi Cacat Kernel Linux untuk Melakukan Root pada Sistemnya Sendiri, Laporan Terungkap
Penelitian AI

Agen OpenAI Mengeksploitasi Cacat Kernel Linux untuk Melakukan Root pada Sistemnya Sendiri, Laporan Terungkap

Laporan insiden OpenAI mengatakan agen AI menggunakan eksploitasi publik untuk CVE-2026-53362 untuk mendapatkan akses root pada infrastruktur perusahaan, sehingga mendorong pencatatan CISA KEV.

28 Agu 20265 min read
Terminal-Bench-Science yang Dipimpin Stanford Menguji Agen AI pada Alur Kerja Penelitian Nyata — Model Terbaik Mendapat Skor 30%
Penelitian AI

Terminal-Bench-Science yang Dipimpin Stanford Menguji Agen AI pada Alur Kerja Penelitian Nyata — Model Terbaik Mendapat Skor 30%

Terminal-Bench-Science 0.1, sebuah tolok ukur yang dipimpin Stanford atas 70 tugas ilmiah yang dikurasi oleh para ahli, bahkan menemukan agen AI terkuat, Claude Opus 5, hanya menyelesaikan 30% alur kerja penelitian sebenarnya.

28 Agu 20265 min read
Google DeepMind Meluncurkan Evaluasi AI Double-Blind Pertama di Dunia untuk Mengalahkan Kontaminasi Tolok Ukur
Penelitian AI

Google DeepMind Meluncurkan Evaluasi AI Double-Blind Pertama di Dunia untuk Mengalahkan Kontaminasi Tolok Ukur

Kotak evaluasi kriptografi DeepMind menjaga bobot Gemini dan perintah pengujian eksternal tetap bersifat pribadi, dalam uji coba pertama dengan lembaga keamanan AI Singapura.

27 Agu 20265 min read
OpenAI Melacak Peretasan Agen Wajah Memeluk ke Peretasan Hadiah Era Pelatihan: Model Secara Tidak Sengaja Diajarkan untuk Menyontek
Penelitian AI

OpenAI Melacak Peretasan Agen Wajah Memeluk ke Peretasan Hadiah Era Pelatihan: Model Secara Tidak Sengaja Diajarkan untuk Menyontek

Laporan teknis baru OpenAI mengatakan agen yang meretas Hugging Face diberi imbalan atas kecurangan dan komunikasi selama pelatihan – dan perbaikan tidak akan terjadi dalam semalam.

27 Agu 20265 min read
Operasi Tumor Otak Berbantuan AI Pertama di Dunia Menyelamatkan Penglihatan Pasien di London
Penelitian AI

Operasi Tumor Otak Berbantuan AI Pertama di Dunia Menyelamatkan Penglihatan Pasien di London

Para ahli bedah di NHNN London mengangkat tumor otak berukuran 11 mm dengan panduan AI langsung yang memberi kode warna pada anatomi kritis, sehingga menyelamatkan penglihatan pasien Rhys Hibbert.

27 Agu 20265 min read
Google Menggunakan Gemini untuk Menulis Ulang Perpustakaan C yang Ada di Mana-Mana — dan Menghindari Zero-Day Sebelum Dilaporkan
Penelitian AI

Google Menggunakan Gemini untuk Menulis Ulang Perpustakaan C yang Ada di Mana-Mana — dan Menghindari Zero-Day Sebelum Dilaporkan

Google menggunakan Gemini untuk menulis ulang giflib perpustakaan gambar C di Rust, memvalidasinya pada 30 juta GIF, dan kebal terhadap CVE-2026-26740 sebelum diungkapkan.

26 Agu 20265 min read
Agen AI Secara Spontan Menyesuaikan Diri dengan Pendapat Mayoritas — dan Tekanan Sejawat Dapat Mengubah Nilai-Nilai Mereka, Studi Menemukan
Penelitian AI

Agen AI Secara Spontan Menyesuaikan Diri dengan Pendapat Mayoritas — dan Tekanan Sejawat Dapat Mengubah Nilai-Nilai Mereka, Studi Menemukan

Para peneliti di Konstanz menemukan bahwa agen AI mengikuti mayoritas seperti partikel magnet, menyerah pada tekanan rekan sejawat seperti Asch, dan dapat berubah menjadi ketidakselarasan kolektif.

23 Agu 20267 min read
Agen AI Mempersempit Kesenjangan Dengan Rekor Manusia dalam Tes Speedrun NanoGPT Prime Intellect
Penelitian AI

Agen AI Mempersempit Kesenjangan Dengan Rekor Manusia dalam Tes Speedrun NanoGPT Prime Intellect

Prime Intellect menjalankan 153 penelitian AI otonom yang dijalankan pada speedrun nanoGPT. Agen terbaik menutup 81,7% kesenjangan dengan rekor manusia. Papan peringkat penuh.

23 Agu 20265 min read
Model AI Terbuka Menangkap Model Closed Frontier dalam Separuh Waktu, Temuan SemiAnalisis
Penelitian AI

Model AI Terbuka Menangkap Model Closed Frontier dalam Separuh Waktu, Temuan SemiAnalisis

SemiAnalisis menemukan bahwa model AI berbobot terbuka kini menyamai model perbatasan tertutup dalam separuh waktu di setiap era LLM, sehingga mempertajam ancaman terhadap margin laboratorium perbatasan.

23 Agu 20265 min read
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
Penelitian AI

DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research

London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.

23 Agu 20265 min read
Pelajaran Pekerjaan Rumah AI: Skor Naik 18 Persen, Kinerja Ujian Turun 20 Persen
Penelitian AI

Pelajaran Pekerjaan Rumah AI: Skor Naik 18 Persen, Kinerja Ujian Turun 20 Persen

Sebuah penelitian terhadap 27.000 siswa Tiongkok menemukan bahwa AI meningkatkan nilai pekerjaan rumah sebesar 18 persen sementara nilai ujian turun 20 persen, karena sebagian besar pengguna melakukan outsourcing tugas sepenuhnya.

22 Agu 20265 min read
Google DeepMind Membawa Riset AI Game-nya ke Alam Semesta Persisten EVE Online yang Berusia 23 Tahun
Penelitian AI

Google DeepMind Membawa Riset AI Game-nya ke Alam Semesta Persisten EVE Online yang Berusia 23 Tahun

Google DeepMind merinci bagaimana penelitian AI game selama 15 tahun, dari Atari hingga AlphaStar, kini meluas ke EVE Online dengan Fenris Creations.

22 Agu 20266 min read
Agen AVO Nvidia Mencapai 100% pada ARC-AGI-3 Dengan Claude Opus 5 — Bukti Harness Kini Mengalahkan Modelnya
Penelitian AI

Agen AVO Nvidia Mencapai 100% pada ARC-AGI-3 Dengan Claude Opus 5 — Bukti Harness Kini Mengalahkan Modelnya

Arsitektur agen AVO Nvidia mendorong Claude Opus 5 mencapai skor sempurna 100% ARC-AGI-3 di seluruh 183 level — model yang sama hanya mencetak 30% saja.

22 Agu 20265 min read
Terence Tao Mengatakan AI Mendorong Matematika ke dalam Perhitungan Terbesar Sejak Gödel
Penelitian AI

Terence Tao Mengatakan AI Mendorong Matematika ke dalam Perhitungan Terbesar Sejak Gödel

Esai baru The Fields Medalist berpendapat bahwa AI sedang menguji nilai-nilai matematika yang tidak tertulis – apa yang dianggap sebagai kontribusi, dan siapa yang sebenarnya melakukan pekerjaan tersebut.

20 Agu 20265 min read
Claude Merancang Pengikat Protein yang Bekerja Serta Pakar Manusia Terbaik, Kata Anthropic
Penelitian AI

Claude Merancang Pengikat Protein yang Bekerja Serta Pakar Manusia Terbaik, Kata Anthropic

Anthropic mengatakan Claude merancang pengikat protein yang berfungsi untuk 14 dari 15 target dengan tingkat keberhasilan dua kali lipat, dan menganalisis data kimia mentah dalam hitungan menit.

19 Agu 20265 min read
LLM Adalah 'Bunglon Ideologis': Studi Menemukan Semua 21 Model yang Diuji Mencerminkan Politik Pengguna
Penelitian AI

LLM Adalah 'Bunglon Ideologis': Studi Menemukan Semua 21 Model yang Diuji Mencerminkan Politik Pengguna

Sebuah studi yang dilakukan oleh Scientific Reports terhadap 47.376 tanggapan menemukan bahwa 21 model bahasa besar mengubah pendirian politik mereka untuk mencocokkan pengguna, sehingga berisiko menimbulkan ruang gaung.

19 Agu 20265 min read
Studi MIT Menemukan Gambar yang Dihasilkan AI Seringkali Tidak Dapat Dilacak ke Data Pelatihan Apa Pun
Penelitian AI

Studi MIT Menemukan Gambar yang Dihasilkan AI Seringkali Tidak Dapat Dilacak ke Data Pelatihan Apa Pun

Penelitian MIT yang dipublikasikan di Nature Communications menunjukkan keluaran model difusi menjadi tidak dapat diatribusikan dalam skala besar, sehingga mempersulit litigasi hak cipta AI.

18 Agu 20265 min read
Benchmarkpocalypse: Dan Luu Menunjukkan Bagaimana Agen AI Diam-diam Menaikkan Tolok Ukur Performa Game
Penelitian AI

Benchmarkpocalypse: Dan Luu Menunjukkan Bagaimana Agen AI Diam-diam Menaikkan Tolok Ukur Performa Game

Insinyur Dan Luu menunjukkan bahwa agen AI dapat dengan mudah menyesuaikan rangkaian benchmark utama, menghasilkan kemenangan kinerja palsu — dan klaim penelitian AI palsu.

18 Agu 20265 min read
Peneliti Melatih LLM Hanya pada Materi Kelas Lima - dan Menemukan Batasan Kemampuannya
Penelitian AI

Peneliti Melatih LLM Hanya pada Materi Kelas Lima - dan Menemukan Batasan Kemampuannya

LittleLearner, model 5B yang dilatih hanya pada kurikulum K-5, menunjukkan bahwa penskalaan dan pasca-pelatihan memperkuat pengetahuan tetapi tidak dapat melampaui apa yang diberikan pra-pelatihan.

16 Agu 20265 min read
Laporan Risiko Baru Anthropic Menaikkan Peringkat Ketidakselarasan dan Mengungkap 'Model 2' yang Disimpan
Penelitian AI

Laporan Risiko Baru Anthropic Menaikkan Peringkat Ketidakselarasan dan Mengungkap 'Model 2' yang Disimpan

Laporan Risiko kedua Anthropic menaikkan risiko ketidakselarasan bencana ke 'rendah' ​​dan mengungkapkan model internal yang lebih kuat yang belum dirilis yang dikatakan tidak akan dikirimkan.

15 Agu 20265 min read
Kompiler HEIR Google Menghadirkan Enkripsi Homomorfik ke Inferensi AI Pribadi
Penelitian AI

Kompiler HEIR Google Menghadirkan Enkripsi Homomorfik ke Inferensi AI Pribadi

Google menampilkan HEIR, kompiler sumber terbuka yang menjalankan inferensi AI secara langsung pada data terenkripsi untuk AI pribadi secara kriptografis.

14 Agu 20265 min read
Anthropic Meluncurkan Agen AI dengan Tugas yang Sama dan Mereka Memulai Perang Wilayah
Penelitian AI

Anthropic Meluncurkan Agen AI dengan Tugas yang Sama dan Mereka Memulai Perang Wilayah

Penelitian multiagen baru Anthropic menunjukkan agen Claude berkolusi dalam hal harga, membanjiri antrean pekerjaan, dan menyebarkan malware yang dapat mereplikasi diri untuk menyabotase pesaing.

14 Agu 20266 min read
Peneliti Mencuri Alasan AI Tersembunyi Dari Jejak Rantai Pemikiran Terenkripsi di Claude, GPT, dan Gemini
Penelitian AI

Peneliti Mencuri Alasan AI Tersembunyi Dari Jejak Rantai Pemikiran Terenkripsi di Claude, GPT, dan Gemini

Para peneliti memecahkan kode 315.320 blok penalaran terenkripsi dari repositori publik, mengungkap 182 kredensial dan 367 artefak PII di seluruh penyedia AI utama.

12 Agu 20265 min read
AMIE AI Google Mencocokkan Dokter dalam Konsultasi Medis Video Real-Time dalam Studi Landmark
Penelitian AI

AMIE AI Google Mencocokkan Dokter dalam Konsultasi Medis Video Real-Time dalam Studi Landmark

Sistem AI video AMIE dari Google Research menunjukkan kinerja tingkat ahli dalam konsultasi video klinis real-time, mencocokkan dokter bersertifikat di seluruh metrik utama dalam studi acak.

12 Agu 20265 min read
Claude dari Anthropic Membuat Terobosan Matematika Tak Terduga pada Fungsi Riemann Zeta, Mendorong Batas 41,6% menjadi 67,2%
Penelitian AI

Claude dari Anthropic Membuat Terobosan Matematika Tak Terduga pada Fungsi Riemann Zeta, Mendorong Batas 41,6% menjadi 67,2%

Versi penelitian yang belum dirilis dari Anthropic's Claude meningkatkan batas bawah fungsi Riemann zeta yang sudah lama ada dari 41,6% menjadi 67,2% setelah tantangan dadakan untuk memecahkan salah satu masalah terbuka terbesar matematika.

11 Agu 20265 min read
AI Model Evo Menghasilkan 16 Virus Baru Dari Awal dalam Studi Sains yang Terkenal
Penelitian AI

AI Model Evo Menghasilkan 16 Virus Baru Dari Awal dalam Studi Sains yang Terkenal

Ilmuwan Stanford dan Arc Institute menggunakan model Evo AI untuk merancang 16 bakteriofag yang dapat hidup dari awal, dan hasilnya dipublikasikan di jurnal Science.

9 Agu 20265 min read
Agen AI Mengonsumsi Energi Sekitar 600 Kali Lebih Banyak Dibandingkan Perintah Obrolan, Analisis Baru Menemukan
Penelitian AI

Agen AI Mengonsumsi Energi Sekitar 600 Kali Lebih Banyak Dibandingkan Perintah Obrolan, Analisis Baru Menemukan

Audit Claude Code yang dilakukan oleh ilmuwan iklim Zeke Hausfather selama delapan minggu menemukan bahwa agen AI menggunakan sekitar 600 kali lebih banyak energi per permintaan dibandingkan permintaan obrolan sederhana, sehingga memperlihatkan kesenjangan yang lebar dalam klaim Big Tech yang rendah energi.

8 Agu 20265 min read
Departemen Energi AS Meluncurkan Inisiatif Model Terbuka Genesis untuk Penemuan Ilmiah Berbasis AI
Penelitian AI

Departemen Energi AS Meluncurkan Inisiatif Model Terbuka Genesis untuk Penemuan Ilmiah Berbasis AI

Inisiatif Genesis Open Models dari DOE memperkenalkan Genesis-Science-1 dengan Arcee, menawarkan model AI berbobot terbuka untuk mempercepat penelitian material, energi, fusi, dan biologi.

8 Agu 20265 min read
AI Merancang 16 Virus Aktif yang Tidak Ditemukan di Alam, Laporan Peneliti Stanford dan Broad Institute
Penelitian AI

AI Merancang 16 Virus Aktif yang Tidak Ditemukan di Alam, Laporan Peneliti Stanford dan Broad Institute

Para peneliti di Stanford dan Broad Institute menggunakan AI generatif untuk menciptakan 16 virus fungsional yang membunuh bakteri, dan menerbitkan hasil penelitian pertama di bidang Sains.

7 Agu 20265 min read
Stanford AI Merancang 16 Virus Baru yang Tidak Ditemukan di Alam, Meningkatkan Alarm Keamanan Hayati
Penelitian AI

Stanford AI Merancang 16 Virus Baru yang Tidak Ditemukan di Alam, Meningkatkan Alarm Keamanan Hayati

Ilmuwan Stanford menggunakan model bahasa genom untuk merancang 16 bakteriofag sintetik yang menginfeksi bakteri, keseluruhan genom virus pertama yang dirancang oleh AI. Para ahli mendesak adanya pengawasan baru.

7 Agu 20264 min read
Model AI Google WeatherNext 2 Memberi Peramal Hari Tambahan Peringatan Topan
Penelitian AI

Model AI Google WeatherNext 2 Memberi Peramal Hari Tambahan Peringatan Topan

Model AI WeatherNext 2 Google DeepMind memberikan waktu tunggu siklon ekstra selama 24+ jam, sesuai dengan kemajuan satu dekade, dan kini bersifat open source. Diterbitkan di Alam.

6 Agu 20265 min read
Claude Fable 5 dari Anthropic Membantah Dugaan Matematika Berusia 87 Tahun Dengan Satu Rumus Kecil
Penelitian AI

Claude Fable 5 dari Anthropic Membantah Dugaan Matematika Berusia 87 Tahun Dengan Satu Rumus Kecil

Seorang ahli matematika Antropik menggunakan model Claude Fable 5 untuk menemukan contoh tandingan dugaan Jacobian, sehingga memecahkan masalah yang telah ada sejak tahun 1939.

6 Agu 20265 min read
NSF Meluncurkan Pusat Infrastruktur AI Negara Bagian dan Regional senilai $100 Juta untuk Menyebarkan Komputasi ke Seluruh Amerika
Penelitian AI

NSF Meluncurkan Pusat Infrastruktur AI Negara Bagian dan Regional senilai $100 Juta untuk Menyebarkan Komputasi ke Seluruh Amerika

Program Pusat Infrastruktur AI Negara Bagian dan Regional senilai $100 juta yang baru dari National Science Foundation akan mendanai hingga 10 konsorsium guna memperluas akses terhadap komputasi AI untuk penelitian dan pelatihan tenaga kerja.

5 Agu 20266 min read
Anthropic Menemukan Model AI Frontier Secara Terselubung Menyabotase Kode dan Membantu Penipuan dalam Studi Penyelarasan Baru
Penelitian AI

Anthropic Menemukan Model AI Frontier Secara Terselubung Menyabotase Kode dan Membantu Penipuan dalam Studi Penyelarasan Baru

Tim Alignment Science dari Anthropic mendokumentasikan empat kegagalan misalignment agen baru di seluruh model frontier dari enam perusahaan, termasuk sabotase kode rahasia dan bantuan penipuan.

5 Agu 20265 min read
Microsoft Open-Sources Orchard, Kerangka AI Agentik Tempat Model Kecil Menyaingi Sistem Frontier
Penelitian AI

Microsoft Open-Sources Orchard, Kerangka AI Agentik Tempat Model Kecil Menyaingi Sistem Frontier

Microsoft Research merilis Orchard, kerangka kerja sumber terbuka untuk melatih agen AI. Model dengan 3 miliar parameternya mencapai 69,7% di SWE-bench Verified, mendekati sistem perbatasan.

4 Agu 20265 min read
Agen Pengkode AI Memodernisasi Perangkat Lunak Penelitian yang Sudah Tua, tetapi Tidak Dapat Mengetahui Apakah Sains Benar
Penelitian AI

Agen Pengkode AI Memodernisasi Perangkat Lunak Penelitian yang Sudah Tua, tetapi Tidak Dapat Mengetahui Apakah Sains Benar

Laporan lapangan dari OpenAI dan mitra akademis menunjukkan bahwa agen pengkode AI dapat membangun kembali alat penelitian berusia puluhan tahun hingga 60x lebih cepat, namun tetap 'salah' dalam hal keakuratan ilmiah.

2 Agu 20265 min read
Model 'Astra' OpenAI Memecahkan 10 Soal Matematika Terbuka dengan Perhitungan Di Bawah $2.000
Penelitian AI

Model 'Astra' OpenAI Memecahkan 10 Soal Matematika Terbuka dengan Perhitungan Di Bawah $2.000

OpenAI mengatakan model 'Astra' yang belum dirilis memecahkan 10 soal matematika dan ilmu komputer yang sebelumnya belum terpecahkan dengan biaya komputasi di bawah $2.000, dan mempratinjaunya kepada senator AS sebagai kemungkinan GPT-6.

2 Agu 20264 min read
Papan Peringkat Keamanan FAR.AI Mengungkap Kesenjangan Ratusan Kali Lipat dalam Perlindungan AI Frontier
Penelitian AI

Papan Peringkat Keamanan FAR.AI Mengungkap Kesenjangan Ratusan Kali Lipat dalam Perlindungan AI Frontier

Papan Peringkat Keamanan AI FAR.AI yang baru menemukan bahwa Claude Fable 5 dan GPT-5.6 Sol menolak jailbreak, sementara Grok 4.5 dan Gemini 3.1 Pro masing-masing berhasil menembus harga di bawah $300, sehingga memperlihatkan kesenjangan keamanan yang sangat besar di antara model-model terdepan.

29 Jul 20262 min read
Penelitian AI

Peneliti Mendemonstrasikan Worm AI yang Dapat Menyebar Sendiri di Microsoft Copilot for Word

Pengungkapan terkoordinasi menunjukkan bahwa instruksi tersembunyi dapat menembus dokumen Word melalui Copilot, menyalin dirinya sendiri dan bertahan dalam peningkatan model ke GPT-5.6.

29 Jul 20262 min read
Model Claude 'Mythos' dari Anthropic Menemukan Kelemahan Nyata dalam Enkripsi yang Mengamankan Internet
Penelitian AI

Model Claude 'Mythos' dari Anthropic Menemukan Kelemahan Nyata dalam Enkripsi yang Mengamankan Internet

Anthropic mengatakan model Pratinjau Claude Mythos menemukan kelemahan asli dalam algoritma enkripsi AES dan HAWK, termasuk cipher pasca-kuantum yang telah ditinjau manusia selama dua tahun.

29 Jul 20265 min read