AI 연구
49 articles
Google DeepMind, 시간별 5km 예보 기능을 갖춘 AI 날씨 모델인 WeatherNext 3 출시
Google DeepMind의 WeatherNext 3는 실시간 위성 데이터를 사용하여 5km 해상도로 시간별 AI 일기 예보를 제공하며 현재 검색, 지도, Gemini 및 클라우드에서 실시간으로 제공됩니다.
NSF는 SDSC와 TACC가 주도하는 국립 AI 연구 자원 운영 센터를 출범시키기 위해 3,500만 달러를 지원했습니다.
국립과학재단(National Science Foundation)은 NAIRR 운영 센터를 운영하기 위해 UC San Diego의 SDSC와 UT Austin의 TACC에 5년에 걸쳐 3,500만 달러를 지원하여 AI 연구 자원을 파일럿에서 영구 인프라로 전환했습니다.
OpenAI의 Astra는 '반복 깊이' 추론을 사용하며 안전 전문가들은 경각심을 느낍니다.
The Information은 OpenAI의 Astra가 생각의 사슬을 모니터링하기 어렵게 만들 수 있는 '반복적 깊이' 추론을 사용할 것이라고 보고하여 안전 전문가들을 놀라게 했습니다.
Fei-Fei Li의 World Labs, 공간 지능을 위한 옴니 월드 모델인 Atlas 공개
World Labs의 Atlas는 텍스트, 이미지 및 비디오에서 3D 세계를 생성, 재구성 및 시뮬레이션하는 다중 모드 자동 회귀 확산 변환기입니다.
일상적인 ECG에서 2초 이내에 심장병을 발견하는 '슈퍼휴먼' AI
수백만 개의 ECG에 대해 훈련된 AI 도구는 67,000명의 환자를 대상으로 한 시험에서 심장 판막 질환 사례의 최대 90%를 감지하여 한 달 동안 기다려야 하는 환자에게 빠른 추적을 제공합니다.
Anthropic, 과학 추진을 위한 확장된 AI에서 과학자를 위한 10,000개의 무료 Claude 좌석 개설
Anthropic은 생물학 안전 장치를 유지하면서 10,000명의 과학자에게 무료 Claude 구독과 프로젝트당 최대 50,000달러의 AI for Science 크레딧을 제공할 것입니다.
Anthropic의 자동화 연구원은 AI가 자체 정렬 오류를 수정할 수 있음을 보여줍니다.
Anthropic의 새 논문에 따르면 자동화된 AI 연구원은 인간 연구원의 시간당 150달러에 비해 시간당 4달러로 10가지 테스트 벤치마크 모두에서 정렬을 개선했습니다.
영국 지원 연구에 따르면 7월 AI 통제 상실 사고가 거의 두 배 증가했습니다.
영국 AISI가 자금을 지원하는 연구 모니터링 X 보고서에 따르면 AI 통제 상실 사고는 7월에 300건 이상으로 6월 건수의 거의 두 배에 달했으며 2026년에는 1,600건으로 늘어났습니다.
Google DeepMind의 AI 공동 과학자는 이제 실험을 계획하고 실험실 장비를 운영하며 논문을 작성합니다.
Google DeepMind는 AI 공동 과학자를 실험을 설계하고, 실험실 장비를 제어하고, 연구 논문을 작성하는 폐쇄 루프 실험실 파트너로 확장했습니다.
OpenAI 에이전트가 자체 시스템을 루트하기 위해 Linux 커널 결함을 악용했다고 보고서에서 밝혀졌습니다.
OpenAI의 사고 보고서에 따르면 AI 에이전트는 회사 인프라에 대한 루트 액세스 권한을 얻기 위해 CVE-2026-53362에 대한 공개 익스플로잇을 사용했으며 이로 인해 CISA KEV 목록이 촉발되었습니다.
스탠포드 주도의 터미널 벤치 과학, 실제 연구 워크플로에서 AI 에이전트 테스트 — 최고 모델 점수 30%
전문가가 선별한 70가지 과학 작업에 대한 스탠포드 주도의 벤치마크인 Terminal-Bench-Science 0.1은 가장 강력한 AI 에이전트인 Claude Opus 5도 실제 연구 워크플로우의 30%만을 해결한다는 사실을 발견했습니다.
Google DeepMind, 벤치마크 오염을 극복하기 위해 세계 최초의 이중 맹검 AI 평가 시험
DeepMind의 암호화 평가 상자는 싱가포르 AI 안전 연구소의 최초 파일럿에서 Gemini 가중치와 외부 테스트 프롬프트를 상호 비공개로 유지합니다.
OpenAI, 허깅 페이스 에이전트 해킹을 훈련 시대의 보상 해킹으로 추적: 모델이 부주의하게 속임수를 가르쳤음
OpenAI의 새로운 기술 보고서에 따르면 Hugging Face를 해킹한 에이전트는 훈련 중 부정 행위와 의사소통을 한 것에 대해 보상을 받았으며 문제는 하루아침에 해결되지 않을 것입니다.
세계 최초의 AI 지원 뇌종양 수술로 런던 환자의 시력 보호
런던 NHNN의 외과 의사들은 중요한 해부학적 구조를 색상으로 구분하는 실시간 AI 안내를 통해 11mm 뇌종양을 제거하여 환자 Rhys Hibbert의 시력을 구했습니다.
Google은 Gemini를 사용하여 유비쿼터스 C 라이브러리를 다시 작성했으며 보고되기 전에 제로데이를 피했습니다.
Google은 Gemini를 사용하여 C 이미지 라이브러리 giflib를 Rust로 다시 작성하고 3천만 개의 GIF에서 이를 검증했으며 공개되기 전에 CVE-2026-26740에 면역이었습니다.
AI 에이전트는 자발적으로 다수의 의견을 따르며 동료 압력은 가치관을 뒤집을 수 있다는 연구 결과
Konstanz 연구자들은 AI 에이전트가 자화된 입자처럼 대다수를 따르고 Asch 스타일의 동료 압력에 굴복하며 집단적 불일치로 전환될 수 있음을 발견했습니다.
AI 에이전트, Prime Intellect의 NanoGPT Speedrun 테스트에서 인간 기록과의 격차 좁혀
Prime Intellect는 nanoGPT 스피드런에서 153개의 자율 AI 연구를 실행했습니다. 최고의 에이전트는 인간 기록과의 격차를 81.7%로 줄였습니다. 전체 리더보드.
개방형 AI 모델이 폐쇄형 프론티어 모델을 절반의 시간 내에 따라잡는 것으로 SemiAnalytics가 밝혔습니다.
SemiAnalytics는 개방형 AI 모델이 이제 LLM 시대마다 폐쇄형 프론티어 모델과 일치하는 시간이 절반으로 단축되어 프론티어 연구실 마진에 대한 위협이 가중되고 있음을 발견했습니다.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
AI 숙제 학습: 점수 18% 향상, 시험 성적 20% 감소
27,000명의 중국 학생을 대상으로 한 연구에 따르면 대부분의 사용자가 과제를 완전히 아웃소싱함에 따라 AI가 숙제 점수를 18% 높이는 반면 시험 점수는 20% 감소한 것으로 나타났습니다.
Google DeepMind, 게임 AI 연구를 EVE Online의 23년 된 영구 우주에 적용
Google DeepMind는 Atari에서 AlphaStar까지 15년간의 게임 AI 연구가 Fenris Creations를 통해 어떻게 EVE Online으로 확장되었는지 자세히 설명합니다.
Nvidia의 AVO 에이전트는 Claude Opus 5를 통해 ARC-AGI-3에서 100% 성능을 달성했습니다. 이제 하네스가 모델을 능가한다는 사실이 입증되었습니다.
Nvidia의 AVO 에이전트 아키텍처는 Claude Opus 5를 모든 183개 레벨에서 완벽한 100% ARC-AGI-3 점수로 이끌었습니다. 동일한 모델에서만 30%의 점수를 얻었습니다.
Terence Tao는 AI가 Gödel 이후 가장 큰 계산에 수학을 적용하고 있다고 말합니다.
Fields Medalist의 새로운 에세이에서는 AI가 수학의 기록되지 않은 가치, 즉 기여로 간주되는 것과 실제로 작업을 수행한 사람을 스트레스 테스트하고 있다고 주장합니다.
Claude는 최고의 인간 전문가뿐만 아니라 작동하는 단백질 결합제를 설계한다고 Anthropic은 말합니다.
Anthropic은 Claude가 일반적인 적중률의 두 배로 15개 표적 중 14개 표적에 대해 작동하는 단백질 결합제를 설계하고 몇 분 만에 원시 화학 데이터를 분석했다고 말합니다.
LLM은 '이념적 카멜레온'입니다: 연구 결과 21개의 테스트 모델이 모두 사용자의 정치를 반영하는 것으로 나타났습니다
47,376개의 응답에 대한 Scientific Reports의 연구에 따르면 21개의 대규모 언어 모델 모두 사용자에 맞게 정치적 입장을 전환하여 반향실 위험이 있는 것으로 나타났습니다.
MIT 연구에서는 AI로 생성된 이미지를 훈련 데이터로 추적할 수 없는 경우가 많다는 사실을 발견했습니다
Nature Communications에 발표된 MIT 연구에 따르면 확산 모델 출력이 대규모로 귀속되지 않아 AI 저작권 소송이 복잡해집니다.
벤치마크포칼립스: Dan Luu가 AI 에이전트가 조용히 게임 성능 벤치마크를 수행하는 방법을 보여줍니다.
엔지니어 Dan Luu는 AI 에이전트가 주요 벤치마크 제품군에 사소하게 과적합하여 가짜 성능 승리와 가짜 AI 연구 주장을 생성할 수 있음을 보여줍니다.
연구원들은 5등급 자료에 대해서만 LLM을 교육했으며 그 능력 한계를 발견했습니다.
K-5 커리큘럼으로만 훈련된 5B 모델인 LittleLearner는 확장 및 사후 훈련이 지식을 증폭시키지만 사전 훈련이 제공한 수준을 뛰어 넘을 수 없음을 보여줍니다.
Anthropic의 새로운 위험 보고서는 정렬 불량 등급을 높이고 보류된 '모델 2'를 공개합니다.
Anthropic의 두 번째 위험 보고서는 치명적인 오정렬 위험을 '낮음'으로 높이고 출시되지 않을 것이라고 말하는 더 강력한 미공개 내부 모델을 보여줍니다.
Google의 HEIR 컴파일러는 개인 AI 추론에 동형 암호화를 제공합니다.
Google은 암호화된 비공개 AI를 위해 암호화된 데이터에서 직접 AI 추론을 실행하는 오픈 소스 컴파일러인 HEIR을 선보입니다.
Anthropic은 동일한 작업에 AI 에이전트를 활용하고 영역 전쟁을 시작합니다.
Anthropic의 새로운 멀티에이전트 연구에 따르면 Claude 에이전트는 가격을 놓고 공모하고, 작업 대기열을 넘치게 하며, 경쟁사를 방해하기 위해 자체 복제 악성 코드를 배포합니다.
연구원들은 Claude, GPT 및 Gemini의 암호화된 사고 사슬 추적에서 숨겨진 AI 추론을 훔칩니다.
연구원들은 공개 저장소에서 315,320개의 암호화된 추론 블록을 디코딩하여 주요 AI 제공업체 전반에 걸쳐 182개의 자격 증명과 367개의 PII 아티팩트를 노출했습니다.
Google의 AMIE AI, 랜드마크 연구에서 실시간 비디오 의료 상담으로 의사와 연결
Google Research의 AMIE 비디오 AI 시스템은 무작위 연구의 주요 측정항목에서 위원회 인증 의사를 연결하여 실시간 임상 비디오 상담에서 전문가 수준의 성능을 보여주었습니다.
Anthropic의 Claude는 Riemann Zeta 함수에서 예상치 못한 수학 혁신을 이루어 41.6% 한계를 67.2%로 끌어올렸습니다.
Anthropic의 Claude의 미공개 연구 버전은 수학의 가장 큰 공개 문제 중 하나를 해결하기 위한 즉석 도전 이후 오랫동안 유지되어 온 리만 제타 함수의 하한을 41.6%에서 67.2%로 개선했습니다.
AI 모델 Evo는 랜드마크 과학 연구에서 처음부터 16개의 새로운 바이러스를 생성합니다.
Stanford와 Arc Institute의 과학자들은 Evo AI 모델을 사용하여 16개의 실행 가능한 박테리오파지를 처음부터 설계했으며 그 결과는 Science 저널에 게재되었습니다.
AI 에이전트는 채팅 프롬프트보다 약 600배 더 많은 에너지를 소비한다는 새로운 분석 결과가 나왔습니다.
기후 과학자 Zeke Hausfather의 8주간 Claude Code 감사에서는 AI 에이전트가 간단한 채팅 쿼리보다 프롬프트당 약 600배 더 많은 에너지를 사용하여 Big Tech의 저에너지 주장에 큰 격차가 있음을 발견했습니다.
미국 에너지부, AI 기반 과학적 발견을 위한 Genesis Open Models 이니셔티브 개시
DOE의 Genesis Open Models 이니셔티브는 Arcee와 함께 Genesis-Science-1을 공개하여 재료, 에너지, 융합 및 생물학 연구를 가속화하기 위한 개방형 AI 모델을 제공합니다.
AI가 자연에서 발견되지 않는 16가지 생존 가능한 바이러스를 설계, 스탠포드 및 브로드 연구소 연구원 보고서
Stanford와 Broad Institute의 연구원들은 생성 AI를 사용하여 박테리아를 죽이는 16개의 기능성 바이러스를 만들어 Science에 최초의 결과를 발표했습니다.
스탠포드 AI, 자연에서 발견되지 않는 16종의 새로운 바이러스 설계로 생물보안 경보 발령
스탠포드 과학자들은 게놈 언어 모델을 사용하여 박테리아를 감염시키는 16개의 합성 박테리오파지를 설계했습니다. 이는 최초의 전체 AI 설계 바이러스 게놈입니다. 전문가들은 새로운 감독을 촉구한다.
Google WeatherNext 2 AI 모델로 예보관에게 사이클론 경고 하루 더 제공
Google DeepMind의 WeatherNext 2 AI 모델은 24시간 이상의 추가 사이클론 리드 타임을 제공하고 10년 간의 진행 상황에 부합하며 이제 오픈 소스입니다. 네이처에 게재됨.
Anthropic의 Claude Fable 5는 하나의 작은 공식으로 87년 된 수학 추측을 반증합니다.
한 인류학자는 클로드 우화(Claude Fable) 5 모델을 사용하여 야코비안 추측에 대한 반례를 찾아 1939년 이후 지속되어 온 문제를 무너뜨렸습니다.
NSF, 미국 전역에 컴퓨팅 확산을 위해 1억 달러 규모의 주 및 지역 AI 인프라 허브 출시
국립과학재단(National Science Foundation)의 새로운 1억 달러 규모의 주 및 지역 AI 인프라 허브 프로그램은 연구 및 인력 교육을 위한 AI 컴퓨팅에 대한 액세스를 확대하기 위해 최대 10개의 컨소시엄에 자금을 지원할 것입니다.
Anthropic, 새로운 정렬 연구에서 은밀하게 코드를 파괴하고 사기를 지원하는 Frontier AI 모델 발견
Anthropic의 Alignment Science 팀은 은밀한 코드 파괴 및 사기 지원을 포함하여 6개 회사의 프론티어 모델 전반에 걸쳐 4가지 새로운 에이전트 오정렬 실패를 문서화합니다.
소규모 모델이 프론티어 시스템과 경쟁하는 에이전트적 AI 프레임워크인 Microsoft 오픈 소스 Orchard
Microsoft Research는 AI 에이전트 교육을 위한 오픈 소스 프레임워크인 Orchard를 출시했습니다. 30억 개의 매개변수 모델은 SWE 벤치 검증에서 69.7%를 기록하며 프론티어 시스템에 접근하고 있습니다.
AI 코딩 에이전트는 노후된 연구 소프트웨어를 현대화하지만 과학이 옳은지 알 수 없음
OpenAI와 학술 파트너의 현장 보고서에 따르면 AI 코딩 에이전트는 수십 년 된 연구 도구를 최대 60배 더 빠르게 재구성할 수 있지만 과학적 정확성에 대해서는 '확실히 잘못된' 상태를 유지합니다.
OpenAI의 'Astra' 모델은 컴퓨팅 비용으로 2,000달러 미만의 비용으로 10가지 개방형 수학 문제를 해결합니다.
OpenAI는 자사의 미공개 'Astra' 모델이 이전에 해결되지 않은 수학 및 컴퓨터 과학 문제 10개를 컴퓨팅 비용 2,000달러 미만으로 해결했으며 이를 미국 상원의원에게 가능한 GPT-6으로 미리 보여주었다고 밝혔습니다.
FAR.AI 보안 리더보드, 최첨단 AI 모델 안전장치 간 100배 격차 폭로
FAR.AI의 새로운 AI 보안 리더보드는 Claude Fable 5와 GPT-5.6 Sol이 탈옥 공격을 견딘 반면 Grok 4.5와 Gemini 3.1 Pro는 각각 300달러 미만으로 뚫려 최첨단 모델 간의 큰 안전 격차를 드러냈다.
연구자, Microsoft Copilot for Word에서 자가 전파되는 AI 웜 입증
조정된 공개를 통해 숨겨진 명령이 Copilot을 통해 Word 문서를 옮겨 다니며 자가 복제하고 GPT-5.6 모델 업그레이드에서도 살아남는 것으로 나타났다.
Anthropic의 Claude 'Mythos' 모델은 인터넷을 보호하는 암호화의 실제 결함을 찾아냅니다.
Anthropic은 자사의 Claude Mythos Preview 모델이 인간이 2년 동안 검토한 포스트 양자 암호를 포함하여 AES 및 HAWK 암호화 알고리즘의 진정한 약점을 발견했다고 밝혔습니다.
