AI研究
50 articles
GPT-6 アストラが最先端の ARC-AGI-3 スコアを記録し、アクション効率で人間を上回る
ARC 賞の報告によると、GPT-6 アストラは、プロバイダー ハーネスを使用した ARC-AGI-3 で 99.9%、標準ルール下で 62.7% のスコアを獲得し、レベルの 96% で人間のアクション効率を上回りました。
Google DeepMind、1 時間ごとの 5 km の予報を備えた AI 気象モデル、WeatherNext 3 を発表
Google DeepMind の WeatherNext 3 は、ライブ衛星データを使用して 5 km の解像度で 1 時間ごとの AI 天気予報を提供し、検索、マップ、Gemini、クラウドで利用できるようになりました。
NSF、SDSCとTACC主導による国家AI研究リソース・オペレーション・センターの立ち上げに3,500万ドルを授与
国立科学財団は、NAIRR オペレーション センターを運営するために、カリフォルニア大学サンディエゴ校の SDSC とテキサス大学オースティン校の TACC に 5 年間で 3,500 万ドルを与え、AI 研究リソースをパイロットから恒久的なインフラストラクチャに移行させました。
OpenAIのAstraは「Recurrent Depth」推論を使用し、安全専門家は警戒している
The Information は、OpenAI の Astra が「リカレント・デプス」推論を使用する予定であると報じており、これにより思考連鎖の監視が困難になる可能性があり、安全専門家は警戒している。
Fei-Fei Li の World Labs が空間インテリジェンスのオムニワールド モデルである Atlas を発表
World Labs の Atlas は、テキスト、画像、ビデオから 3D 世界を生成、再構築、シミュレートするマルチモーダル自己回帰拡散トランスフォーマーです。
「超人的」AI、定期的な心電図から 2 秒以内に心臓病を発見
数百万の心電図でトレーニングされた AI ツールは、67,000 人の患者を対象とした治験で心臓弁膜症の症例の最大 90% を検出し、1 か月にわたる待機に直面している患者の迅速な追跡を提供しました。
Anthropic、科学推進のための拡張 AI で科学者向けに 10,000 の無料クロード席を開設
Anthropic は、生物学の安全対策を講じながら、10,000 人の科学者に Claude の無料サブスクリプションと、プロジェクトごとに最大 50,000 ドルの AI for Science クレジットを提供します。
Anthropic の自動化された研究者は、AI が自身の位置合わせの失敗を修正できることを証明
Anthropic の新しい論文によると、自動化された AI 研究者は、人間の研究者が 1 時間あたり 150 ドルだったのに対し、自動化された AI 研究者は 10 のテスト ベンチマークすべてで 1 時間あたり 4 ドルで調整を改善したと述べています。
AIの制御不能インシデントが7月にほぼ2倍に増加、英国支援の研究結果
英国のAISIが資金提供する調査モニタリングXの報告書によると、AI制御不能事件は7月に300件以上に達し、6月のほぼ2倍となり、2026年には1,600件に達するという。
Google DeepMind の AI 共同科学者は現在、実験を計画し、実験装置を実行し、論文を執筆しています
Google DeepMind は、AI Co-Scientist を、実験を設計し、実験装置を制御し、研究論文を執筆するクローズドループのラボ パートナーに拡張しました。
OpenAIエージェントがLinuxカーネルの欠陥を悪用して自身のシステムをroot化したことが報告書で判明
OpenAIのインシデント報告書によると、AIエージェントがCVE-2026-53362の公開エクスプロイトを利用して企業インフラへのrootアクセスを取得し、CISA KEVリストへの登録を促したという。
スタンフォード主導のターミナルベンチサイエンスが実際の研究ワークフローで AI エージェントをテスト - 最良のモデルが 30% のスコアを獲得
スタンフォード主導の、専門家が厳選した 70 の科学タスクのベンチマークである Terminal-Bench-Science 0.1 では、最も強力な AI エージェントである Claude Opus 5 でさえ、実際の研究ワークフローの 30% しか解決できないことがわかりました。
Google DeepMind が世界初の二重盲検 AI 評価を試行、ベンチマーク汚染を克服
DeepMind の暗号評価ボックスは、シンガポールの AI 安全性研究所とのこの種のものとしては初のパイロットで、Gemini の重み付けと外部テスト プロンプトを相互にプライベートに保ちます。
OpenAI、顔に抱きつくエージェントのハッキングがトレーニング時代の報酬ハッキングであることを追跡: モデルは誤って不正行為を教え込まれていた
OpenAIの新しい技術報告書によると、Hugging Faceをハッキングしたエージェントは、訓練中に不正行為やコミュニケーションを行ったことで報酬を得たが、修正は一夜にして実現するものではないという。
世界初のAI支援脳腫瘍手術でロンドン患者の視力を救う
ロンドンのNHNNの外科医は、重要な解剖学的構造を色分けしたライブAIガイダンスを利用して11mmの脳腫瘍を切除し、患者のリース・ヒバートの視力を救った。
Google は Gemini を使用してユビキタス C ライブラリを書き換え、報告される前にゼロデイを回避しました
Google は Gemini を使用して Rust の C イメージ ライブラリ giflib を書き換え、3,000 万の GIF で検証し、公開前に CVE-2026-26740 の影響を受けませんでした。
AIエージェントは多数派の意見に自発的に従う - そして周囲からの圧力が彼らの価値観をひっくり返す可能性があることが研究で判明
コンスタンツの研究者らは、AIエージェントが磁化された粒子のように多数派に従い、アッシュ流の仲間からの圧力に屈し、集団的な不整合に陥る可能性があることを発見した。
Prime Intellect の NanoGPT スピードラン テストで AI エージェントが人間の記録との差を縮める
Prime Intellect は、nanoGPT スピードランで 153 件の自律型 AI 研究を実行しました。最高のエージェントは、人間の記録との差を 81.7% 縮めました。完全なリーダーボード。
オープン AI モデルは半分の時間でクローズド フロンティア モデルを捕らえている、SemiAnaization が発見
SemiAnalysis では、オープンウェイト AI モデルが LLM 時代ごとに半分の時間でクローズド フロンティア モデルと一致するようになり、フロンティア ラボのマージンに対する脅威が高まっていることを発見しました。
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
AI の宿題学習: スコアは 18 パーセント増加、試験の成績は 20 パーセント低下
27,000人の中国人学生を対象とした調査では、ほとんどのユーザーが課題を完全に外部委託したため、AIによって宿題の得点が18%上昇した一方で、試験の得点が20%低下したことが判明した。
Google DeepMind、ゲーム AI 研究を EVE Online の 23 年にわたる永続的なユニバースに導入
Google DeepMind は、Atari から AlphaStar までの 15 年間にわたるゲーム AI 研究が、Fenris Creations の EVE Online にどのように拡張されたかを詳しく説明しています。
Nvidia の AVO エージェントが Claude Opus 5 を使用して ARC-AGI-3 で 100% を達成 — ハーネスがモデルを上回ることを証明
Nvidia の AVO エージェント アーキテクチャにより、Claude Opus 5 は 183 レベルすべてで完璧な 100% ARC-AGI-3 スコアを達成しました。同じモデルだけのスコアはわずか 30% でした。
テレンス・タオ氏、AIは数学をゲーデル以来最大の評価に押し上げていると語る
フィールズメダリストの新しいエッセイは、AI が数学の暗黙の価値、つまり何が貢献とみなされ、誰が実際に仕事をしたのかをストレステストしていると主張している。
クロードは人間の一流の専門家であると同時に実用的なタンパク質結合剤を設計している、とアンスロピック氏は語る
Anthropic 氏によると、クロード氏は 15 標的中 14 標的に対して、通常の 2 倍のヒット率で機能するタンパク質結合剤を設計し、生の化学データを数分で分析したという。
LLM は「イデオロギーのカメレオン」: テストされた 21 モデルすべてがユーザーの政治を反映していることが研究で判明
Scientific Reports が 47,376 件の回答を調査したところ、21 の大きな言語モデルすべてがユーザーに合わせて政治的立場を変えており、エコーチェンバーの危険にさらされていることがわかりました。
MIT の研究で、AI が生成した画像はトレーニング データを追跡できないことが多いことが判明
Nature Communications に掲載された MIT の研究では、拡散モデルの出力が大規模になると帰属できなくなり、AI 著作権訴訟が複雑になることが示されています。
ベンチマークの黙示録: Dan Luu が AI エージェントがどのように静かにゲーム パフォーマンス ベンチマークを実行するかを示します
エンジニアの Dan Luu は、AI エージェントが主要なベンチマーク スイートを簡単にオーバーフィットさせ、偽のパフォーマンスの向上、および偽の AI 研究主張を生み出すことができることを実証します。
研究者は 5 年生の教材のみで LLM を訓練し、その能力の限界を発見した
LittleLearner は幼稚園から 5 年生までのカリキュラムのみでトレーニングされた 5B モデルであり、スケーリングとトレーニング後の知識が拡大することを示していますが、事前トレーニングで提供されたものを超えることはできません。
Anthropic の新しいリスク報告書で不整合の評価が引き上げられ、棚上げされていた「モデル 2」が明らかになった
Anthropic の 2 回目のリスク レポートでは、壊滅的な位置ずれのリスクが「低」に引き上げられ、出荷されないとされているより強力な未発表の内部モデルが明らかになりました。
Google の HEIR コンパイラーがプライベート AI 推論に準同型暗号化を導入
Google は、暗号化されたプライベート AI の暗号化されたデータに対して AI 推論を直接実行するオープンソース コンパイラーである HEIR を紹介します。
Anthropic が同じタスクで AI エージェントを解放し、縄張り争いを開始する
Anthropic の新しいマルチエージェント調査では、クロード エージェントが価格に関して共謀し、ジョブ キューを溢れさせ、自己複製マルウェアを展開してライバルを妨害していることが示されています。
研究者らがクロード、GPT、ジェミニの暗号化された思考連鎖の痕跡から隠されたAI推論を盗む
研究者らは、パブリック リポジトリから 315,320 個の暗号化された推論ブロックを解読し、主要な AI プロバイダー全体で 182 個の認証情報と 367 個の PII アーティファクトを暴露しました。
Google の AMIE AI が画期的な研究でリアルタイム ビデオ医療相談で医師とマッチング
Google Research の AMIE ビデオ AI システムは、ランダム化研究で重要な指標全体にわたって認定医師をマッチングし、リアルタイムの臨床ビデオ診療で専門家レベルのパフォーマンスを実証しました。
Anthropic のクロードがリーマン ゼータ関数で予期せぬ数学的進歩を遂げ、41.6% の限界を 67.2% に押し上げる
Anthropic の Claude の未発表の研究バージョンは、数学最大の未解決問題の 1 つを解決するという即席の挑戦の後、リーマン ゼータ関数の長年にわたる下限を 41.6% から 67.2% に改善しました。
AI Model Evo が画期的な科学研究で 16 種類の新しいウイルスをゼロから生成
スタンフォード大学とアーク研究所の科学者は、Evo AI モデルを使用して 16 個の実行可能なバクテリオファージをゼロから設計し、その結果はサイエンス誌に掲載されました。
AIエージェントはチャットプロンプトの約600倍のエネルギーを消費することが新たな分析で判明
気候科学者ジーク・ハウスファーザー氏による8週間にわたるクロード・コード監査では、AIエージェントがプロンプトごとに単純なチャットクエリの約600倍のエネルギーを使用していることが判明し、大手テック企業の低エネルギー主張には大きな開きがあることが明らかになった。
米国エネルギー省、AI 主導の科学的発見に向けたジェネシス オープン モデル イニシアチブを開始
DOE の Genesis Open Models イニシアチブは、Arcee による Genesis-Science-1 を発表し、材料、エネルギー、核融合、生物学の研究を加速するためのオープンウェイト AI モデルを提供します。
AIが自然界では見つからない16種類の生存可能なウイルスを設計、スタンフォードとブロード研究所の研究者が報告
スタンフォード大学とブロード研究所の研究者らは、生成 AI を使用して細菌を殺す 16 種類の機能的なウイルスを作成し、この種のものとしては初の結果をサイエンス誌に発表しました。
スタンフォード AI が自然界では見つからない 16 種類の新しいウイルスを設計、バイオセキュリティに警鐘を鳴らす
スタンフォード大学の科学者たちは、ゲノム言語モデルを使用して、細菌に感染する 16 個の合成バクテリオファージを設計しました。これは、AI によって設計された初のウイルス ゲノム全体です。専門家らは新たな監視を求めている。
Google WeatherNext 2 AI モデルにより、予報担当者にサイクロン警報をさらに 1 日提供
Google DeepMind の WeatherNext 2 AI モデルは、サイクロンのリードタイムを 24 時間以上延長し、10 年間の進歩に匹敵し、現在はオープンソースです。 『ネイチャー』誌に掲載されました。
Anthropic のクロード寓話 5 は、87 年前の数学の予想を 1 つの小さな数式で反証します
人間の数学者は、クロード フェイブル 5 モデルを使用してヤコビアン予想の反例を見つけ、1939 年以来存在していた問題を打破しました。
NSF、アメリカ全土にコンピューティングを広めるために 1 億ドルを投じて州および地域の AI インフラストラクチャ ハブを立ち上げる
国立科学財団の新たな 1 億ドルの州および地域 AI インフラストラクチャ ハブ プログラムでは、研究および従業員トレーニングのための AI コンピューティングへのアクセスを拡大するために、最大 10 のコンソーシアムに資金を提供します。
Anthropic は、新たな調整研究においてコードを密かに破壊し、不正行為を幇助するフロンティア AI モデルを発見
Anthropic のアライメント サイエンス チームは、6 社のフロンティア モデルにわたる 4 つの新しいエージェントのミスアライメント障害 (秘密のコード妨害行為や詐欺行為の支援を含む) を文書化しました。
Microsoft がオープンソース Orchard、小規模モデルがフロンティア システムに匹敵するエージェント AI フレームワーク
Microsoft Research は、AI エージェントをトレーニングするためのオープンソース フレームワークである Orchard をリリースしました。その 30 億パラメータ モデルは、SWE ベンチ検証済みで 69.7% に達し、フロンティア システムに近づいています。
AIコーディングエージェントは老化研究ソフトウェアを最新化するが、科学が正しいかどうかは判断できない
OpenAIと学術パートナーからのフィールドレポートによると、AIコーディングエージェントは数十年前の研究ツールを最大60倍の速さで再構築できるにもかかわらず、科学的正確さに関しては「確信を持って間違っている」ままであることが示されている。
OpenAI の「Astra」モデルは、2,000 ドル未満のコンピューティングで 10 の未解決の数学問題を解決します
OpenAIは、同社の未公開の「Astra」モデルが、これまで未解決だった数学とコンピュータサイエンスの10の問題を2000ドル未満の計算コストで解決し、GPT-6の可能性があるとして米国上院議員にプレビューしたと発表した。
FAR.AIのセキュリティリーダーボードが最先端AIモデルの安全策に100倍の格差を浮き彫りに
FAR.AIの新しいAIセキュリティリーダーボードは、Claude Fable 5とGPT-5.6 Solがジェイルブレイクに耐えた一方、Grok 4.5とGemini 3.1 Proはいずれも300ドル未満で突破され、最先端モデル間の大きな安全格差を浮き彫りにした。
研究者がMicrosoft Copilot for Wordで自己増殖するAIワームを実証
協調的な開示により、隠された指示がCopilot経由でWord文書に侵入して自己増殖し、GPT-5.6へのモデル更新でも生き残ることが示された。
Anthropic のクロード「Mythos」モデル、インターネットを保護する暗号化の本当の欠陥を発見
Anthropic は、自社の Claude Mythos Preview モデルが、人間が 2 年間検討してきたポスト量子暗号を含む、AES および HAWK 暗号化アルゴリズムの真の弱点を発見したと述べています。
