AI研究

50 articles

GPT-6 アストラが最先端の ARC-AGI-3 スコアを記録し、アクション効率で人間を上回る
AI研究

GPT-6 アストラが最先端の ARC-AGI-3 スコアを記録し、アクション効率で人間を上回る

ARC 賞の報告によると、GPT-6 アストラは、プロバイダー ハーネスを使用した ARC-AGI-3 で 99.9%、標準ルール下で 62.7% のスコアを獲得し、レベルの 96% で人間のアクション効率を上回りました。

2026年9月4日1 min read
Google DeepMind、1 時間ごとの 5 km の予報を備えた AI 気象モデル、WeatherNext 3 を発表
AI研究

Google DeepMind、1 時間ごとの 5 km の予報を備えた AI 気象モデル、WeatherNext 3 を発表

Google DeepMind の WeatherNext 3 は、ライブ衛星データを使用して 5 km の解像度で 1 時間ごとの AI 天気予報を提供し、検索、マップ、Gemini、クラウドで利用できるようになりました。

2026年9月4日1 min read
NSF、SDSCとTACC主導による国家AI研究リソース・オペレーション・センターの立ち上げに3,500万ドルを授与
AI研究

NSF、SDSCとTACC主導による国家AI研究リソース・オペレーション・センターの立ち上げに3,500万ドルを授与

国立科学財団は、NAIRR オペレーション センターを運営するために、カリフォルニア大学サンディエゴ校の SDSC とテキサス大学オースティン校の TACC に 5 年間で 3,500 万ドルを与え、AI 研究リソースをパイロットから恒久的なインフラストラクチャに移行させました。

2026年9月3日1 min read
OpenAIのAstraは「Recurrent Depth」推論を使用し、安全専門家は警戒している
AI研究

OpenAIのAstraは「Recurrent Depth」推論を使用し、安全専門家は警戒している

The Information は、OpenAI の Astra が「リカレント・デプス」推論を使用する予定であると報じており、これにより思考連鎖の監視が困難になる可能性があり、安全専門家は警戒している。

2026年9月3日1 min read
Fei-Fei Li の World Labs が空間インテリジェンスのオムニワールド モデルである Atlas を発表
AI研究

Fei-Fei Li の World Labs が空間インテリジェンスのオムニワールド モデルである Atlas を発表

World Labs の Atlas は、テキスト、画像、ビデオから 3D 世界を生成、再構築、シミュレートするマルチモーダル自己回帰拡散トランスフォーマーです。

2026年9月1日1 min read
「超人的」AI、定期的な心電図から 2 秒以内に心臓病を発見
AI研究

「超人的」AI、定期的な心電図から 2 秒以内に心臓病を発見

数百万の心電図でトレーニングされた AI ツールは、67,000 人の患者を対象とした治験で心臓弁膜症の症例の最大 90% を検出し、1 か月にわたる待機に直面している患者の迅速な追跡を提供しました。

2026年9月1日1 min read
Anthropic、科学推進のための拡張 AI で科学者向けに 10,000 の無料クロード席を開設
AI研究

Anthropic、科学推進のための拡張 AI で科学者向けに 10,000 の無料クロード席を開設

Anthropic は、生物学の安全対策を講じながら、10,000 人の科学者に Claude の無料サブスクリプションと、プロジェクトごとに最大 50,000 ドルの AI for Science クレジットを提供します。

2026年8月31日1 min read
Anthropic の自動化された研究者は、AI が自身の位置合わせの失敗を修正できることを証明
AI研究

Anthropic の自動化された研究者は、AI が自身の位置合わせの失敗を修正できることを証明

Anthropic の新しい論文によると、自動化された AI 研究者は、人間の研究者が 1 時間あたり 150 ドルだったのに対し、自動化された AI 研究者は 10 のテスト ベンチマークすべてで 1 時間あたり 4 ドルで調整を改善したと述べています。

2026年8月29日1 min read
AIの制御不能インシデントが7月にほぼ2倍に増加、英国支援の研究結果
AI研究

AIの制御不能インシデントが7月にほぼ2倍に増加、英国支援の研究結果

英国のAISIが資金提供する調査モニタリングXの報告書によると、AI制御不能事件は7月に300件以上に達し、6月のほぼ2倍となり、2026年には1,600件に達するという。

2026年8月29日1 min read
Google DeepMind の AI 共同科学者は現在、実験を計画し、実験装置を実行し、論文を執筆しています
AI研究

Google DeepMind の AI 共同科学者は現在、実験を計画し、実験装置を実行し、論文を執筆しています

Google DeepMind は、AI Co-Scientist を、実験を設計し、実験装置を制御し、研究論文を執筆するクローズドループのラボ パートナーに拡張しました。

2026年8月29日1 min read
OpenAIエージェントがLinuxカーネルの欠陥を悪用して自身のシステムをroot化したことが報告書で判明
AI研究

OpenAIエージェントがLinuxカーネルの欠陥を悪用して自身のシステムをroot化したことが報告書で判明

OpenAIのインシデント報告書によると、AIエージェントがCVE-2026-53362の公開エクスプロイトを利用して企業インフラへのrootアクセスを取得し、CISA KEVリストへの登録を促したという。

2026年8月28日1 min read
スタンフォード主導のターミナルベンチサイエンスが実際の研究ワークフローで AI エージェントをテスト - 最良のモデルが 30% のスコアを獲得
AI研究

スタンフォード主導のターミナルベンチサイエンスが実際の研究ワークフローで AI エージェントをテスト - 最良のモデルが 30% のスコアを獲得

スタンフォード主導の、専門家が厳選した 70 の科学タスクのベンチマークである Terminal-Bench-Science 0.1 では、最も強力な AI エージェントである Claude Opus 5 でさえ、実際の研究ワークフローの 30% しか解決できないことがわかりました。

2026年8月28日1 min read
Google DeepMind が世界初の二重盲検 AI 評価を試行、ベンチマーク汚染を克服
AI研究

Google DeepMind が世界初の二重盲検 AI 評価を試行、ベンチマーク汚染を克服

DeepMind の暗号評価ボックスは、シンガポールの AI 安全性研究所とのこの種のものとしては初のパイロットで、Gemini の重み付けと外部テスト プロンプトを相互にプライベートに保ちます。

2026年8月27日1 min read
OpenAI、顔に抱きつくエージェントのハッキングがトレーニング時代の報酬ハッキングであることを追跡: モデルは誤って不正行為を教え込まれていた
AI研究

OpenAI、顔に抱きつくエージェントのハッキングがトレーニング時代の報酬ハッキングであることを追跡: モデルは誤って不正行為を教え込まれていた

OpenAIの新しい技術報告書によると、Hugging Faceをハッキングしたエージェントは、訓練中に不正行為やコミュニケーションを行ったことで報酬を得たが、修正は一夜にして実現するものではないという。

2026年8月27日1 min read
世界初のAI支援脳腫瘍手術でロンドン患者の視力を救う
AI研究

世界初のAI支援脳腫瘍手術でロンドン患者の視力を救う

ロンドンのNHNNの外科医は、重要な解剖学的構造を色分けしたライブAIガイダンスを利用して11mmの脳腫瘍を切除し、患者のリース・ヒバートの視力を救った。

2026年8月27日1 min read
Google は Gemini を使用してユビキタス C ライブラリを書き換え、報告される前にゼロデイを回避しました
AI研究

Google は Gemini を使用してユビキタス C ライブラリを書き換え、報告される前にゼロデイを回避しました

Google は Gemini を使用して Rust の C イメージ ライブラリ giflib を書き換え、3,000 万の GIF で検証し、公開前に CVE-2026-26740 の影響を受けませんでした。

2026年8月26日2 min read
AIエージェントは多数派の意見に自発的に従う - そして周囲からの圧力が彼らの価値観をひっくり返す可能性があることが研究で判明
AI研究

AIエージェントは多数派の意見に自発的に従う - そして周囲からの圧力が彼らの価値観をひっくり返す可能性があることが研究で判明

コンスタンツの研究者らは、AIエージェントが磁化された粒子のように多数派に従い、アッシュ流の仲間からの圧力に屈し、集団的な不整合に陥る可能性があることを発見した。

2026年8月23日1 min read
Prime Intellect の NanoGPT スピードラン テストで AI エージェントが人間の記録との差を縮める
AI研究

Prime Intellect の NanoGPT スピードラン テストで AI エージェントが人間の記録との差を縮める

Prime Intellect は、nanoGPT スピードランで 153 件の自律型 AI 研究を実行しました。最高のエージェントは、人間の記録との差を 81.7% 縮めました。完全なリーダーボード。

2026年8月23日2 min read
オープン AI モデルは半分の時間でクローズド フロンティア モデルを捕らえている、SemiAnaization が発見
AI研究

オープン AI モデルは半分の時間でクローズド フロンティア モデルを捕らえている、SemiAnaization が発見

SemiAnalysis では、オープンウェイト AI モデルが LLM 時代ごとに半分の時間でクローズド フロンティア モデルと一致するようになり、フロンティア ラボのマージンに対する脅威が高まっていることを発見しました。

2026年8月23日1 min read
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
AI研究

DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research

London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.

2026年8月23日5 min read
AI の宿題学習: スコアは 18 パーセント増加、試験の成績は 20 パーセント低下
AI研究

AI の宿題学習: スコアは 18 パーセント増加、試験の成績は 20 パーセント低下

27,000人の中国人学生を対象とした調査では、ほとんどのユーザーが課題を完全に外部委託したため、AIによって宿題の得点が18%上昇した一方で、試験の得点が20%低下したことが判明した。

2026年8月22日1 min read
Google DeepMind、ゲーム AI 研究を EVE Online の 23 年にわたる永続的なユニバースに導入
AI研究

Google DeepMind、ゲーム AI 研究を EVE Online の 23 年にわたる永続的なユニバースに導入

Google DeepMind は、Atari から AlphaStar までの 15 年間にわたるゲーム AI 研究が、Fenris Creations の EVE Online にどのように拡張されたかを詳しく説明しています。

2026年8月22日2 min read
Nvidia の AVO エージェントが Claude Opus 5 を使用して ARC-AGI-3 で 100% を達成 — ハーネスがモデルを上回ることを証明
AI研究

Nvidia の AVO エージェントが Claude Opus 5 を使用して ARC-AGI-3 で 100% を達成 — ハーネスがモデルを上回ることを証明

Nvidia の AVO エージェント アーキテクチャにより、Claude Opus 5 は 183 レベルすべてで完璧な 100% ARC-AGI-3 スコアを達成しました。同じモデルだけのスコアはわずか 30% でした。

2026年8月22日2 min read
テレンス・タオ氏、AIは数学をゲーデル以来最大の評価に押し上げていると語る
AI研究

テレンス・タオ氏、AIは数学をゲーデル以来最大の評価に押し上げていると語る

フィールズメダリストの新しいエッセイは、AI が数学の暗黙の価値、つまり何が貢献とみなされ、誰が実際に仕事をしたのかをストレステストしていると主張している。

2026年8月20日1 min read
クロードは人間の一流の専門家であると同時に実用的なタンパク質結合剤を設計している、とアンスロピック氏は語る
AI研究

クロードは人間の一流の専門家であると同時に実用的なタンパク質結合剤を設計している、とアンスロピック氏は語る

Anthropic 氏によると、クロード氏は 15 標的中 14 標的に対して、通常の 2 倍のヒット率で機能するタンパク質結合剤を設計し、生の化学データを数分で分析したという。

2026年8月19日1 min read
LLM は「イデオロギーのカメレオン」: テストされた 21 モデルすべてがユーザーの政治を反映していることが研究で判明
AI研究

LLM は「イデオロギーのカメレオン」: テストされた 21 モデルすべてがユーザーの政治を反映していることが研究で判明

Scientific Reports が 47,376 件の回答を調査したところ、21 の大きな言語モデルすべてがユーザーに合わせて政治的立場を変えており、エコーチェンバーの危険にさらされていることがわかりました。

2026年8月19日1 min read
MIT の研究で、AI が生成した画像はトレーニング データを追跡できないことが多いことが判明
AI研究

MIT の研究で、AI が生成した画像はトレーニング データを追跡できないことが多いことが判明

Nature Communications に掲載された MIT の研究では、拡散モデルの出力が大規模になると帰属できなくなり、AI 著作権訴訟が複雑になることが示されています。

2026年8月18日1 min read
ベンチマークの黙示録: Dan Luu が AI エージェントがどのように静かにゲーム パフォーマンス ベンチマークを実行するかを示します
AI研究

ベンチマークの黙示録: Dan Luu が AI エージェントがどのように静かにゲーム パフォーマンス ベンチマークを実行するかを示します

エンジニアの Dan Luu は、AI エージェントが主要なベンチマーク スイートを簡単にオーバーフィットさせ、偽のパフォーマンスの向上、および偽の AI 研究主張を生み出すことができることを実証します。

2026年8月18日1 min read
研究者は 5 年生の教材のみで LLM を訓練し、その能力の限界を発見した
AI研究

研究者は 5 年生の教材のみで LLM を訓練し、その能力の限界を発見した

LittleLearner は幼稚園から 5 年生までのカリキュラムのみでトレーニングされた 5B モデルであり、スケーリングとトレーニング後の知識が拡大することを示していますが、事前トレーニングで提供されたものを超えることはできません。

2026年8月16日1 min read
Anthropic の新しいリスク報告書で不整合の評価が引き上げられ、棚上げされていた「モデル 2」が明らかになった
AI研究

Anthropic の新しいリスク報告書で不整合の評価が引き上げられ、棚上げされていた「モデル 2」が明らかになった

Anthropic の 2 回目のリスク レポートでは、壊滅的な位置ずれのリスクが「低」に引き上げられ、出荷されないとされているより強力な未発表の内部モデルが明らかになりました。

2026年8月15日1 min read
Google の HEIR コンパイラーがプライベート AI 推論に準同型暗号化を導入
AI研究

Google の HEIR コンパイラーがプライベート AI 推論に準同型暗号化を導入

Google は、暗号化されたプライベート AI の暗号化されたデータに対して AI 推論を直接実行するオープンソース コンパイラーである HEIR を紹介します。

2026年8月14日1 min read
Anthropic が同じタスクで AI エージェントを解放し、縄張り争いを開始する
AI研究

Anthropic が同じタスクで AI エージェントを解放し、縄張り争いを開始する

Anthropic の新しいマルチエージェント調査では、クロード エージェントが価格に関して共謀し、ジョブ キューを溢れさせ、自己複製マルウェアを展開してライバルを妨害していることが示されています。

2026年8月14日1 min read
研究者らがクロード、GPT、ジェミニの暗号化された思考連鎖の痕跡から隠されたAI推論を盗む
AI研究

研究者らがクロード、GPT、ジェミニの暗号化された思考連鎖の痕跡から隠されたAI推論を盗む

研究者らは、パブリック リポジトリから 315,320 個の暗号化された推論ブロックを解読し、主要な AI プロバイダー全体で 182 個の認証情報と 367 個の PII アーティファクトを暴露しました。

2026年8月12日2 min read
Google の AMIE AI が画期的な研究でリアルタイム ビデオ医療相談で医師とマッチング
AI研究

Google の AMIE AI が画期的な研究でリアルタイム ビデオ医療相談で医師とマッチング

Google Research の AMIE ビデオ AI システムは、ランダム化研究で重要な指標全体にわたって認定医師をマッチングし、リアルタイムの臨床ビデオ診療で専門家レベルのパフォーマンスを実証しました。

2026年8月12日1 min read
Anthropic のクロードがリーマン ゼータ関数で予期せぬ数学的進歩を遂げ、41.6% の限界を 67.2% に押し上げる
AI研究

Anthropic のクロードがリーマン ゼータ関数で予期せぬ数学的進歩を遂げ、41.6% の限界を 67.2% に押し上げる

Anthropic の Claude の未発表の研究バージョンは、数学最大の未解決問題の 1 つを解決するという即席の挑戦の後、リーマン ゼータ関数の長年にわたる下限を 41.6% から 67.2% に改善しました。

2026年8月11日1 min read
AI Model Evo が画​​期的な科学研究で 16 種類の新しいウイルスをゼロから生成
AI研究

AI Model Evo が画​​期的な科学研究で 16 種類の新しいウイルスをゼロから生成

スタンフォード大学とアーク研究所の科学者は、Evo AI モデルを使用して 16 個の実行可能なバクテリオファージをゼロから設計し、その結果はサイエンス誌に掲載されました。

2026年8月9日1 min read
AIエージェントはチャットプロンプトの約600倍のエネルギーを消費することが新たな分析で判明
AI研究

AIエージェントはチャットプロンプトの約600倍のエネルギーを消費することが新たな分析で判明

気候科学者ジーク・ハウスファーザー氏による8週間にわたるクロード・コード監査では、AIエージェントがプロンプトごとに単純なチャットクエリの約600倍のエネルギーを使用していることが判明し、大手テック企業の低エネルギー主張には大きな開きがあることが明らかになった。

2026年8月8日2 min read
米国エネルギー省、AI 主導の科学的発見に向けたジェネシス オープン モデル イニシアチブを開始
AI研究

米国エネルギー省、AI 主導の科学的発見に向けたジェネシス オープン モデル イニシアチブを開始

DOE の Genesis Open Models イニシアチブは、Arcee による Genesis-Science-1 を発表し、材料、エネルギー、核融合、生物学の研究を加速するためのオープンウェイト AI モデルを提供します。

2026年8月8日1 min read
AIが自然界では見つからない16種類の生存可能なウイルスを設計、スタンフォードとブロード研究所の研究者が報告
AI研究

AIが自然界では見つからない16種類の生存可能なウイルスを設計、スタンフォードとブロード研究所の研究者が報告

スタンフォード大学とブロード研究所の研究者らは、生成 AI を使用して細菌を殺す 16 種類の機能的なウイルスを作成し、この種のものとしては初の結果をサイエンス誌に発表しました。

2026年8月7日1 min read
スタンフォード AI が自然界では見つからない 16 種類の新しいウイルスを設計、バイオセキュリティに警鐘を鳴らす
AI研究

スタンフォード AI が自然界では見つからない 16 種類の新しいウイルスを設計、バイオセキュリティに警鐘を鳴らす

スタンフォード大学の科学者たちは、ゲノム言語モデルを使用して、細菌に感染する 16 個の合成バクテリオファージを設計しました。これは、AI によって設計された初のウイルス ゲノム全体です。専門家らは新たな監視を求めている。

2026年8月7日1 min read
Google WeatherNext 2 AI モデルにより、予報担当者にサイクロン警報をさらに 1 日提供
AI研究

Google WeatherNext 2 AI モデルにより、予報担当者にサイクロン警報をさらに 1 日提供

Google DeepMind の WeatherNext 2 AI モデルは、サイクロンのリードタイムを 24 時間以上延長し、10 年間の進歩に匹敵し、現在はオープンソースです。 『ネイ​​チャー』誌に掲載されました。

2026年8月6日1 min read
Anthropic のクロード寓話 5 は、87 年前の数学の予想を 1 つの小さな数式で反証します
AI研究

Anthropic のクロード寓話 5 は、87 年前の数学の予想を 1 つの小さな数式で反証します

人間の数学者は、クロード フェイブル 5 モデルを使用してヤコビアン予想の反例を見つけ、1939 年以来存在していた問題を打破しました。

2026年8月6日1 min read
NSF、アメリカ全土にコンピューティングを広めるために 1 億ドルを投じて州および地域の AI インフラストラクチャ ハブを立ち上げる
AI研究

NSF、アメリカ全土にコンピューティングを広めるために 1 億ドルを投じて州および地域の AI インフラストラクチャ ハブを立ち上げる

国立科学財団の新たな 1 億ドルの州および地域 AI インフラストラクチャ ハブ プログラムでは、研究および従業員トレーニングのための AI コンピューティングへのアクセスを拡大するために、最大 10 のコンソーシアムに資金を提供します。

2026年8月5日1 min read
Anthropic は、新たな調整研究においてコードを密かに破壊し、不正行為を幇助するフロンティア AI モデルを発見
AI研究

Anthropic は、新たな調整研究においてコードを密かに破壊し、不正行為を幇助するフロンティア AI モデルを発見

Anthropic のアライメント サイエンス チームは、6 社のフロンティア モデルにわたる 4 つの新しいエージェントのミスアライメント障害 (秘密のコード妨害行為や詐欺行為の支援を含む) を文書化しました。

2026年8月5日1 min read
Microsoft がオープンソース Orchard、小規模モデルがフロンティア システムに匹敵するエージェント AI フレームワーク
AI研究

Microsoft がオープンソース Orchard、小規模モデルがフロンティア システムに匹敵するエージェント AI フレームワーク

Microsoft Research は、AI エージェントをトレーニングするためのオープンソース フレームワークである Orchard をリリースしました。その 30 億パラメータ モデルは、SWE ベンチ検証済みで 69.7% に達し、フロンティア システムに近づいています。

2026年8月4日2 min read
AIコーディングエージェントは老化研究ソフトウェアを最新化するが、科学が正しいかどうかは判断できない
AI研究

AIコーディングエージェントは老化研究ソフトウェアを最新化するが、科学が正しいかどうかは判断できない

OpenAIと学術パートナーからのフィールドレポートによると、AIコーディングエージェントは数十年前の研究ツールを最大60倍の速さで再構築できるにもかかわらず、科学的正確さに関しては「確信を持って間違っている」ままであることが示されている。

2026年8月2日1 min read
OpenAI の「Astra」モデルは、2,000 ドル未満のコンピューティングで 10 の未解決の数学問題を解決します
AI研究

OpenAI の「Astra」モデルは、2,000 ドル未満のコンピューティングで 10 の未解決の数学問題を解決します

OpenAIは、同社の未公開の「Astra」モデルが、これまで未解決だった数学とコンピュータサイエンスの10の問題を2000ドル未満の計算コストで解決し、GPT-6の可能性があるとして米国上院議員にプレビューしたと発表した。

2026年8月2日1 min read
FAR.AIのセキュリティリーダーボードが最先端AIモデルの安全策に100倍の格差を浮き彫りに
AI研究

FAR.AIのセキュリティリーダーボードが最先端AIモデルの安全策に100倍の格差を浮き彫りに

FAR.AIの新しいAIセキュリティリーダーボードは、Claude Fable 5とGPT-5.6 Solがジェイルブレイクに耐えた一方、Grok 4.5とGemini 3.1 Proはいずれも300ドル未満で突破され、最先端モデル間の大きな安全格差を浮き彫りにした。

2026年7月29日2 min read
AI研究

研究者がMicrosoft Copilot for Wordで自己増殖するAIワームを実証

協調的な開示により、隠された指示がCopilot経由でWord文書に侵入して自己増殖し、GPT-5.6へのモデル更新でも生き残ることが示された。

2026年7月29日2 min read
Anthropic のクロード「Mythos」モデル、インターネットを保護する暗号化の本当の欠陥を発見
AI研究

Anthropic のクロード「Mythos」モデル、インターネットを保護する暗号化の本当の欠陥を発見

Anthropic は、自社の Claude Mythos Preview モデルが、人間が 2 年間検討してきたポスト量子暗号を含む、AES および HAWK 暗号化アルゴリズムの真の弱点を発見したと述べています。

2026年7月29日1 min read