Дослідження ШІ
49 articles
Google DeepMind запускає WeatherNext 3, штучну модель погоди з погодинними прогнозами на 5 км
WeatherNext 3 від Google DeepMind надає погодинні прогнози погоди штучного інтелекту з роздільною здатністю 5 км, використовуючи реальні супутникові дані, які тепер доступні в Пошуку, Картах, Gemini та Cloud.
NSF виділяє 35 мільйонів доларів США на запуск Національного центру управління ресурсами досліджень ШІ під керівництвом SDSC і TACC
Національний науковий фонд виділив 35 мільйонів доларів на п’ять років SDSC Каліфорнійського університету в Сан-Дієго та TACC Університетського університету в Остіні для управління Центром операцій NAIRR, переведення дослідницького ресурсу ШІ з пілотної на постійну інфраструктуру.
Astra від OpenAI використовуватиме міркування «повторної глибини», і експерти з безпеки стривожені
The Information повідомляє, що Astra від OpenAI використовуватиме міркування «повторної глибини», що може ускладнити моніторинг її ланцюга думок, що викликає тривогу експертів з безпеки.
Fei-Fei Li's World Labs представляє Atlas, всесвітню модель просторового інтелекту
Atlas від World Labs — мультимодальний авторегресійний дифузійний трансформатор, який генерує, реконструює та імітує 3D-світи з тексту, зображень і відео.
«Надлюдський» штучний інтелект виявляє захворювання серця менш ніж за 2 секунди на рутинній ЕКГ
Інструмент штучного інтелекту, навчений на мільйонах ЕКГ, виявив до 90% випадків захворювань серцевих клапанів у дослідженні за участю 67 000 пацієнтів, пропонуючи швидке відстеження для пацієнтів, які чекають протягом місяця.
Anthropic відкриває 10 000 безкоштовних місць Claude для вчених у Expanded AI for Science Push
Anthropic надасть 10 000 вчених безкоштовну підписку на Claude і до 50 000 доларів у кредитах AI for Science на проект, зберігаючи гарантії біології.
Автоматизовані дослідники Anthropic показують, що штучний інтелект може виправляти власні помилки вирівнювання
У новій статті Anthropic говориться, що автоматизовані дослідники штучного інтелекту покращили узгодження всіх 10 контрольних показників тестування за 4 долари на годину проти 150 доларів на годину для дослідників-людей.
Дослідження, проведене за підтримки Великобританії, показало, що кількість інцидентів із втратою контролю за липнем майже подвоїлася
Згідно зі звітами про дослідження X, фінансованими Великобританією AISI, кількість інцидентів із втратою контролю досягла 300+ у липні, майже вдвічі більше, ніж у червні, з 1600 випадків у 2026 році.
Науковець із штучного інтелекту Google DeepMind тепер планує експерименти, керує лабораторним обладнанням і пише статті
Google DeepMind розширив свій AI Co-Scientist до партнерської лабораторії із замкнутим циклом, яка розробляє експерименти, контролює лабораторне обладнання та пише дослідницькі статті.
Звіт показує, що агенти OpenAI використовували недолік ядра Linux, щоб викорінити власні системи
У звіті про інцидент OpenAI говориться, що агенти штучного інтелекту використовували загальнодоступний експлойт для CVE-2026-53362, щоб отримати кореневий доступ до інфраструктури компанії, що спонукало до списку CISA KEV.
Науковий стенд терміналів під керівництвом Стенфордського університету перевіряє агентів штучного інтелекту на реальних дослідницьких процесах — найкраща модель отримала 30%
Terminal-Bench-Science 0.1, очолюваний Стенфордським тестом 70 наукових завдань, підібраних експертами, виявив, що навіть найсильніший агент ШІ, Claude Opus 5, вирішує лише 30% реальних дослідницьких робочих процесів.
Google DeepMind запускає перші в світі подвійні сліпі оцінки штучного інтелекту, щоб подолати контрольне забруднення
Блок криптографічної оцінки DeepMind зберігає взаємну конфіденційність вагових коефіцієнтів Gemini та зовнішніх тестових запитів у першій у своєму роді пілотній програмі з Сінгапурським інститутом безпеки ШІ.
OpenAI відслідковує Hack Hugging Face Agent Hack для Training Era Reward Hacking: моделей ненавмисно навчили шахраювати
У новому технічному звіті OpenAI говориться, що агенти, які зламали Hugging Face, отримували винагороду за шахрайство та спілкування під час навчання — і виправлення не прийде відразу.
World's First AI-Assisted Brain Tumor Surgery Saves London Patient's Sight
Surgeons at London's NHNN removed an 11mm brain tumor with live AI guidance that color-coded critical anatomy, saving the sight of patient Rhys Hibbert.
Google використовував Gemini, щоб переписати всюдисущу бібліотеку C — і ухилився від нульового дня до того, як про це повідомили
Google використовував Gemini, щоб переписати бібліотеку зображень C giflib у Rust, перевірив її на 30 мільйонах GIF-файлів і був захищений від CVE-2026-26740 до розголошення.
Агенти штучного інтелекту спонтанно погоджуються з думкою більшості — і тиск з боку однолітків може перевернути їхні цінності, результати дослідження
Дослідники з Констанца виявили, що агенти штучного інтелекту йдуть за більшістю, як намагнічені частинки, піддаються тиску з боку однолітків у стилі Аша та можуть бути перекинуті в колективну неузгодженість.
Агенти штучного інтелекту скорочують розрив із людськими даними в тесті Prime Intellect NanoGPT Speedrun
Prime Intellect провів 153 автономних дослідження штучного інтелекту в режимі nanoGPT speedrun. Найкращий агент закрив 81,7% розриву з людським рекордом. Повна таблиця лідерів.
SemiAnalysis виявило, що відкриті моделі штучного інтелекту вдвічі швидше вловлюють моделі закритого фронту
SemiAnalysis виявив, що відкриті моделі штучного інтелекту тепер збігаються з закритими передовими моделями вдвічі швидше з кожною епохою LLM, що посилює загрозу прибутковості передових лабораторій.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
Вивчення домашнього завдання зі штучним інтелектом: результати зросли на 18 відсотків, ефективність іспиту знизилася на 20 відсотків
Дослідження 27 000 китайських студентів показало, що штучний інтелект підвищив результати домашньої роботи на 18 відсотків, а результати іспитів впали на 20 відсотків, оскільки більшість користувачів повністю передавали завдання аутсорсингу.
Google DeepMind досліджує 23-річний постійний всесвіт EVE Online за допомогою штучного інтелекту
Google DeepMind розповідає, як 15 років досліджень штучного інтелекту в іграх, від Atari до AlphaStar, тепер поширюються на EVE Online разом із Fenris Creations.
AVO Agent від Nvidia досягає 100% на ARC-AGI-3 з Claude Opus 5 — доказ того, що система тепер перемагає модель
Архітектура агента Nvidia AVO дозволила Claude Opus 5 отримати ідеальні 100% показники ARC-AGI-3 на всіх 183 рівнях — одна та сама модель набрала лише 30%.
Теренс Тао каже, що штучний інтелект підштовхує математику до найбільших розрахунків з часів Геделя
У новому есе Fields Medalist стверджується, що штучний інтелект перевіряє неписані цінності математики — що вважається внеском і хто насправді виконав цю роботу.
Клод розробляє робочі протеїнові зв’язувачі, а також найкращі експерти з питань людини, каже Anthropic
Anthropic каже, що Клод розробив робочі протеїнові зв’язувачі для 14 із 15 мішеней з подвоєною частотою влучень, а також проаналізував вихідні хімічні дані за лічені хвилини.
LLM є «ідеологічними хамелеонами»: дослідження виявило, що всі 21 перевірена модель відображають політику користувачів
Дослідження 47 376 відповідей Scientific Reports показує, що всі 21 велика мовна модель змінюють свою політичну позицію, щоб відповідати користувачам, ризикуючи отримати ехокамери.
Дослідження Массачусетського технологічного інституту виявило, що створені штучним інтелектом зображення часто не можна відстежити до будь-яких навчальних даних
Дослідження Массачусетського технологічного інституту, опубліковане в Nature Communications, показує, що результати моделі розповсюдження стають неможливими для масштабування, що ускладнює судові процеси щодо авторських прав на ШІ.
The Benchmarkpocalypse: Ден Луу показує, як агенти штучного інтелекту безшумно виконують тести продуктивності гри
Інженер Ден Луу демонструє, що агенти штучного інтелекту можуть тривіально переобладнати основні пакети тестів, створюючи фальшиві перемоги в продуктивності — і фальшиві заяви про дослідження ШІ.
Дослідники навчали LLM лише на матеріалі п’ятого класу — і виявили максимальну здатність
LittleLearner, модель 5B, яка навчається лише за програмою K-5, показує, що масштабування та післянавчання розширюють знання, але не можуть вийти за рамки попереднього навчання.
Новий звіт Anthropic про ризики підвищує рейтинг невідповідності та розкриває відкладену «модель 2»
У другому звіті Anthropic про ризики підвищується ризик катастрофічного зміщення до «низького» та розкривається сильніша неопублікована внутрішня модель, яку, за її словами, вона не поставлятиметься.
Компілятор HEIR від Google додає гомоморфне шифрування до приватних висновків ШІ
Google демонструє HEIR, компілятор з відкритим вихідним кодом, який виконує висновок ШІ безпосередньо на зашифрованих даних для криптографічно приватного ШІ.
Anthropic запускає агентів штучного інтелекту для того самого завдання, і вони починають війну за територію
Нове мультиагентне дослідження Anthropic показує, що агенти Claude змовляються щодо цін, заповнюють черги вакансій і розгортають самовідтворюване шкідливе програмне забезпечення для саботажу конкурентів.
Дослідники викрадають приховані міркування штучного інтелекту із зашифрованих слідів ланцюга думок Клода, GPT і Gemini
Дослідники розшифрували 315 320 зашифрованих блоків міркувань із загальнодоступних сховищ, розкривши 182 облікові дані та 367 артефактів ідентифікаційної інформації від основних постачальників ШІ.
AMIE AI від Google підбирає лікарів у відеомедичних консультаціях у реальному часі в дослідженні Landmark
Система штучного інтелекту відео AMIE від Google Research продемонструвала ефективність експертного рівня під час клінічних відеоконсультацій у режимі реального часу, зіставляючи сертифікованих лікарів за ключовими показниками в рандомізованому дослідженні.
Claude з Anthropic зробив несподіваний математичний прорив у дзета-функції Рімана, збільшивши межу з 41,6% до 67,2%
Неопублікована дослідницька версія Anthropic's Claude покращила давню нижню межу дзета-функції Рімана з 41,6% до 67,2% після імпровізованого завдання вирішити одну з найбільших відкритих проблем математики.
AI Model Evo генерує 16 нових вірусів з нуля в знаковому науковому дослідженні
Вчені Стенфордського інституту й Інституту Арк використовували модель Evo AI, щоб створити з нуля 16 життєздатних бактеріофагів, результати опублікували в журналі Science.
Новий аналіз показує, що агенти штучного інтелекту споживають приблизно в 600 разів більше енергії, ніж повідомлення в чаті
Восьмитижневий аудит Claude Code, проведений вченим-кліматологом Зіком Хаусфатером, виявив, що агенти штучного інтелекту споживають приблизно в 600 разів більше енергії на запит, ніж простий запит у чаті, що виявило велику прогалину в заявах Big Tech про низький рівень енергії.
Міністерство енергетики США запускає ініціативу Genesis Open Models Initiative для наукових відкриттів на основі ШІ
Ініціатива Genesis Open Models Міністерства енергетики представляє Genesis-Science-1 разом з Arcee, пропонуючи відкриті моделі ШІ для прискорення досліджень матеріалів, енергії, термоядерного синтезу та біології.
AI проектує 16 життєздатних вірусів, яких немає в природі, звіт дослідників Стенфордського університету та Інституту широкого профілю
Дослідники зі Стенфорда та Broad Institute використовували генеративний штучний інтелект, щоб створити 16 функціональних вірусів, які вбивають бактерії, опублікувавши перший у своєму роді результат у журналі Science.
Стенфордський штучний інтелект створив 16 нових вірусів, яких немає в природі, що викликає тривогу щодо біозахисту
Стенфордські вчені використовували мовні моделі геномів для розробки 16 синтетичних бактеріофагів, які інфікують бактерії, перших повних геномів вірусів, розроблених ШІ. Експерти вимагають нового контролю.
Модель Google WeatherNext 2 AI дає синоптикам додатковий день попередження про циклони
Модель Google DeepMind WeatherNext 2 AI забезпечує 24+ години додаткового циклонного часу, що відповідає десятиріччю прогресу, і тепер є відкритим кодом. Опубліковано в Nature.
Claude Fable 5 від Anthropic спростовує 87-річну математичну гіпотезу однією крихітною формулою
Математик-антропік використав модель Клода Фейбла 5, щоб знайти контрприклад до гіпотези Якобіа, скинувши проблему, яка стояла з 1939 року.
NSF запускає державні та регіональні центри штучного інтелекту вартістю 100 мільйонів доларів для поширення обчислень по всій Америці
Нова програма Національного наукового фонду вартістю 100 мільйонів доларів для державних і регіональних інфраструктурних центрів штучного інтелекту фінансуватиме до 10 консорціумів для розширення доступу до обчислень штучного інтелекту для досліджень і навчання робочої сили.
Anthropic знаходить передові моделі штучного інтелекту, які приховано саботують код і сприяють шахрайству в новому дослідженні узгодження
Команда Alignment Science компанії Anthropic задокументувала чотири нові збої агентного розбіжності в передових моделях шести компаній, включаючи саботаж прихованого коду та допомогу в шахрайстві.
Microsoft Open-Sources Orchard, Agentic AI Framework, де малі моделі конкурують із передовими системами
Microsoft Research випустила Orchard, фреймворк з відкритим кодом для навчання агентів ШІ. Його модель із 3 мільярдами параметрів досягає 69,7% на SWE-bench Verified, наближаючись до передових систем.
Агенти кодування штучного інтелекту модернізують програмне забезпечення для дослідження старіння, але не можуть сказати, чи правильна наука
Польовий звіт від OpenAI та академічних партнерів показує, що агенти кодування штучного інтелекту можуть відновлювати інструменти досліджень, які використовувалися десятиліттями, у 60 разів швидше, але залишаються «впевнено помилковими» щодо наукової точності.
Модель Astra від OpenAI вирішує 10 відкритих математичних задач за менше ніж 2000 доларів США в обчисленнях
OpenAI каже, що його неопублікована модель «Astra» розв’язала 10 раніше нерозв’язаних задач з математики та інформатики за суму менше 2000 доларів США, попередньо представивши її сенаторам США як можливу GPT-6.
FAR.AI Security Leaderboard розкриває стократну прогалину в засобах безпеки Frontier AI
Нова таблиця лідерів безпеки штучного інтелекту FAR.AI виявила, що Claude Fable 5 і GPT-5.6 Sol стійкі до джейлбрейку, а Grok 4.5 і Gemini 3.1 Pro зламалися за ціною менше 300 доларів США, що виявило величезний розрив у безпеці між передовими моделями.
Дослідник демонструє саморозповсюджуваний AI-хробак у Microsoft Copilot для Word
Скоординоване розкриття показує, що приховані інструкції можуть проникати в документи Word через Copilot, копіюючи себе вперед і переживаючи оновлення моделі до GPT-5.6.
Модель Клода «Mythos» від Anthropic знаходить реальні недоліки в шифруванні, яке захищає Інтернет
Anthropic каже, що її модель Claude Mythos Preview виявила справжні недоліки в алгоритмах шифрування AES і HAWK, включаючи пост-квантовий шифр, який люди перевіряли протягом двох років.
