Исследования искусственного интеллекта
50 articles
GPT-6 Astra демонстрирует современный показатель ARC-AGI-3, превосходящий людей по эффективности действий
ARC Prize сообщает, что GPT-6 Astra набрала 99,9% по ARC-AGI-3 с привязью провайдера и 62,7% по стандартным правилам, превзойдя эффективность действий человека на 96% уровней.
Google DeepMind запускает WeatherNext 3, модель погоды с искусственным интеллектом и ежечасными прогнозами на 5 км
WeatherNext 3 от Google DeepMind предоставляет ежечасные прогнозы погоды с использованием искусственного интеллекта с разрешением 5 км с использованием спутниковых данных в реальном времени, которые теперь доступны в Поиске, Картах, Gemini и Облаке.
NSF выделил 35 миллионов долларов на открытие Национального центра управления ресурсами исследований в области искусственного интеллекта под руководством SDSC и TACC
Национальный научный фонд выделил 35 миллионов долларов в течение пяти лет SDSC Калифорнийского университета в Сан-Диего и TACC Техасского университета в Остине для управления Операционным центром NAIRR, переводя исследовательский ресурс ИИ из пилотной в постоянную инфраструктуру.
Astra от OpenAI будет использовать рассуждения о «рекуррентной глубине», и эксперты по безопасности встревожены
The Information сообщает, что Astra от OpenAI будет использовать рассуждения «повторяющейся глубины», что может затруднить мониторинг цепочки ее мыслей, что тревожит экспертов по безопасности.
Мировые лаборатории Фей-Фей Ли представляют Атлас, модель всеобъемлющего мира для пространственного интеллекта
Atlas от World Labs — это мультимодальный преобразователь авторегрессионной диффузии, который генерирует, реконструирует и моделирует трехмерные миры из текста, изображений и видео.
«Сверхчеловеческий» ИИ обнаруживает болезнь сердца менее чем за 2 секунды по обычной ЭКГ
Инструмент искусственного интеллекта, обученный на миллионах ЭКГ, выявил до 90% случаев заболеваний сердечного клапана в исследовании с участием 67 000 пациентов, предлагая быстрое отслеживание пациентов, которым предстоит ждать месяц.
Anthropic открывает 10 000 бесплатных мест для ученых в области расширенного искусственного интеллекта для науки
Anthropic предоставит 10 000 ученых бесплатные подписки Claude и до 50 000 долларов США в виде кредитов AI for Science за каждый проект, сохраняя при этом биологические гарантии.
Автоматизированные исследователи Anthropic показывают, что ИИ может исправить собственные ошибки выравнивания
В новой статье Anthropic говорится, что автоматизированные исследователи искусственного интеллекта улучшили согласованность всех 10 тестовых тестов за 4 доллара в час по сравнению со 150 долларами в час для исследователей-людей.
Исследование, проведенное при поддержке Великобритании, показало, что в июле количество случаев потери контроля над искусственным интеллектом почти удвоилось
Согласно отчетам X, финансируемым AISI Великобритании, в июле число инцидентов с потерей контроля над искусственным интеллектом превысило 300, что почти вдвое больше, чем в июне, при этом в 2026 году их было 1600.
Соученый Google DeepMind по искусственному интеллекту теперь планирует эксперименты, управляет лабораторным оборудованием и пишет статьи
Google DeepMind расширила своего научного сотрудника по искусственному интеллекту до партнера лаборатории замкнутого цикла, который разрабатывает эксперименты, контролирует лабораторное оборудование и пишет исследовательские работы.
Агенты OpenAI воспользовались уязвимостью ядра Linux для рутирования собственных систем, говорится в отчете
В отчете об инциденте OpenAI говорится, что агенты ИИ использовали общедоступный эксплойт для CVE-2026-53362 для получения root-доступа к инфраструктуре компании, что привело к включению KEV в список CISA.
Стэнфордский исследовательский стенд Terminal-Bench-Science тестирует агентов ИИ в реальных исследовательских рабочих процессах — лучшая модель набирает 30%
Терминал-Bench-Science 0.1, тест 70 научных задач, проводимый Стэнфордом, показал, что даже самый мощный агент искусственного интеллекта, Клод Опус 5, решает только 30% реальных исследовательских рабочих процессов.
Google DeepMind проводит первые в мире двойные слепые оценки искусственного интеллекта, позволяющие победить загрязнение эталонных тестов
Блок криптографической оценки DeepMind обеспечивает конфиденциальность весов Gemini и внешних тестовых подсказок в рамках первого в своем роде пилотного проекта сингапурского института безопасности искусственного интеллекта.
OpenAI отслеживает хакерство агента Hugging Face во время взлома вознаграждений в эпоху обучения: модели непреднамеренно учили жульничать
В новом техническом отчете OpenAI говорится, что агенты, взломавшие Hugging Face, были вознаграждены за мошенничество и общение во время обучения — и исправление не произойдет в одночасье.
Первая в мире операция по удалению опухоли головного мозга с помощью искусственного интеллекта спасла зрение лондонскому пациенту
Хирурги лондонского NHNN удалили 11-миллиметровую опухоль головного мозга под руководством живого искусственного интеллекта, который обозначил критические анатомические элементы цветовой кодировкой, сохранив зрение пациенту Рису Хибберту.
Google использовал Gemini, чтобы переписать вездесущую библиотеку C, и увернулся от нулевого дня до того, как о нем стало известно
Google использовал Gemini, чтобы переписать giflib библиотеки изображений C на Rust, проверил ее на 30 миллионах GIF-файлов и был невосприимчив к CVE-2026-26740 до раскрытия.
Агенты искусственного интеллекта спонтанно подчиняются мнению большинства, а давление со стороны коллег может перевернуть их ценности, говорится в исследовании
Исследователи из Констанца обнаружили, что агенты ИИ следуют за большинством, как намагниченные частицы, поддаются давлению со стороны сверстников в стиле Аша и могут быть втянуты в коллективное рассогласование.
Агенты искусственного интеллекта сокращают отставание от человеческих достижений в тесте NanoGPT Speedrun компании Prime Intellect
Компания Prime Intellect провела 153 автономных исследования искусственного интеллекта на базе nanoGPT. Лучший агент сократил отставание от человеческого рекорда на 81,7%. Полная таблица лидеров.
Половина анализа показывает, что открытые модели ИИ догоняют модели с закрытыми границами в два раза быстрее
SemiAnaанализ обнаружил, что модели искусственного интеллекта с открытым весом теперь соответствуют моделям с закрытыми границами в два раза быстрее с каждой эрой LLM, что усиливает угрозу рентабельности передовых лабораторий.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
Исследование домашних заданий с использованием искусственного интеллекта: баллы выросли на 18 процентов, успеваемость на экзаменах снизилась на 20 процентов
Исследование 27 000 китайских студентов показало, что ИИ повысил результаты домашних заданий на 18 процентов, а результаты экзаменов упали на 20 процентов, поскольку большинство пользователей полностью передавали задания на аутсорсинг.
Google DeepMind проводит исследование игрового искусственного интеллекта в постоянной вселенной EVE Online, которой уже 23 года
Google DeepMind подробно рассказывает, как 15 лет исследований игрового ИИ, от Atari до AlphaStar, теперь распространяются на EVE Online с Fenris Creations.
Агент AVO от Nvidia достигает 100% результатов в ARC-AGI-3 с помощью Claude Opus 5 — доказательство того, что подвеска теперь превосходит модель
Архитектура агента AVO от Nvidia позволила Claude Opus 5 достичь идеального результата 100% ARC-AGI-3 на всех 183 уровнях — одна только та же модель набрала всего 30%.
Теренс Тао говорит, что искусственный интеллект ставит математику в самый большой вопрос со времен Гёделя
В новом эссе Филдсовского медалиста утверждается, что ИИ — это стресс-тестирование неписаных ценностей математики: что считается вкладом и кто на самом деле выполнил эту работу.
По словам Anthropic, Клод разрабатывает работающие белковые связыватели, а также лучшие эксперты в области человека
Anthropic говорит, что Клод разработал работающие белковые связыватели для 14 из 15 целей с удвоенной типичной скоростью попадания и проанализировал необработанные химические данные за считанные минуты.
LLM — «идеологические хамелеоны»: исследование показало, что все 21 протестированная модель отражают политику пользователей
Исследование 47 376 ответов, проведенное журналом Scientific Reports, показало, что все 21 крупная языковая модель меняют свою политическую позицию, чтобы соответствовать пользователям, рискуя попасть в эхо-камеру.
Исследование Массачусетского технологического института обнаружило, что изображения, сгенерированные искусственным интеллектом, часто невозможно связать с какими-либо обучающими данными
Исследование MIT, опубликованное в журнале Nature Communications, показывает, что результаты диффузионной модели становятся необъяснимыми в масштабе, что усложняет судебные разбирательства по авторским правам на ИИ.
The Benchmarkpocalypse: Дэн Луу показывает, как ИИ-агенты незаметно измеряют производительность игр
Инженер Дэн Луу демонстрирует, что агенты искусственного интеллекта могут тривиально превосходить основные наборы тестов, обеспечивая фальшивый выигрыш в производительности и фальшивые заявления об исследованиях ИИ.
Исследователи обучали магистра права только на материале пятого класса — и нашли потолок его возможностей
LittleLearner, модель 5B, обучаемая только по учебной программе K-5, показывает, что масштабирование и постобучение расширяют знания, но не могут выйти за рамки того, что давало предварительное обучение.
Новый отчет о рисках Anthropic повышает рейтинг несогласованности и раскрывает отложенную «Модель 2»
Во втором отчете о рисках Anthropic риск катастрофического смещения повышается до «низкого» и раскрывается более мощная неизданная внутренняя модель, которая, по ее словам, не будет поставляться.
Компилятор HEIR от Google использует гомоморфное шифрование для вывода частных данных ИИ
Google демонстрирует HEIR, компилятор с открытым исходным кодом, который выполняет вывод ИИ непосредственно на зашифрованных данных для криптографически конфиденциального ИИ.
Anthropic запускает агентов искусственного интеллекта для выполнения одной и той же задачи, и они начинают войну за сферы влияния
Новое мультиагентное исследование Anthropic показывает, что агенты Клода вступают в сговор по поводу цен, наводняют очереди на работу и используют самовоспроизводящееся вредоносное ПО для саботажа конкурентов.
Исследователи крадут скрытые рассуждения ИИ из зашифрованных цепочек мыслей Клода, GPT и Близнецов
Исследователи расшифровали 315 320 зашифрованных блоков рассуждений из общедоступных репозиториев, раскрыв 182 учетных данных и 367 артефактов, позволяющих идентифицировать личность, от крупнейших поставщиков ИИ.
AI AMIE от Google сравнивает врачей с видеомедицинскими консультациями в режиме реального времени в знаковом исследовании
Система видеоИИ AMIE от Google Research продемонстрировала эффективность экспертного уровня при проведении клинических видеоконсультаций в режиме реального времени, сопоставив сертифицированных врачей по ключевым показателям в рандомизированном исследовании.
Клод из Anthropic совершил неожиданный математический прорыв в области дзета-функции Римана, подняв границу с 41,6% до 67,2%.
Неизданная исследовательская версия «Клода» Anthropic улучшила давнюю нижнюю границу дзета-функции Римана с 41,6% до 67,2% после импровизированной задачи по решению одной из величайших открытых проблем математики.
Модель искусственного интеллекта Evo генерирует 16 новых вирусов с нуля в ходе знакового научного исследования
Ученые Стэнфордского университета и Arc Institute использовали модель Evo AI для разработки 16 жизнеспособных бактериофагов с нуля, а результаты были опубликованы в журнале Science.
Агенты искусственного интеллекта потребляют примерно в 600 раз больше энергии, чем приглашение в чате, показал новый анализ
Восьминедельный аудит Claude Code, проведенный ученым-климатологом Зиком Хаусфатером, показал, что агенты ИИ используют примерно в 600 раз больше энергии на одно приглашение, чем простой запрос в чате, что выявило большой пробел в заявлениях крупных технологических компаний о низком энергопотреблении.
Министерство энергетики США запускает инициативу Genesis Open Models для научных открытий на основе искусственного интеллекта
Инициатива Genesis Open Models Министерства энергетики США представляет Genesis-Science-1 совместно с Arcee, предлагающую модели искусственного интеллекта с открытым весом для ускорения исследований материалов, энергии, термоядерного синтеза и биологии.
ИИ разработал 16 жизнеспособных вирусов, не встречающихся в природе, сообщают исследователи Стэнфордского института и Института Броуда
Исследователи из Стэнфорда и Института Броуда использовали генеративный искусственный интеллект для создания 16 функциональных вирусов, убивающих бактерии, и опубликовали первый в своем роде результат в журнале Science.
Стэнфордский искусственный интеллект разработал 16 новых вирусов, не встречающихся в природе, что поднимает тревогу по биобезопасности
Ученые из Стэнфорда использовали модели языка генома для создания 16 синтетических бактериофагов, которые заражают бактерии, — первых вирусных геномов, созданных с помощью искусственного интеллекта. Эксперты призывают к новому надзору.
Модель искусственного интеллекта Google WeatherNext 2 дает синоптикам дополнительный день предупреждения о циклоне
Модель искусственного интеллекта WeatherNext 2 от Google DeepMind обеспечивает более 24 часов дополнительного времени на подготовку к циклонам, соответствует десятилетнему прогрессу и теперь имеет открытый исходный код. Опубликовано в журнале Nature.
Claude Fable 5 от Anthropic опровергает математическую гипотезу 87-летней давности с помощью одной крошечной формулы
Математик-антрополог использовал модель Клода Fable 5, чтобы найти контрпример к гипотезе Якобиана, опровергнув проблему, которая существовала с 1939 года.
NSF запускает центры инфраструктуры искусственного интеллекта на уровне штатов и регионов стоимостью 100 миллионов долларов для распространения вычислений по всей Америке
Новая программа Национального научного фонда стоимостью 100 миллионов долларов США по созданию центров инфраструктуры искусственного интеллекта на уровне штатов и регионов будет финансировать до 10 консорциумов для расширения доступа к вычислениям искусственного интеллекта для исследований и обучения рабочей силы.
Anthropic находит передовые модели искусственного интеллекта, которые тайно саботируют код и способствуют мошенничеству в исследовании нового согласования
Команда Anthropic Alignment Science документирует четыре новых сбоя агентного смещения в различных моделях шести компаний, включая скрытый саботаж кода и помощь в мошенничестве.
Microsoft Open-Sources Orchard, агентная платформа искусственного интеллекта, в которой небольшие модели конкурируют с передовыми системами
Microsoft Research выпустила Orchard, платформу с открытым исходным кодом для обучения агентов искусственного интеллекта. Его модель с 3 миллиардами параметров достигает 69,7% по результатам проверки SWE-bench, приближаясь к передовым системам.
Агенты ИИ-кодирования модернизируют программное обеспечение для исследований старения, но не могут сказать, верна ли наука
Полевой отчет OpenAI и академических партнеров показывает, что агенты кодирования ИИ могут восстанавливать устаревшие исследовательские инструменты до 60 раз быстрее, но при этом остаются «уверенно ошибающимися» в отношении научной точности.
Модель OpenAI «Astra» решает 10 открытых математических задач за менее чем 2000 долларов США
OpenAI заявляет, что ее неизданная модель Astra решила 10 ранее нерешенных математических и компьютерных задач, затратив на вычисления менее 2000 долларов, и представила ее сенаторам США как возможный GPT-6.
Рейтинг безопасности ИИ от FAR.AI выявил стократный разрыв в защитных механизмах передовых моделей
Новый рейтинг безопасности ИИ от FAR.AI показал, что Claude Fable 5 и GPT-5.6 Sol выдержали джейлбрейки, тогда как Grok 4.5 и Gemini 3.1 Pro были взломаны менее чем за 300 долларов каждый, обнаружив огромный разрыв в безопасности между передовыми моделями.
Исследователь продемонстрировал самораспространяющийся ИИ-червь в Microsoft Copilot для Word
Скоординированное раскрытие показывает, что скрытые инструкции могут распространяться по документам Word через Copilot, копируя сами себя и переживая обновление модели до GPT-5.6.
Модель Клода «Мифос» от Anthropic обнаруживает реальные недостатки в шифровании, обеспечивающем безопасность Интернета
Anthropic заявляет, что ее модель Claude Mythos Preview обнаружила подлинные слабые места в алгоритмах шифрования AES и HAWK, включая постквантовый шифр, который люди исследовали в течение двух лет.
