Badania nad sztuczną inteligencją
49 articles
Google DeepMind uruchamia WeatherNext 3, model pogody oparty na sztucznej inteligencji z cogodzinnymi prognozami na dystansie 5 km
WeatherNext 3 firmy Google DeepMind dostarcza godzinowe prognozy pogody oparte na sztucznej inteligencji w rozdzielczości 5 km, korzystając z aktualnych danych satelitarnych, dostępnych teraz w wyszukiwarce, Mapach, Gemini i chmurze.
NSF przyznaje 35 milionów dolarów na uruchomienie krajowego centrum operacyjnego zasobów badawczych w zakresie sztucznej inteligencji, pod przewodnictwem SDSC i TACC
Narodowa Fundacja Nauki przyznała w ciągu pięciu lat 35 milionów dolarów SDSC na Uniwersytecie Kalifornijskim w San Diego i TACC na Uniwersytecie Kalifornijskim w Austin na prowadzenie Centrum Operacyjnego NAIRR, przenosząc zasoby badawcze w zakresie sztucznej inteligencji z infrastruktury pilotażowej do infrastruktury stałej.
Astra OpenAI zastosuje rozumowanie oparte na „powtarzającej się głębokości” – eksperci ds. bezpieczeństwa są zaniepokojeni
Według doniesień informacyjnych Astra z OpenAI zastosuje rozumowanie oparte na „powtarzającej się głębi”, co może utrudnić monitorowanie łańcucha myślowego, co budzi niepokój ekspertów ds. bezpieczeństwa.
Światowe laboratoria Fei-Fei Li przedstawiają Atlas, model świata Omni dla inteligencji przestrzennej
Atlas firmy World Labs to multimodalny autoregresyjny transformator dyfuzyjny, który generuje, rekonstruuje i symuluje światy 3D z tekstu, obrazów i wideo.
„Nadludzka” sztuczna inteligencja wykrywa chorobę serca w mniej niż 2 sekundy na podstawie rutynowego EKG
Narzędzie AI przeszkolone na podstawie milionów zapisów EKG wykryło do 90% przypadków chorób zastawek serca w badaniu obejmującym 67 000 pacjentów, oferując szybką ścieżkę leczenia pacjentom, którym grozi miesięczne oczekiwanie.
Anthropic udostępnia naukowcom 10 000 bezpłatnych miejsc Claude w ramach rozszerzonej sztucznej inteligencji w ramach Science Push
Anthropic zapewni 10 000 naukowcom bezpłatne subskrypcje Claude i aż do 50 000 dolarów w postaci kredytów AI for Science na każdy projekt, przy jednoczesnym zachowaniu zabezpieczeń biologicznych.
Zautomatyzowani badacze firmy Anthropic pokazują, że sztuczna inteligencja może naprawić własne błędy w wyrównaniu
Z nowego artykułu Anthropic wynika, że zautomatyzowani badacze sztucznej inteligencji poprawili dostosowanie wszystkich 10 testów porównawczych przy cenie 4 dolarów za godzinę w porównaniu do 150 dolarów za godzinę w przypadku badaczy-ludzi.
Jak wynika z badań wspieranych przez Wielką Brytanię, w lipcu liczba przypadków utraty kontroli nad sztuczną inteligencją niemal się podwoiła
Według raportów monitorujących X finansowanych przez brytyjską AISI, w lipcu liczba przypadków utraty kontroli nad sztuczną inteligencją osiągnęła ponad 300, co stanowi prawie dwukrotność liczby w czerwcu, z 1600 przypadkami w 2026 r.
Współpracownik AI w Google DeepMind planuje teraz eksperymenty, obsługuje sprzęt laboratoryjny i pisze artykuły
Firma Google DeepMind przekształciła swojego współpracownika ds. sztucznej inteligencji w partnera laboratoryjnego o zamkniętej pętli, który projektuje eksperymenty, kontroluje sprzęt laboratoryjny i pisze artykuły badawcze.
Z raportu wynika, że agenci OpenAI wykorzystali lukę w jądrze Linuksa do zrootowania własnych systemów
Z raportu incydentu OpenAI wynika, że agenci AI wykorzystali publiczny exploit dla CVE-2026-53362, aby uzyskać dostęp do konta root w infrastrukturze firmy, co spowodowało umieszczenie go na liście CISA KEV.
Stanford-Led Terminal-Bench-Science testuje agentów AI na rzeczywistych przepływach pracy badawczej — najlepsze wyniki modelu 30%
Terminal-Bench-Science 0.1, prowadzony przez Stanford test porównawczy obejmujący 70 zadań naukowych wybranych przez ekspertów, stwierdza, że nawet najsilniejszy agent sztucznej inteligencji, Claude Opus 5, rozwiązuje zaledwie 30% rzeczywistych procesów badawczych.
Google DeepMind przeprowadza pierwsze na świecie podwójnie ślepe oceny sztucznej inteligencji w celu pokonania zanieczyszczeń w testach porównawczych
Kryptograficzna skrzynka ewaluacyjna DeepMind zapewnia wzajemną prywatność ciężarów Gemini i monitów o testy zewnętrzne w ramach pierwszego w swoim rodzaju pilotażu przeprowadzonego przez singapurski instytut bezpieczeństwa AI.
OpenAI śledzi hacking agenta obejmującego twarz do hakowania z nagrodami z czasów szkoleniowych: modele zostały nieumyślnie nauczone oszukiwać
Z nowego raportu technicznego OpenAI wynika, że agenci, którzy zhakowali Hugging Face, zostali nagrodzeni za oszukiwanie i komunikowanie się podczas szkolenia, a rozwiązanie nie nastąpi z dnia na dzień.
Pierwsza na świecie operacja guza mózgu wspomagana sztuczną inteligencją ratuje wzrok londyńskiego pacjenta
Chirurdzy z londyńskiej NHNN usunęli 11-milimetrowego guza mózgu za pomocą sztucznej inteligencji na żywo, która oznaczyła krytyczną anatomię kolorami, ratując wzrok pacjentowi Rhysowi Hibbertowi.
Google wykorzystał Gemini do przepisania wszechobecnej biblioteki C i uniknął dnia zerowego, zanim zostało to zgłoszone
Firma Google użyła Gemini do przepisania biblioteki obrazów C w języku Rust, sprawdziła ją na 30 milionach plików GIF i przed ujawnieniem była odporna na CVE-2026-26740.
Agenci sztucznej inteligencji spontanicznie dostosowują się do opinii większości, a presja rówieśników może odwrócić ich wartości, wynika z badania
Badacze z Konstanz odkryli, że agenci sztucznej inteligencji podążają za większością niczym namagnesowane cząstki, ulegają presji otoczenia w stylu Ascha i mogą zostać zamienione w zbiorową niewspółosiowość.
Agenci AI zmniejszają różnicę w wynikach testów ludzkich w teście NanoGPT Speedrun firmy Prime Intellect
Prime Intellect przeprowadził 153 autonomiczne badania nad sztuczną inteligencją w speedrun nanoGPT. Najlepszy agent wypełnił 81,7% luki w stosunku do rekordu ludzkiego. Pełna tabela liderów.
Jak wynika z półanalizy, otwarte modele AI wychwytują modele o zamkniętej granicy w o połowę krótszym czasie
SemiAnalytics wykazało, że otwarte modele sztucznej inteligencji dopasowują się teraz do zamkniętych modeli granicznych w o połowę krótszym czasie w każdej epoce LLM, zwiększając zagrożenie dla marginesów laboratoriów granicznych.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
Badanie zadań domowych AI: wzrost o 18 procent, wydajność na egzaminach niższa o 20 procent
Badanie przeprowadzone na 27 000 chińskich uczniów wykazało, że sztuczna inteligencja podniosła wyniki w zadaniach domowych o 18 procent, a wyniki egzaminów spadły o 20 procent, ponieważ większość użytkowników całkowicie zlecała zadania podmiotom zewnętrznym.
Google DeepMind przenosi swoje badania nad sztuczną inteligencją gier do 23-letniego, trwałego wszechświata EVE Online
Google DeepMind szczegółowo opisuje, jak 15 lat badań nad sztuczną inteligencją w grach, od Atari po AlphaStar, przekłada się teraz na EVE Online z Fenris Creations.
Agent AVO firmy Nvidia osiąga 100% skuteczności w ARC-AGI-3 dzięki Claude Opus 5 — dowód, że uprząż pokonuje teraz model
Architektura agenta AVO firmy Nvidia doprowadziła Claude Opus 5 do doskonałego wyniku 100% ARC-AGI-3 na wszystkich 183 poziomach — ten sam model uzyskał zaledwie 30% wyniku.
Terence Tao twierdzi, że sztuczna inteligencja stawia matematykę w największym stopniu od czasów Gödla
W nowym eseju The Fields Medalist dowodzi się, że sztuczna inteligencja testuje niepisane wartości matematyki pod kątem warunków skrajnych – co liczy się jako wkład i kto faktycznie wykonał tę pracę.
Claude projektuje działające spoiwa białkowe równie dobrze jak najlepsi eksperci od ludzi, mówi Anthropic
Anthropic twierdzi, że Claude zaprojektował działające białka wiążące dla 14 z 15 celów z dwukrotnie większą częstością trafień i przeanalizował surowe dane chemiczne w ciągu kilku minut.
LLM to „ideologiczne kameleony”: badanie wykazało, że wszystkie 21 przetestowanych modeli odzwierciedla politykę użytkowników
Badanie Scientific Reports obejmujące 47 376 odpowiedzi wykazało, że wszystkie 21 dużych modeli językowych zmienia swoje stanowisko polityczne, aby dopasować się do użytkowników, ryzykując powstanie efektu „echa”.
Badanie MIT wykazało, że obrazów generowanych przez sztuczną inteligencję często nie da się powiązać z żadnymi danymi treningowymi
Badania MIT opublikowane w Nature Communications pokazują, że wyników modelu dyfuzji nie można przypisać na dużą skalę, co komplikuje spory dotyczące praw autorskich do sztucznej inteligencji.
Benchmarkpocalypse: Dan Luu pokazuje, jak agenci AI po cichu testują wydajność gier
Inżynier Dan Luu pokazuje, że agenci sztucznej inteligencji mogą w trywialny sposób przewyższyć główne zestawy testów porównawczych, generując fałszywe korzyści w zakresie wydajności i fałszywe twierdzenia z badań nad sztuczną inteligencją.
Naukowcy przeszkolili LLM wyłącznie na materiale piątej klasy i odkryli pułap jego możliwości
LittleLearner, model 5B szkolony wyłącznie w oparciu o program nauczania dla szkół podstawowych i gimnazjów, pokazuje, że skalowanie i szkolenie po szkoleniu poszerzają wiedzę, ale nie mogą przekroczyć tego, co zapewniło szkolenie wstępne.
Nowy raport Anthropic na temat ryzyka podnosi wskaźnik niewspółosiowości i ujawnia odłożony na półkę „Model 2”
Drugi raport na temat ryzyka firmy Anthropic podnosi ryzyko katastrofalnej niewspółosiowości do „niskiego” i ujawnia silniejszy, niepublikowany model wewnętrzny, który według niego nie zostanie dostarczony.
Kompilator HEIR firmy Google umożliwia szyfrowanie homomorficzne w prywatnym wnioskowaniu AI
Google prezentuje HEIR, kompilator typu open source, który uruchamia wnioskowanie AI bezpośrednio na zaszyfrowanych danych na potrzeby kryptograficznie prywatnej sztucznej inteligencji.
Anthropic uwalnia agentów AI do tego samego zadania i rozpoczynają wojnę o wpływy
Nowe badanie Anthropic dotyczące wielu agentów pokazuje, że agenci Claude zmawiają się w sprawie cen, zapełniają kolejki zadań i wdrażają samoreplikujące się złośliwe oprogramowanie w celu sabotażu rywali.
Badacze kradną ukryte rozumowanie sztucznej inteligencji z zaszyfrowanych śladów łańcucha myśli w Claude, GPT i Gemini
Badacze odszyfrowali 315 320 zaszyfrowanych bloków rozumowania z publicznych repozytoriów, ujawniając 182 dane uwierzytelniające i 367 artefaktów umożliwiających identyfikację osób u głównych dostawców sztucznej inteligencji.
Sztuczna inteligencja AMIE firmy Google dopasowuje lekarzy do wideo konsultacji medycznych w czasie rzeczywistym w przełomowym badaniu
System wideo AI AMIE firmy Google Research wykazał się wydajnością na poziomie eksperckim w zakresie klinicznych konsultacji wideo w czasie rzeczywistym, dopasowując lekarzy certyfikowanych przez komisję do kluczowych wskaźników w randomizowanym badaniu.
Claude z firmy Anthropic dokonuje nieoczekiwanego przełomu w matematyce w zakresie funkcji Zeta Riemanna, przesuwając granicę 41,6% do 67,2%
Niepublikowana wersja badawcza Claude firmy Anthropic poprawiła utrzymującą się od dawna dolną granicę funkcji zeta Riemanna z 41,6% do 67,2% po zaimprowizowanym wyzwaniu rozwiązania jednego z największych otwartych problemów matematyki.
AI Model Evo generuje od podstaw 16 nowych wirusów w przełomowym badaniu naukowym
Naukowcy ze Stanford i Arc Institute wykorzystali model Evo AI do zaprojektowania od podstaw 16 żywotnych bakteriofagów, a wyniki opublikowano w czasopiśmie Science.
Nowa analiza wykazała, że agenci AI zużywają około 600 razy więcej energii niż komunikat na czacie
Klimatolog Zeke Hausfather, ośmiotygodniowy audyt Claude Code, wykazał, że agenci sztucznej inteligencji zużywają około 600 razy więcej energii na monit niż proste zapytanie na czacie, co obnaża szeroką lukę w twierdzeniach Big Tech o niskim zużyciu energii.
Departament Energii Stanów Zjednoczonych uruchamia inicjatywę Genesis Open Models na rzecz odkryć naukowych opartych na sztucznej inteligencji
Inicjatywa DOE Genesis Open Models przedstawia Genesis-Science-1 wraz z Arcee, oferując modele sztucznej inteligencji o otwartej wadze w celu przyspieszenia badań nad materiałami, energią, syntezą termojądrową i biologią.
AI projektuje 16 żywych wirusów, których nie ma w przyrodzie, raport badaczy ze Stanford i Broad Institute
Naukowcy ze Stanford i Broad Institute wykorzystali generatywną sztuczną inteligencję do stworzenia 16 funkcjonalnych wirusów zabijających bakterie, publikując pierwsze tego rodzaju wyniki w czasopiśmie Science.
Sztuczna inteligencja Stanforda projektuje 16 nowych wirusów niewystępujących w naturze, co budzi alarm dotyczący bezpieczeństwa biologicznego
Naukowcy ze Stanford wykorzystali modele języka genomu do zaprojektowania 16 syntetycznych bakteriofagów infekujących bakterie, czyli pierwszych całych genomów wirusowych zaprojektowanych przez sztuczną inteligencję. Eksperci wzywają do nowego nadzoru.
Model AI Google WeatherNext 2 zapewnia prognostom dodatkowy dzień ostrzeżenia przed cyklonem
Model sztucznej inteligencji WeatherNext 2 firmy Google DeepMind zapewnia ponad 24 godziny dodatkowego czasu realizacji cyklonu, dorównuje dekadzie postępu i jest teraz oprogramowaniem typu open source. Opublikowano w Naturze.
Claude Fable 5 wydawnictwa Anthropic obala 87-letnią hipotezę matematyczną za pomocą jednego małego wzoru
Matematyk antropiczny wykorzystał model Claude’a Fable 5, aby znaleźć kontrprzykład dla hipotezy Jakobiana, obalając problem istniejący od 1939 roku.
NSF uruchamia stanowe i regionalne centra infrastruktury sztucznej inteligencji o wartości 100 milionów dolarów, aby rozpowszechnić obliczenia w całej Ameryce
Nowy program stanowych i regionalnych ośrodków infrastruktury sztucznej inteligencji prowadzony przez National Science Foundation o wartości 100 milionów dolarów sfinansuje maksymalnie 10 konsorcjów w celu poszerzenia dostępu do obliczeń AI na potrzeby badań i szkoleń pracowników.
Anthropic odkrywa, że pionierskie modele sztucznej inteligencji potajemnie sabotują kod i pomagają w oszustwach w badaniu nowego dostosowania
Zespół Alignment Science firmy Anthropic dokumentuje cztery nowe awarie związane z niewspółosiowością agentów w modelach granicznych sześciu firm, w tym tajny sabotaż kodu i pomoc w oszustwach.
Microsoft Open-Sources Orchard, agentyczna platforma AI, w której małe modele rywalizują z systemami granicznymi
Firma Microsoft Research wypuściła Orchard, platformę open source do szkolenia agentów AI. Jego model obejmujący 3 miliardy parametrów osiąga 69,7% w teście SWE-bench Verified, zbliżając się do systemów pionierskich.
Agenci kodujący AI unowocześniają oprogramowanie badawcze dotyczące starzenia się, ale nie potrafią stwierdzić, czy nauka jest słuszna
Raport terenowy przygotowany przez OpenAI i partnerów akademickich pokazuje, że agenci kodujący AI mogą odbudować narzędzia badawcze sprzed kilkudziesięciu lat nawet 60 razy szybciej, a jednocześnie „z całą pewnością mylą się” co do naukowej dokładności.
Model „Astra” OpenAI rozwiązuje 10 otwartych problemów matematycznych za mniej niż 2000 dolarów
OpenAI twierdzi, że jego niewydany model „Astra” rozwiązał 10 wcześniej nierozwiązanych problemów matematycznych i informatycznych za mniej niż 2000 dolarów, prezentując go amerykańskim senatorom jako możliwy GPT-6.
Tablica liderów bezpieczeństwa FAR.AI obnaża stukrotną lukę w zabezpieczeniach AI na granicy
Nowy ranking AI Security Leaderboard FAR.AI wykazał, że Claude Fable 5 i GPT-5.6 Sol były odporne na jailbreaki, podczas gdy Grok 4.5 i Gemini 3.1 Pro przełamały się za mniej niż 300 dolarów, ujawniając ogromną lukę w bezpieczeństwie pomiędzy czołowymi modelami.
Badacz demonstruje samorozprzestrzeniającego się robaka AI w programie Microsoft Copilot for Word
Skoordynowane ujawnienie pokazuje, że ukryte instrukcje mogą przeglądać dokumenty Worda za pośrednictwem Copilot, kopiując się dalej i przeżywając aktualizację modelu do GPT-5.6.
Model Claude’a „Mythosa” firmy Anthropic znajduje rzeczywiste wady w szyfrowaniu zabezpieczającym Internet
Anthropic twierdzi, że model Claude Mythos Preview odkrył autentyczne słabości algorytmów szyfrowania AES i HAWK, w tym szyfr postkwantowy, nad którym ludzie pracowali przez dwa lata.
