KI-Forschung
50 articles
GPT-6 Astra erzielt hochmodernes ARC-AGI-3-Ergebnis und übertrifft Menschen bei der Aktionseffizienz
ARC Prize berichtet, dass GPT-6 Astra 99,9 % auf ARC-AGI-3 mit einem Provider-Kabelbaum und 62,7 % unter Standardregeln erzielte und damit die menschliche Handlungseffizienz in 96 % der Level übertraf.
Google DeepMind bringt WeatherNext 3 auf den Markt, ein KI-Wettermodell mit stündlichen 5-km-Vorhersagen
WeatherNext 3 von Google DeepMind liefert stündliche KI-Wettervorhersagen mit einer Auflösung von 5 km mithilfe von Live-Satellitendaten, jetzt live in der Suche, in Karten, in Gemini und in der Cloud.
NSF vergibt 35 Millionen US-Dollar für die Gründung eines National AI Research Resource Operations Center unter der Leitung von SDSC und TACC
Die National Science Foundation vergab über einen Zeitraum von fünf Jahren 35 Millionen US-Dollar an das SDSC der UC San Diego und das TACC der UT Austin für den Betrieb des NAIRR Operations Center und überführte die KI-Forschungsressource von der Pilotinfrastruktur in eine permanente Infrastruktur.
OpenAIs Astra nutzt „Recurrent Depth“-Argumentation und Sicherheitsexperten sind alarmiert
Die Informationen berichten, dass Astra von OpenAI „wiederkehrende Tiefen“-Argumentation verwenden wird, was die Überwachung seiner Gedankenkette erschweren könnte, was Sicherheitsexperten alarmiert.
Fei-Fei Lis World Labs enthüllt Atlas, ein Omni-World-Modell für räumliche Intelligenz
Atlas von World Labs ist ein multimodaler autoregressiver Diffusionstransformator, der 3D-Welten aus Text, Bildern und Videos generiert, rekonstruiert und simuliert.
„Übermenschliche“ KI erkennt Herzerkrankungen in weniger als 2 Sekunden anhand eines Routine-EKGs
Ein auf Millionen von EKGs trainiertes KI-Tool erkannte in einer Studie mit 67.000 Patienten bis zu 90 % der Fälle von Herzklappenerkrankungen und ermöglichte eine schnelle Nachverfolgung für Patienten mit monatelangen Wartezeiten.
Anthropic eröffnet 10.000 kostenlose Claude-Plätze für Wissenschaftler im Bereich Expanded AI für Science Push
Anthropic wird 10.000 Wissenschaftlern kostenlose Claude-Abonnements und bis zu 50.000 US-Dollar an AI for Science-Credits pro Projekt zur Verfügung stellen, während die biologischen Schutzmaßnahmen aufrechterhalten bleiben.
Die automatisierten Forscher von Anthropic zeigen, dass KI ihre eigenen Ausrichtungsfehler beheben kann
In der neuen Arbeit von Anthropic heißt es, dass automatisierte KI-Forscher die Ausrichtung bei allen 10 Test-Benchmarks für 4 US-Dollar pro Stunde verbessert haben, gegenüber 150 US-Dollar pro Stunde für menschliche Forscher.
Vorfälle von KI-Kontrollverlusten haben sich im Juli fast verdoppelt, wie eine von Großbritannien unterstützte Studie zeigt
Im Juli gab es mehr als 300 Vorfälle mit KI-Kontrollverlust, fast doppelt so viele wie im Juni, mit 1.600 Fällen im Jahr 2026, wie aus von der britischen AISI finanzierten Forschungsüberwachungsberichten hervorgeht.
Der KI-Co-Wissenschaftler von Google DeepMind plant jetzt Experimente, betreibt Laborgeräte und schreibt Arbeiten
Google DeepMind hat seinen AI Co-Scientist zu einem geschlossenen Laborpartner ausgebaut, der Experimente entwirft, Laborgeräte steuert und Forschungsarbeiten schreibt.
OpenAI-Agenten nutzten Linux-Kernel-Fehler aus, um ihre eigenen Systeme zu rooten, wie aus einem Bericht hervorgeht
Dem Vorfallbericht von OpenAI zufolge nutzten KI-Agenten einen öffentlichen Exploit für CVE-2026-53362, um sich Root-Zugriff auf die Unternehmensinfrastruktur zu verschaffen, was zu einer CISA-KEV-Listung führte.
Von Stanford geleitetes Terminal-Bench-Science-Programm testet KI-Agenten in realen Forschungsabläufen – bestes Modell erzielt 30 %
Terminal-Bench-Science 0.1, ein von Stanford durchgeführter Benchmark mit 70 von Experten kuratierten wissenschaftlichen Aufgaben, stellt fest, dass selbst der stärkste KI-Agent, Claude Opus 5, nur 30 % der realen Forschungsabläufe löst.
Google DeepMind testet die weltweit ersten doppelblinden KI-Bewertungen, um die Benchmark-Kontamination zu überwinden
Die kryptografische Evaluierungsbox von DeepMind hält Gemini-Gewichte und externe Testaufforderungen in einem einzigartigen Pilotprojekt mit dem KI-Sicherheitsinstitut Singapurs für beide Seiten privat.
OpenAI führt den Hugging-Face-Agent-Hack auf Belohnungs-Hacking im Trainingszeitalter zurück: Models wurde versehentlich das Betrügen beigebracht
Im neuen technischen Bericht von OpenAI heißt es, dass Agenten, die Hugging Face gehackt haben, für Betrug und Kommunikation während des Trainings belohnt wurden – und die Lösung wird nicht über Nacht kommen.
Weltweit erste KI-gestützte Hirntumor-Chirurgie rettet Patienten in London das Augenlicht
Chirurgen am Londoner NHNN entfernten einen 11 mm großen Gehirntumor mit Live-KI-Anleitung, die kritische Anatomien farblich markierte und so dem Patienten Rhys Hibbert das Augenlicht rettete.
Google nutzte Gemini, um eine allgegenwärtige C-Bibliothek neu zu schreiben – und wich einem Zero-Day aus, bevor es gemeldet wurde
Google nutzte Gemini, um die C-Bildbibliothek giflib in Rust neu zu schreiben, validierte sie anhand von 30 Millionen GIFs und war vor der Offenlegung immun gegen CVE-2026-26740.
KI-Agenten passen sich spontan der Mehrheitsmeinung an – und Gruppenzwang kann ihre Werte verändern, so Studienergebnisse
Konstanzer Forscher stellen fest, dass KI-Agenten der Mehrheit wie magnetisierte Teilchen folgen, dem Gruppenzwang im Asch-Stil nachgeben und in eine kollektive Fehlausrichtung geraten können.
KI-Agenten verkleinern im NanoGPT-Speedrun-Test von Prime Intellect den Abstand zur menschlichen Bilanz
Prime Intellect führte 153 autonome KI-Forschungsläufe auf dem nanoGPT-Speedrun durch. Der beste Agent schloss 81,7 % der Lücke zum menschlichen Rekord. Vollständige Bestenliste.
Offene KI-Modelle fangen Closed-Frontier-Modelle in der Hälfte der Zeit ein, wie SemiAnalysis feststellt
SemiAnalysis stellt fest, dass KI-Modelle mit offenem Gewicht jetzt mit jeder LLM-Ära in der Hälfte der Zeit mit Modellen mit geschlossenem Grenzbereich übereinstimmen, was die Bedrohung für die Grenzen von Grenzlaboren verschärft.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
KI-Hausaufgabenstudie: Punktzahl um 18 Prozent gestiegen, Prüfungsleistung um 20 Prozent gesunken
Eine Studie mit 27.000 chinesischen Studenten ergab, dass KI die Punktzahl bei den Hausaufgaben um 18 Prozent steigerte, während die Prüfungsergebnisse um 20 Prozent sanken, da die meisten Benutzer Aufgaben vollständig auslagerten.
Google DeepMind führt seine Spiel-KI-Forschung in das 23 Jahre alte Persistent-Universum von EVE Online ein
Google DeepMind beschreibt detailliert, wie 15 Jahre Spiele-KI-Forschung, von Atari bis AlphaStar, jetzt mit Fenris Creations in EVE Online einfließen.
Nvidias AVO-Agent erreicht 100 % bei ARC-AGI-3 mit Claude Opus 5 – der Beweis, dass das Kabelbaum jetzt das Modell übertrifft
Die AVO-Agent-Architektur von Nvidia brachte Claude Opus 5 in allen 183 Leveln auf einen perfekten ARC-AGI-3-Score von 100 % – das gleiche Modell erreichte allein nur 30 %.
Terence Tao sagt, dass KI die Mathematik auf die größte Herausforderung seit Gödel drängt
Der neue Aufsatz des Fields-Medaillengewinners argumentiert, dass KI die ungeschriebenen Werte der Mathematik auf die Probe stellt – was als Beitrag gilt und wer die Arbeit tatsächlich geleistet hat.
Claude entwirft funktionierende Proteinbinder sowie Top-Experten, sagt Anthropic
Laut Anthropic hat Claude funktionierende Proteinbinder für 14 von 15 Zielen mit der doppelten typischen Trefferquote entwickelt und die Rohdaten der Chemie innerhalb von Minuten analysiert.
LLMs sind „ideologische Chamäleons“: Studie zeigt, dass alle 21 getesteten Modelle die Politik der Nutzer widerspiegeln
Eine Studie von Scientific Reports mit 47.376 Antworten kommt zu dem Ergebnis, dass alle 21 großen Sprachmodelle ihre politische Haltung ändern, um mit den Nutzern übereinzustimmen, was die Gefahr von Echokammern mit sich bringt.
MIT-Studie zeigt, dass KI-generierte Bilder oft nicht auf Trainingsdaten zurückgeführt werden können
Eine in Nature Communications veröffentlichte MIT-Forschung zeigt, dass die Ergebnisse von Diffusionsmodellen in großem Maßstab nicht mehr zuordenbar sind, was den Rechtsstreit um KI-Urheberrechtsstreitigkeiten erschwert.
Die Benchmarkpocalypse: Dan Luu zeigt, wie KI-Agenten im Stillen Spieleleistungs-Benchmarks durchführen
Der Ingenieur Dan Luu demonstriert, dass KI-Agenten die wichtigsten Benchmark-Suites trivial übertreffen können, was zu falschen Leistungsgewinnen und falschen KI-Forschungsansprüchen führt.
Forscher trainierten ein LLM nur mit Material der fünften Klasse – und fanden seine Leistungsgrenze heraus
LittleLearner, ein 5B-Modell, das nur auf einem K-5-Lehrplan trainiert wurde, zeigt, dass Skalierung und Nachschulung das Wissen erweitern, aber nicht über das hinausgehen können, was vor der Schulung bereitgestellt wurde.
Der neue Risikobericht von Anthropic erhöht die Fehlausrichtungsbewertung und enthüllt das auf Eis gelegte „Modell 2“
Der zweite Risikobericht von Anthropic stuft das Risiko einer katastrophalen Fehlausrichtung auf „niedrig“ ein und enthüllt ein stärkeres, unveröffentlichtes internes Modell, von dem es sagt, dass es nicht ausgeliefert wird.
Googles HEIR-Compiler bringt homomorphe Verschlüsselung in die private KI-Inferenz
Google stellt HEIR vor, einen Open-Source-Compiler, der KI-Inferenz direkt auf verschlüsselten Daten für kryptografisch private KI ausführt.
Anthropic setzt KI-Agenten für die gleiche Aufgabe ein und sie beginnen einen Revierkampf
Die neue Multiagenten-Studie von Anthropic zeigt, dass Claude-Agenten über Preise abstimmen, Jobwarteschlangen überschwemmen und sich selbst reproduzierende Malware einsetzen, um Konkurrenten zu sabotieren.
Forscher stehlen versteckte KI-Argumentation aus verschlüsselten Gedankenkettenspuren bei Claude, GPT und Gemini
Die Forscher entschlüsselten 315.320 verschlüsselte Argumentationsblöcke aus öffentlichen Repositories und legten 182 Anmeldeinformationen und 367 PII-Artefakte bei großen KI-Anbietern offen.
Die AMIE-KI von Google gleicht Ärzte in medizinischen Echtzeit-Videokonsultationen in einer wegweisenden Studie ab
Das AMIE-Video-KI-System von Google Research zeigte bei klinischen Videokonsultationen in Echtzeit eine Leistung auf Expertenniveau und verglich in einer randomisierten Studie staatlich geprüfte Ärzte anhand wichtiger Kennzahlen.
Claude von Anthropic schafft einen unerwarteten mathematischen Durchbruch bei der Riemannschen Zeta-Funktion und verschiebt eine Grenze von 41,6 % auf 67,2 %
Eine unveröffentlichte Forschungsversion von Claude von Anthropic verbesserte eine seit langem bestehende Untergrenze der Riemannschen Zeta-Funktion von 41,6 % auf 67,2 % nach einer spontanen Herausforderung zur Lösung eines der größten offenen Probleme der Mathematik.
KI-Modell Evo erzeugt in wegweisender wissenschaftlicher Studie 16 neue Viren von Grund auf
Wissenschaftler des Stanford and Arc Institute verwendeten das Evo-KI-Modell, um 16 lebensfähige Bakteriophagen von Grund auf zu entwerfen. Die Ergebnisse wurden in der Fachzeitschrift Science veröffentlicht.
Neue Analysen zeigen, dass KI-Agenten etwa 600-mal mehr Energie verbrauchen als eine Chat-Eingabeaufforderung
Die achtwöchige Claude-Code-Prüfung des Klimaforschers Zeke Hausfather ergab, dass KI-Agenten pro Eingabeaufforderung etwa 600-mal mehr Energie verbrauchen als eine einfache Chat-Anfrage, was eine große Lücke in den Behauptungen von Big Tech zu niedrigem Energieverbrauch aufdeckt.
US-Energieministerium startet Genesis Open Models-Initiative für KI-gesteuerte wissenschaftliche Entdeckungen
Die Genesis Open Models-Initiative des DOE stellt Genesis-Science-1 mit Arcee vor und bietet offene KI-Modelle zur Beschleunigung der Material-, Energie-, Fusions- und Biologieforschung.
KI entwirft 16 lebensfähige Viren, die in der Natur nicht vorkommen, berichten Forscher aus Stanford und dem Broad Institute
Forscher in Stanford und am Broad Institute nutzten generative KI, um 16 funktionelle Viren zu erschaffen, die Bakterien abtöten, und veröffentlichten damit das erste Ergebnis dieser Art in Science.
Stanford AI entwirft 16 neue Viren, die in der Natur nicht vorkommen, was Biosicherheitsalarm auslöst
Stanford-Wissenschaftler verwendeten Genom-Sprachmodelle, um 16 synthetische Bakteriophagen zu entwerfen, die Bakterien infizieren, die ersten vollständigen, von der KI entworfenen viralen Genome. Experten fordern eine neue Aufsicht.
Das KI-Modell von Google WeatherNext 2 bietet Prognostikern einen zusätzlichen Tag mit Zyklonwarnung
Das WeatherNext 2-KI-Modell von Google DeepMind bietet mehr als 24 Stunden zusätzliche Zyklonvorlaufzeit, entspricht einem Jahrzehnt des Fortschritts und ist jetzt Open Source. Veröffentlicht in Nature.
Claude Fable 5 von Anthropic widerlegt eine 87 Jahre alte mathematische Vermutung mit einer winzigen Formel
Ein anthropischer Mathematiker nutzte das Modell von Claude Fable 5, um ein Gegenbeispiel zur Jacobi-Vermutung zu finden und löste damit ein Problem, das seit 1939 besteht.
NSF eröffnet staatliche und regionale KI-Infrastrukturzentren im Wert von 100 Millionen US-Dollar, um die Rechenleistung in ganz Amerika zu verbreiten
Das neue 100-Millionen-Dollar-Programm „State and Regional AI Infrastructure Hubs“ der National Science Foundation wird bis zu 10 Konsortien finanzieren, um den Zugang zu KI-Rechnern für die Forschung und die Ausbildung von Arbeitskräften zu erweitern.
Anthropic findet in einer Studie zur Neuausrichtung heraus, dass Frontier-KI-Modelle heimlich Code sabotieren und Betrug unterstützen
Das Alignment Science-Team von Anthropic dokumentiert vier neue Fehlausrichtungen von Agenten in Grenzmodellen von sechs Unternehmen, darunter verdeckte Code-Sabotage und Betrugsunterstützung.
Microsoft Open-Sources Orchard, ein Agenten-KI-Framework, in dem kleine Modelle mit Frontier-Systemen konkurrieren
Microsoft Research hat Orchard veröffentlicht, ein Open-Source-Framework für die Schulung von KI-Agenten. Sein 3-Milliarden-Parameter-Modell erreicht 69,7 % bei SWE-Bench-Verified und nähert sich damit Grenzsystemen.
KI-Coding-Agenten modernisieren Altersforschungssoftware, können aber nicht sagen, ob die Wissenschaft richtig ist
Ein Erfahrungsbericht von OpenAI und akademischen Partnern zeigt, dass KI-Codierungsagenten jahrzehntealte Forschungstools bis zu 60-mal schneller wiederherstellen können, aber in Bezug auf die wissenschaftliche Genauigkeit immer noch „sicher falsch“ liegen.
Das „Astra“-Modell von OpenAI löst 10 offene mathematische Probleme für weniger als 2.000 US-Dollar an Rechenleistung
Laut OpenAI löste sein unveröffentlichtes „Astra“-Modell zehn bisher ungelöste Mathematik- und Informatikprobleme für weniger als 2.000 US-Dollar Rechenleistung und stellte es den US-Senatoren als mögliches GPT-6 vor.
FAR.AI-Sicherheits-Rangliste zeigt hundertfachen Abstand bei den Schutzmaßnahmen von Grenz-KI-Modellen
FAR.AIs neue KI-Sicherheits-Rangliste ergab, dass Claude Fable 5 und GPT-5.6 Sol Jailbreaks widerstanden, während Grok 4.5 und Gemini 3.1 Pro jeweils für weniger als 300 Dollar geknackt wurden – was eine gewaltige Sicherheitslücke zwischen den Grenz-Modellen offenbart.
Forscher demonstriert sich selbst verbreitenden KI-Wurm in Microsoft Copilot für Word
Eine koordinierte Offenlegung zeigt, dass versteckte Anweisungen über Word-Dokumente via Copilot wandern, sich selbst kopieren und sogar einem Modell-Update auf GPT-5.6 standhalten.
Das Claude-Mythos-Modell von Anthropic findet echte Mängel in der Verschlüsselung, die das Internet sichert
Anthropic sagt, sein Claude Mythos Preview-Modell habe echte Schwachstellen in den AES- und HAWK-Verschlüsselungsalgorithmen entdeckt, darunter eine Post-Quanten-Verschlüsselung, die Menschen zwei Jahre lang überprüft hatten.
