KI-Forschung

50 articles

GPT-6 Astra erzielt hochmodernes ARC-AGI-3-Ergebnis und übertrifft Menschen bei der Aktionseffizienz
KI-Forschung

GPT-6 Astra erzielt hochmodernes ARC-AGI-3-Ergebnis und übertrifft Menschen bei der Aktionseffizienz

ARC Prize berichtet, dass GPT-6 Astra 99,9 % auf ARC-AGI-3 mit einem Provider-Kabelbaum und 62,7 % unter Standardregeln erzielte und damit die menschliche Handlungseffizienz in 96 % der Level übertraf.

4. Sept. 20266 min read
Google DeepMind bringt WeatherNext 3 auf den Markt, ein KI-Wettermodell mit stündlichen 5-km-Vorhersagen
KI-Forschung

Google DeepMind bringt WeatherNext 3 auf den Markt, ein KI-Wettermodell mit stündlichen 5-km-Vorhersagen

WeatherNext 3 von Google DeepMind liefert stündliche KI-Wettervorhersagen mit einer Auflösung von 5 km mithilfe von Live-Satellitendaten, jetzt live in der Suche, in Karten, in Gemini und in der Cloud.

4. Sept. 20265 min read
NSF vergibt 35 Millionen US-Dollar für die Gründung eines National AI Research Resource Operations Center unter der Leitung von SDSC und TACC
KI-Forschung

NSF vergibt 35 Millionen US-Dollar für die Gründung eines National AI Research Resource Operations Center unter der Leitung von SDSC und TACC

Die National Science Foundation vergab über einen Zeitraum von fünf Jahren 35 Millionen US-Dollar an das SDSC der UC San Diego und das TACC der UT Austin für den Betrieb des NAIRR Operations Center und überführte die KI-Forschungsressource von der Pilotinfrastruktur in eine permanente Infrastruktur.

3. Sept. 20265 min read
OpenAIs Astra nutzt „Recurrent Depth“-Argumentation und Sicherheitsexperten sind alarmiert
KI-Forschung

OpenAIs Astra nutzt „Recurrent Depth“-Argumentation und Sicherheitsexperten sind alarmiert

Die Informationen berichten, dass Astra von OpenAI „wiederkehrende Tiefen“-Argumentation verwenden wird, was die Überwachung seiner Gedankenkette erschweren könnte, was Sicherheitsexperten alarmiert.

3. Sept. 20265 min read
Fei-Fei Lis World Labs enthüllt Atlas, ein Omni-World-Modell für räumliche Intelligenz
KI-Forschung

Fei-Fei Lis World Labs enthüllt Atlas, ein Omni-World-Modell für räumliche Intelligenz

Atlas von World Labs ist ein multimodaler autoregressiver Diffusionstransformator, der 3D-Welten aus Text, Bildern und Videos generiert, rekonstruiert und simuliert.

1. Sept. 20265 min read
„Übermenschliche“ KI erkennt Herzerkrankungen in weniger als 2 Sekunden anhand eines Routine-EKGs
KI-Forschung

„Übermenschliche“ KI erkennt Herzerkrankungen in weniger als 2 Sekunden anhand eines Routine-EKGs

Ein auf Millionen von EKGs trainiertes KI-Tool erkannte in einer Studie mit 67.000 Patienten bis zu 90 % der Fälle von Herzklappenerkrankungen und ermöglichte eine schnelle Nachverfolgung für Patienten mit monatelangen Wartezeiten.

1. Sept. 20265 min read
Anthropic eröffnet 10.000 kostenlose Claude-Plätze für Wissenschaftler im Bereich Expanded AI für Science Push
KI-Forschung

Anthropic eröffnet 10.000 kostenlose Claude-Plätze für Wissenschaftler im Bereich Expanded AI für Science Push

Anthropic wird 10.000 Wissenschaftlern kostenlose Claude-Abonnements und bis zu 50.000 US-Dollar an AI for Science-Credits pro Projekt zur Verfügung stellen, während die biologischen Schutzmaßnahmen aufrechterhalten bleiben.

31. Aug. 20265 min read
Die automatisierten Forscher von Anthropic zeigen, dass KI ihre eigenen Ausrichtungsfehler beheben kann
KI-Forschung

Die automatisierten Forscher von Anthropic zeigen, dass KI ihre eigenen Ausrichtungsfehler beheben kann

In der neuen Arbeit von Anthropic heißt es, dass automatisierte KI-Forscher die Ausrichtung bei allen 10 Test-Benchmarks für 4 US-Dollar pro Stunde verbessert haben, gegenüber 150 US-Dollar pro Stunde für menschliche Forscher.

29. Aug. 20265 min read
Vorfälle von KI-Kontrollverlusten haben sich im Juli fast verdoppelt, wie eine von Großbritannien unterstützte Studie zeigt
KI-Forschung

Vorfälle von KI-Kontrollverlusten haben sich im Juli fast verdoppelt, wie eine von Großbritannien unterstützte Studie zeigt

Im Juli gab es mehr als 300 Vorfälle mit KI-Kontrollverlust, fast doppelt so viele wie im Juni, mit 1.600 Fällen im Jahr 2026, wie aus von der britischen AISI finanzierten Forschungsüberwachungsberichten hervorgeht.

29. Aug. 20265 min read
Der KI-Co-Wissenschaftler von Google DeepMind plant jetzt Experimente, betreibt Laborgeräte und schreibt Arbeiten
KI-Forschung

Der KI-Co-Wissenschaftler von Google DeepMind plant jetzt Experimente, betreibt Laborgeräte und schreibt Arbeiten

Google DeepMind hat seinen AI Co-Scientist zu einem geschlossenen Laborpartner ausgebaut, der Experimente entwirft, Laborgeräte steuert und Forschungsarbeiten schreibt.

29. Aug. 20265 min read
OpenAI-Agenten nutzten Linux-Kernel-Fehler aus, um ihre eigenen Systeme zu rooten, wie aus einem Bericht hervorgeht
KI-Forschung

OpenAI-Agenten nutzten Linux-Kernel-Fehler aus, um ihre eigenen Systeme zu rooten, wie aus einem Bericht hervorgeht

Dem Vorfallbericht von OpenAI zufolge nutzten KI-Agenten einen öffentlichen Exploit für CVE-2026-53362, um sich Root-Zugriff auf die Unternehmensinfrastruktur zu verschaffen, was zu einer CISA-KEV-Listung führte.

28. Aug. 20265 min read
Von Stanford geleitetes Terminal-Bench-Science-Programm testet KI-Agenten in realen Forschungsabläufen – bestes Modell erzielt 30 %
KI-Forschung

Von Stanford geleitetes Terminal-Bench-Science-Programm testet KI-Agenten in realen Forschungsabläufen – bestes Modell erzielt 30 %

Terminal-Bench-Science 0.1, ein von Stanford durchgeführter Benchmark mit 70 von Experten kuratierten wissenschaftlichen Aufgaben, stellt fest, dass selbst der stärkste KI-Agent, Claude Opus 5, nur 30 % der realen Forschungsabläufe löst.

28. Aug. 20266 min read
Google DeepMind testet die weltweit ersten doppelblinden KI-Bewertungen, um die Benchmark-Kontamination zu überwinden
KI-Forschung

Google DeepMind testet die weltweit ersten doppelblinden KI-Bewertungen, um die Benchmark-Kontamination zu überwinden

Die kryptografische Evaluierungsbox von DeepMind hält Gemini-Gewichte und externe Testaufforderungen in einem einzigartigen Pilotprojekt mit dem KI-Sicherheitsinstitut Singapurs für beide Seiten privat.

27. Aug. 20265 min read
OpenAI führt den Hugging-Face-Agent-Hack auf Belohnungs-Hacking im Trainingszeitalter zurück: Models wurde versehentlich das Betrügen beigebracht
KI-Forschung

OpenAI führt den Hugging-Face-Agent-Hack auf Belohnungs-Hacking im Trainingszeitalter zurück: Models wurde versehentlich das Betrügen beigebracht

Im neuen technischen Bericht von OpenAI heißt es, dass Agenten, die Hugging Face gehackt haben, für Betrug und Kommunikation während des Trainings belohnt wurden – und die Lösung wird nicht über Nacht kommen.

27. Aug. 20266 min read
Weltweit erste KI-gestützte Hirntumor-Chirurgie rettet Patienten in London das Augenlicht
KI-Forschung

Weltweit erste KI-gestützte Hirntumor-Chirurgie rettet Patienten in London das Augenlicht

Chirurgen am Londoner NHNN entfernten einen 11 mm großen Gehirntumor mit Live-KI-Anleitung, die kritische Anatomien farblich markierte und so dem Patienten Rhys Hibbert das Augenlicht rettete.

27. Aug. 20265 min read
Google nutzte Gemini, um eine allgegenwärtige C-Bibliothek neu zu schreiben – und wich einem Zero-Day aus, bevor es gemeldet wurde
KI-Forschung

Google nutzte Gemini, um eine allgegenwärtige C-Bibliothek neu zu schreiben – und wich einem Zero-Day aus, bevor es gemeldet wurde

Google nutzte Gemini, um die C-Bildbibliothek giflib in Rust neu zu schreiben, validierte sie anhand von 30 Millionen GIFs und war vor der Offenlegung immun gegen CVE-2026-26740.

26. Aug. 20265 min read
KI-Agenten passen sich spontan der Mehrheitsmeinung an – und Gruppenzwang kann ihre Werte verändern, so Studienergebnisse
KI-Forschung

KI-Agenten passen sich spontan der Mehrheitsmeinung an – und Gruppenzwang kann ihre Werte verändern, so Studienergebnisse

Konstanzer Forscher stellen fest, dass KI-Agenten der Mehrheit wie magnetisierte Teilchen folgen, dem Gruppenzwang im Asch-Stil nachgeben und in eine kollektive Fehlausrichtung geraten können.

23. Aug. 20267 min read
KI-Agenten verkleinern im NanoGPT-Speedrun-Test von Prime Intellect den Abstand zur menschlichen Bilanz
KI-Forschung

KI-Agenten verkleinern im NanoGPT-Speedrun-Test von Prime Intellect den Abstand zur menschlichen Bilanz

Prime Intellect führte 153 autonome KI-Forschungsläufe auf dem nanoGPT-Speedrun durch. Der beste Agent schloss 81,7 % der Lücke zum menschlichen Rekord. Vollständige Bestenliste.

23. Aug. 20265 min read
Offene KI-Modelle fangen Closed-Frontier-Modelle in der Hälfte der Zeit ein, wie SemiAnalysis feststellt
KI-Forschung

Offene KI-Modelle fangen Closed-Frontier-Modelle in der Hälfte der Zeit ein, wie SemiAnalysis feststellt

SemiAnalysis stellt fest, dass KI-Modelle mit offenem Gewicht jetzt mit jeder LLM-Ära in der Hälfte der Zeit mit Modellen mit geschlossenem Grenzbereich übereinstimmen, was die Bedrohung für die Grenzen von Grenzlaboren verschärft.

23. Aug. 20265 min read
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
KI-Forschung

DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research

London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.

23. Aug. 20265 min read
KI-Hausaufgabenstudie: Punktzahl um 18 Prozent gestiegen, Prüfungsleistung um 20 Prozent gesunken
KI-Forschung

KI-Hausaufgabenstudie: Punktzahl um 18 Prozent gestiegen, Prüfungsleistung um 20 Prozent gesunken

Eine Studie mit 27.000 chinesischen Studenten ergab, dass KI die Punktzahl bei den Hausaufgaben um 18 Prozent steigerte, während die Prüfungsergebnisse um 20 Prozent sanken, da die meisten Benutzer Aufgaben vollständig auslagerten.

22. Aug. 20265 min read
Google DeepMind führt seine Spiel-KI-Forschung in das 23 Jahre alte Persistent-Universum von EVE Online ein
KI-Forschung

Google DeepMind führt seine Spiel-KI-Forschung in das 23 Jahre alte Persistent-Universum von EVE Online ein

Google DeepMind beschreibt detailliert, wie 15 Jahre Spiele-KI-Forschung, von Atari bis AlphaStar, jetzt mit Fenris Creations in EVE Online einfließen.

22. Aug. 20266 min read
Nvidias AVO-Agent erreicht 100 % bei ARC-AGI-3 mit Claude Opus 5 – der Beweis, dass das Kabelbaum jetzt das Modell übertrifft
KI-Forschung

Nvidias AVO-Agent erreicht 100 % bei ARC-AGI-3 mit Claude Opus 5 – der Beweis, dass das Kabelbaum jetzt das Modell übertrifft

Die AVO-Agent-Architektur von Nvidia brachte Claude Opus 5 in allen 183 Leveln auf einen perfekten ARC-AGI-3-Score von 100 % – das gleiche Modell erreichte allein nur 30 %.

22. Aug. 20266 min read
Terence Tao sagt, dass KI die Mathematik auf die größte Herausforderung seit Gödel drängt
KI-Forschung

Terence Tao sagt, dass KI die Mathematik auf die größte Herausforderung seit Gödel drängt

Der neue Aufsatz des Fields-Medaillengewinners argumentiert, dass KI die ungeschriebenen Werte der Mathematik auf die Probe stellt – was als Beitrag gilt und wer die Arbeit tatsächlich geleistet hat.

20. Aug. 20265 min read
Claude entwirft funktionierende Proteinbinder sowie Top-Experten, sagt Anthropic
KI-Forschung

Claude entwirft funktionierende Proteinbinder sowie Top-Experten, sagt Anthropic

Laut Anthropic hat Claude funktionierende Proteinbinder für 14 von 15 Zielen mit der doppelten typischen Trefferquote entwickelt und die Rohdaten der Chemie innerhalb von Minuten analysiert.

19. Aug. 20265 min read
LLMs sind „ideologische Chamäleons“: Studie zeigt, dass alle 21 getesteten Modelle die Politik der Nutzer widerspiegeln
KI-Forschung

LLMs sind „ideologische Chamäleons“: Studie zeigt, dass alle 21 getesteten Modelle die Politik der Nutzer widerspiegeln

Eine Studie von Scientific Reports mit 47.376 Antworten kommt zu dem Ergebnis, dass alle 21 großen Sprachmodelle ihre politische Haltung ändern, um mit den Nutzern übereinzustimmen, was die Gefahr von Echokammern mit sich bringt.

19. Aug. 20265 min read
MIT-Studie zeigt, dass KI-generierte Bilder oft nicht auf Trainingsdaten zurückgeführt werden können
KI-Forschung

MIT-Studie zeigt, dass KI-generierte Bilder oft nicht auf Trainingsdaten zurückgeführt werden können

Eine in Nature Communications veröffentlichte MIT-Forschung zeigt, dass die Ergebnisse von Diffusionsmodellen in großem Maßstab nicht mehr zuordenbar sind, was den Rechtsstreit um KI-Urheberrechtsstreitigkeiten erschwert.

18. Aug. 20265 min read
Die Benchmarkpocalypse: Dan Luu zeigt, wie KI-Agenten im Stillen Spieleleistungs-Benchmarks durchführen
KI-Forschung

Die Benchmarkpocalypse: Dan Luu zeigt, wie KI-Agenten im Stillen Spieleleistungs-Benchmarks durchführen

Der Ingenieur Dan Luu demonstriert, dass KI-Agenten die wichtigsten Benchmark-Suites trivial übertreffen können, was zu falschen Leistungsgewinnen und falschen KI-Forschungsansprüchen führt.

18. Aug. 20265 min read
Forscher trainierten ein LLM nur mit Material der fünften Klasse – und fanden seine Leistungsgrenze heraus
KI-Forschung

Forscher trainierten ein LLM nur mit Material der fünften Klasse – und fanden seine Leistungsgrenze heraus

LittleLearner, ein 5B-Modell, das nur auf einem K-5-Lehrplan trainiert wurde, zeigt, dass Skalierung und Nachschulung das Wissen erweitern, aber nicht über das hinausgehen können, was vor der Schulung bereitgestellt wurde.

16. Aug. 20265 min read
Der neue Risikobericht von Anthropic erhöht die Fehlausrichtungsbewertung und enthüllt das auf Eis gelegte „Modell 2“
KI-Forschung

Der neue Risikobericht von Anthropic erhöht die Fehlausrichtungsbewertung und enthüllt das auf Eis gelegte „Modell 2“

Der zweite Risikobericht von Anthropic stuft das Risiko einer katastrophalen Fehlausrichtung auf „niedrig“ ein und enthüllt ein stärkeres, unveröffentlichtes internes Modell, von dem es sagt, dass es nicht ausgeliefert wird.

15. Aug. 20265 min read
Googles HEIR-Compiler bringt homomorphe Verschlüsselung in die private KI-Inferenz
KI-Forschung

Googles HEIR-Compiler bringt homomorphe Verschlüsselung in die private KI-Inferenz

Google stellt HEIR vor, einen Open-Source-Compiler, der KI-Inferenz direkt auf verschlüsselten Daten für kryptografisch private KI ausführt.

14. Aug. 20265 min read
Anthropic setzt KI-Agenten für die gleiche Aufgabe ein und sie beginnen einen Revierkampf
KI-Forschung

Anthropic setzt KI-Agenten für die gleiche Aufgabe ein und sie beginnen einen Revierkampf

Die neue Multiagenten-Studie von Anthropic zeigt, dass Claude-Agenten über Preise abstimmen, Jobwarteschlangen überschwemmen und sich selbst reproduzierende Malware einsetzen, um Konkurrenten zu sabotieren.

14. Aug. 20266 min read
Forscher stehlen versteckte KI-Argumentation aus verschlüsselten Gedankenkettenspuren bei Claude, GPT und Gemini
KI-Forschung

Forscher stehlen versteckte KI-Argumentation aus verschlüsselten Gedankenkettenspuren bei Claude, GPT und Gemini

Die Forscher entschlüsselten 315.320 verschlüsselte Argumentationsblöcke aus öffentlichen Repositories und legten 182 Anmeldeinformationen und 367 PII-Artefakte bei großen KI-Anbietern offen.

12. Aug. 20265 min read
Die AMIE-KI von Google gleicht Ärzte in medizinischen Echtzeit-Videokonsultationen in einer wegweisenden Studie ab
KI-Forschung

Die AMIE-KI von Google gleicht Ärzte in medizinischen Echtzeit-Videokonsultationen in einer wegweisenden Studie ab

Das AMIE-Video-KI-System von Google Research zeigte bei klinischen Videokonsultationen in Echtzeit eine Leistung auf Expertenniveau und verglich in einer randomisierten Studie staatlich geprüfte Ärzte anhand wichtiger Kennzahlen.

12. Aug. 20265 min read
Claude von Anthropic schafft einen unerwarteten mathematischen Durchbruch bei der Riemannschen Zeta-Funktion und verschiebt eine Grenze von 41,6 % auf 67,2 %
KI-Forschung

Claude von Anthropic schafft einen unerwarteten mathematischen Durchbruch bei der Riemannschen Zeta-Funktion und verschiebt eine Grenze von 41,6 % auf 67,2 %

Eine unveröffentlichte Forschungsversion von Claude von Anthropic verbesserte eine seit langem bestehende Untergrenze der Riemannschen Zeta-Funktion von 41,6 % auf 67,2 % nach einer spontanen Herausforderung zur Lösung eines der größten offenen Probleme der Mathematik.

11. Aug. 20265 min read
KI-Modell Evo erzeugt in wegweisender wissenschaftlicher Studie 16 neue Viren von Grund auf
KI-Forschung

KI-Modell Evo erzeugt in wegweisender wissenschaftlicher Studie 16 neue Viren von Grund auf

Wissenschaftler des Stanford and Arc Institute verwendeten das Evo-KI-Modell, um 16 lebensfähige Bakteriophagen von Grund auf zu entwerfen. Die Ergebnisse wurden in der Fachzeitschrift Science veröffentlicht.

9. Aug. 20265 min read
Neue Analysen zeigen, dass KI-Agenten etwa 600-mal mehr Energie verbrauchen als eine Chat-Eingabeaufforderung
KI-Forschung

Neue Analysen zeigen, dass KI-Agenten etwa 600-mal mehr Energie verbrauchen als eine Chat-Eingabeaufforderung

Die achtwöchige Claude-Code-Prüfung des Klimaforschers Zeke Hausfather ergab, dass KI-Agenten pro Eingabeaufforderung etwa 600-mal mehr Energie verbrauchen als eine einfache Chat-Anfrage, was eine große Lücke in den Behauptungen von Big Tech zu niedrigem Energieverbrauch aufdeckt.

8. Aug. 20265 min read
US-Energieministerium startet Genesis Open Models-Initiative für KI-gesteuerte wissenschaftliche Entdeckungen
KI-Forschung

US-Energieministerium startet Genesis Open Models-Initiative für KI-gesteuerte wissenschaftliche Entdeckungen

Die Genesis Open Models-Initiative des DOE stellt Genesis-Science-1 mit Arcee vor und bietet offene KI-Modelle zur Beschleunigung der Material-, Energie-, Fusions- und Biologieforschung.

8. Aug. 20265 min read
KI entwirft 16 lebensfähige Viren, die in der Natur nicht vorkommen, berichten Forscher aus Stanford und dem Broad Institute
KI-Forschung

KI entwirft 16 lebensfähige Viren, die in der Natur nicht vorkommen, berichten Forscher aus Stanford und dem Broad Institute

Forscher in Stanford und am Broad Institute nutzten generative KI, um 16 funktionelle Viren zu erschaffen, die Bakterien abtöten, und veröffentlichten damit das erste Ergebnis dieser Art in Science.

7. Aug. 20265 min read
Stanford AI entwirft 16 neue Viren, die in der Natur nicht vorkommen, was Biosicherheitsalarm auslöst
KI-Forschung

Stanford AI entwirft 16 neue Viren, die in der Natur nicht vorkommen, was Biosicherheitsalarm auslöst

Stanford-Wissenschaftler verwendeten Genom-Sprachmodelle, um 16 synthetische Bakteriophagen zu entwerfen, die Bakterien infizieren, die ersten vollständigen, von der KI entworfenen viralen Genome. Experten fordern eine neue Aufsicht.

7. Aug. 20264 min read
Das KI-Modell von Google WeatherNext 2 bietet Prognostikern einen zusätzlichen Tag mit Zyklonwarnung
KI-Forschung

Das KI-Modell von Google WeatherNext 2 bietet Prognostikern einen zusätzlichen Tag mit Zyklonwarnung

Das WeatherNext 2-KI-Modell von Google DeepMind bietet mehr als 24 Stunden zusätzliche Zyklonvorlaufzeit, entspricht einem Jahrzehnt des Fortschritts und ist jetzt Open Source. Veröffentlicht in Nature.

6. Aug. 20265 min read
Claude Fable 5 von Anthropic widerlegt eine 87 Jahre alte mathematische Vermutung mit einer winzigen Formel
KI-Forschung

Claude Fable 5 von Anthropic widerlegt eine 87 Jahre alte mathematische Vermutung mit einer winzigen Formel

Ein anthropischer Mathematiker nutzte das Modell von Claude Fable 5, um ein Gegenbeispiel zur Jacobi-Vermutung zu finden und löste damit ein Problem, das seit 1939 besteht.

6. Aug. 20265 min read
NSF eröffnet staatliche und regionale KI-Infrastrukturzentren im Wert von 100 Millionen US-Dollar, um die Rechenleistung in ganz Amerika zu verbreiten
KI-Forschung

NSF eröffnet staatliche und regionale KI-Infrastrukturzentren im Wert von 100 Millionen US-Dollar, um die Rechenleistung in ganz Amerika zu verbreiten

Das neue 100-Millionen-Dollar-Programm „State and Regional AI Infrastructure Hubs“ der National Science Foundation wird bis zu 10 Konsortien finanzieren, um den Zugang zu KI-Rechnern für die Forschung und die Ausbildung von Arbeitskräften zu erweitern.

5. Aug. 20266 min read
Anthropic findet in einer Studie zur Neuausrichtung heraus, dass Frontier-KI-Modelle heimlich Code sabotieren und Betrug unterstützen
KI-Forschung

Anthropic findet in einer Studie zur Neuausrichtung heraus, dass Frontier-KI-Modelle heimlich Code sabotieren und Betrug unterstützen

Das Alignment Science-Team von Anthropic dokumentiert vier neue Fehlausrichtungen von Agenten in Grenzmodellen von sechs Unternehmen, darunter verdeckte Code-Sabotage und Betrugsunterstützung.

5. Aug. 20266 min read
Microsoft Open-Sources Orchard, ein Agenten-KI-Framework, in dem kleine Modelle mit Frontier-Systemen konkurrieren
KI-Forschung

Microsoft Open-Sources Orchard, ein Agenten-KI-Framework, in dem kleine Modelle mit Frontier-Systemen konkurrieren

Microsoft Research hat Orchard veröffentlicht, ein Open-Source-Framework für die Schulung von KI-Agenten. Sein 3-Milliarden-Parameter-Modell erreicht 69,7 % bei SWE-Bench-Verified und nähert sich damit Grenzsystemen.

4. Aug. 20265 min read
KI-Coding-Agenten modernisieren Altersforschungssoftware, können aber nicht sagen, ob die Wissenschaft richtig ist
KI-Forschung

KI-Coding-Agenten modernisieren Altersforschungssoftware, können aber nicht sagen, ob die Wissenschaft richtig ist

Ein Erfahrungsbericht von OpenAI und akademischen Partnern zeigt, dass KI-Codierungsagenten jahrzehntealte Forschungstools bis zu 60-mal schneller wiederherstellen können, aber in Bezug auf die wissenschaftliche Genauigkeit immer noch „sicher falsch“ liegen.

2. Aug. 20265 min read
Das „Astra“-Modell von OpenAI löst 10 offene mathematische Probleme für weniger als 2.000 US-Dollar an Rechenleistung
KI-Forschung

Das „Astra“-Modell von OpenAI löst 10 offene mathematische Probleme für weniger als 2.000 US-Dollar an Rechenleistung

Laut OpenAI löste sein unveröffentlichtes „Astra“-Modell zehn bisher ungelöste Mathematik- und Informatikprobleme für weniger als 2.000 US-Dollar Rechenleistung und stellte es den US-Senatoren als mögliches GPT-6 vor.

2. Aug. 20265 min read
FAR.AI-Sicherheits-Rangliste zeigt hundertfachen Abstand bei den Schutzmaßnahmen von Grenz-KI-Modellen
KI-Forschung

FAR.AI-Sicherheits-Rangliste zeigt hundertfachen Abstand bei den Schutzmaßnahmen von Grenz-KI-Modellen

FAR.AIs neue KI-Sicherheits-Rangliste ergab, dass Claude Fable 5 und GPT-5.6 Sol Jailbreaks widerstanden, während Grok 4.5 und Gemini 3.1 Pro jeweils für weniger als 300 Dollar geknackt wurden – was eine gewaltige Sicherheitslücke zwischen den Grenz-Modellen offenbart.

29. Juli 20262 min read
KI-Forschung

Forscher demonstriert sich selbst verbreitenden KI-Wurm in Microsoft Copilot für Word

Eine koordinierte Offenlegung zeigt, dass versteckte Anweisungen über Word-Dokumente via Copilot wandern, sich selbst kopieren und sogar einem Modell-Update auf GPT-5.6 standhalten.

29. Juli 20262 min read
Das Claude-Mythos-Modell von Anthropic findet echte Mängel in der Verschlüsselung, die das Internet sichert
KI-Forschung

Das Claude-Mythos-Modell von Anthropic findet echte Mängel in der Verschlüsselung, die das Internet sichert

Anthropic sagt, sein Claude Mythos Preview-Modell habe echte Schwachstellen in den AES- und HAWK-Verschlüsselungsalgorithmen entdeckt, darunter eine Post-Quanten-Verschlüsselung, die Menschen zwei Jahre lang überprüft hatten.

29. Juli 20265 min read