Een gezamenlijke voorlopige beoordeling door de AI-veiligheidsinstituten van de Amerikaanse en Britse overheid heeft geconcludeerd dat het open-weight Kimi K3-model van Moonshot AI de toonaangevende Amerikaanse frontier-modellen met een ruime marge achterlaat op het gebied van offensieve cybertaken. De bevinding, gepubliceerd op 25 juli 2026, voegt een concreet datapunt toe aan een intensivering van het debat over de manier waarop door China ontwikkelde AI-systemen moeten worden behandeld als ze in de Verenigde Staten worden geaccepteerd.

De beoordeling werd vrijgegeven door het Amerikaanse AI-veiligheidsinstituut, gehuisvest bij NIST, bekend als CAISI, samen met het Britse AISI. Het vertegenwoordigt een van de eerste officiële westerse evaluaties van Kimi K3 die specifiek op het cyberdomein zijn gericht. Voor lezers die het snel veranderende landschap van breaking AI news volgen, is het resultaat minder opmerkelijk voor een enkele benchmarkscore dan voor wat het aangeeft over de groeiende rol die overheidslaboratoria nu spelen bij het doorlichten van buitenlandse modellen voordat ze op grote schaal worden ingezet.

Wat de beoordeling heeft gemeten

Kimi K3, uitgebracht door het in Beijing gevestigde Moonshot AI, is een groot model met open gewicht dat na de lancering snel de wereldwijde aandacht trok vanwege zijn sterke prestaties voor algemene doeleinden. Dankzij de open distributie konden onderzoekers en ontwikkelaars de gewichten rechtstreeks downloaden en inspecteren, wat het op zijn beurt een natuurlijke kandidaat maakte voor externe veiligheidstests.

Het nieuwe voorlopige rapport concentreert zich op een smallere en gevoeligere vraag: hoe capabel is het model voor offensieve cyberoperaties, het soort taken dat het belangrijkst is voor nationale veiligheidsdiensten? In plaats van Kimi K3 te beoordelen op basis van brede kennis of redenering, onderzochten de instituten of het kon helpen bij het uitvoeren van cyberaanvallen, het exploiteren van kwetsbaarheden in software of op andere wijze kon helpen bij kwaadaardige computeroperaties.

De cijfers: grofweg 32% versus 76%

Het belangrijkste resultaat is een scherpe kloof. Bij de evaluatie van cybercapaciteiten scoorde Kimi K3 ongeveer 32%, terwijl toonaangevende Amerikaanse frontiermodellen ongeveer 76% behaalden, volgens de rapportage over de beoordeling. In duidelijke termen vertaald kwamen de Amerikaanse instituten tot de conclusie dat het Chinese model slechts ongeveer een derde van de offensieve cybertaken kon voltooien die de westerse topmodellen afhandelden.

Meerdere verkooppunten die de release bestreken, omlijstten de kloof consequent. De South China Morning Post meldde dat Kimi K3 "ruim achter de Amerikaanse rivalen zat wat betreft cyberaanvalvermogen", terwijl Interesting Engineering de 76% versus 32% spreiding op cyberbenchmarks benadrukte. De beoordeling wordt beschreven als voorlopig, wat betekent dat de instituten aangeven dat verdere tests waarschijnlijk zijn voordat er definitieve conclusies worden getrokken.

Waarom de kloof zou kunnen bestaan

Een model dat sterk presteert op algemene benchmarks, maar zwak op cybercriminaliteit, levert een interessante puzzel op, en analisten zijn al begonnen hun mening te geven. In The Decoder merkten commentatoren op dat distillatie een deel van de discrepantie kan verklaren.

Distillatie is een trainingstechniek waarbij een model leert door de resultaten van een capabeler 'leraar'-model te imiteren, in plaats van elke mogelijkheid helemaal opnieuw op te bouwen. Als Kimi K3 gedeeltelijk door distillatie zou worden ontwikkeld, zo stellen analisten, zou het een plafond aan zijn capaciteiten kunnen erven, opgelegd door welk model dan ook dat als leermeester diende, waardoor de prestaties bij de moeilijkste taken, zoals geavanceerde offensieve cyberoperaties, mogelijk zouden worden beperkt.

Die hypothese blijft precies dat: een hypothese. Het voorlopige rapport stelt niet vast waarom de kloof bestaat, maar alleen dat deze bestaat. Andere mogelijke factoren zijn onder meer opzettelijke capaciteitsbeperkingen, verschillen in trainingsgegevens of afwegingen die zijn gemaakt om het model efficiënt genoeg te houden om op algemeen beschikbare hardware te kunnen draaien.

Een geladen politieke achtergrond

De beoordeling komt terecht in het midden van een bredere Amerikaanse poging om Chinese AI-systemen onder de loep te nemen. Eerder in juli heeft de regering-Trump de inspanningen nieuw leven ingeblazen om het gebruik van door China ontwikkelde AI-modellen in de Verenigde Staten te beperken, daarbij verwijzend naar zorgen over cyberveiligheid, waarbij Kimi K3 herhaaldelijk in die discussie werd genoemd. Amerikaanse wetgevers hebben Amerikaanse bedrijven afzonderlijk onder druk gezet over de gevolgen voor de gegevensbeveiliging van de integratie van buitenlandse modellen in hun producten.

Tegen die achtergrond constateert de regering dat het meest prominente Chinese open-weight-model ondermaats presteert als het gaat om bezuinigingen in de aanvalslinie in twee richtingen. Voor degenen die voor beperkingen pleiten, levert het officieel bewijs dat het model serieus genoeg wordt behandeld om te worden getest. Voor degenen die op hun hoede zijn voor overdreven reikwijdte: een relatief lage cyberscore compliceert ook het verhaal dat elk Chinees model een onmiddellijke cyberdreiging vertegenwoordigt.

Wat het betekent voor adoptie met open gewicht

Het resultaat draagt ook bij aan een apart debat over open-weight AI in bredere zin. Voorstanders van open-weight-modellen beweren dat vrij downloadbare gewichten onafhankelijke veiligheidstests mogelijk maken, precies zoals CAISI en de Britse AISI uitvoeren, waardoor open distributie een netto positief effect heeft op de veiligheid. Critici werpen tegen dat dezelfde openheid de barrière verlaagt voor kwaadwillende actoren om geschikte systemen te wijzigen of te misbruiken.

In het geval van Kimi K3 is de beschikbaarheid van open gewichten precies wat deze onafhankelijke beoordeling door de overheid mogelijk maakte. Of de relatief bescheiden cyberscore beleidsmakers geruststelt of alarmeert, zal waarschijnlijk minder afhangen van het cijfer zelf en meer van de manier waarop Amerikaanse en Britse instanties dit de komende weken willen formuleren.

Voorlopig geldt de voorlopige beoordeling als referentiepunt: de eerste officiële westerse meting van de offensieve cybercapaciteiten van Kimi K3, en een die hem ver achter de Amerikaanse modellen plaatst waar hij zo vaak mee wordt vergeleken.

Blijf AI een stap voor

Scores op het gebied van cybercapaciteiten zijn slechts één front in een veel grotere strijd om AI-veiligheid, regelgeving en mondiale concurrentie. Het beleidslandschap verandert wekelijks, en het missen van een enkele beoordeling kan betekenen dat je de context achter de volgende kop mist. Lees meer AI-nieuws op AI Buzz Wire om op de hoogte te blijven van elke modelrelease, overheidsuitspraak en veiligheidsevaluatie die ertoe doet.

Blijf de AI-race een stap voor – bezoek AI Buzz Wire