Wspólna wstępna ocena przeprowadzona przez instytuty bezpieczeństwa sztucznej inteligencji rządów Stanów Zjednoczonych i Wielkiej Brytanii wykazała, że model Kimi K3 firmy Moonshot AI z dużą przewagą w stosunku do wiodących modeli granicznych USA z dużym marginesem w zakresie ofensywnych zadań cybernetycznych. Odkrycie opublikowane 25 lipca 2026 r. stanowi konkretny punkt odniesienia dla nasilającej się debaty na temat tego, jak należy traktować opracowane w Chinach systemy sztucznej inteligencji, gdy zostaną one przyjęte w Stanach Zjednoczonych.
Ocenę opublikował amerykański instytut bezpieczeństwa AI mieszczący się w NIST, znany jako CAISI, wraz z brytyjską AISI. Stanowi jedną z pierwszych oficjalnych zachodnich ocen Kimi K3 skupionych szczególnie na domenie cybernetycznej. Dla czytelników śledzących szybko zmieniający się krajobraz najnowszych wiadomości o sztucznej inteligencji wynik jest godny uwagi nie tyle w przypadku pojedynczego wyniku testu porównawczego, ile w związku z tym, co sygnalizuje rosnącą rolę, jaką laboratoria rządowe odgrywają obecnie w weryfikacji zagranicznych modeli przed ich powszechnym wdrożeniem.
Co zmierzono w ramach oceny
Kimi K3, wypuszczony na rynek przez firmę Moonshot AI z Pekinu, to duży model o otwartej masie, który po wprowadzeniu na rynek szybko zwrócił na siebie uwagę świata ze względu na doskonałe parametry użytkowe. Otwarta dystrybucja oznaczała, że badacze i programiści mogli bezpośrednio pobierać i sprawdzać wagi, co z kolei czyniło go naturalnym kandydatem do zewnętrznych testów bezpieczeństwa.
Nowy raport wstępny koncentruje się na węższym i bardziej delikatnym pytaniu: w jakim stopniu model ten jest zdolny do przeprowadzania ofensywnych operacji cybernetycznych, czyli zadań, które mają największe znaczenie dla agencji bezpieczeństwa narodowego? Zamiast oceniać Kimi K3 na podstawie szerokiej wiedzy lub rozumowania, instytuty zbadały, czy może on pomóc w przeprowadzaniu cyberataków, wykorzystaniu luk w zabezpieczeniach oprogramowania lub w inny sposób pomóc w złośliwych operacjach na komputerze.
Liczby: około 32% w porównaniu do 76%
Głównym rezultatem jest wyraźna luka. Według sprawozdań z oceny w ocenie zdolności cybernetycznych Kimi K3 uzyskał około 32%, podczas gdy wiodące amerykańskie modele graniczne osiągnęły około 76%. Mówiąc najprościej, instytuty amerykańskie ustaliły, że model chiński był w stanie wykonać jedynie około jednej trzeciej ofensywnych zadań cybernetycznych, którymi zajmowały się czołowe modele zachodnie.
Wiele placówek zajmujących się tym wydaniem konsekwentnie wypełniało tę lukę. South China Morning Post doniósł, że Kimi K3 jest „znacznie w tyle za amerykańskimi rywalami pod względem zdolności do cyberataków”, natomiast Interesting Engineering podkreśliło różnicę 76% w stosunku do 32% w testach cybernetycznych. Ocenę określa się jako wstępną, co oznacza, że instytuty sygnalizują, że prawdopodobne są dalsze badania, zanim zostaną wyciągnięte jakiekolwiek ostateczne wnioski.
Dlaczego może istnieć luka
Model, który radzi sobie dobrze w ogólnych testach, ale słabo w przypadku cyberprzestępstw, stanowi interesującą zagadkę, nad którą analitycy już zaczęli się zastanawiać. W artykule dla The Decoder komentatorzy zauważyli, że destylacja może wyjaśnić część rozbieżności.
Destylacja to technika szkoleniowa, w której model uczy się poprzez naśladowanie wyników bardziej zdolnego modelu „nauczyciela”, zamiast budować wszystkie umiejętności od zera. Analitycy twierdzą, że gdyby Kimi K3 powstał częściowo w drodze destylacji, mógłby odziedziczyć pułap swoich możliwości ustalony przez dowolny model, który służył za jego nauczyciela, potencjalnie ograniczając wydajność w przypadku najtrudniejszych zadań, takich jak wyrafinowane ofensywne operacje cybernetyczne.
Ta hipoteza pozostaje tylko hipotezą. Wstępne sprawozdanie nie rozstrzyga, dlaczego istnieje luka, a jedynie stwierdza, że istnieje. Inne możliwe czynniki obejmują celowe ograniczenia możliwości, różnice w danych szkoleniowych lub kompromisy dokonane w celu utrzymania wystarczającej wydajności modelu do działania na powszechnie dostępnym sprzęcie.
Naładowane tło polityczne
Ocena wpisuje się w szerszy kontekst amerykańskich wysiłków zmierzających do zbadania chińskich systemów sztucznej inteligencji. Na początku lipca administracja Trumpa wznowiła wysiłki mające na celu ograniczenie stosowania opracowanych w Chinach modeli sztucznej inteligencji w Stanach Zjednoczonych, powołując się na obawy dotyczące cyberbezpieczeństwa, a w tej dyskusji wielokrotnie wymieniano Kimi K3. Amerykańscy prawodawcy oddzielnie wywierali nacisk na amerykańskie firmy w zakresie konsekwencji integracji zagranicznych modeli z ich produktami dla bezpieczeństwa danych.
W tym kontekście stwierdzenie rządu, że najbardziej znana chińska modelka z wagą otwartą osiąga słabsze wyniki w przypadku przestępstw, powoduje cięcia w dwóch kierunkach. Dla zwolenników ograniczeń stanowi oficjalny dowód na to, że model jest traktowany na tyle poważnie, że można go przetestować. Dla tych, którzy obawiają się nadmiernego zasięgu, stosunkowo niski wynik cybernetyczny komplikuje również narrację, że każdy chiński model stanowi bezpośrednie zagrożenie cybernetyczne.
Co to oznacza dla adopcji w wadze otwartej
Wynik wpisuje się również w oddzielną debatę na temat szerzej stosowanej sztucznej inteligencji. Zwolennicy modeli z otwartą wagą argumentują, że bezpłatne wagi do pobrania umożliwiają niezależne testy bezpieczeństwa, dokładnie takie same, jakie przeprowadziły CAISI i brytyjska AISI, co sprawia, że otwarta dystrybucja ma pozytywny wpływ na bezpieczeństwo. Krytycy twierdzą, że ta sama otwartość obniża barierę dla złośliwych aktorów w modyfikowaniu lub niewłaściwym wykorzystaniu odpowiednich systemów.
W przypadku Kimi K3 właśnie dostępność wagi otwartej umożliwiła przeprowadzenie tej niezależnej oceny rządowej. To, czy stosunkowo skromny wynik w zakresie cyberbezpieczeństwa uspokoi, czy zaniepokoi decydentów, będzie prawdopodobnie zależeć w mniejszym stopniu od samych liczb, a bardziej od tego, jak agencje amerykańskie i brytyjskie zdecydują się je sformułować w nadchodzących tygodniach.
Na razie punktem odniesienia jest wstępna ocena: pierwszy oficjalny zachodni pomiar ofensywnych zdolności cybernetycznych Kimi K3, który plasuje go daleko w tyle za czołowymi modelami amerykańskimi, z którymi jest tak często porównywany.
Wyprzedź sztuczną inteligencję
Wyniki w zakresie zdolności cybernetycznych to tylko jeden front w znacznie szerszej rywalizacji o bezpieczeństwo sztucznej inteligencji, regulacje i globalną konkurencję. Krajobraz polityczny zmienia się co tydzień, a pominięcie jednej oceny może oznaczać pominięcie kontekstu kolejnego nagłówka. Przeczytaj więcej aktualności na temat sztucznej inteligencji w AI Buzz Wire, aby być na bieżąco z każdym wydaniem modelu, orzeczeniem rządu i oceną bezpieczeństwa, które mają znaczenie.
Wyprzedź wyścig sztucznej inteligencji – odwiedź AI Buzz Wire


