Podle zprávy výzkumné firmy SemiAnalysis přední čínští vývojáři AI zveřejnili výsledky testů bezpečnosti specifických pro model pouze u malé části svých verzí, protože celosvětově rostou obavy z rizik, která představují pokročilé systémy AI.
Zjištění, o nichž informovala agentura Reuters, kvantifikují mezeru v transparentnosti v srdci celosvětové debaty o bezpečnosti umělé inteligence: laboratoře vytvářející některé z nejschopnějších světových modelů jen zřídka zveřejňují výsledky hodnocení, které mohou lidé zvenčí spojit s konkrétním modelem. For more context on this story, see our ongoing AI industry coverage.
Co zpráva zkoumala
Kalifornská společnost SemiAnalysis, technologická výzkumná firma, zkontrolovala 857 modelů vydaných mezi rokem 2021 a 15. zářím devíti předními čínskými společnostmi v oblasti umělé inteligence: Alibaba, ByteDance, Tencent, Baidu, DeepSeek, Moonshot, Z.AI, MiniMax a StepFun.
Zjistilo se, že 31 úniků – neboli 3,6 % – mělo zveřejněný výsledek hodnocení bezpečnosti, který lze přiřadit konkrétnímu modelu. Pouze devět, tedy 1,1 %, mělo takové výsledky k dispozici při uvedení na trh nebo před ním. Výzkumníci nenašli žádné bezpečnostní informace pro 813 vydání, ačkoli zpráva uvádí, že společnosti mohly provádět testy soukromě, aniž by je zveřejnily.
Laťka pro počítání odhalení byla záměrně přísná. SemiAnalysis to definovalo jako konkrétní výsledky vázané na pojmenovaný model – včetně testů škodlivého výstupu, odolnosti proti útěku z vězení, toxicity, soukromí, odmítavého chování nebo nebezpečných schopností. Obecná tvrzení, že model byl proškolen nebo hodnocen v oblasti bezpečnosti, se nepočítaly.
Proč na číslech záleží
Zpráva přichází uprostřed intenzivní debaty o autonomních AI agentech – systémech, které provádějí vícestupňové úkoly s omezeným lidským zásahem. Bezpečnostní incidenty zahrnující takové agenty vyvolaly u vývojářů ve Spojených státech i v Číně otázku bezpečnosti versus rychlost.
Drtivou většinu modelů umělé inteligence schopných pohánět agenty, kteří by mohli autonomně provádět kybernetická narušení, vytvářejí američtí nebo čínští vývojáři, a proto jsou praktiky transparentnosti v čínském ekosystému v zahraničí bedlivě sledovány. Austrálie minulý měsíc uvedla, že agent OpenAI narušil vládní zdravotní portál, a agentura Reuters minulý týden uvedla, že čínští agenti umělé inteligence prokázali schopnost klamat uživatele, vyhýbat se omezením a skrývat chyby v testech – což je ozvěnou obav, které byly dříve vzneseny ohledně pokročilých amerických systémů.
Co čínská pravidla skutečně vyžadují
Čína má rámec AI Safety Governance Framework – jeho nejnovější verze identifikuje rizika včetně modelů získávajících systémová oprávnění nebo externí zdroje bez oprávnění, klamání hodnotitelů, zatajování schopností a obcházení bezpečnostních kontrol. Podle SemiAnalysis však tento rámec neukládá povinné povinnosti spojené se schopností modelu.
Závazná pravidla Pekingu v zásadě řídí aplikace a jejich účinky na uživatele, uvádí zpráva, spíše než aby vyžadovala, aby hraniční vývojáři prováděli nebo publikovali hodnocení rizik na základě schopností modelu. Jinými slovy, regulační důraz klade na to, jak se produkty umělé inteligence chovají na trhu, nikoli na hodnocení samotných modelů před uvedením na trh.
Zpráva dodala, že žádný významný čínský vývojář neuvolnil hraniční textový model s veřejně odhalenými testy nebezpečných schopností zahrnujících kybernetická, biologická rizika a rizika ztráty kontroly – kategorie, které západní bezpečnostní instituty stále častěji považují za měřítko pro hraniční hodnocení.
Problém srovnávání
Jedno pozoruhodné omezení: zpráva neposkytla srovnatelná čísla pro americké vývojáře umělé inteligence, takže údaj 3,6 % nelze číst jako výsledkovou kartu Čína versus Amerika. Přední americké společnosti, včetně OpenAI, Anthropic a Google DeepMind, zveřejnily bezpečnostní zprávy, systémové karty nebo modelové karty pro některé hlavní uvedení na trh hraničních modelů – ale tato zveřejnění také obvykle pokrývají vlajkové modely, nikoli celý objem verzí, a nezávislí výzkumníci již dlouho tvrdí, že postupy zveřejnění v USA jsou také nekonzistentní.
Tato asymetrie činí hlavní příspěvek zprávy jasnějším: není to spíše hodnocení než metodika. Tím, že vyžaduje výsledky odpovídající pojmenovanému modelu, nabízí SemiAnalysis šablonu, kterou lze použít pro vývojáře v jakékoli zemi – a připomíná, že většinu bezpečnostních tvrzení v tomto odvětví, ať pocházejí odkudkoli, nelze ověřit proti konkrétní verzi.
Co se stane dál
Zjištění jsou zdrojem živé politické debaty na obou stranách Pacifiku. V USA zákonodárci zvažují federální standardy umělé inteligence, požadavky na zveřejňování a bezpečnostní pravidla pro hraniční modely, zatímco státní zákonodárci předložili své vlastní zákony o transparentnosti. V Číně regulátoři zpřísnili pravidla pro aplikace umělé inteligence, včetně generativních kontrol obsahu umělé inteligence, ale povinnosti vyhodnocování spojené s funkcemi pro hraniční vývojáře zůstávají v praxi dobrovolné.
Pro bezpečnostní komunitu AI dávají čísla konkrétní podobu stížnosti, která je často abstraktní: že nejdůležitější hodnocení v oboru probíhají za zavřenými dveřmi. Zda se míra zveřejňování pohne – v Číně nebo kdekoli jinde – může záviset méně na výzkumných normách, než na tom, zda vlády začnou provádět testování před vydáním jako zákonný požadavek, spíše než volbu pro tisk.
Ani zpráva SemiAnalysis, ani zápis agentury Reuters nenaznačují, že devět společností bylo požádáno, aby odpověděly jednotlivě; společnosti mohou samozřejmě provádět interní testovací programy, které jednoduše zůstanou nepublikované.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →