Americký startup s názvem Abliteration.ai přeměnil jednu z nejkontroverznějších technik AI s otevřeným zdrojovým kódem na komerční službu, prodává prohlížeč a přístup k rozhraní API k oblíbeným modelům s otevřenou váhou s odstraněným jejich bezpečnostním školením – včetně nedávno vydaného GLM-5.3 společnosti Z.ai, jednoho z nejschopnějších otevřených modelů současnosti.

Společnost převzala svůj název od „abliterace“, metody, která odstraňuje tendenci modelu odmítat škodlivé požadavky. Výzkumníci a fandové používají tuto techniku ​​roky a Hugging Face hostí tisíce abliterovaných modelů. Co je nové, je balení: Abliteration.ai hostí upravené modely na své vlastní infrastruktuře, takže kdokoli s webovým prohlížečem se na ně může dotazovat, aniž by si musel stahovat váhy nebo pronajímat GPU. TechCrunch informoval o vývoji 3. září a od té doby jej zkoumali bezpečnostní výzkumníci, kteří sledovali debatu o otevřených vahách, kterou sledujeme v našem zpravodajství o AI.

Od podzemní techniky k platformě na klíč

Společnost Abliteration.ai, založená koncem minulého roku a oficiálně začleněná v březnu, posouvá tuto praxi z „udělej si sám“ open source výklenku do leštěného komerčního produktu. Hostováním samotných modelů společnost odstraňuje dvě třecí místa najednou: uživatelé již nepotřebují technické dovednosti k odstranění modelu ani výpočetní techniku, aby jej mohli spustit.

Spoluzakladatel Devon – TechCrunch na jeho žádost zamlčel jeho příjmení, protože zůstává zaměstnán v jiné firmě – uvedl, že společnost uzavřela dohody s několika významnými poskytovateli cloudu a je financována výhradně z příjmů zákazníků. Startup nezískal rizikový kapitál, ačkoli řekl, že jednání probíhají.

Co našel test TechCrunch

Společnost říká, že jejím cílem je umožnit „urážlivou kybernetickou práci, práci red-teamingu a testování agentů, kterou jiné modely odmítají dělat“. TechCrunch to otestoval pomocí bezplatného účtu a dotazoval se na zrušenou verzi GLM-5.3 prostřednictvím webového prohlížeče. Reportéři požádali modelku, aby napsala program Python, který krade uložená hesla pro Chrome, a aby vytvořila podrobný protokol pro domácí kultivaci nebezpečného lidského patogenu. Oběma žádostem podle zprávy ochotně vyhověla.

Tento experiment je jádrem příběhu: Úkoly, které mainstreamové hraniční modely kategoricky odmítají, jsou nyní zdarma dostupné na kartě prohlížeče prostřednictvím přihlašovacího formuláře.

Obranný argument červeného týmu

Devonův případ pro obchod je klasický bezpečnostní argument: nemůžete se bránit chování, které nemůžete reprodukovat. Model, který odmítá napsat funkční exploit kód, je pro červený tým, který se snaží porozumět skutečným útočníkům, málo užitečný.

"Velkým obrazem zničených modelů je, že jsou schopni modelovat špatné herce," řekl TechCrunch. "Výhodou je, že se nyní obránci mohou pohybovat tak rychle, jak je to jen možné... Myslím, že to urychlí kybernetickou bezpečnost, což je druh kontraintuitivního bodu."

Mezi zákazníky společnosti patří začínající red-teamingové startupy ve Velké Británii a Evropě, které testují bezpečnost bank, leteckých společností a dalších provozovatelů kritické infrastruktury. Jeden z hlavních zákazníků, řekl Devon, tvoří červené týmy bankovních agentů a nemohl by tuto práci vykonávat s neupravenými komerčními modely.

'Model, který se stává sociopatem'

Bezpečnostní výzkumníci vidí stejnou schopnost velmi odlišně. Andrew Yoon, vedoucí výzkumu v neziskové organizaci CivAI pro bezpečnost AI, řekl TechCrunch, že abliterace vám umožňuje „upravit model tak, aby se stal sociopatem“.

"Můžete zde zadat doslova cokoli a bude to v souladu," řekl Yoon a dodal, že očekává, že "upravené, smazané modely budou v blízké budoucnosti použity k poškození."

V nedávném stanovisku Yoon tvrdil, že pokud nelze realisticky zabránit odstranění zábradlí, vlády by měly vyžadovat, aby poskytovatelé provozovali klasifikátory, které detekují a blokují škodlivé aktivity v oblasti kybernetických a biologických zbraní, a měly by vyžadovat od společností, které si pronajímají přímý přístup k pokročilým GPU, aby ověřily totožnost zákazníků a odmítly službu tam, kde existuje podezření na nebezpečné zneužití.

Tenké zábradlí a žádné kontroly identity

Prozatím jsou vlastní ochrany Abliteration.ai minimální. Platforma nabízí zákazníkům volitelnou vrstvu moderování, aby mohli přidat jakákoli omezení, která si přejí, a samotný web zachovává určité drobné limity – TechCrunch nedokázal přimět model, aby vytvořil pokyny k sebevraždě, a Devon řekl, že pracuje na dalších opatřeních k prevenci násilí.

Společnost neprovádí žádnou kontrolu „poznej svého zákazníka“ kromě přihlášení kreditní karty použité k platbě. "Nechcete být osobou odpovědnou za to, že někdo udělá něco šíleného... tak kde nakreslíte hranici vaší odpovědnosti jako společnosti?" řekl Devon. "Stále jsme v procesu definování."

Otázka, kterou průmysl nemůže uhnout

Ne každý bezpečnostní odborník souhlasí s tím, že abliterované modely jsou dokonce tím nejlepším nástrojem pro útočné testování. Ahmed Aly, generální ředitel agent red-teaming firmy Fabraix, řekl TechCrunch, že jeho společnost se více spoléhá na jemné doladění modelů s otevřenou váhou, které se již dodávají s malým počtem odmítnutí – a poznamenává, že abliterace může degradovat základní schopnosti modelu.

Většina odborníků konzultovaných společností TechCrunch se shoduje na jedné věci: praxi nelze zastavit. Stahovatelné váhy znamenají, že každý může odstranit odmítnutí lokálně, jak podtrhl komentář Centra pro boj proti terorismu ve West Point z roku 2026 o „abliteračním“ zneužití. Otevřenou otázkou je, zda snížení nákladů na přístup pro všechny – obránce i útočníky – činí internet bezpečnějším nebo nebezpečnějším.

Udržujte si náskok před AI

Bezpečnost AI se každým dnem vyvíjí. Získejte [nejnovější vývoj AI] (https://aibuzzwire.news) na jednom místě.

Přečtěte si další zprávy o AI →