Druhý matematik veřejně obvinil OpenAI z neetického a „nečestného“ chování v souvislosti s daty, která stojí za jeho slavnými matematickými průlomy, a řekl, že společnost nedokázala, že jeho soukromé interakce s ChatGPT nepřispěly k výsledkům oznámeným minulý měsíc s velkou pompou.

Matematik Andreas Thom v sérii příspěvků na Mastodon, o kterých ve středu informoval The Verge, vyjádřil obavy, že rozhovory, které on a jeho kolegové vedli s ChatGPT před oznámením OpenAI, mohly přispět k úspěchu modelu. Jeho zásah přišel jen několik dní poté, co profesor matematiky na New York University Tristan Buckmaster veřejně zpochybnil, zda modely OpenAI měly prospěch z jeho vlastního použití firemního nástroje Codex – čímž se okamžik triumfu laboratoře změnil v probíhající spor o původ tréninkových dat. For more context on this story, see our ongoing AI trends.

Od průlomu k odporu

V srpnu OpenAI oznámila, že její systém přinesl deset významných výsledků v matematice a teoretické informatice, z nichž každý byl zkontrolován strojově ověřenými Lean důkazy – což byl milník, který tento web v té době pokrýval, spolu s tvrzeným řešením problému s cenou tisíciletí. Jeden z deseti výsledků prokázal existenci takzvaných nesofických skupin, což je dlouho otevřená otázka v teorii grup.

Tento výsledek je jádrem nové kontroverze. Podle The Verge OpenAI uznala, že důkaz těžce vycházel z předchozí práce Thoma a kolegy matematika Gábora Kuna – a po kritice z matematických kruhů za to, že zpočátku neuznala jejich nedávné příspěvky, společnost v tichosti upravila svůj zápis.

Pro Thoma toto uznání vyvolalo nepříjemnou otázku: jak se model dostal k tomu, aby ovládal jeho a Kunovy techniky tak podrobně?

Otázka, kterou Thom říká, zůstala nezodpovězena

Thom řekl, že ho zasáhlo „podrobné ovládání našich technik OpenAI“, které, jak poznamenal, nebyly v té době ani nejzřejmější, ani nejslibnější cestou k řešení. Napsal e-maily výzkumníkům OpenAI Sébastienu Bubeckovi a Marku Sellkemu – posledně jmenovanému také statistikovi na Harvardu – a zeptal se, zda jeho interakce s ChatGPT byly „součástí tréninkových dat nebo přístupné pro proces uvažování“ a mohly tedy přispět k výsledku.

Odpověď, kterou obdržel, se týkala pouze toho, zda je možné přistupovat přímo k jeho konverzacím, nikoli toho, zda vstoupily do rozsáhlých zdrojů dat používaných k trénování a zlepšování modelů společnosti. "Žádná taková kvalifikace, vysvětlení nebo důkazy nebyly poskytnuty," napsal Thom. "Beru to přinejmenším jako nečestnost."

V pokračování citovaném The Verge obžalobu přiostřil: „Sellkeho kategorická odpověď byla přinejmenším neoprávněně široká a věcně zavádějící; když se ohlédnu zpět, byla jasně nečestná.“

Thomův argument není ani tak o tom, co OpenAI udělala, jako o tom, kdo nese důkazní břemeno. Výzkumníci, řekl, nejsou vybaveni k reverznímu inženýrství školícího potrubí společnosti. "Pouze OpenAI má k tomu relevantní data," napsal - takže pokud chce společnost popřít, že uživatelská data přispěla k jejím výsledkům, je na OpenAI, aby to dokázala zveřejněním příslušných datových sad a objasněním, jak využívá interakce se zákazníky.

Opatrné odmítnutí OpenAI

Spor odráží to, jak se společnost vypořádala s proklamovaným průlomem Navier-Stokes, prací, na které Buckmaster podle The Verge osobně pracoval s antropickým výzkumníkem Leventem Alpögem. V blogovém příspěvku oznamujícím tento výsledek OpenAI uvedl: "My (výzkumníci a agenti) jsme neviděli žádnou jejich práci žádnými prostředky, dokud ji nezveřejnili - zejména nebyl přístup k žádným konkrétním uživatelským datům, aby bylo možné tento problém vyřešit."

Ale stejný příspěvek připustil nepřímý kanál: "Ačkoliv nepravděpodobné, nemůžeme vyloučit, že deidentifikovaná data odvozená z jejich používání našich produktů pomohla zlepšit naše modely."

Pro Thoma je toto rozlišení celý problém. "De-identifikace může odstranit jméno, ale neodstraní intelektuální obsah matematické myšlenky," napsal. OpenAI okamžitě neodpověděla na žádost The Verge o komentář.

Dodal, že by „bylo eticky neobhajitelné“, kdyby neveřejný výzkum dodaný uživateli pomohl zlepšit modely, které společnost poté použila k tomu, aby ty samé uživatele hnala ke zveřejnění – bez souhlasu, řádného zveřejnění nebo uznání.

Chlad nad matematikou

Okolnosti předávání cen Millennium Prize jen málo uklidnily nervy. OpenAI uvedla, že se tímto problémem zabývala poté, co na internetu vyslechla zvěsti, že jiní výzkumníci udělali velký pokrok – efektivně doháněli akademiky k výsledku, k němuž se roky přibližovali.

Četní výzkumníci řekli The Verge, že se obávají, že takové chování posune matematiku do ještě utajovanějšího stavu, pokud matematici dospějí k přesvědčení, že i zvěsti o blížícím se průlomu by mohly podnítit závod proti dobře vybavenému technologickému gigantovi toužícímu po slávě. Související zpravodajství The Verge – „Slimý matematický průlom OpenAI vhání do akademické sféry mrazení“ – zachytilo náladu v této oblasti.

Epizoda se dostává do choulostivého okamžiku pro společnosti s umělou inteligencí a výzkumné komunity, se kterými se stále častěji setkávají. Ať už jsou přednosti jakéhokoli jednotlivého výsledku jakékoli, asymetrie, kterou Thom popisuje, je strukturální: laboratoře mohou přijímat uživatelské interakce ve velkém, zatímco lidé, kteří tato data generují, nemají žádný způsob, jak zkontrolovat, co bylo pořízeno. Dokud společnosti buď neotevřou své školicí kanály ke kontrole nebo nezavedou tvrdé a ověřitelné firewally mezi konverzacemi se zákazníky a modelovým školením, bude každé prohlášení „nepoužili jsme vaše data“ označeno implicitní hvězdičkou – a každý průlom přijde s matematiky a stále častěji výzkumníky v jiných oblastech, kteří budou žádat důkaz.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →