Seorang ahli matematik kedua secara terbuka menuduh OpenAI berkelakuan tidak beretika dan "tidak jujur" berhubung data di sebalik kejayaan matematiknya yang terkenal, mengatakan syarikat itu telah gagal membuktikan bahawa interaksi peribadinya dengan ChatGPT tidak menyumbang kepada keputusan yang diumumkan dengan hebat bulan lepas.
Dalam satu siri siaran di Mastodon yang dilaporkan oleh The Verge pada hari Rabu, ahli matematik Andreas Thom membangkitkan kebimbangan bahawa perbualan dia dan rakan-rakannya dengan ChatGPT sebelum pengumuman OpenAI mungkin memberi kesan kepada kejayaan model itu. Campur tangan beliau datang hanya beberapa hari selepas profesor matematik Universiti New York Tristan Buckmaster mempersoalkan secara terbuka sama ada model OpenAI telah mendapat manfaat daripada penggunaan sendiri alat Codex syarikat itu — mengubah detik kejayaan makmal itu menjadi pertikaian yang berterusan mengenai sumber data latihan. For more context on this story, see our ongoing AI trends.
Daripada Terobosan kepada Tindak Balas
Pada bulan Ogos, OpenAI mengumumkan bahawa sistemnya telah menghasilkan sepuluh keputusan penting dalam matematik dan sains komputer teori, masing-masing disemak dengan bukti Lean yang disahkan mesin — satu peristiwa penting yang diliputi oleh laman web ini pada masa itu, di samping penyelesaian tuntutan syarikat untuk masalah Hadiah Milenium. Salah satu daripada sepuluh keputusan membuktikan kewujudan apa yang dipanggil kumpulan bukan sofik, soalan yang sudah lama terbuka dalam teori kumpulan.
Keputusan itu berada di tengah-tengah kontroversi baharu. Menurut The Verge, OpenAI mengakui bahawa bukti itu dibina dengan kuat pada kerja sebelumnya oleh Thom dan rakan ahli matematik Gábor Kun — dan selepas kritikan daripada kalangan matematik kerana pada mulanya gagal mengiktiraf sumbangan mereka baru-baru ini, syarikat itu secara senyap-senyap meminda penulisannya.
Bagi Thom, pengakuan itu menimbulkan persoalan yang tidak selesa: bagaimana model itu menguasai tekniknya dan Kun dengan begitu terperinci?
Soalan Thom Tidak Terjawab
Thom berkata dia terkejut dengan "perintah terperinci OpenAI tentang teknik kami," yang dia nyatakan bukanlah laluan yang paling jelas mahupun paling menjanjikan kepada penyelesaian pada masa itu. Dia menulis e-mel kepada penyelidik OpenAI Sébastien Bubeck dan Mark Sellke — yang kedua juga seorang ahli statistik di Harvard — bertanya sama ada interaksinya dengan ChatGPT telah menjadi "sebahagian daripada data latihan atau boleh diakses kepada proses penaakulan" dan oleh itu boleh menyumbang kepada keputusan.
Jawapan yang diterimanya hanya merujuk sama ada perbualannya boleh diakses secara langsung, bukan sama ada perbualan itu telah memasuki kumpulan data yang luas yang digunakan untuk melatih dan menambah baik model syarikat. "Tiada kelayakan, penjelasan, atau bukti sedemikian diberikan," tulis Thom. "Saya menganggap ini sebagai ketidakjujuran untuk mengatakan sekurang-kurangnya."
Dalam susulan yang dipetik oleh The Verge, dia mempertajam tuduhan itu: "Jawapan kategorikal Sellke, sekurang-kurangnya, tidak wajar luas dan mengelirukan secara material; melihat ke belakang ia jelas tidak jujur."
Hujah Thom kurang mengenai apa yang OpenAI lakukan daripada tentang siapa yang menanggung beban pembuktian. Penyelidik, katanya, tidak dilengkapi untuk merekayasa balik saluran paip latihan syarikat. "Hanya OpenAI mempunyai data yang berkaitan untuk itu," tulisnya — jadi jika syarikat itu mahu menafikan bahawa data pengguna menyumbang kepada keputusannya, tanggungjawab terletak pada OpenAI untuk membuktikannya dengan mendedahkan set data yang berkaitan dan menjelaskan cara ia menggunakan interaksi pelanggan.
Penafian Berhati-hati OpenAI
Pertikaian itu menggemakan pengendalian syarikat terhadap penemuan Navier-Stokes yang didakwanya, kerja yang telah diusahakan oleh Buckmaster dengan penyelidik Anthropic Levent Alpöge dalam kapasiti peribadi, menurut The Verge. Dalam catatan blog yang mengumumkan keputusan itu, OpenAI menyatakan: "Kami (para penyelidik dan ejen) tidak melihat apa-apa kerja mereka melalui apa-apa cara sehingga mereka mengeluarkannya secara terbuka - khususnya, tiada data pengguna khusus diakses untuk menyelesaikan masalah ini."
Tetapi siaran yang sama mengakui saluran tidak langsung: "Walaupun tidak mungkin, kami tidak boleh menolak bahawa data yang tidak dikenal pasti yang diperoleh daripada penggunaan produk kami oleh mereka membantu meningkatkan model kami."
Bagi Thom, perbezaan itu adalah keseluruhan masalah. "Penyahcaman boleh mengalih keluar nama; ia tidak menghilangkan kandungan intelektual idea matematik," tulisnya. OpenAI tidak segera menjawab permintaan The Verge untuk komen.
Beliau menambah bahawa ia "tidak boleh dipertahankan dari segi etika" jika penyelidikan bukan awam yang dibekalkan oleh pengguna membantu menambah baik model yang digunakan syarikat itu untuk berlumba dengan pengguna yang sama untuk diterbitkan — tanpa persetujuan, pendedahan yang betul atau kredit.
Santai Menghadapi Matematik
Keadaan dorongan Hadiah Milenium tidak banyak membantu menenangkan saraf. OpenAI berkata ia meneruskan masalah itu selepas mendengar khabar angin dalam talian bahawa penyelidik lain telah mencapai kemajuan besar — dengan berkesan berlumba-lumba ahli akademik untuk mencapai keputusan yang telah mereka habiskan selama bertahun-tahun.
Ramai penyelidik memberitahu The Verge bahawa mereka bimbang bahawa tingkah laku sebegitu akan mendorong matematik ke dalam keadaan yang lebih rahsia, jika ahli matematik mula percaya bahawa khabar angin tentang kejayaan yang akan berlaku boleh mencetuskan perlumbaan terhadap gergasi teknologi yang mempunyai sumber yang baik yang mendambakan kejayaan. Liputan berkaitan The Verge — "Penembusan matematik yang licik OpenAI memberikan ketenangan melalui akademia" — menangkap suasana di lapangan.
Episod ini tiba pada saat yang sukar untuk syarikat AI dan komuniti penyelidikan yang semakin ditentang mereka. Walau apa pun kebaikan mana-mana hasil individu, asimetri yang diterangkan Thom adalah berstruktur: makmal boleh menelan interaksi pengguna pada skala, manakala orang yang menjana data tersebut tidak mempunyai cara untuk mengaudit perkara yang diambil. Sehingga syarikat sama ada membuka saluran latihan mereka untuk meneliti atau mengenakan tembok api yang keras dan boleh disahkan antara perbualan pelanggan dan latihan model, setiap pernyataan "kami tidak menggunakan data anda" akan membawa asterisk tersirat — dan setiap kejayaan akan datang dengan ahli matematik, dan semakin ramai penyelidik dalam bidang lain, meminta bukti.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →