Второй математик публично обвинил OpenAI в неэтичном и «нечестном» поведении в отношении данных, лежащих в основе его знаменитых математических прорывов, заявив, что компания не смогла доказать, что его личное взаимодействие с ChatGPT не способствовало результатам, объявленным с большой помпой в прошлом месяце.
В серии публикаций о Mastodon, опубликованных The Verge в среду, математик Андреас Том выразил обеспокоенность тем, что разговоры, которые он и его коллеги вели с ChatGPT до объявления OpenAI, возможно, способствовали успеху модели. Его вмешательство произошло всего через несколько дней после того, как профессор математики Нью-Йоркского университета Тристан Бакмастер публично поставил под сомнение, получили ли модели OpenAI пользу от его собственного использования инструмента Codex, превратив момент триумфа лаборатории в постоянный спор о происхождении обучающих данных. Подробнее об этой истории — в нашем последние разработки в ИИ.
От прорыва к негативной реакции
В августе OpenAI объявила, что ее система дала десять значимых результатов в области математики и теоретической информатики, каждый из которых проверен с помощью машинно-проверенных доказательств бережливого производства — веха, которую в то время освещал этот сайт, наряду с заявленным компанией решением проблемы Премии тысячелетия. Один из десяти результатов установил существование так называемых несофических групп, давно открытого вопроса в теории групп.
Этот результат находится в центре новых споров. По данным The Verge, OpenAI признала, что доказательство во многом основано на предыдущей работе Тома и его коллеги-математика Габора Куна, и после критики со стороны математических кругов за то, что поначалу они не признали их недавний вклад, компания незаметно внесла поправки в свое описание.
Для Тома это признание подняло неудобный вопрос: как модель смогла так детально освоить его и Куна техники?
Вопрос, по словам Тома, остался без ответа
Том сказал, что его поразило «детальное владение нашими методами OpenAI», которые, по его словам, не были ни самыми очевидными, ни самыми многообещающими путями к решению в то время. Он написал электронные письма исследователям OpenAI Себастьену Бубеку и Марку Селлке — последний также статистик в Гарварде — с вопросом, было ли его взаимодействие с ChatGPT «частью обучающих данных или доступно для процесса рассуждения» и, следовательно, могло ли оно способствовать полученному результату.
Ответ, который он получил, касался только того, можно ли получить прямой доступ к его разговорам, а не того, вошли ли они в огромные массивы данных, используемые для обучения и улучшения моделей компании. «Никаких оговорок, объяснений или доказательств предоставлено не было», — написал Том. «Я воспринимаю это как минимум нечестность».
В продолжении, цитируемом The Verge, он ужесточил обвинение: «Категоричный ответ Селлке был, как минимум, неоправданно широким и вводящим в заблуждение по существу; оглядываясь назад, он был явно нечестным».
Аргумент Тома касается не того, что сделал OpenAI, а того, кто несет бремя доказательства. Исследователи, по его словам, не имеют возможности провести реверс-инжиниринг системы обучения компании. «Только OpenAI располагает соответствующими данными для этого», — написал он — поэтому, если компания хочет отрицать, что пользовательские данные способствовали ее результатам, OpenAI несет ответственность за доказательство этого, раскрывая соответствующие наборы данных и поясняя, как она использует взаимодействие с клиентами.
Осторожные опровержения OpenAI
По данным The Verge, этот спор отражает действия компании в отношении заявленного ею прорыва Навье-Стокса, работу над которым Бакмастер проводил вместе с исследователем антропологии Левентом Альпёге в личном качестве. В сообщении в блоге, объявляющем об этом результате, OpenAI заявила: «Мы (исследователи и агенты) не видели ни одной из их работ, пока они не опубликовали ее публично — в частности, для решения этой проблемы не было доступа к конкретным пользовательским данным».
Но в том же сообщении допускался косвенный канал: «Хотя это маловероятно, мы не можем исключать, что обезличенные данные, полученные в результате использования ими наших продуктов, помогли улучшить наши модели».
Для Тома это различие является целой проблемой. «Деидентификация может удалить имя, но не удаляет интеллектуальное содержание математической идеи», — писал он. OpenAI не сразу ответила на запрос The Verge о комментариях.
Он добавил, что «было бы этически неоправданно», если бы закрытые исследования, предоставленные пользователями, помогли улучшить модели, которые компания затем использовала для того, чтобы привлечь тех же самых пользователей к публикации — без согласия, надлежащего раскрытия информации или признания.
Холод над математикой
Обстоятельства проведения Премии тысячелетия мало что помогли успокоить нервы. OpenAI заявила, что занялась этой проблемой после того, как услышала в Интернете слухи о том, что другие исследователи добились значительного прогресса, фактически подгоняя ученых к результату, к которому они стремились годами.
Многочисленные исследователи рассказали The Verge, что они обеспокоены тем, что такое поведение приведет к тому, что математика станет еще более секретной, если математики поверят, что даже слухи о неизбежном прорыве могут спровоцировать гонку против хорошо обеспеченного ресурсами технологического гиганта, жаждущего славы. Соответствующее сообщение The Verge — «Коварный математический прорыв OpenAI вызывает дрожь в академических кругах» — отразило настроение в этой области.
Этот эпизод приходится на деликатный момент для компаний, занимающихся искусственным интеллектом, и исследовательских сообществ, с которыми они все чаще сталкиваются. Какими бы ни были достоинства любого отдельного результата, асимметрия, которую описывает Том, носит структурный характер: лаборатории могут учитывать взаимодействие с пользователем в большом масштабе, в то время как люди, генерирующие эти данные, не имеют возможности проверить то, что было получено. До тех пор, пока компании не откроют свои каналы обучения для тщательного изучения или не введут жесткие, поддающиеся проверке барьеры между общением с клиентами и обучением моделей, каждое утверждение «мы не использовали ваши данные» будет неявно отмечено звездочкой — и каждый прорыв будет происходить с математиками и все чаще исследователями в других областях, требующими доказательств.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →