27 серпня Google DeepMind оголосив про те, що він називає першою в світі подвійною сліпою оцінкою власної моделі штучного інтелекту передового класу — криптографічної установки, розробленої, щоб дозволити стороннім експертам проводити стрес-тестування моделей Google, жодна зі сторін ніколи не бачить секретів іншої.
Пілотний проект, описаний у публікації блогу DeepMind Вільямом Айзеком, Солом Мессінгом і Крістіаном Лумом, запускає модель Gemini Flash Lite через конфіденційні тести в криптографічно безпечному середовищі. Google DeepMind співпрацює з Сінгапурським інститутом безпеки штучного інтелекту, OpenMined, AVERI та MLCommons і опублікував технічний звіт із описом методології.
Оголошення стосується однієї з найпоширеніших слабких сторін оцінки штучного інтелекту: забруднення тестів. Для читачів, які відстежують [новини дослідження AI] (https://aibuzzwire.news), це одна з більш конкретних спроб зробити тестування моделей сторонніх розробників перевірено чистим.
Проблема забруднення, пояснення
DeepMind починає своє оголошення аналогією з класною кімнатою. Якщо студент випадково побачить екзаменаційні запитання заздалегідь, відмінний бал нічого не означає. Така ж логіка застосовується до граничних моделей: якщо модель вже була піддана питанням у бенчмарку — через навчальні дані, витік наборів оцінок або попередню оптимізацію — отримані результати можуть значно перевищувати реальні можливості.
Це не гіпотетична проблема. Забруднення бенчмарків переслідувало поле протягом багатьох років, і дослідники неодноразово демонстрували, що популярні набори тестів просочуються в навчальні корпуси веб-масштабу, і що моделі можна спокійно налаштувати, щоб добре працювати при відомих оцінках. Коли уряди та підприємства використовують контрольні показники для прийняття рішень щодо закупівель і політики, завищені цифри мають реальні наслідки.
Як стверджує DeepMind, у міру того, як моделі стають все більш спроможними, ставки стають найвищими для чутливих категорій оцінювання — тестування кібербезпеки та державні оцінки, головні серед яких — де заражений бал не просто вводить в оману, але й потенційно небезпечний.
Старий компроміс: ваші підказки чи наші ваги
Історично так склалося, що високі ставки ЗНО змушували робити незручний вибір. Оцінювач або передавав підказки щодо тестування постачальнику моделі — ризикуючи тим, що постачальник побачить тестові запитання заздалегідь, — або постачальник передавав оцінювачу ваги моделі — ризикуючи втратою своєї найціннішої інтелектуальної власності.
DeepMind пише, що протоколи без реєстрації та суворі договірні гарантії довго зберігали конфіденційність підказок щодо зовнішніх тестів, але це обіцянки, які виконуються політикою, а не математикою. Подвійне сліпе оцінювання замінює цю довіру криптографічним доказом.
Як працює криптографічний ящик
Пілотний проект використовує Confidential Space, частину портфоліо конфіденційних обчислень Google Cloud, щоб створити те, що DeepMind описує як криптографічний «ящик». Всередині нього обидві половини оцінювання — конфіденційний тест і запатентована модель — залишаються приватними для відповідних власників, а середовище криптографічно перевіряє цей факт.
Результат справді подвійний сліпий: зовнішній оцінювач не може бачити вагові коефіцієнти моделі Gemini, а Google не може бачити тестові підказки оцінювача. Жодна сторона не повинна довіряти обіцянкам іншої, оскільки сама архітектура унеможливлює витік в принципі. Важливо те, що налаштування також запобігає використанню даних оцінки пізніше для оптимізації продуктивності моделі перед майбутнім тестуванням, замикаючи цикл, через який зазвичай повертається забруднення.
Чому це важливо для нагляду ШІ
Більш широке значення виходить за рамки однієї моделі Близнюків. Незалежні організації — інститути безпеки штучного інтелекту, академічні лабораторії, регулятори — роками боролися за сувору оцінку закритих граничних моделей саме тому, що постачальники не можуть передати ваги, а оцінювачі не передадуть контрольні показники. Кожен великий інститут безпеки штучного інтелекту стикався з версіями цієї проблеми, коли підписував угоди про оцінку з передовими лабораторіями.
Якщо пілот витримає, він запропонує шаблон, за яким суверенітет даних та інтелектуальна власність збережуться після незалежного контролю. DeepMind заявляє, що сподівається, що пілот «встановлює нові межі для нагляду за моделлю, допомагаючи ширшій галузі створювати безпечніші, надійніші та користуються довірою системи ШІ».
Список партнерів примітний сам по собі. Сінгапурський інститут безпеки штучного інтелекту є одним із найактивніших національних органів оцінки; OpenMined створює засоби обчислення, що зберігають конфіденційність; MLCommons стандартизує галузевий бенчмаркінг. AVERI об’єднує консорціум, що охоплює державні, наукові та галузеві органи зі стандартизації — групи, яким потрібно буде прийняти подвійне сліпе оцінювання, щоб воно стало нормою, а не демонстрацією.
Гонка озброєнь через чесність оцінювання
Оголошення з’явилося на тлі дедалі більшої уваги до того, як компанії зі штучним інтелектом оцінюють себе. Лабораторії стикаються з дедалі більшими звинуваченнями у вибору сприятливих тестів, а незалежні таблиці лідерів стали впливовими саме тому, що знаходяться поза контролем постачальників. Подвійне сліпе оцінювання розширює цей рух незалежності всередині власної інфраструктури постачальника — помітний зрушення для компаній, які історично наполягали на контролі кожної деталі того, як тестуються їхні моделі.
Наразі пілот охоплює одну модель і набір конфіденційних тестів. Але якщо криптографічно перевірена оцінка без зараження стане технічно звичайною справою, це може змінити те, що підприємства та регулятори очікують від кожної передової лабораторії — і зробити «довіряйте нашим оцінкам» важче продавати на ринку, який дедалі більше будується на перевірених твердженнях.
---
Будьте попереду ШІОтримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.
Читати більше новин AI →