Google DeepMind объявила 27 августа о том, что она называет первой в мире двойной слепой оценкой запатентованной модели искусственного интеллекта передового класса — криптографической установки, предназначенной для того, чтобы позволить сторонним экспертам проводить стресс-тестирование моделей Google, при этом ни одна из сторон никогда не узнает секретов другой.

Пилотный проект, описанный в блоге DeepMind Уильямом Исааком, Солом Мессингом и Кристианом Лумом, запускает модель Gemini Flash Lite через конфиденциальные тесты в криптографически безопасной среде. Google DeepMind сотрудничает с Сингапурским институтом безопасности искусственного интеллекта, OpenMined, AVERI и MLCommons и опубликовал технический отчет с описанием методологии.

В этом объявлении рассматривается один из наиболее распространенных недостатков в оценке ИИ: загрязнение тестов. Для читателей, отслеживающих [новости исследований искусственного интеллекта] (https://aibuzzwire.news), это представляет собой одну из наиболее конкретных попыток сделать стороннее тестирование моделей проверяемым и чистым.

Объяснение проблемы загрязнения

DeepMind открывает свое объявление аналогией с классом. Если студент случайно заранее увидит вопросы экзамена, высший балл ничего не значит. Та же логика применима и к пограничным моделям: если модель уже подвергалась вопросам в тесте — через данные обучения, утечку оценочных наборов или предварительную оптимизацию — полученные оценки могут значительно преувеличить реальные возможности.

Это не гипотетическая проблема. Загрязнение эталонных тестов преследовало эту область в течение многих лет: исследователи неоднократно показывали, что популярные наборы тестов просачиваются в обучающие веб-корпуса и что модели можно незаметно настроить для обеспечения хороших результатов в известных оценках. Когда правительства и предприятия используют контрольные показатели для принятия решений о закупках и политике, завышенные цифры имеют реальные последствия.

По мере того, как модели становятся более функциональными, утверждает DeepMind, ставки становятся самыми высокими для чувствительных категорий оценки (главные из них – тестирование кибербезопасности и правительственные оценки), где искаженная оценка не просто вводит в заблуждение, но и потенциально опасна.

Старый компромисс: ваши подсказки или наши веса

Исторически сложилось так, что внешние оценки с высокими ставками вынуждали делать неудобный выбор. Либо оценщик передал свои запросы на тестирование провайдеру модели (рискуя, что провайдер увидит тестовые вопросы заранее), либо провайдер передал оценщику веса модели, рискуя потерять свою наиболее ценную интеллектуальную собственность.

Протоколы нулевого протоколирования и строгие договорные гарантии уже давно обеспечивают конфиденциальность внешних тестовых запросов, пишет DeepMind, но эти обещания выполняются политикой, а не математикой. Двойные слепые оценки заменяют это доверие криптографическими доказательствами.

Как работает криптографический ящик

Пилотный проект использует Confidential Space, часть портфолио Google Cloud Confidential Computing, для создания того, что DeepMind называет криптографическим «коробкой». Внутри него обе половины оценки — конфиденциальный тест и проприетарная модель — остаются конфиденциальными для своих владельцев, и среда криптографически проверяет этот факт.

Результат на самом деле является двойным слепым: внешний оценщик не может видеть веса модели Gemini, а Google не может видеть тестовые подсказки оценщика. Ни одна из сторон не обязана доверять обещаниям другой, поскольку сама архитектура делает утечку информации невозможной в принципе. Крайне важно, что эта установка также предотвращает дальнейшее использование данных оценки для оптимизации производительности модели перед будущими испытаниями, замыкая цикл, через который загрязнение обычно проникает обратно.

Почему это важно для надзора за ИИ

Более широкое значение выходит за рамки одной модели Близнецов. Независимые организации — институты безопасности ИИ, академические лаборатории, регулирующие органы — в течение многих лет боролись за то, чтобы строго оценить модели с закрытыми границами именно потому, что поставщики не могут передать веса, а оценщики не будут передавать тесты. Каждый крупный институт безопасности ИИ столкнулся с разными вариантами этой проблемы при подписании соглашений об оценке с пограничными лабораториями.

Если пилотный проект окажется успешным, он станет шаблоном, согласно которому суверенитет данных и интеллектуальная собственность выдержат контакт с независимой проверкой. DeepMind заявляет, что надеется, что пилотный проект «открывает новые горизонты для надзора за моделями, помогая всей отрасли создавать более безопасные, надежные и широко пользующиеся доверием системы искусственного интеллекта».

Список партнеров примечателен сам по себе. Сингапурский институт безопасности ИИ — один из наиболее активных национальных оценочных органов; OpenMined создает инструменты вычислений, сохраняющие конфиденциальность; MLCommons стандартизирует отраслевой бенчмаркинг. AVERI завершает консорциум, включающий правительственные, академические и отраслевые органы по стандартизации — группы, которым необходимо будет принять двойную слепую оценку, чтобы она стала нормой, а не демонстрацией.

Гонка вооружений за честность оценки

Это заявление прозвучало на фоне растущего внимания к тому, как компании, занимающиеся искусственным интеллектом, оценивают себя. Лаборатории сталкиваются с растущими обвинениями в том, что они выбирают благоприятные тесты, а независимые таблицы лидеров стали влиятельными именно потому, что они находятся вне контроля поставщиков. Двойная слепая оценка расширяет это движение за независимость внутри собственной инфраструктуры поставщика — заметный сдвиг для компаний, которые исторически настаивали на контроле каждой детали тестирования своих моделей.

На данный момент пилотный проект охватывает одну модель и набор конфиденциальных тестов. Но если криптографически проверенная, незагрязненная оценка станет технически рутинной, это может изменить то, что предприятия и регулирующие органы ожидают от каждой пограничной лаборатории, и сделать «доверие нашему результату» более трудным для продажи на рынке, который все больше строится на проверяемых заявлениях.

---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →