Sakana AI опубликовала в журнале Transactions on Machine Learning Research (TMLR) исследовательскую работу «За гранью имитации», в которой описывается система рецензирования с помощью LLM, построенная на обнаружении ошибок, а не на имитации отзывов людей, сообщил MarkTechPost 10 октября. Центральный вопрос, на который намеревалась ответить токийская лаборатория: вместо того, чтобы оценивать рецензента ИИ по тому, насколько близко его результаты соответствуют отзывам людей, может ли он найти заведомую ошибку?

Команда представила два продукта: тест противоречий для измерения обнаружения ошибок и систему многоуровневого анализа (MLR), которая проводила каждое тестирование базовых показателей. Результаты получены на фоне растущего интереса к использованию искусственного интеллекта для поддержки экспертной оценки — процесса, который испытывает трудности из-за растущих объемов заявок. Чтобы узнать больше о том, как ИИ меняет сами исследования, следите за нашими последними разработками в области ИИ.

Эталон намеренных ошибок

Тест противоречий вносит ошибки в реальные статьи и проверяет, обнаруживают ли их рецензенты. Исследователи собрали 257 статей, лицензированных CC, из ACL, AISTATS, CVPR и ICML 2025, а также NeurIPS 2024, а затем использовали Gemini 2.5 Pro для построения графика знаний утверждений, доказательств и методов каждой статьи.

Серьезность определяется структурно: расстояние узла от «основной претензии» статьи определяет, насколько центральной является ошибка. Нулевое расстояние соответствует основному утверждению; на больших расстояниях поражаются опорные детали. Затем GPT-4.1 переписывает один узел на каждое расстояние в противоречие, создавая в общей сложности 1164 точки данных. Судья o3 оценивает каждый отзыв десять раз. На чистых бумагах эксперт достиг точности 99,9% и показал чувствительность 86,8% на подтвержденных вручную уловах — это означает, что сообщаемые оценки обнаружения могут на самом деле быть консервативными.

Как работает многоуровневая проверка

MLR — это агентная система, которая понимает статью, прежде чем ее критиковать, собранная из трех специализированных агентов, работающих на готовых моделях Claude — без кластера графического процессора и тонкой настройки:

  • Агент приложения (Claude Haiku 3.5): обобщает эксперименты и детали реализации из приложения.
  • Агент по обзору литературы (Клод Сонет 4, необязательно): использует веб-поиск, чтобы поместить статью в контекст предыдущей работы.
  • Агент по проверке (Клод Сонет 4): запускает трехэтапную цепочку подсказок, вдохновленную известным «трехэтапным подходом» ученого-компьютерщика С. Кешава — сначала общий план, затем подробное чтение с указанием слабых сторон, предположений и пробелов и, наконец, объединение всех результатов агента в сильные и слабые стороны, вопросы, рекомендации, оценки и список дел.

PDF-файл передается в модели напрямую, поэтому рисунки и уравнения сохраняются при обработке. Система читает до 10 страниц основного текста, и Сакана оценивает стоимость примерно в 0,47 доллара за отзыв.

Результаты: выбор конструкции и модели имеют значение

MLR возглавила все четыре системы, протестированные в эталонном тесте. Благодаря четырем независимым проверкам было выявлено 73,43% противоречий в основных утверждениях (нулевая дистанция) и 40,95% в целом. Лучший базовый показатель, система под названием AgentReview, справилась только с 14,81% по основным претензиям. Даже одна проверка MLR выявила 60,79% ошибок в основных утверждениях.

Исследование абляции отделяет вклад дизайна от выбора модели. Замена GPT-4.1 на Claude Sonnet 4 в существующем конвейере проверок повысила уровень обнаружения основных претензий с 14,56% до 35,40%, а многоагентная конструкция MLR добавила примерно на 25 процентных пунктов больше для одной проверки. Точность обнаружения падает по мере того, как ошибки отходят от основного утверждения, которое, по словам авторов, поддерживает оценку серьезности.

Картина темнеет на более запутанных, реальных данных. На WithdrarXiv-Check, наборе из 211 фактически отозванных статей arXiv, MLR набрал 26,07% по «похожим» совпадениям и 16,11% по точным совпадениям — и система остается уязвимой для скрытых подсказок, внедренных в текст рукописи. Другими словами, читать настоящие отозванные статьи гораздо сложнее, чем выявлять синтетические противоречия.

Что это значит для экспертной оценки

Самый практический вывод исследования, возможно, наименее привлекательный: как проектирование системы, так и выбор модели существенно влияют на обнаружение ошибок, и рецензенты, которые читают, прежде чем судить, находят гораздо более серьезные ошибки, чем те, которые сопоставляют шаблоны в тексте, написанном людьми. Это различие имеет значение, поскольку большая часть предыдущих работ по проверке с помощью ИИ была оптимизирована для согласования с человеческими суждениями — показателя, который вознаграждает за уверенно звучащее соответствие, а не за искреннюю проверку.

Результаты Саканы не предполагают, что ИИ готов заменить рецензентов-людей — систему, которая пропускает большинство ошибок в подлинных отозванных статьях и которой можно манипулировать с помощью встроенных подсказок, лучше всего рассматривать как вспомогательный уровень, а не как авторитетный источник. Синтетические ошибки эталонного теста также чище, чем статистические двусмысленности и спорные интерпретации, которые доминируют в реальных разногласиях при экспертной оценке, поэтому результаты по выявленным противоречиям следует рассматривать как потолок, а не обещание.

Но при цене примерно 0,47 доллара за обзор и самом высоком уровне обнаружения ошибок среди всех протестированных систем MLR указывает на краткосрочную перспективу, когда рецензенты ИИ будут выполнять первоначальный отбор противоречий, в то время как рецензенты-люди сосредоточатся на суждениях, которые машины все еще не могут вынести. Журналы и организаторы конференций, экспериментирующие с обзорами с помощью LLM, теперь имеют как общедоступный эталон, так и прочную основу для измерения своих собственных систем — и, если разрыв между 73,43% и 14,81% сохранится, это явный сигнал о том, что чтение архитектуры имеет большее значение, чем размер сырой модели.

---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →