Sakana AI опублікував «Beyond Imitation» — дослідницьку статтю в журналі Transactions on Machine Learning Research (TMLR), в якій описується система рецензування за допомогою LLM, побудована на виявленні помилок, а не на імітації людських рецензій, повідомляє MarkTechPost 10 жовтня. Головне питання, на яке токійська лабораторія збиралася відповісти: замість того, щоб оцінювати рецензента ШІ за тим, наскільки його результати відповідають людським рецензіям, чи може вона знайти підсаджену помилку?
Команда надіслала два артефакти: Contradiction Benchmark для виявлення помилок у вимірюванні та систему багаторівневого перегляду (MLR), яка керувала кожним базовим тестуванням. Результати отримані на тлі зростаючого інтересу до використання штучного інтелекту для посилення експертної оцінки — процесу, який перебуває під напругою через різке збільшення обсягів подання. Щоб дізнатися більше про те, як штучний інтелект змінює форму самих досліджень, слідкуйте за нашими останніми розробками ШІ.
Еталон насаджених помилок
Contradiction Benchmark вкладає помилки в реальні документи та перевіряє, чи вловлюють їх рецензенти. Дослідники зібрали 257 статей із ліцензією CC з ACL, AISTATS, CVPR та ICML 2025, а також NeurIPS 2024, а потім використали Gemini 2.5 Pro, щоб побудувати графік знань із тверджень, доказів і методів кожної статті.
Ступінь серйозності визначається структурно: відстань вузла від «основної вимоги» паперу визначає, наскільки центральною є помилка. Нульова відстань потрапляє на основне твердження; більші відстані вражають опорні деталі. Потім GPT-4.1 переписує один вузол на відстань у протиріччя, створюючи загалом 1164 точки даних. Суддя o3 оцінює кожен огляд десять разів. На чистих паперах суддя досяг 99,9% точності, і він показав 86,8% чутливості на підтверджених вручну уловах — це означає, що повідомлені результати виявлення насправді можуть бути консервативними.
Як працює багаторівневий огляд
MLR — це агентна система, яка розуміє статтю перед тим, як її критикувати, зібрана з трьох спеціалізованих агентів, що працюють на готових моделях Claude — без кластера GPU і тонкого налаштування:
- Агент додатка (Claude Haiku 3.5): підсумовує експерименти та деталі реалізації з додатка.
- Агент з огляду літератури (Клод Сонет 4, необов’язково): використовує веб-пошук, щоб розмістити статтю в контексті попередньої роботи.
- Review Agent (Claude Sonnet 4): запускає трипрохідний ланцюжок підказок, натхненний відомим «Підходом трьох проходів» комп’ютерного вченого С. Кешава — спочатку схема високого рівня, потім детальне читання, що позначає слабкі місця, припущення та прогалини, і, нарешті, об’єднує всі вихідні дані агента в сильні сторони, слабкі сторони, запитання, рекомендацію, оцінку та список справ.
PDF-файл передається моделям напряму, тому малюнки та рівняння залишаються обробленими. Система читає до 10 сторінок основного тексту, і Сакана оцінює вартість приблизно в $0,47 за рецензію.
Результати: дизайн і вибір моделі мають значення
MLR лідирував у всіх чотирьох тестованих системах. Завдяки чотирьом незалежним перевіркам було виявлено 73,43% протиріч основних тверджень (нульова відстань) і 40,95% загалом. Найкраща базова лінія, система під назвою AgentReview, впоралася лише на 14,81% основних вимог. Навіть один огляд MLR виявив 60,79% основних помилок у заявах.
Дослідження абляції відокремлює внесок дизайну від вибору моделі. Заміна GPT-4.1 на Claude Sonnet 4 у рамках існуючого конвеєру рецензування збільшила виявлення основних претензій з 14,56% до 35,40%, тоді як багатоагентний дизайн MLR додав ще приблизно 25 відсоткових пунктів для одного рецензування. Точність виявлення падає, коли помилки віддаляються від основного твердження, яке, за словами авторів, підтверджує оцінку серйозності.
Зображення темнішає на брудніших реальних даних. На WithdrarXiv-Check, наборі з 211 фактично відкликаних документів arXiv, MLR набрала 26,07% за «схожі» збіги та 16,11% за точні збіги — і система залишається вразливою до прихованого швидкого введення в текст рукопису. Іншими словами, читати справжні відкликані документи набагато важче, ніж вловлювати синтетичні протиріччя.
Що це означає для рецензування
Найпрактичніший висновок дослідження може бути найменш привабливим: як дизайн системи, так і вибір моделі суттєво сприяють виявленню помилок, а рецензенти, які читають, перш ніж судити, знаходять набагато серйозніші помилки, ніж ті, які збігаються з шаблоном у тексті перевірки руками. Ця різниця має значення, оскільки більшість попередніх робіт із перевірки за допомогою штучного інтелекту оптимізовано для узгодження з людськими судженнями — показник, який винагороджує відповідність, що звучить впевнено, а не справжню перевірку.
Результати Сакани не свідчать про те, що штучний інтелект готовий замінити людей-референтів — систему, яка пропускає більшість помилок на справжніх відкликаних паперах і нею можна маніпулювати за допомогою вбудованих підказок, краще розглядати як допоміжний рівень, а не як орган. Синтетичні помилки тесту також чистіші, ніж статистичні неоднозначності та суперечливі інтерпретації, які домінують у реальних розбіжностях у експертній оцінці, тому ефективність насаджених протиріч слід сприймати як стелю, а не як обіцянку.
Але при приблизно 0,47 долара за рецензію, з найвищим рівнем виявлення помилок серед усіх перевірених систем, MLR вказує на найближчий період, коли рецензенти штучного інтелекту перевірятимуть протиріччя першого проходу, а рецензенти-люди зосереджуватимуться на судженнях, які машини ще не можуть зробити. Журнали та організатори конференцій, які експериментують із рецензуванням за допомогою LLM, тепер мають як загальнодоступний еталон, так і надійну базу для порівняння своїх власних систем — і, якщо розрив між 73,43% і 14,81% збережеться, це чіткий сигнал, що архітектура читання важливіша, ніж розмір сирої моделі.
---
Будьте попереду ШІОтримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.
Читати більше новин AI →