Проблеми, які Astra допомогла зламати, не спостерігали «жодного прогресу в їхніх центральних результатах принаймні протягом десятиліття, а в більшості випадків набагато довше», пише OpenAI. Результати охоплюють такі галузі, як високовимірна геометрія, теорія кодування, складність арифметичних схем, теорія груп, квантова складність, ґраткова криптографія та екстремальна комбінаторика — територія, де прогрес зазвичай вимірюється роками, а не окремими дослідженнями.
Перевірені докази, а не просто відповіді
Що відрізняє результат Astra від чат-бота, який вгадує математику, так це перевірка. OpenAI сказав, що дослідники-люди використовували ту саму модель для підготовки аргументів у вигляді рукописів, а потім Astra формалізувала кожен аргумент як Lean сертифікат. Lean — це помічник із відкритим вихідним кодом, який може машинно перевіряти математичні аргументи, тобто іншим математикам не потрібно вірити результатам — їх можна незалежно перевірити за допомогою програмного забезпечення за лічені секунди.
Ця різниця має значення. Мовна модель може створити правдоподібний доказ, який містить тонку фатальну помилку. Завдяки перекладу кожного аргументу на Lean OpenAI перетворив маркетингову заяву на перевірений артефакт. За даними BleepingComputer, які повідомили подробиці, конкретні досягнення включають доказ існування несуфічних груп, вирішення великого відкритого питання в теорії груп; спростування гіпотези Конна про жорсткість; нові межі для упаковки високорозмірних сфер; і результати вирішення кількох проблем, спочатку поставлених плідним математиком Полом Ердешем.
OpenAI зазначив, що загальна кількість токенів, необхідних для пошуку цих рішень, коштуватиме приблизно 2000 доларів США за нинішніми ставками API — це вражаюча інформація про обчислювальний слід сучасних математичних відкриттів і така, що робить дослідження передового рівня доступними для добре фінансованих академічних команд, а не лише для самих лабораторій.
Математики реагують
Томас Блум, математик з Університету Манчестера, який керує довідковим сайтом із проблем Ердеша erdosproblems.com, назвав результати «великою новиною» на X, повідомляє The Decoder. Він оцінив їх як важливіші, ніж контрприклад до гіпотези про одиницю відстані, опублікованої в травні. «Можливо, не більше, ніж доказ одиничної відстані, але з точки зору конструкцій, це велике», — написав Блум.Блум також заперечив думку про те, що штучний інтелект замінює математиків, стверджуючи, що це твердження не має сенсу, оскільки система спирається на теорію понад століття, була створена математиками та була навчена всьому, що коли-небудь писали математики.
Ноам Браун, дослідник, який розробляє технологію вимірювання часу тестування, на яку спирається Astra, був більш виваженим. «На жаль, проблем з премією тисячоліття (поки що) немає», — написав він на X, маючи на увазі сім відомих проблем, для яких Інститут математики Клея пропонує по 1 мільйону доларів кожна — лише одна була розв’язана з моменту оголошення премій у 2000 році.Не всі були вражені. Критик штучного інтелекту Гері Маркус назвав модель «чудовою, але значно перепроданою» в публікації Substack, знайома лінія скепсису щоразу, коли передова лабораторія заявляє про віху. Напруга між справжніми технічними досягненнями та рекламним оформленням, ймовірно, визначить, як сприймають Astra.
Нова модель сім'ї для довгих завдань
Інформація незалежно підтвердила, що Astra — це нове сімейство моделей, створене для тривалих робочих навантажень. OpenAI описує це як систему, яка дозволяє декільком агентам штучного інтелекту співпрацювати над різними частинами більшої проблеми — дизайн, спрямований прямо на завдання, які займають години або дні, а не секунди, наприклад, доведення теореми або рефакторинг великої кодової бази.
BleepingComputer повідомив, що OpenAI не вирішив, чи буде модель поставлятися як GPT-5.7, GPT-6 або під іншою назвою. Генеральний директор Сем Альтман уже продемонстрував Astra у Вашингтоні, округ Колумбія, повідомляє The Decoder, сигналізуючи про те, що компанія вважає систему достатньо зрілою, щоб представити її політикам.
Перешкода урядового перегляду
Мабуть, найбільш важливою деталлю є нормативна. Згідно з The Decoder, Astra стане однією з перших моделей, які пройдуть запланований процес перевірки урядом США, який потребує офіційного схвалення перед публічним випуском. Це додає рівень політичної невизначеності до термінів запуску, з яким ніколи не стикалися попередні флагманські моделі, і підвищує ставки на те, як OpenAI характеризує можливості Astra.
Дебют також відбувся серед запеклої гонки у відкритій вазі. Кілька днів тому лабораторія Thinking Machines Lab випустила свою відкриту модель Inkling-Small, а китайські лабораторії продовжують просувати відкриті граничні системи. Astra свідчить про ставку OpenAI на те, що запатентовані широкомасштабні міркування — перевірені такими інструментами, як Lean — залишаються шляхом до найбільших проривів.
Наразі Astra залишається невипущеною. Але його математичний дебют уже переосмислив розмову про те, які передові системи штучного інтелекту можуть сприяти чистій науці, і наскільки уважно громадськість повинна вивчати твердження, які їх супроводжують.
Будьте попереду ШІ
Хочете йти в ногу з такими розробками, як Astra та ширшою передовою модельною гонкою? Додайте в закладки наш центр для останніх розробок ШІ.
Читати більше новин AI →