Anthropic ਦੇ Claude Opus 5 ਦੇ ARC-AGI-3 ਬੈਂਚਮਾਰਕ 'ਤੇ ਹਾਵੀ ਹੋਣ ਤੋਂ ਬਾਅਦ OpenAI ਪਿੱਛੇ ਹਟ ਰਿਹਾ ਹੈ, ਨਤੀਜੇ ਪ੍ਰਕਾਸ਼ਿਤ ਕਰ ਰਹੇ ਹਨ ਜੋ ਦਿਖਾਉਂਦੇ ਹਨ ਕਿ ਇਸਦਾ ਆਪਣਾ GPT-5.6 Sol ਮਾਡਲ 38.3 ਪ੍ਰਤੀਸ਼ਤ ਹੈ - ਬਸ਼ਰਤੇ ਤੁਸੀਂ ਅਧਿਕਾਰਤ ਟੈਸਟ ਹਾਰਨੈੱਸ ਦੀ ਬਜਾਏ OpenAI ਦੀਆਂ ਤਰਜੀਹੀ ਸੈਟਿੰਗਾਂ ਦੀ ਵਰਤੋਂ ਕਰੋ।

ਇਹ ਵਿਵਾਦ, ਜੋ 30 ਜੁਲਾਈ, 2026 ਨੂੰ ਹੋਇਆ ਸੀ, ਏਆਈ ਮੁਲਾਂਕਣ ਵਿੱਚ ਇੱਕ ਵਧ ਰਹੀ ਸਮੱਸਿਆ ਦੇ ਦਿਲ ਨੂੰ ਕੱਟਦਾ ਹੈ: ਬੈਂਚਮਾਰਕ ਹੁਣ ਸਿਰਫ਼ ਇੱਕ ਮਾਡਲ ਨੂੰ ਮਾਪਦੇ ਨਹੀਂ ਹਨ, ਸਗੋਂ ਇਸਦੇ ਦੁਆਲੇ ਸਮੁੱਚਾ ਤਕਨੀਕੀ ਪਾੜ ਲਪੇਟਿਆ ਹੋਇਆ ਹੈ। ਨਵੀਨਤਮ AI ਵਿਕਾਸ ਅਤੇ ਮਾਡਲ ਰੀਲੀਜ਼ਾਂ ਦੇ ਡੂੰਘੇ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ, AI Buzz Wire ਕਹਾਣੀ ਨੂੰ ਟਰੈਕ ਕਰ ਰਿਹਾ ਹੈ।

ਨੰਬਰ ਅਤੇ ਕੈਚ

ਓਪਨਏਆਈ ਨੇ ਰਿਪੋਰਟ ਕੀਤੀ ਕਿ GPT-5.6 Sol ARC-AGI-3 'ਤੇ 38.3 ਪ੍ਰਤੀਸ਼ਤ ਤੱਕ ਪਹੁੰਚਦਾ ਹੈ, ਜਿਸ ਨੇ ਐਂਥਰੋਪਿਕ ਦੇ ਕਲਾਉਡ ਓਪਸ 5 ਨੂੰ ਪਿੱਛੇ ਛੱਡਿਆ, ਜਿਸ ਨੇ ਪਹਿਲਾਂ ਬੈਂਚਮਾਰਕ ਦੇ ਰਿਕਾਰਡ ਨੂੰ ਚੌਗੁਣਾ ਕਰਨ ਤੋਂ ਬਾਅਦ 30.2 ਪ੍ਰਤੀਸ਼ਤ ਸਕੋਰ ਕੀਤਾ। ਚੇਤਾਵਨੀ ਮਹੱਤਵਪੂਰਨ ਹੈ: ਇਹ 38.3 ਪ੍ਰਤੀਸ਼ਤ ਅੰਕੜਾ OpenAI ਦੇ ਜਵਾਬ API ਦੀਆਂ ਦੋ ਵਿਸ਼ੇਸ਼ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ।

ਪਹਿਲਾ ਰਿਟੇਨਡ ਰੀਜ਼ਨਿੰਗ ਹੈ, ਜੋ ਹਰ ਕਿਰਿਆ ਤੋਂ ਬਾਅਦ ਇਸ ਨੂੰ ਰੱਦ ਕਰਨ ਦੀ ਬਜਾਏ ਕਦਮਾਂ ਦੇ ਵਿਚਕਾਰ ਵਿਚਾਰ ਦੀ ਲੜੀ ਨੂੰ ਸੁਰੱਖਿਅਤ ਰੱਖਦਾ ਹੈ। ਦੂਜਾ ਕੰਪੈਕਸ਼ਨ ਹੈ, ਜੋ ਇਸ ਨੂੰ ਕੱਟਣ ਦੀ ਬਜਾਏ ਪੁਰਾਣੇ ਸੰਦਰਭ ਦਾ ਸਾਰ ਦਿੰਦਾ ਹੈ, ਮਾਡਲ ਨੂੰ ਪੁਰਾਣੇ ਤਰਕ ਨੂੰ ਗੁਆਏ ਬਿਨਾਂ ਲੰਬੀਆਂ ਸਮੱਸਿਆਵਾਂ 'ਤੇ ਕੰਮ ਕਰਦੇ ਰਹਿਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ।

ARC ਪ੍ਰਾਈਜ਼ ਦੇ ਅਧਿਕਾਰਤ ਮਾਨਕੀਕ੍ਰਿਤ ਹਾਰਨੇਸ ਦੁਆਰਾ ਚਲਾਓ — ਜੋ ਜਾਣਬੁੱਝ ਕੇ ਸੇਬ-ਤੋਂ-ਸੇਬਾਂ ਦੀ ਤੁਲਨਾ ਨੂੰ ਯਕੀਨੀ ਬਣਾਉਣ ਲਈ ਪ੍ਰਦਾਤਾ-ਵਿਸ਼ੇਸ਼ ਸੈਟਿੰਗਾਂ ਤੋਂ ਬਚਦਾ ਹੈ — GPT-5.6 Sol ਸਿਰਫ਼ 7.8 ਪ੍ਰਤੀਸ਼ਤ ਦਾ ਪ੍ਰਬੰਧਨ ਕੀਤਾ ਗਿਆ ਹੈ। ਕਾਰਨ, ਓਪਨਏਆਈ ਦਾ ਤਰਕ ਹੈ, ਇਹ ਹੈ ਕਿ ਅਧਿਕਾਰਤ ਸੈੱਟਅੱਪ ਹਰ ਕਦਮ ਦੇ ਬਾਅਦ ਮਾਡਲ ਦੇ ਤਰਕ ਨੂੰ ਰੱਦ ਕਰਦਾ ਹੈ, ਉਹਨਾਂ ਕਾਰਜਾਂ 'ਤੇ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਲਈ ਨਿਰੰਤਰ ਬਹੁ-ਪੜਾਵੀ ਸੋਚ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।

ਸ਼ੁੱਧਤਾ ਲਈ ਬਣਾਇਆ ਗਿਆ ਇੱਕ ਬੈਂਚਮਾਰਕ

ARC-AGI-3 ਨੂੰ François Chollet ਅਤੇ ARC ਪ੍ਰਾਈਜ਼ ਟੀਮ ਦੁਆਰਾ ਇੱਕ ਮਾਡਲ ਦੀ ਨਵੀਂ ਤਰਕ ਦੀਆਂ ਬੁਝਾਰਤਾਂ ਨੂੰ ਹੱਲ ਕਰਨ ਦੀ ਯੋਗਤਾ ਦੀ ਜਾਂਚ ਕਰਨ ਲਈ ਡਿਜ਼ਾਇਨ ਕੀਤਾ ਗਿਆ ਸੀ ਜੋ ਇਸਨੇ ਪਹਿਲਾਂ ਕਦੇ ਨਹੀਂ ਵੇਖੀਆਂ - ਯਾਦ ਕੀਤੇ ਗਿਆਨ ਦੀ ਬਜਾਏ ਆਮ ਬੁੱਧੀ ਦਾ ਟੈਸਟ। ਤੁਲਨਾਵਾਂ ਨੂੰ ਨਿਰਪੱਖ ਰੱਖਣ ਲਈ, ਇੱਕ ਨਿਰਪੱਖ ਵਾਤਾਵਰਨ ਵਿੱਚ ਕੱਚੇ ਮਾਡਲ ਦੀ ਸਮਰੱਥਾ ਨੂੰ ਮਾਪਦੇ ਹੋਏ, ਅਧਿਕਾਰਤ ਹਾਰਨੇਸ ਜਾਣਬੁੱਝ ਕੇ ਪ੍ਰਦਾਤਾ-ਵਿਸ਼ੇਸ਼ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਨੂੰ ਦੂਰ ਕਰ ਦਿੰਦਾ ਹੈ।

ਓਪਨਏਆਈ ਦੀ ਵਿਰੋਧੀ ਦਲੀਲ ਇਹ ਹੈ ਕਿ ਇਹ ਨਿਰਪੱਖਤਾ ਇੱਕ ਰੁਕਾਵਟ ਬਣ ਸਕਦੀ ਹੈ। ਕੰਪਨੀ ਦਾ ਦਾਅਵਾ ਹੈ ਕਿ ਅਧਿਕਾਰਤ ਵਰਤੋਂ ਇੱਕ ਪੁਰਾਣੇ "ਓਪਨਏਆਈ-ਸਟਾਈਲ ਕੰਪਲੀਸ਼ਨ API" 'ਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ ਜਿਸ ਵਿੱਚ ਕਲੌਡ API ਦੁਆਰਾ ਪਹਿਲਾਂ ਹੀ ਪੇਸ਼ ਕੀਤੀ ਗਈ ਸਮਰੱਥਾਵਾਂ ਦੀ ਘਾਟ ਸੀ, ਜਿਸ ਨਾਲ ਓਪਨਏਆਈ ਨੂੰ ਅਸਲ ਤੁਲਨਾ ਵਿੱਚ ਐਂਥਰੋਪਿਕ ਦੇ ਮੁਕਾਬਲੇ ਇੱਕ ਢਾਂਚਾਗਤ ਨੁਕਸਾਨ 'ਤੇ ਅਸਰਦਾਰ ਢੰਗ ਨਾਲ ਪਾ ਦਿੱਤਾ ਗਿਆ ਸੀ।

ਸੰਖੇਪ ਰੂਪ ਵਿੱਚ, ਓਪਨਏਆਈ ਕਹਿ ਰਿਹਾ ਹੈ: ਤੁਸੀਂ ਸਾਡੇ ਮਾਡਲ ਨੂੰ ਇੱਕ ਹੱਥ ਪਿੱਛੇ ਬੰਨ੍ਹ ਕੇ ਮਾਪਿਆ ਹੈ।

ਚੋਲੇਟ ਦਾ ਜਵਾਬ

ARC ਇਨਾਮ ਦੇ ਸਹਿ-ਸੰਸਥਾਪਕ ਫ੍ਰਾਂਕੋਇਸ ਚੋਲੇਟ ਨੇ ਦੋ ਕਿਸਮਾਂ ਦੇ ਟੈਸਟ ਸੈੱਟਅੱਪਾਂ ਵਿਚਕਾਰ ਇੱਕ ਸਪਸ਼ਟ ਲਾਈਨ ਖਿੱਚ ਕੇ ਜਵਾਬ ਦਿੱਤਾ। ਉਸ ਨੇ ਕਿਹਾ, "ਬੈਂਚਮਾਰਕ ਨੂੰ ਹੱਲ ਕਰਨ ਲਈ ਕਸਟਮ-ਬਣਾਇਆ ਜਾਂ ਜਿਸ ਵਿੱਚ ਬੈਂਚਮਾਰਕ ਫਾਰਮੈਟ ਬਾਰੇ ਜਾਣਕਾਰੀ ਹੁੰਦੀ ਹੈ" ਸੀਮਾਵਾਂ ਤੋਂ ਬਾਹਰ ਹਨ। ਪਰ ਆਮ-ਉਦੇਸ਼ API ਸੈਟਿੰਗਾਂ "ਜੋ ARC-AGI-3 ਲਈ ਵਿਕਸਤ ਨਹੀਂ ਕੀਤੀਆਂ ਗਈਆਂ ਸਨ ਅਤੇ ਜੋ ਸਾਰੇ API ਉਪਭੋਗਤਾਵਾਂ ਲਈ ਉਪਲਬਧ ਹਨ" ਨਿਰਪੱਖ ਗੇਮ ਹਨ।

ਅਸਲ ਵਿੱਚ, ਚੋਲੇਟ ਨੇ ਮੰਨਿਆ ਕਿ ARC ਇਨਾਮ ਦੇ ਆਪਣੇ GPT-5.6 ਸੋਲ ਸਕੋਰ ਨੇ OpenAI ਨੂੰ ਨੁਕਸਾਨ ਪਹੁੰਚਾਇਆ। ਉਸਨੇ ਨੋਟ ਕੀਤਾ ਕਿ ਸੰਗਠਨ ਨੇ "ਓਪਨਏਆਈ ਦੇ ਨਾਲ ਆਪਣੇ ਮਾਡਲਾਂ ਦੀ ਸਭ ਤੋਂ ਵਧੀਆ ਜਾਂਚ ਕਿਵੇਂ ਕਰਨੀ ਹੈ, ਖਾਸ ਤੌਰ 'ਤੇ ਕੰਪੈਕਸ਼ਨ ਦੇ ਸਬੰਧ ਵਿੱਚ" ਬਾਰੇ ਬਹੁਤ ਕੁਝ ਕੀਤਾ ਹੈ, ਅਤੇ ਕੰਪਨੀ ਦਾ "ਜਵਾਬ ਲੱਭਣਾ ਸ਼ੁਰੂ ਕਰਨ" ਦਾ ਸਵਾਗਤ ਕੀਤਾ ਹੈ।

ਚੋਲੇਟ ਨੇ ਇੱਕ ਬਾਕੀ ਚਿੰਤਾ ਨੂੰ ਫਲੈਗ ਕੀਤਾ. ਵੱਖੋ-ਵੱਖਰੀਆਂ ਸੈਟਿੰਗਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨ ਵਾਲੇ ਵੱਖ-ਵੱਖ ਪ੍ਰਦਾਤਾ ਉਸ ਨੂੰ "ਇੱਕ ਸੰਭਾਵੀ ਸਮਾਨਤਾ ਮੁੱਦਾ" ਕਹਿੰਦੇ ਹਨ - ਪਰ ਉਹ ਮੰਨਦਾ ਹੈ ਕਿ "ਜਦੋਂ ਤੱਕ ਸੈਟਿੰਗਾਂ ਅਤੇ ਲਾਗਤ ਸਪਸ਼ਟ ਤੌਰ 'ਤੇ ਰਿਪੋਰਟ ਕੀਤੀ ਜਾਂਦੀ ਹੈ।"

ਇਹ ਲੀਡਰਬੋਰਡ ਤੋਂ ਪਰੇ ਕਿਉਂ ਮਹੱਤਵਪੂਰਣ ਹੈ

ਐਪੀਸੋਡ ਇੱਕ ਤਣਾਅ ਨੂੰ ਰੇਖਾਂਕਿਤ ਕਰਦਾ ਹੈ ਜੋ ਮੁੜ ਆਕਾਰ ਦੇ ਰਿਹਾ ਹੈ ਕਿ ਕਿਵੇਂ AI ਉਦਯੋਗ ਪ੍ਰਗਤੀ ਦਾ ਮੁਲਾਂਕਣ ਕਰਦਾ ਹੈ। ਜਿਵੇਂ ਕਿ ਮਾਡਲ ਸਟੈਂਡਅਲੋਨ ਸਿਸਟਮਾਂ ਦੀ ਬਜਾਏ ਵਿਸ਼ੇਸ਼ਤਾ-ਅਮੀਰ API ਦੁਆਰਾ ਤੇਜ਼ੀ ਨਾਲ ਤੈਨਾਤ ਕੀਤੇ ਜਾ ਰਹੇ ਹਨ, ਇੱਕ ਮਾਡਲ ਦੀ ਅੰਦਰੂਨੀ ਯੋਗਤਾ ਅਤੇ ਇਸਦੇ ਆਲੇ ਦੁਆਲੇ ਦੀ ਇੰਜੀਨੀਅਰਿੰਗ ਵਿਚਕਾਰ ਲਾਈਨ ਧੁੰਦਲੀ ਹੁੰਦੀ ਰਹਿੰਦੀ ਹੈ। ਇੱਕ ਬੈਂਚਮਾਰਕ ਜੋ ਸਕੈਫੋਲਡਿੰਗ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਦਾ ਹੈ ਅਸਲ-ਸੰਸਾਰ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਨੂੰ ਘੱਟ ਸਮਝ ਸਕਦਾ ਹੈ; ਇੱਕ ਜੋ ਇਸ ਨੂੰ ਅਪਣਾ ਲੈਂਦਾ ਹੈ, ਉਹ ਕੰਪਨੀਆਂ ਨੂੰ ਟੈਸਟ ਗੇਮਿੰਗ ਲਈ ਇਨਾਮ ਦੇ ਸਕਦਾ ਹੈ।

ARC-AGI-3 ਬਹਿਸ ਆਖਰੀ ਹੋਣ ਦੀ ਸੰਭਾਵਨਾ ਨਹੀਂ ਹੈ। ਜਿਵੇਂ ਕਿ ਸਥਾਪਿਤ ਮਾਪਦੰਡਾਂ ਦੇ ਸਿਖਰ ਦੇ ਨੇੜੇ ਫਰੰਟੀਅਰ ਮਾਡਲ ਕਲੱਸਟਰ ਹੁੰਦੇ ਹਨ, ਇਸ ਗੱਲ 'ਤੇ ਅਸਹਿਮਤੀ ਹੁੰਦੀ ਹੈ ਕਿ ਕੀ ਇੱਕ ਨਿਰਪੱਖ ਮਾਪ ਵਜੋਂ ਗਿਣਿਆ ਜਾਂਦਾ ਹੈ - ਅਤੇ ਜਿਸਦੀ ਵਰਤੋਂ ਸਟੈਂਡਰਡ ਨੂੰ ਸੈੱਟ ਕਰਨ ਲਈ ਪ੍ਰਾਪਤ ਹੁੰਦੀ ਹੈ - ਸਿਰਫ ਤੇਜ਼ ਹੋਵੇਗੀ।

AI ਤੋਂ ਅੱਗੇ ਰਹੋ

ਕੀ ਤੁਸੀਂ ਮਾਡਲਾਂ, ਬੈਂਚਮਾਰਕਾਂ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਬਣਾਉਣ ਵਾਲੀਆਂ ਲੈਬਾਂ 'ਤੇ ਬ੍ਰੇਕਿੰਗ ਏਆਈ ਨਿਊਜ਼ ਦੀ ਪਾਲਣਾ ਕਰਨਾ ਚਾਹੁੰਦੇ ਹੋ? AI Buzz Wire ਨੇ ਤੁਹਾਨੂੰ ਕਵਰ ਕੀਤਾ ਹੈ।

ਹੋਰ AI ਖਬਰਾਂ ਪੜ੍ਹੋ