Nvidia ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਇੱਕ ਏਜੰਟ ਸਿਸਟਮ ਬਣਾਇਆ ਹੈ ਜਿਸ ਨੇ Anthropic ਦੇ Claude Opus 5 ਨੂੰ ARC-AGI-3 'ਤੇ ਇੱਕ ਸੰਪੂਰਣ 100% ਸਕੋਰ ਤੱਕ ਪਹੁੰਚਾਇਆ, AI ਵਿੱਚ ਸਭ ਤੋਂ ਵੱਧ ਮੰਗ ਕਰਨ ਵਾਲੇ ਇੰਟਰਐਕਟਿਵ ਤਰਕ ਦੇ ਮਾਪਦੰਡਾਂ ਵਿੱਚੋਂ ਇੱਕ - ਉਸੇ ਮਾਡਲ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ ਜੋ 30% ਸਕੋਰ ਕਰਦਾ ਹੈ ਜਦੋਂ ਇਹ ਆਪਣੇ ਆਪ ਚੱਲਦਾ ਹੈ। ਨਤੀਜਾ, ਸ਼ੁੱਕਰਵਾਰ ਨੂੰ ਐਨਵੀਡੀਆ ਟੈਕਨੀਕਲ ਬਲੌਗ 'ਤੇ ਪ੍ਰਕਾਸ਼ਤ ਹੋਇਆ, ਅਜੇ ਤੱਕ ਦਾ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ਸਬੂਤ ਹੈ ਕਿ ਇੱਕ ਫਰੰਟੀਅਰ ਮਾਡਲ ਦੇ ਦੁਆਲੇ ਲਪੇਟਿਆ ਸੌਫਟਵੇਅਰ ਓਨਾ ਹੀ ਮਾਅਨੇ ਰੱਖਦਾ ਹੈ ਜਿੰਨਾ ਆਪਣੇ ਆਪ ਵਿੱਚ। ਨਵੀਨਤਮ AI ਵਿਕਾਸ ਨੂੰ ਟਰੈਕ ਕਰਨ ਵਾਲੇ ਕਿਸੇ ਵੀ ਵਿਅਕਤੀ ਲਈ, ਇਹ ਇੱਕ ਤਬਦੀਲੀ ਦੀ ਨਿਸ਼ਾਨਦੇਹੀ ਕਰਦਾ ਹੈ ਜਿੱਥੇ ਏਜੰਟ AI ਵਿੱਚ ਪ੍ਰਤੀਯੋਗੀ ਲਾਭ ਅਸਲ ਵਿੱਚ ਰਹਿੰਦਾ ਹੈ।
ਸਿਸਟਮ ਨੂੰ AVO ਕਿਹਾ ਜਾਂਦਾ ਹੈ, ਏਜੰਟਿਕ ਪਰਿਵਰਤਨ ਆਪਰੇਟਰਾਂ ਲਈ ਛੋਟਾ ਹੈ, ਅਤੇ ਇਹ Nvidia ਦੁਆਰਾ ਲੰਬੇ-ਦਿਮਾਗ ਦੇ ਆਟੋਨੋਮਸ ਏਜੰਟਾਂ - AI ਲਈ ਇੱਕ ਆਮ-ਉਦੇਸ਼ ਦੇ ਆਰਕੀਟੈਕਚਰ ਨੂੰ ਅਪਣਾਇਆ ਗਿਆ ਹੈ ਜੋ ਇੱਕ ਸਿੰਗਲ ਪ੍ਰੋਂਪਟ ਦਾ ਜਵਾਬ ਦੇਣ ਦੀ ਬਜਾਏ ਘੰਟਿਆਂ ਜਾਂ ਦਿਨਾਂ ਲਈ ਕੰਮ 'ਤੇ ਰਹਿ ਸਕਦਾ ਹੈ। ARC-AGI-3 ਜਨਤਕ ਸੈੱਟ 'ਤੇ, AVO ਨੇ ਸਾਰੇ 25 ਗੇਮ ਵਾਤਾਵਰਨਾਂ ਵਿੱਚ 100.00 RHAE ਸਕੋਰ ਦਰਜ ਕੀਤਾ, ਜਿਸ ਨੇ ਕਲਾਉਡ ਓਪਸ 5 ਨੂੰ ਇਸਦੇ ਬੈਕਐਂਡ ਮਾਡਲ ਵਜੋਂ ਵਰਤਦੇ ਹੋਏ 6,624 ਵਾਤਾਵਰਨ ਐਕਸ਼ਨਾਂ ਵਿੱਚ ਸਾਰੇ 183 ਪੱਧਰਾਂ ਨੂੰ ਪੂਰਾ ਕੀਤਾ।
ARC-AGI-3 ਅਸਲ ਵਿੱਚ ਕੀ ਟੈਸਟ ਕਰਦਾ ਹੈ
ARC-AGI-3 ਇੱਕ ਇੰਟਰਐਕਟਿਵ ਤਰਕ ਦਾ ਬੈਂਚਮਾਰਕ ਹੈ ਜੋ ARC ਇਨਾਮ ਫਾਊਂਡੇਸ਼ਨ ਦੁਆਰਾ ਬਣਾਇਆ ਗਿਆ ਹੈ। ਇੱਕ ਏਜੰਟ ਨੂੰ ਅਣਜਾਣ, ਖੇਡ-ਵਰਗੇ ਵਾਤਾਵਰਣ ਵਿੱਚ ਛੱਡ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ, ਬਿਨਾਂ ਕੋਈ ਹਦਾਇਤਾਂ, ਕੋਈ ਦੱਸੇ ਗਏ ਨਿਯਮ, ਅਤੇ ਕੋਈ ਟੀਚਾ ਨਹੀਂ। ਇਸ ਨੂੰ ਅਜ਼ਮਾਇਸ਼ ਅਤੇ ਗਲਤੀ ਦੁਆਰਾ ਖੋਜ ਕਰਨੀ ਪੈਂਦੀ ਹੈ, ਵਾਤਾਵਰਣ ਕਿਵੇਂ ਕੰਮ ਕਰਦਾ ਹੈ, ਇਹ ਪਤਾ ਲਗਾਉਣਾ ਹੁੰਦਾ ਹੈ ਕਿ "ਜਿੱਤਣ" ਦਾ ਕੀ ਮਤਲਬ ਹੈ, ਅਤੇ ਫਿਰ ਹੌਲੀ-ਹੌਲੀ ਔਖੇ ਪੱਧਰਾਂ ਦੁਆਰਾ ਤਰੱਕੀ ਕਰਨ ਲਈ ਕਾਫ਼ੀ ਕੁਸ਼ਲਤਾ ਨਾਲ ਕੰਮ ਕਰਨਾ ਹੈ।
ਬੈਂਚਮਾਰਕ ਦਾ ਸਕੋਰਿੰਗ ਮੈਟ੍ਰਿਕ, ਰਿਲੇਟਿਵ ਹਿਊਮਨ ਐਕਸ਼ਨ ਐਫੀਸ਼ੀਐਂਸੀ (RHAE), ਟਾਸਕ ਕੰਪਲੀਸ਼ਨ ਨੂੰ ਇਸ ਨਾਲ ਜੋੜਦਾ ਹੈ ਕਿ ਏਜੰਟ ਪਹਿਲੀ ਵਾਰ ਮਨੁੱਖੀ ਖਿਡਾਰੀਆਂ ਦੇ ਮੁਕਾਬਲੇ ਕਿੰਨੀਆਂ ਘੱਟ ਕਾਰਵਾਈਆਂ ਨੂੰ ਬਰਬਾਦ ਕਰਦਾ ਹੈ। ਇਹ ਇਸਨੂੰ ਸਥਾਈ ਖੁਦਮੁਖਤਿਆਰੀ ਦਾ ਇੱਕ ਬੇਰਹਿਮ ਟੈਸਟ ਬਣਾਉਂਦਾ ਹੈ: ਏਜੰਟ ਨੂੰ ਯਾਦ ਰੱਖਣਾ ਚਾਹੀਦਾ ਹੈ ਕਿ ਉਸਨੇ ਕੀ ਸਿੱਖਿਆ ਹੈ, ਗਲਤੀਆਂ ਤੋਂ ਮੁੜ ਪ੍ਰਾਪਤ ਕਰਨਾ ਹੈ, ਅਤੇ ਪੂਰੀ ਦੌੜ ਵਿੱਚ ਇਸਦੀਆਂ ਕਾਰਵਾਈਆਂ ਨੂੰ ਧਿਆਨ ਨਾਲ ਬਜਟ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ।
Nvidia ਦਾ ਸਿਰਲੇਖ ਨੰਬਰ ਤੁਲਨਾ ਤੋਂ ਸੰਦਰਭ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ। VISTA, ਇੱਕ ਪਿਛਲੀ ਸਿੱਧੀ-ਇੰਟਰੈਕਸ਼ਨ ਹਾਰਨੇਸ ਜਿਸਨੇ ਕਲਾਉਡ ਓਪਸ 5 ਦੀ ਵੀ ਵਰਤੋਂ ਕੀਤੀ, ਨੇ 7,542 ਵਾਤਾਵਰਣ ਕਾਰਵਾਈਆਂ ਵਿੱਚ ਉਹੀ 183 ਜਨਤਕ-ਸੈੱਟ ਪੱਧਰਾਂ ਨੂੰ ਪੂਰਾ ਕੀਤਾ। ਐਨਵੀਡੀਆ ਦੇ ਬਲੌਗ ਪੋਸਟ ਦੇ ਅਨੁਸਾਰ, AVO ਨੂੰ ਕੰਮ ਨੂੰ ਪੂਰਾ ਕਰਨ ਲਈ ਲਗਭਗ 12% ਘੱਟ ਕਾਰਵਾਈਆਂ ਦੀ ਲੋੜ ਸੀ।
GPU ਕਰਨਲ ਤੋਂ ਅਣਜਾਣ ਗੇਮਾਂ ਤੱਕ
AVO ਪਹੇਲੀਆਂ ਲਈ ਨਹੀਂ ਬਣਾਇਆ ਗਿਆ ਸੀ। ਐਨਵੀਡੀਆ ਨੇ ਸਭ ਤੋਂ ਪਹਿਲਾਂ GPU-ਕਰਨਲ ਓਪਟੀਮਾਈਜੇਸ਼ਨ 'ਤੇ ਆਰਕੀਟੈਕਚਰ ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਕੀਤਾ, ਇੱਕ ਡੋਮੇਨ ਜਿੱਥੇ ਛੋਟੇ ਕੋਡ ਬਦਲਾਅ ਸਹੀਤਾ, ਮੈਮੋਰੀ ਵਿਵਹਾਰ, ਅਤੇ ਅਣਪਛਾਤੇ ਤਰੀਕਿਆਂ ਨਾਲ ਥ੍ਰੋਪੁੱਟ ਨੂੰ ਤੋੜ ਸਕਦੇ ਹਨ। ਇੱਕ ਧਿਆਨ-ਕਰਨਲ ਅਧਿਐਨ ਵਿੱਚ, AVO ਸੱਤ ਦਿਨਾਂ ਲਈ ਲਗਾਤਾਰ ਚੱਲਿਆ, 500 ਤੋਂ ਵੱਧ ਅਨੁਕੂਲਨ ਦਿਸ਼ਾਵਾਂ ਦੀ ਖੋਜ ਕੀਤੀ, ਅਤੇ 40 ਕਰਨਲ ਸੰਸਕਰਣਾਂ ਨੂੰ ਪ੍ਰਤੀਬੱਧ ਕੀਤਾ। NVIDIA DGX B200 ਸਿਸਟਮਾਂ 'ਤੇ, ਨਤੀਜੇ ਵਜੋਂ ਮਲਟੀਹੈੱਡ ਅਟੈਂਸ਼ਨ ਕਰਨਲ ਨੇ cuDNN ਨੂੰ 3.5% ਤੱਕ ਅਤੇ ਫਲੈਸ਼ ਅਟੈਂਸ਼ਨ-4 ਨੂੰ 10.5% ਤੱਕ ਪਛਾੜ ਦਿੱਤਾ। ਏਜੰਟ ਨੇ ਫਿਰ ਆਪਣੇ ਵਿਕਸਤ ਕਰਨਲ ਨੂੰ ਲਗਭਗ 30 ਮਿੰਟਾਂ ਦੇ ਵਾਧੂ ਖੁਦਮੁਖਤਿਆਰੀ ਕੰਮ ਵਿੱਚ ਸਮੂਹਿਕ-ਪੁੱਛਗਿੱਛ ਦੇ ਧਿਆਨ ਵਿੱਚ ਅਨੁਕੂਲਿਤ ਕੀਤਾ।
ਉਹੀ ਕੋਰ ਲੂਪ — ਨਿਰੀਖਣ, ਯੋਜਨਾ, ਲਾਗੂ, ਟੈਸਟ, ਮੁਲਾਂਕਣ — ਫਿਰ ARC-AGI-3 ਵੱਲ ਇਸ਼ਾਰਾ ਕੀਤਾ ਗਿਆ ਸੀ ਜਿਸ ਵਿੱਚ ਸਿਰਫ ਟਾਸਕ ਇੰਟਰਫੇਸ ਬਦਲਿਆ ਗਿਆ ਸੀ। ਦੋ ਮਕੈਨਿਜ਼ਮ ਕੀਤੇ ਗਏ। ਸਭ ਤੋਂ ਪਹਿਲਾਂ ਸਥਾਈ ਮੈਮੋਰੀ ਹੈ, ਜੋ ਪਹਿਲਾਂ ਲਾਗੂ ਕਰਨ, ਮੁਲਾਂਕਣ ਨਤੀਜੇ, ਕੰਪਾਈਲਰ ਅਤੇ ਪ੍ਰੋਫਾਈਲਰ ਆਉਟਪੁੱਟ, ਅਤੇ ਸੰਚਿਤ ਤਰਕ ਨੂੰ ਸਟੋਰ ਕਰਦੀ ਹੈ, ਇਸਲਈ ਏਜੰਟ ਸਕ੍ਰੈਚ ਤੋਂ ਸੰਦਰਭ ਨੂੰ ਮੁੜ ਬਣਾਉਣ ਦੀ ਬਜਾਏ ਆਪਣੀ ਮੌਜੂਦਾ ਸਥਿਤੀ ਤੋਂ ਮੁੜ ਸ਼ੁਰੂ ਕਰ ਸਕਦਾ ਹੈ। ਦੂਜਾ ਇੱਕ ਸੁਪਰਵਾਈਜ਼ਰ ਹੈ, ਇੱਕ ਦੂਜਾ ਏਜੰਟ ਜੋ ਸਮੁੱਚੇ ਟ੍ਰੈਜੈਕਟਰੀ ਨੂੰ ਦੇਖਦਾ ਹੈ ਅਤੇ ਜਦੋਂ ਤਰੱਕੀ ਰੁਕ ਜਾਂਦੀ ਹੈ ਤਾਂ ਦਖਲਅੰਦਾਜ਼ੀ ਕਰਦਾ ਹੈ।
ਸੁਪਰਵਾਈਜ਼ਰ ਸਫਲਤਾ ਹੈ
TechCrunch, ਜਿਸ ਨੇ Nvidia ਦੇ Adel El Hallak, ਕੰਪਨੀ ਦੀ AI ਯੂਨਿਟ ਵਿੱਚ ਉਤਪਾਦ ਦੇ ਉਪ ਪ੍ਰਧਾਨ, ਦੀ ਇੰਟਰਵਿਊ ਕੀਤੀ, ਨੇ ਸੁਪਰਵਾਈਜ਼ਰ ਨੂੰ ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ ਸਮੱਗਰੀ ਵਜੋਂ ਉਜਾਗਰ ਕੀਤਾ। ਏਲ ਹਾਲਕ ਨੇ ਪ੍ਰਕਾਸ਼ਨ ਨੂੰ ਦੱਸਿਆ, "ਇਹ ਲਗਭਗ ਇੱਕ ਸੀਈਓ ਦੀ ਤਰ੍ਹਾਂ ਕੰਮ ਕਰਦਾ ਹੈ ਕਿ ਏਜੰਟ ਨੂੰ ਧੱਕਾ ਦੇਣ ਲਈ ਜਦੋਂ ਉਹ ਦਿਸ਼ਾ ਤੋਂ ਬਾਹਰ ਜਾਂਦਾ ਹੈ ਜਾਂ ਇੱਕ ਅਜਿਹੇ ਮਾਰਗ ਦੀ ਖੋਜ ਕਰਨਾ ਸ਼ੁਰੂ ਕਰਦਾ ਹੈ ਜੋ ਇੱਕ ਮੁਰਦਾ ਅੰਤ ਵੱਲ ਲੈ ਜਾ ਸਕਦਾ ਹੈ, ਜਾਂ ਉਸ ਰਸਤੇ ਦੀ ਮੁੜ ਖੋਜ ਕਰਦਾ ਹੈ ਜਿਸਨੂੰ ਇਹ ਪਹਿਲਾਂ ਲੰਘਿਆ ਸੀ," ਐਲ ਹਾਲਕ ਨੇ ਪ੍ਰਕਾਸ਼ਨ ਨੂੰ ਦੱਸਿਆ।
ਪ੍ਰਦਰਸ਼ਨ ਦਾ ਅੰਤਰ ਬਹੁਤ ਜ਼ਿਆਦਾ ਹੈ। ਐਨਵੀਡੀਆ ਦੇ ਟੈਸਟਿੰਗ ਨੇ ਪਾਇਆ ਕਿ ਕਲਾਉਡ ਓਪਸ 5 ਨੇ ਬਿਨਾਂ ਕਿਸੇ ਵਧੀਆ ਹਾਰਨੇਸ ਦੇ ARC-AGI-3 'ਤੇ 30% ਸਕੋਰ ਦਾ ਪ੍ਰਬੰਧਨ ਕੀਤਾ — ਟੈਸਟ ਕੀਤੇ ਗਏ ਨੰਗੇ ਮਾਡਲਾਂ ਵਿੱਚੋਂ ਸਭ ਤੋਂ ਵਧੀਆ ਨਤੀਜਾ, ਪਰ ਪੂਰੀ ਦੌੜ ਦੇ ਨੇੜੇ ਕਿਤੇ ਵੀ ਨਹੀਂ। ਓਪਨਏਆਈ ਦੇ ਮਾਡਲਾਂ ਨੇ ਬੈਂਚਮਾਰਕ 'ਤੇ 10% ਤੋਂ ਘੱਟ ਸਕੋਰ ਪ੍ਰਾਪਤ ਕੀਤੇ ਹਨ, ਅਤੇ ਕੰਪਨੀ ਨੇ ਪਿਛਲੇ ਮਹੀਨੇ ਆਪਣੀ ਖੋਜ ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤੀ ਹੈ ਜੋ ਦਿਖਾਉਂਦੀ ਹੈ ਕਿ ਸਿਰਫ ਦੋ ਹਾਰਨੈੱਸ ਸੈਟਿੰਗਾਂ ਨੂੰ ਟਵੀਕ ਕਰਨ ਨਾਲ ਇਸਦੇ ਸਕੋਰ ਤਿੰਨ ਗੁਣਾ ਹੋ ਗਏ ਹਨ। ਕੋਈ ਵੀ ਮਾਡਲ-ਸਿਰਫ਼ ਸੰਰਚਨਾ 100% ਦੇ ਨੇੜੇ ਨਹੀਂ ਆਈ ਹੈ ਜੋ AVO ਨੇ ਪ੍ਰਾਪਤ ਕੀਤੀ ਹੈ।
ਖਾਸ ਤੌਰ 'ਤੇ, AVO ਕੌਂਫਿਗਰੇਸ਼ਨ ਸਿਰਫ਼-ਟੈਕਸਟ ਮੋਡੈਲਿਟੀ ਵਿੱਚ ਚੱਲਦੀ ਸੀ: ਹਰੇਕ ਨਿਰੀਖਣ ਨੂੰ ਇੱਕ ਸਟੀਕ 64x64 ਟੈਕਸਟ ਗਰਿੱਡ ਵਜੋਂ ਸਪਲਾਈ ਕੀਤਾ ਗਿਆ ਸੀ, ਮਾਡਲ ਨੂੰ ਕੋਈ ਚਿੱਤਰ ਜਾਂ ਚਿੱਤਰ ਟੋਕਨ ਨਹੀਂ ਭੇਜੇ ਗਏ ਸਨ। ਤਰਕ ਸ਼ਕਤੀ ਮਾਡਲ ਦੇ ਆਲੇ ਦੁਆਲੇ ਦੇ ਲੂਪ ਤੋਂ ਆਈ ਹੈ, ਨਾ ਕਿ ਬਹੁ-ਵਿਧੀ ਧਾਰਨਾ ਤੋਂ।
ਉਦਯੋਗ ਹਰਨੇਸ 'ਤੇ ਕਿਉਂ ਸੱਟਾ ਲਗਾ ਰਿਹਾ ਹੈ
ਸਬੂਤਾਂ ਦੀ ਇੱਕ ਲਹਿਰ ਦੇ ਵਿਚਕਾਰ ਇਹ ਖੋਜ ਜ਼ਮੀਨ ਹੈ ਕਿ ਏਜੰਟ ਬੁਨਿਆਦੀ ਢਾਂਚਾ, ਨਾ ਕਿ ਕੱਚੀ ਮਾਡਲ ਸਮਰੱਥਾ, ਆਟੋਨੋਮਸ ਏਆਈ ਲਈ ਮੌਜੂਦਾ ਰੁਕਾਵਟ ਹੈ। ਡੇਟਾਬ੍ਰਿਕਸ ਨੇ ਜੁਲਾਈ ਵਿੱਚ ਬੈਂਚਮਾਰਕਿੰਗ ਖੋਜ ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤੀ ਜੋ ਦਰਸਾਉਂਦੀ ਹੈ ਕਿ ਹਾਰਨੈਸ ਨਾਟਕੀ ਢੰਗ ਨਾਲ ਪ੍ਰਦਰਸ਼ਨ ਅਤੇ ਲਾਗਤ ਦੋਵਾਂ ਨੂੰ ਪ੍ਰਭਾਵਤ ਕਰਦੀ ਹੈ। ਡੈਟਾਬ੍ਰਿਕਸ ਦੇ ਸੀਈਓ ਅਲੀ ਘੋਡਸੀ ਨੇ ਟੇਕਕ੍ਰੰਚ ਨੂੰ ਦੱਸਿਆ, "ਤੁਸੀਂ ਇੱਕੋ ਮਾਡਲ ਚੁਣ ਸਕਦੇ ਹੋ ਪਰ ਵੱਖ-ਵੱਖ ਹਾਰਨੈੱਸਜ਼, ਅਤੇ ਜੇਕਰ ਤੁਸੀਂ ਗਲਤ ਹਾਰਨੈੱਸ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋ ਤਾਂ ਤੁਹਾਨੂੰ ਕਾਫ਼ੀ ਜ਼ਿਆਦਾ ਕੀਮਤ ਮਿਲਦੀ ਹੈ।" "ਇਹ ਖੁਦ ਤੁਹਾਡੀ ਲਾਗਤ ਨੂੰ 2 ਗੁਣਾ ਕਰ ਸਕਦਾ ਹੈ।"
ਏਲ ਹਾਲਕ ਨੇ ਖੁੱਲੇਪਣ ਦੇ ਮਾਮਲੇ ਵਿੱਚ ਐਨਵੀਡੀਆ ਦੀ ਵਿਆਪਕ ਦਲੀਲ ਤਿਆਰ ਕੀਤੀ। "ਅਸੀਂ ਇੱਕ ਓਪਨ ਏਜੰਟ ਸਟੈਕ ਰੱਖਣ ਵਿੱਚ ਵਿਸ਼ਵਾਸ ਰੱਖਦੇ ਹਾਂ - ਜਿੱਥੇ ਤੁਹਾਡੇ ਕੋਲ ਹਰਨੇਸ, ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਦੇ ਪਾਰ, ਰਨਟਾਈਮ ਵਿੱਚ ਨਿਯੰਤਰਣ ਹੈ - ਸਾਡੇ ਲਈ ਈਕੋਸਿਸਟਮ ਨੂੰ ਅੱਗੇ ਅਤੇ ਸੁਰੱਖਿਅਤ ਢੰਗ ਨਾਲ ਅੱਗੇ ਵਧਾਉਣ ਲਈ ਲੋੜੀਂਦਾ ਹੈ," ਉਸਨੇ ਕਿਹਾ। Nvidia ਕੋਲ ਇਸਦੇ NeMo ਬ੍ਰਾਂਡ ਦੇ ਅਧੀਨ ਹਾਰਨੇਸ ਤਕਨਾਲੋਜੀ ਦੇ ਖੁੱਲੇ ਆਕਾਰ ਦੇ ਟੁਕੜੇ ਹਨ, ਅਤੇ AVO ਖੋਜ ਨੂੰ arXiv 'ਤੇ ਇੱਕ ਪੇਪਰ ਵਿੱਚ ਦਰਜ ਕੀਤਾ ਗਿਆ ਹੈ।
ਇਤਿਹਾਸ ਦੇ ਨਾਲ ਇੱਕ ਬੈਂਚਮਾਰਕ
ARC-AGI-3 ਫਰੰਟੀਅਰ-ਲੈਬ ਦੁਸ਼ਮਣੀ ਵਿੱਚ ਇੱਕ ਫਲੈਸ਼ਪੁਆਇੰਟ ਬਣ ਗਿਆ ਹੈ। ਓਪਨਏਆਈ ਨੇ ਪਹਿਲਾਂ ਆਪਣੇ GPT-5.6 ਸੋਲ ਮਾਡਲ ਲਈ ਬੈਂਚਮਾਰਕ 'ਤੇ ਮਜ਼ਬੂਤ ਨਤੀਜਿਆਂ ਦਾ ਦਾਅਵਾ ਕੀਤਾ ਸੀ, ਜਿਸ ਨਾਲ ਵਰਤੀਆਂ ਗਈਆਂ ਮੁਲਾਂਕਣ ਸੈਟਿੰਗਾਂ ਦੀ ਜਾਂਚ ਕੀਤੀ ਗਈ ਸੀ। ਐਨਵੀਡੀਆ ਦਾ ਨਤੀਜਾ ਇੱਕ ਅਰਥ ਵਿੱਚ ਬਹਿਸ ਨੂੰ ਪਾਸੇ ਕਰਦਾ ਹੈ - ਇਹ ਇੱਕ ਚੁਸਤ ਮਾਡਲ ਦਾ ਦਾਅਵਾ ਨਹੀਂ ਕਰਦਾ, ਸਿਰਫ ਇੱਕ ਮੌਜੂਦਾ ਮਾਡਲ ਦੇ ਆਲੇ ਦੁਆਲੇ ਇੱਕ ਬਿਹਤਰ-ਇੰਜੀਨੀਅਰ ਏਜੰਟ ਹੈ।
ਏਜੰਟ ਉਤਪਾਦ ਬਣਾਉਣ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ ਅਤੇ ਉੱਦਮਾਂ ਲਈ ਸੁਨੇਹਾ ਸਿੱਧਾ ਹੈ: ਮਾਡਲ ਦੀ ਚੋਣ ਅਜੇ ਵੀ ਮਾਇਨੇ ਰੱਖਦੀ ਹੈ, ਪਰ ਸਿਸਟਮ ਡਿਜ਼ਾਈਨ ਹੁਣ ਇਹ ਫੈਸਲਾ ਕਰਦਾ ਹੈ ਕਿ ਕੀ ਇੱਕ ਫਰੰਟੀਅਰ ਮਾਡਲ ਸਰਹੱਦੀ ਨਤੀਜੇ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ। ਜਿਵੇਂ ਕਿ ਐਨਵੀਡੀਆ ਇਹ ਕਹਿੰਦਾ ਹੈ, ਇੱਕ ਮਾਡਲ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨਾ ਇੱਕ ਏਜੰਟ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨ ਦੇ ਸਮਾਨ ਨਹੀਂ ਹੈ - ਅਤੇ 2026 ਦੇ ਬੈਂਚਮਾਰਕ ਟੇਬਲ ਉਹਨਾਂ ਇੰਜੀਨੀਅਰਾਂ ਨੂੰ ਵੱਧ ਤੋਂ ਵੱਧ ਇਨਾਮ ਦੇ ਰਹੇ ਹਨ ਜੋ ਸਕੈਫੋਲਡਿੰਗ ਬਣਾਉਂਦੇ ਹਨ।
AI ਤੋਂ ਅੱਗੇ ਰਹੋ
ਏਜੰਟ ਆਰਕੀਟੈਕਚਰ ਪਹਿਲਾਂ ਨਾਲੋਂ ਤੇਜ਼ੀ ਨਾਲ ਅੱਗੇ ਵਧ ਰਹੇ ਹਨ, ਅਤੇ ਇੱਕ ਚੰਗੇ ਹਾਰਨੈਸ ਅਤੇ ਇੱਕ ਮਾੜੇ ਵਿਚਕਾਰ ਪਾੜੇ ਨੂੰ ਹੁਣ ਬੈਂਚਮਾਰਕ ਪੁਆਇੰਟਾਂ ਅਤੇ ਅਸਲ ਡਾਲਰਾਂ ਵਿੱਚ ਮਾਪਿਆ ਜਾਂਦਾ ਹੈ। AI ਖੋਜ, ਬੈਂਚਮਾਰਕ ਅਤੇ ਉਤਪਾਦ ਲਾਂਚ ਦੇ ਰੋਜ਼ਾਨਾ, ਸਰੋਤ-ਪ੍ਰਮਾਣਿਤ ਕਵਰੇਜ ਲਈ AI Buzz Wire ਦਾ ਅਨੁਸਰਣ ਕਰੋ।
ਹੋਰ AI ਖੋਜ ਖ਼ਬਰਾਂ ਪੜ੍ਹੋ →