ਓਪਨਏਆਈ ਦਾ GPT-6 ਐਸਟਰਾ ਕੋਡਿੰਗ ਫਰੰਟ 'ਤੇ ਉਪਭੋਗਤਾ-ਭਰੋਸੇ ਦੀਆਂ ਸਮੱਸਿਆਵਾਂ ਨਾਲ ਜੂਝ ਰਿਹਾ ਹੋ ਸਕਦਾ ਹੈ, ਪਰ ਇੱਕ ਨਵੇਂ ਰੋਬੋਟਿਕਸ ਬੈਂਚਮਾਰਕ 'ਤੇ ਇਹ ਅੰਕ ਪੋਸਟ ਕਰ ਰਿਹਾ ਹੈ ਜਿਸ ਵਿੱਚ ਖੋਜਕਰਤਾ ਗੁਣਾਤਮਕ ਲੀਪ ਬਾਰੇ ਗੱਲ ਕਰ ਰਹੇ ਹਨ। ਸਟੇਸ਼ਨਰੀਬੈਂਚ 'ਤੇ, ਸਾਧਾਰਨ ਡੈਸਕ ਵਸਤੂਆਂ ਦੇ ਆਲੇ-ਦੁਆਲੇ ਬਣਾਇਆ ਗਿਆ ਇੱਕ ਟੈਸਟ, Astra ਨੇ 100 ਵਿੱਚੋਂ 7 ਟਾਸਕਾਂ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਪੂਰਾ ਕੀਤਾ ਜਦੋਂ ਕਿ Ai2 ਦੇ MolmoAct2, ਜਿਸ ਮਾਡਲ ਦੇ ਵਿਰੁੱਧ ਸੀ, ਨੇ ਜ਼ੀਰੋ ਨੂੰ ਪੂਰਾ ਕੀਤਾ।
ਦ ਡੀਕੋਡਰ ਦੁਆਰਾ ਦਰਸਾਇਆ ਗਿਆ ਬੈਂਚਮਾਰਕ, ਪੰਜ ਡੈਸਕ-ਆਬਜੈਕਟ ਟਾਸਕਾਂ ਵਿੱਚ ਦੋ ਮਾਡਲਾਂ ਨੂੰ ਇੱਕ ਦੂਜੇ ਦੇ ਵਿਰੁੱਧ ਖੜ੍ਹਾ ਕਰਦਾ ਹੈ - ਇੱਕ ਮਾਰਕਰ ਨੂੰ ਅਨਕੈਪ ਕਰਨਾ, ਪੇਪਰ ਕਲਿੱਪਾਂ ਨੂੰ ਡੋਲ੍ਹਣਾ, ਜਾਂ ਦੋ ਰੋਬੋਟ ਬਾਹਾਂ ਦੇ ਵਿਚਕਾਰ ਇੱਕ ਸ਼ਾਸਕ ਨੂੰ ਪਾਸ ਕਰਨਾ। ਦੋਵੇਂ ਮਾਡਲਾਂ ਨੇ 200 ਟਰਾਇਲਾਂ ਵਿੱਚ ਇੱਕੋ ਹੀ ਦੋਹਰੇ-ਆਰਮ YAM ਰੋਬੋਟਾਂ ਨੂੰ ਨਿਯੰਤਰਿਤ ਕੀਤਾ, ਇੱਕ ਨਿਯੰਤਰਣ ਡਿਜ਼ਾਈਨ ਦਾ ਮਤਲਬ ਹਾਰਡਵੇਅਰ ਅੰਤਰਾਂ ਤੋਂ ਮਾਡਲ ਸਮਰੱਥਾ ਨੂੰ ਅਲੱਗ ਕਰਨਾ ਹੈ। ਸਾਰੇ ਨਤੀਜੇ, ਵੀਡੀਓ ਅਤੇ ਕੋਡ GitHub 'ਤੇ ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤੇ ਗਏ ਹਨ। ਇਸ ਤਰ੍ਹਾਂ ਦੀ ਹੋਰ ਖੋਜ ਕਵਰੇਜ ਲਈ, ਸਾਡਾ AI ਨਿਊਜ਼ ਹੱਬ ਦੇਖੋ।
ਖੋਜਕਰਤਾਵਾਂ ਦੇ ਅਨੁਸਾਰ ਇੱਕ 'ਕਦਮ ਤਬਦੀਲੀ'
ਯੋਆਵ ਆਰਟਜ਼ੀ, ਕਾਰਨੇਲ ਅਤੇ ਗੂਗਲ ਡੀਪਮਾਈਂਡ ਦੇ ਇੱਕ ਏਆਈ ਖੋਜਕਰਤਾ, ਨੇ ਐਸਟਰਾ ਦੇ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ "ਸਥਾਨਕ ਤਰਕ ਵਿੱਚ ਇੱਕ ਕਦਮ ਤਬਦੀਲੀ" ਕਿਹਾ - ਭਾਸ਼ਾ ਦੇ ਬੈਂਚਮਾਰਕ ਨਤੀਜੇ ਦੀ ਕਿਸਮ ਘੱਟ ਹੀ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ। REMAP ਨਾਮਕ ਇੱਕ ਅਜੇ ਵੀ-ਅਪ੍ਰਕਾਸ਼ਿਤ ਬੈਂਚਮਾਰਕ 'ਤੇ, ਐਸਟਰਾ ਮਨੁੱਖੀ ਪੱਧਰ ਦੇ ਨੇੜੇ ਸ਼ੁੱਧਤਾ ਤੱਕ ਪਹੁੰਚਦਾ ਹੈ, ਹਾਲਾਂਕਿ ਆਰਟਜ਼ੀ ਨੇ ਨੋਟ ਕੀਤਾ ਕਿ "ਇਥੋਂ ਤੱਕ ਕਿ ਐਸਟਰਾ ਵੀ ਉਹ ਨਹੀਂ ਪ੍ਰਾਪਤ ਕਰਦਾ ਜੋ ਮਨੁੱਖ ਦੂਜੇ ਦ੍ਰਿਸ਼ਾਂ ਵਿੱਚ ਕਰਦੇ ਹਨ।"
Astra ਦਾ ਔਸਤ ਪ੍ਰਗਤੀ ਸਕੋਰ 100 ਵਿੱਚੋਂ 46 ਤੱਕ ਪਹੁੰਚ ਗਿਆ, MolmoAct2 ਲਈ 12 ਦੇ ਮੁਕਾਬਲੇ - ਇੱਕ ਅੰਤਰ ਜੋ ਸਿਰਲੇਖ ਸੰਪੂਰਨਤਾ ਸੰਖਿਆਵਾਂ ਤੋਂ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਹੈ। ਰੋਬੋਟਿਕ ਕੰਮਾਂ ਨੂੰ ਅੰਸ਼ਕ ਤਰੱਕੀ ਦੇ ਨਾਲ-ਨਾਲ ਪੂਰੀ ਸਫਲਤਾ 'ਤੇ ਸ਼੍ਰੇਣੀਬੱਧ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਕਿਸੇ ਵਿਰੋਧੀ ਦੇ ਔਸਤ ਸਕੋਰ ਨੂੰ ਤਿੰਨ ਗੁਣਾ ਕਰਨਾ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਮੁੱਠੀ ਭਰ ਅਜ਼ਮਾਇਸ਼ਾਂ 'ਤੇ ਕਿਸਮਤ ਦੁਆਰਾ ਸਫਲ ਹੋਣ ਦੀ ਬਜਾਏ ਮਾਡਲ ਹੇਰਾਫੇਰੀ ਦੇ ਕ੍ਰਮਾਂ ਦੁਆਰਾ ਲਗਾਤਾਰ ਅੱਗੇ ਵੱਧ ਰਿਹਾ ਹੈ।
ਸਥਾਨਿਕ ਤਰਕ ਅਚਾਨਕ ਮਾਇਨੇ ਕਿਉਂ ਰੱਖਦਾ ਹੈ
ਨਤੀਜਾ ਇਸ਼ਾਰਾ ਕਰਦਾ ਹੈ ਕਿ ਐਸਟਰਾ ਨੂੰ ਕਿਵੇਂ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ ਸੀ। ਆਰਟਜ਼ੀ ਨੂੰ ਸ਼ੱਕ ਹੈ ਕਿ ਓਪਨਏਆਈ ਨੇ ਮਾਡਲ ਨੂੰ ਵੱਡੀ ਮਾਤਰਾ ਵਿੱਚ 3D ਡੇਟਾ, ਜਿਵੇਂ ਕਿ ਬਲੈਂਡਰ ਸੀਨ, 'ਤੇ ਸਿਖਲਾਈ ਦਿੱਤੀ ਹੈ, ਜੋ ਕਿ 3D ਕਾਰਜਾਂ 'ਤੇ ਮਾਡਲ ਦੀ ਵਿਸ਼ੇਸ਼ ਤਾਕਤ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ। ਜੇਕਰ ਇਹ ਰੀਡਿੰਗ ਸਹੀ ਹੈ, ਤਾਂ ਇਹ ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ ਕਿ ਸਿੰਥੈਟਿਕ 3D ਵਾਤਾਵਰਣ — ਅਸਲ-ਸੰਸਾਰ ਡਾਟਾ ਇਕੱਤਰ ਕਰਨ ਨਾਲੋਂ ਸਸਤਾ ਅਤੇ ਸੁਰੱਖਿਅਤ — ਭੌਤਿਕ-ਸੰਸਾਰ ਯੋਗਤਾ ਲਈ ਇੱਕ ਵਿਹਾਰਕ ਮਾਰਗ ਬਣ ਰਹੇ ਹਨ, ਰੋਬੋਟਿਕਸ ਵਿੱਚ ਸਭ ਤੋਂ ਲੰਬੇ ਸਮੇਂ ਤੋਂ ਖੜ੍ਹੀਆਂ ਰੁਕਾਵਟਾਂ ਵਿੱਚੋਂ ਇੱਕ।
ਬੈਂਚਮਾਰਕ ਦਾ ਡਿਜ਼ਾਈਨ ਇਸ ਬਾਰੇ ਵੀ ਕੁਝ ਕਹਿੰਦਾ ਹੈ ਕਿ ਰੋਬੋਟਿਕਸ ਮੁਲਾਂਕਣ ਕਿੱਥੇ ਜਾ ਰਿਹਾ ਹੈ। ਸਟੇਸ਼ਨਰੀਬੈਂਚ ਦੇ ਕੰਮ ਜਾਣਬੁੱਝ ਕੇ ਦੁਨਿਆਵੀ ਹੁੰਦੇ ਹਨ — ਇੱਕ ਮਾਰਕਰ ਨੂੰ ਖੋਲ੍ਹਣਾ, ਪੇਪਰ ਕਲਿੱਪਾਂ ਨੂੰ ਡੋਲ੍ਹਣਾ, ਇੱਕ ਸ਼ਾਸਕ ਨੂੰ ਸੌਂਪਣਾ — ਕਿਉਂਕਿ ਰੋਜ਼ਾਨਾ ਹੇਰਾਫੇਰੀ, ਸਿਨੇਮੈਟਿਕ ਕਾਰਨਾਮੇ ਨਹੀਂ, ਉਹ ਹੈ ਜੋ ਉਪਯੋਗੀ ਮਸ਼ੀਨਾਂ ਤੋਂ ਲੈਬ ਡੈਮੋ ਨੂੰ ਵੱਖ ਕਰਦਾ ਹੈ। 200 ਅਜ਼ਮਾਇਸ਼ਾਂ ਵਿੱਚ ਇੱਕੋ ਡੁਅਲ-ਆਰਮ YAM ਹਾਰਡਵੇਅਰ 'ਤੇ ਦੋਵਾਂ ਮਾਡਲਾਂ ਨੂੰ ਗ੍ਰੇਡਿੰਗ ਕਰਨਾ, ਅਤੇ ਹਰੇਕ ਵੀਡੀਓ ਨੂੰ ਪ੍ਰਕਾਸ਼ਿਤ ਕਰਨਾ, ਇੱਕ ਫਰੰਟੀਅਰ ਲੈਬ ਦੇ ਫਲੈਗਸ਼ਿਪ ਨੂੰ ਸ਼ਾਮਲ ਕਰਨ ਵਾਲੇ ਸਮਰੱਥਾ ਦੇ ਦਾਅਵੇ ਲਈ ਇੱਕ ਅਸਧਾਰਨ ਤੌਰ 'ਤੇ ਪਾਰਦਰਸ਼ੀ ਸੈੱਟਅੱਪ ਹੈ।
MolmoAct2, ਐਲਨ ਇੰਸਟੀਚਿਊਟ ਫਾਰ AI (Ai2) ਦਾ ਤੁਲਨਾਤਮਕ ਮਾਡਲ, ਕਿਸੇ ਵੀ ਕੰਮ ਨੂੰ ਪੂਰਾ ਨਾ ਕਰਨਾ ਆਪਣੀ ਕਿਸਮ ਦਾ ਡੈਟਮ ਹੈ: ਇਹ ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ ਕਿ ਆਮ-ਉਦੇਸ਼ ਵਾਲੇ ਫਰੰਟੀਅਰ ਮਾਡਲਾਂ ਅਤੇ ਉਦੇਸ਼-ਬਣਾਇਆ ਰੋਬੋਟਿਕਸ ਮਾਡਲਾਂ ਵਿਚਕਾਰ ਪਾੜਾ ਹੁਣ ਸਿਰਫ਼ ਬੰਦ ਨਹੀਂ ਹੋ ਰਿਹਾ ਹੈ, ਸਗੋਂ ਉਲਟ ਹੋ ਰਿਹਾ ਹੈ, ਘੱਟੋ ਘੱਟ ਤਰਕ-ਭਾਰੀ ਹੇਰਾਫੇਰੀ 'ਤੇ।
ਇਹ ਓਪਨਏਆਈ ਦੀਆਂ ਦੱਸੀਆਂ ਇੱਛਾਵਾਂ ਦੇ ਨਾਲ ਵੀ ਫਿੱਟ ਹੈ: ਡੀਕੋਡਰ ਦੁਆਰਾ ਹਵਾਲਾ ਦਿੱਤੀ ਗਈ ਰਿਪੋਰਟ ਦੇ ਅਨੁਸਾਰ, ਕੰਪਨੀ ਕੋਲ ਆਪਣੇ ਖੁਦ ਦੇ ਖਪਤਕਾਰ ਰੋਬੋਟ ਬਣਾਉਣ ਲਈ ਲੰਬੇ ਸਮੇਂ ਦੀਆਂ ਯੋਜਨਾਵਾਂ ਹਨ। ਇੱਕ ਫਰੰਟੀਅਰ ਭਾਸ਼ਾ ਮਾਡਲ ਜੋ ਵਸਤੂਆਂ, ਹੱਥਾਂ ਅਤੇ ਟ੍ਰੈਜੈਕਟਰੀਜ਼ ਬਾਰੇ ਤਰਕ ਕਰ ਸਕਦਾ ਹੈ ਉਸ ਪਿੱਚ ਦਾ ਅੱਧਾ ਸੌਫਟਵੇਅਰ ਹੈ। ਹਾਰਡਵੇਅਰ ਅੱਧਾ ਅਣਸੁਲਝਿਆ ਰਹਿੰਦਾ ਹੈ, ਪਰ ਸਟੇਸ਼ਨਰੀਬੈਂਚ ਵਰਗੇ ਬੈਂਚਮਾਰਕ ਇਹ ਹਨ ਕਿ ਉਹ ਕਹਾਣੀ ਕਿਵੇਂ ਮਾਪੀ ਜਾਂਦੀ ਹੈ।
ਸੰਦਰਭ: ਇੱਕ ਗੁੰਝਲਦਾਰ ਹਫ਼ਤੇ ਵਾਲਾ ਮਾਡਲ
ਨਤੀਜਾ OpenAI ਲਈ ਇੱਕ ਅਜੀਬ ਖਬਰ ਚੱਕਰ ਵਿੱਚ ਉਤਰਦਾ ਹੈ। ਇਸ ਬੈਂਚਮਾਰਕ ਦੇ ਕੇਂਦਰ ਵਿੱਚ ਇੱਕੋ ਮਾਡਲ ਨੇ ਉਪਭੋਗਤਾ ਦੀਆਂ ਸ਼ਿਕਾਇਤਾਂ ਦਾ ਸਾਹਮਣਾ ਕਰਦੇ ਹੋਏ ਹਫ਼ਤਾ ਬਿਤਾਇਆ ਹੈ ਕਿ ਇਹ ਲਾਂਚ ਹੋਣ ਤੋਂ ਬਾਅਦ ਗੁੰਝਲਦਾਰ ਹੋ ਗਿਆ ਹੈ - ਸ਼ਿਕਾਇਤਾਂ OpenAI ਨੇ ਕੋਡੈਕਸ ਵਰਤੋਂ ਸੀਮਾਵਾਂ ਨੂੰ ਰੀਸੈਟ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ, ਗਲਤ ਕੰਮ ਕਰਨ ਦੇ ਹੁਨਰ ਤੋਂ ਇੱਕ ਦੁਰਵਿਵਹਾਰ ਕਰਨ ਵਾਲੇ ਸੰਦਰਭ ਪ੍ਰਯੋਗ ਤੱਕ, ਤਿੰਨ ਨਾਮੀ ਨੁਕਸਾਂ ਦਾ ਪਤਾ ਲਗਾਇਆ ਹੈ। ਇੱਕ ਮਾਡਲ ਜੋ ਪ੍ਰਯੋਗਸ਼ਾਲਾ ਵਿੱਚ ਪੜਾਅ-ਪਰਿਵਰਤਨ ਦੇ ਨਤੀਜਿਆਂ ਨੂੰ ਪੋਸਟ ਕਰਦੇ ਸਮੇਂ ਉਤਪਾਦਨ ਵਿੱਚ ਠੋਕਰ ਖਾਂਦਾ ਹੈ, ਮੌਜੂਦਾ AI ਉਦਯੋਗ ਦੀ ਇੱਕ ਖਾਸੀਅਤ ਹੈ: ਸਮਰੱਥਾ ਅਤੇ ਭਰੋਸੇਯੋਗਤਾ ਵੱਖ-ਵੱਖ ਘੜੀਆਂ 'ਤੇ ਅੱਗੇ ਵਧ ਰਹੀ ਹੈ।
ਇਹ ਇੱਕ ਸੁਰੱਖਿਆ ਬਹਿਸ ਦੇ ਵਿਚਕਾਰ ਵੀ ਉਤਰਿਆ ਜਿਸ ਵਿੱਚ ਓਪਨਏਆਈ ਦੀ ਆਪਣੀ ਲੀਡਰਸ਼ਿਪ ਸ਼ਾਮਲ ਹੋਈ। ਕੰਪਨੀ ਦੇ ਮੁੱਖ ਵਿਗਿਆਨੀ ਨੇ ਚੇਤਾਵਨੀ ਦਿੱਤੀ ਹੈ ਕਿ ਕਿਸੇ ਵੀ ਪ੍ਰਯੋਗਸ਼ਾਲਾ ਨੇ ਵਧਦੀ ਖੁਦਮੁਖਤਿਆਰੀ ਪ੍ਰਣਾਲੀਆਂ ਦੇ ਨਿਯੰਤਰਣ ਨੂੰ ਹੱਲ ਨਹੀਂ ਕੀਤਾ ਹੈ, ਅਤੇ ਐਂਥਰੋਪਿਕ ਦੇ ਸੀਈਓ ਨੇ ਉਦਯੋਗ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਸਰਹੱਦੀ ਵਿਕਾਸ ਨੂੰ ਹੌਲੀ ਕਰਨ ਲਈ ਕਿਹਾ ਹੈ. ਮਾਪਦੰਡ ਭੌਤਿਕ ਸੰਸਾਰ ਨਾਲ ਛੇੜਛਾੜ ਕਰਨ ਵਾਲੇ ਮਾਡਲਾਂ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ - ਭਾਵੇਂ ਸੰਸਾਰ ਸਟੇਸ਼ਨਰੀ ਵਿੱਚ ਢੱਕਿਆ ਹੋਇਆ ਇੱਕ ਡੈਸਕ ਹੈ - ਬਿਲਕੁਲ ਉਸੇ ਕਿਸਮ ਦੇ ਨਤੀਜੇ ਹਨ ਜਦੋਂ ਦੋਵੇਂ ਕਾਰਜਕਾਰੀ ਇਹ ਦਲੀਲ ਦਿੰਦੇ ਹਨ ਕਿ ਤਰੱਕੀ ਦੀ ਗਤੀ ਨਿਗਰਾਨੀ ਤੋਂ ਵੱਧ ਹੈ।
ਹੇਠਲੀ ਲਾਈਨ
100 ਵਿੱਚੋਂ ਸੱਤ ਪੂਰੀ ਤਰ੍ਹਾਂ ਪੂਰੇ ਕੀਤੇ ਗਏ ਕੰਮ ਕੱਲ੍ਹ ਨੂੰ ਤੁਹਾਡੇ ਡੈਸਕ 'ਤੇ ਰੋਬੋਟ ਨਹੀਂ ਰੱਖਣਗੇ। ਪਰ ਇੱਕ ਵਿਰੋਧੀ ਦੇ ਜ਼ੀਰੋ ਤੋਂ ਸੱਤ ਤੱਕ ਜਾਣਾ, ਇੱਕ ਔਸਤ ਪ੍ਰਗਤੀ ਸਕੋਰ ਦੇ ਨਾਲ ਤਿੰਨ ਗੁਣਾ ਉੱਚਾ, ਇੱਕ ਤਰ੍ਹਾਂ ਦੀ ਰੁਕਾਵਟ ਹੈ ਜਿਸਨੇ ਦੋ ਸਾਲ ਪਹਿਲਾਂ ਭਾਸ਼ਾ ਦੀ ਸਮਝ ਵਿੱਚ ਸਮਰੱਥਾ ਚਾਰਟ ਨੂੰ ਦੁਬਾਰਾ ਬਣਾਇਆ ਸੀ। ਖੁੱਲਾ ਸਵਾਲ ਇਹ ਹੈ ਕਿ ਕੀ ਉਹੀ ਮਾਡਲ ਉਸ ਯੋਗਤਾ ਨੂੰ ਭਰੋਸੇਯੋਗ ਤੌਰ 'ਤੇ ਪ੍ਰਦਾਨ ਕਰ ਸਕਦਾ ਹੈ, ਬੈਂਚਮਾਰਕ ਤੋਂ ਬਾਹਰ, ਕੀਮਤ 'ਤੇ ਡਿਵੈਲਪਰ ਭੁਗਤਾਨ ਕਰਨ ਲਈ ਤਿਆਰ ਹਨ।
AI ਤੋਂ ਅੱਗੇ ਰਹੋ
ਬੈਂਚਮਾਰਕ, ਸਫਲਤਾਵਾਂ ਅਤੇ ਕੰਮ ਕਰਨ ਵਾਲੀਆਂ ਮਸ਼ੀਨਾਂ ਵੱਲ ਦੌੜ — ਹਰ ਰੋਜ਼ ਪਾਲਣਾ ਕੀਤੀ ਜਾਂਦੀ ਹੈ।
ਹੋਰ AI ਖਬਰਾਂ ਪੜ੍ਹੋ →