ਮੈਟਾ, ਆਕਸਫੋਰਡ ਯੂਨੀਵਰਸਿਟੀ ਅਤੇ ਯੂਨੀਵਰਸਿਟੀ ਕਾਲਜ ਲੰਡਨ ਵਿਖੇ FAIR ਦੀ ਇੱਕ ਖੋਜ ਟੀਮ ਨੇ AI ਰਿਸਰਚ ਪ੍ਰੈਫਰੈਂਸ ਮਾਡਲਸ (RPMs) ਪੇਸ਼ ਕੀਤੇ ਹਨ, ਇਹ ਫੈਸਲਾ ਕਰਨ ਲਈ ਇੱਕ ਵਿਧੀ ਹੈ ਕਿ ਇੱਕ ਆਟੋਨੋਮਸ ਰਿਸਰਚ ਏਜੰਟ ਨੂੰ ਅਸਲ ਵਿੱਚ ਕਿਹੜੇ ਮਸ਼ੀਨ ਸਿਖਲਾਈ ਪ੍ਰਯੋਗਾਂ ਨੂੰ ਚਲਾਉਣਾ ਚਾਹੀਦਾ ਹੈ। ਇਹ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣ ਦੀ ਬਜਾਏ ਕਿ ਇੱਕ ਪ੍ਰਯੋਗ ਕਿਵੇਂ ਸਕੋਰ ਕਰੇਗਾ, ਇੱਕ RPM ਅਣਐਕਜ਼ੀਕਿਊਟ ਕੀਤੇ ਉਮੀਦਵਾਰਾਂ ਨੂੰ ਦਰਜਾ ਦਿੰਦਾ ਹੈ ਅਤੇ ਸਭ ਤੋਂ ਵਧੀਆ ਉਮੀਦਵਾਰਾਂ ਨੂੰ ਚੁਣਦਾ ਹੈ, ਇੱਕ ਸ਼ਿਫਟ ਜੋ ਟੀਮ ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ AI-ਸੰਚਾਲਿਤ ਖੋਜ ਵਿੱਚ ਅਸਲ ਰੁਕਾਵਟ ਨੂੰ ਹੱਲ ਕਰਦੀ ਹੈ: ਕੰਮ 'ਤੇ MarkTechPost ਦੀ ਰਿਪੋਰਟ ਦੇ ਅਨੁਸਾਰ, ਤਸਦੀਕ ਗਣਨਾ।
ਇਹ ਵਿਚਾਰ ਇੱਕ ਪਲ 'ਤੇ ਆਉਂਦਾ ਹੈ ਜਦੋਂ ਖੋਜ ਏਜੰਟ ਪਹਿਲਾਂ ਹੀ ਆਪਣੇ ਪ੍ਰਯੋਗਾਂ ਦਾ ਪ੍ਰਸਤਾਵ, ਲਾਗੂ ਅਤੇ ਸਕੋਰ ਕਰ ਸਕਦੇ ਹਨ। ਵਿਚਾਰ ਪੈਦਾ ਕਰਨਾ ਸਸਤੀ ਹੈ; ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਨਹੀਂ ਹੈ। ਇੱਕ ਸਿੰਗਲ ਉਮੀਦਵਾਰ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣ ਵਿੱਚ ਘੰਟਿਆਂ ਤੋਂ ਲੈ ਕੇ ਦਿਨਾਂ ਤੱਕ GPU ਸਮੇਂ ਦੀ ਖਪਤ ਹੋ ਸਕਦੀ ਹੈ, ਇਸਲਈ ਇੱਕ ਏਜੰਟ ਲਾਜ਼ਮੀ ਤੌਰ 'ਤੇ ਉਸ ਤੋਂ ਕਿਤੇ ਵੱਧ ਪ੍ਰਯੋਗਾਂ ਦਾ ਪ੍ਰਸਤਾਵ ਕਰਦਾ ਹੈ ਜਿੰਨਾ ਕਿ ਇਹ ਚਲਾਉਣ ਲਈ ਬਰਦਾਸ਼ਤ ਕਰ ਸਕਦਾ ਹੈ। ਕਿਹੜੇ ਉਮੀਦਵਾਰਾਂ ਨੂੰ ਲਾਗੂ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਜਿਵੇਂ ਕਿ ਟੀਮ ਇਸ ਨੂੰ ਫਰੇਮ ਕਰਦੀ ਹੈ, ਖੋਜ ਦੀ ਤਰੱਕੀ 'ਤੇ ਅਸਲ ਲੀਵਰ ਹੈ। ਉਹਨਾਂ ਲੈਬਾਂ ਲਈ ਜੋ ਉਹਨਾਂ ਦੇ ਕੰਪਿਊਟ ਬਿੱਲਾਂ ਨੂੰ ਚੜ੍ਹਦੇ ਦੇਖ ਰਹੇ ਹਨ, ਇਹ ਫਰੇਮਿੰਗ ਬਿਲਕੁਲ ਇਸੇ ਲਈ ਹੈ ਕਿ ਇਹ ਕੰਮ ਖੋਜ ਆਟੋਮੇਸ਼ਨ ਵਿੱਚ ਨਵੀਨਤਮ AI ਵਿਕਾਸ ਵੱਲ ਧਿਆਨ ਖਿੱਚ ਰਿਹਾ ਹੈ।
ਪ੍ਰਯੋਗ ਦੀ ਚੋਣ ਵਿਚ ਰੁਕਾਵਟ ਕਿਉਂ ਹੈ
ਟੀਮ ਨੇ ਪਾਇਆ ਕਿ ਭਾਸ਼ਾ ਦੇ ਮਾਡਲ ਸੰਪੂਰਨ ਮੈਟ੍ਰਿਕਸ ਜਾਂ ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਨਤੀਜਿਆਂ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਨ ਲਈ ਭਰੋਸੇਯੋਗ ਨਹੀਂ ਹਨ। ਇੱਕ ਮਾਡਲ ਇੱਕ ਉਮੀਦਵਾਰ ਦੇ ਤਜਰਬੇ ਨੂੰ ਨਹੀਂ ਦੇਖ ਸਕਦਾ ਹੈ ਅਤੇ ਉਸ ਦੁਆਰਾ ਪ੍ਰਾਪਤ ਕੀਤੇ ਗਏ ਸਕੋਰ ਦੀ ਸਹੀ ਭਵਿੱਖਬਾਣੀ ਨਹੀਂ ਕਰ ਸਕਦਾ ਹੈ। ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਪਾਇਆ ਕਿ ਇਹ ਕੀ ਕਰ ਸਕਦਾ ਹੈ, ਇਹ ਨਿਰਣਾ ਕਰਨਾ ਹੈ ਕਿ ਦੋ ਉਮੀਦਵਾਰਾਂ ਵਿੱਚੋਂ ਕਿਹੜਾ ਬਿਹਤਰ ਬਾਜ਼ੀ ਹੈ - ਇੱਕ ਸੰਪੂਰਨ ਭਵਿੱਖਬਾਣੀ ਦੀ ਬਜਾਏ ਇੱਕ ਰਿਸ਼ਤੇਦਾਰ ਤੁਲਨਾ। RPM ਪੂਰੀ ਤਰ੍ਹਾਂ ਉਸ ਅੰਤਰ ਦੇ ਆਲੇ-ਦੁਆਲੇ ਬਣਾਏ ਗਏ ਹਨ: ਉਹ ਕਦੇ ਵੀ ਕਿਸੇ ਸਕੋਰ ਦੀ ਭਵਿੱਖਬਾਣੀ ਨਹੀਂ ਕਰਦੇ, ਉਹ ਸਿਰਫ਼ ਰੈਂਕ ਦਿੰਦੇ ਹਨ।
ਸਿਸਟਮ AIRA-dojo ਦੇ ਅੰਦਰ ਚੱਲਦਾ ਹੈ, ਇੱਕ ਓਪਨ-ਸੋਰਸ ਈਵੇਲੂਸ਼ਨਰੀ ਟ੍ਰੀ ਸਰਚ ਸਕੈਫੋਲਡ ਜੋ ਲਾਲਚੀ ਮਾਤਾ-ਪਿਤਾ ਦੀ ਚੋਣ ਅਤੇ ਡਰਾਫਟ, ਸੁਧਾਰ ਅਤੇ ਡੀਬੱਗ ਓਪਰੇਟਰਾਂ ਦੁਆਰਾ ਮਸ਼ੀਨ ਲਰਨਿੰਗ ਪ੍ਰਯੋਗ ਤਿਆਰ ਕਰਦਾ ਹੈ, ਅੰਤ ਵਿੱਚ ਉੱਚ-ਪ੍ਰਮਾਣਿਕਤਾ-ਸਕੋਰ ਨੋਡ ਵਾਪਸ ਕਰਦਾ ਹੈ। ਬੈਂਚਮਾਰਕ, AIRS-ਬੈਂਚ, ਵੀ ਓਪਨ ਸੋਰਸ ਹੈ। ਸਕੈਫੋਲਡ ਅਤੇ ਤਰਜੀਹ ਮਾਡਲ ਦੋਵੇਂ Qwen3.6-27B ਨੂੰ ਆਪਣੀ ਰੀੜ੍ਹ ਦੀ ਹੱਡੀ ਵਜੋਂ ਵਰਤਦੇ ਹਨ, ਜਿਸ ਨੂੰ ਟੀਮ ਨੋਟ ਕਰਦੀ ਹੈ ਕਿ ਓਪਨ ਵੇਟ ਹੈ।
ਨਾਕਆਊਟ ਟੂਰਨਾਮੈਂਟ ਕਿਵੇਂ ਕੰਮ ਕਰਦਾ ਹੈ
ਇੱਕ ਬਾਲ ਪ੍ਰਯੋਗ ਤਿਆਰ ਕਰਨ ਅਤੇ ਇਸਨੂੰ ਚਲਾਉਣ ਦੀ ਬਜਾਏ, ਏਜੰਟ 15 ਅਣਐਕਜ਼ੀਕਿਊਟ ਕੀਤੇ ਉਮੀਦਵਾਰ ਪੈਦਾ ਕਰਨ ਲਈ ਸਮਾਨਾਂਤਰ ਵਿੱਚ 15 ਵਾਰ ਇੱਕ ਆਪਰੇਟਰ ਨੂੰ ਲਾਗੂ ਕਰਦਾ ਹੈ। RPM ਫਿਰ ਨਾਕਆਊਟ ਟੂਰਨਾਮੈਂਟ ਵਿੱਚ ਉਹਨਾਂ ਦੀ ਜੋੜੇ ਅਨੁਸਾਰ ਤੁਲਨਾ ਕਰਦਾ ਹੈ, ਅਤੇ ਸਿਰਫ਼ ਜੇਤੂ ਨੂੰ ਹੀ ਚਲਾਇਆ ਜਾਂਦਾ ਹੈ। ਹਰੇਕ ਤੁਲਨਾ ਖੋਜੇ ਗਏ ਰੁੱਖ ਦੀ ਇੱਕ ਚੌੜਾਈ-ਪਹਿਲੀ ਸੈਰ ਦੁਆਰਾ ਇਕੱਤਰ ਕੀਤੇ ਸੰਦਰਭ ਨੋਡਾਂ ਵਿੱਚ ਅਧਾਰਤ ਹੈ, ਹਰੇਕ ਉਮੀਦਵਾਰ ਨੂੰ ਇਸਦੇ ਪੂਰਵਜਾਂ ਦੇ ਪ੍ਰਮਾਣਿਕਤਾ ਸਕੋਰਾਂ ਦੇ ਨਾਲ ਦਿਖਾਇਆ ਗਿਆ ਹੈ, ਇਸਲਈ ਜੱਜ ਵੈਕਿਊਮ ਦੀ ਬਜਾਏ ਏਜੰਟ ਦੇ ਅਸਲ ਖੋਜ ਇਤਿਹਾਸ ਤੋਂ ਤਰਕ ਕਰਦਾ ਹੈ।
ਪੇਪਰ ਵੱਖ-ਵੱਖ ਗਣਨਾ ਬਜਟਾਂ ਦੇ ਨਾਲ ਦੋ ਰੂਪਾਂ ਦਾ ਵਰਣਨ ਕਰਦਾ ਹੈ:
- ਅਨੁਮਾਨ-ਸਿਰਫ RPM — ਇੱਕ ਜੱਜ ਵਜੋਂ ਇੱਕ LLM ਜੋ ਉਮੀਦਵਾਰ ਦੀਆਂ ਯੋਜਨਾਵਾਂ, ਕੋਡ ਅਤੇ ਖੋਜ ਇਤਿਹਾਸ ਦੀ ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਵਿੱਚ ਤੁਲਨਾ ਕਰਦਾ ਹੈ। ਇਸ ਦੇ ਪ੍ਰੋਂਪਟ ਨੂੰ DSPy ਫਰੇਮਵਰਕ ਤੋਂ MIPROv2 ਨਾਲ ਅਨੁਕੂਲਿਤ ਕੀਤਾ ਗਿਆ ਸੀ ਅਤੇ ਟੀਮ ਜਿਸ ਨੂੰ ਪ੍ਰਿੰਸੀਪਲ-ਇਨਵੈਸਟੀਗੇਟਰ ਰੂਬਰਿਕ ਕਹਿੰਦੀ ਹੈ ਉਸ 'ਤੇ ਕਨਵਰਟ ਕੀਤਾ ਗਿਆ ਸੀ: ਇਹ ਫਿਕਸ ਕੀਤੇ ਜਾਣ ਵਾਲੇ ਬੱਗਾਂ ਨੂੰ ਬਰਦਾਸ਼ਤ ਕਰਦਾ ਹੈ, ਵਿਸਤਾਰਯੋਗਤਾ ਨੂੰ ਇਨਾਮ ਦਿੰਦਾ ਹੈ ਅਤੇ ਬੇਲੋੜੇ ਖੋਜ ਨਿਰਦੇਸ਼ਾਂ ਨੂੰ ਸਜ਼ਾ ਦਿੰਦਾ ਹੈ। ਔਫਲਾਈਨ ਤੁਲਨਾ ਸ਼ੁੱਧਤਾ 57.7 ਤੋਂ 59.0 ਪ੍ਰਤੀਸ਼ਤ ਮਾਪੀ ਗਈ।
- ਏਜੰਟਿਕ RPM — ਉਹੀ ਜੱਜ ਅਤੇ ਇੱਕ ਸੈਂਡਬੌਕਸ ਜੋ ਏਜੰਟ ਦੇ ਵਾਤਾਵਰਣ ਨੂੰ ਕਲੋਨ ਕਰਦਾ ਹੈ, ਇੱਕ ਸਿੰਗਲ H200 GPU ਸਮੇਤ, ਪਾਇਥਨ, ਬੈਸ਼ ਅਤੇ ਇੱਕ ਸਬਮਿਟ-ਸਲੂਸ਼ਨ ਐਕਸ਼ਨ ਤੱਕ ਸੀਮਿਤ ਟੂਲਸ ਦੇ ਨਾਲ। ਇਹ ਛੋਟੇ ਪੈਮਾਨੇ ਦੇ ਪਾਇਲਟ ਪ੍ਰਯੋਗਾਂ ਨੂੰ ਚਲਾਉਂਦਾ ਹੈ, ਫਿਰ ਇੱਕ ਫੀਡਬੈਕ ਮਾਡਲ ਜਾਂ ਤਾਂ ਸਭ ਤੋਂ ਵੱਧ ਜਾਣਕਾਰੀ ਭਰਪੂਰ ਅਗਲੇ ਪ੍ਰਯੋਗ ਦਾ ਪ੍ਰਸਤਾਵ ਦਿੰਦਾ ਹੈ ਜਾਂ ਲੂਪ ਨੂੰ ਖਤਮ ਕਰਦਾ ਹੈ। ਪਾਇਲਟਾਂ ਨੂੰ 60-ਸਕਿੰਟ ਦੀ ਥ੍ਰੈਸ਼ਹੋਲਡ ਦੇ ਨਾਲ 30 'ਤੇ ਕੈਪ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਬਾਕੀ ਸਮੇਂ ਦੇ ਬਜਟ ਨੂੰ ਜਾਣਬੁੱਝ ਕੇ ਬਹੁਤ ਜ਼ਿਆਦਾ ਦੱਸਿਆ ਜਾਂਦਾ ਹੈ — ਅਸਲ 300 ਦੇ ਮੁਕਾਬਲੇ 2,700 ਸਕਿੰਟ ਦੀ ਰਿਪੋਰਟ ਕੀਤੀ ਜਾਂਦੀ ਹੈ — ਇਸ ਲਈ ਏਜੰਟ ਜਲਦੀ ਅਨੁਕੂਲ ਬਣਾਉਣਾ ਬੰਦ ਨਹੀਂ ਕਰਦਾ ਹੈ।
ਇੱਕ ਜੱਜ ਨੇ ਇੱਕ ਪ੍ਰਮੁੱਖ ਜਾਂਚਕਰਤਾ ਵਾਂਗ ਟਿਊਨ ਕੀਤਾ
ਪ੍ਰਿੰਸੀਪਲ-ਇਨਵੈਸਟੀਗੇਟਰ ਫਰੇਮਿੰਗ ਚੁੱਪ-ਚਾਪ ਦਿਲਚਸਪ ਹਿੱਸਾ ਹੈ। ਵੱਧ ਤੋਂ ਵੱਧ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਦਿਖਾਈ ਦੇਣ ਵਾਲੇ ਉਮੀਦਵਾਰਾਂ ਨੂੰ ਇਨਾਮ ਦੇਣ ਦੀ ਬਜਾਏ, ਅਨੁਕੂਲਿਤ ਰੁਬਰਿਕ ਪ੍ਰਤੀਬਿੰਬਤ ਕਰਦਾ ਹੈ ਕਿ ਕਿਵੇਂ ਇੱਕ ਤਜਰਬੇਕਾਰ ਖੋਜਕਰਤਾ ਵਿਚਾਰਾਂ ਦੀ ਜਾਂਚ ਕਰਦਾ ਹੈ: ਬੱਗੀ ਕੋਡ ਜਿਸ ਨੂੰ ਸਥਿਰ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ ਬੀਟਸ ਪਾਲਿਸ਼ਡ ਕੋਡ ਇੱਕ ਡੈੱਡ ਐਂਡ ਦਾ ਪਿੱਛਾ ਕਰਦਾ ਹੈ, ਅਤੇ ਦਿਸ਼ਾਵਾਂ ਜੋ ਮੌਜੂਦਾ ਰੁੱਖ ਦੀ ਨਕਲ ਕਰਦੀਆਂ ਹਨ ਉਹਨਾਂ ਦੀ ਕੀਮਤ ਨਾਵਲ ਨਾਲੋਂ ਘੱਟ ਹੈ। ਉਹ ਰੁਬਰਿਕ, ਹੈਂਡ-ਟਿਊਨਿੰਗ ਦੀ ਬਜਾਏ ਤੁਰੰਤ ਅਨੁਕੂਲਤਾ ਦੁਆਰਾ ਸਿੱਖਿਆ ਗਿਆ, ਉਹ ਹੈ ਜੋ ਸੁਧਾਰ ਲਿਆਉਂਦਾ ਹੈ, ਟੀਮ ਦੀਆਂ ਕਮੀਆਂ ਸੁਝਾਅ ਦਿੰਦੀਆਂ ਹਨ।
AIRS-ਬੈਂਚ 'ਤੇ ਬੈਂਚਮਾਰਕ ਨਤੀਜੇ
ਮੁਲਾਂਕਣ ਵਿੱਚ 20 ਜਨਤਕ ਪਾਠ ਅਤੇ ਸਾਰਣੀਬੱਧ ਕਾਰਜ ਸ਼ਾਮਲ ਹਨ, ਹਰੇਕ ਕੰਮ ਨੂੰ ਇੱਕ ਸਿੰਗਲ H200 ਅਤੇ 10 ਬੇਤਰਤੀਬੇ ਬੀਜਾਂ 'ਤੇ 24 ਘੰਟੇ ਦਿੱਤੇ ਗਏ ਹਨ। ਮਹੱਤਵਪੂਰਨ ਤੌਰ 'ਤੇ, ਇੱਕੋ Qwen3.6-27B ਬੈਕਬੋਨ ਨੇ ਪ੍ਰਯੋਗ ਸੰਚਾਲਕਾਂ ਅਤੇ ਤਰਜੀਹ ਮਾਡਲ ਦੋਵਾਂ ਨੂੰ ਸੰਚਾਲਿਤ ਕੀਤਾ, ਇਸਲਈ ਲਾਭ ਇੱਕ ਮਜ਼ਬੂਤ ਜੱਜ ਮਾਡਲ ਦੀ ਬਜਾਏ ਚੋਣ ਪਰਤ ਤੋਂ ਆਉਂਦੇ ਹਨ। ਔਸਤ ਸਧਾਰਣ ਸਕੋਰ:
- ਕੋਈ RPM ਨਹੀਂ (ਰੈਂਡਮ ਪਿਕ): 0.684
- ਸਿਰਫ਼-ਅੰਦਾਜ਼ਾ RPM: 0.711
- ਏਜੰਟਿਕ RPM: 0.729
- ਪ੍ਰਮਾਣਿਕਤਾ ਓਰੇਕਲ (ਛੱਤ): 0.748
- ਟੈਸਟ ਓਰੇਕਲ (ਛੱਤ): 0.759
0.5066 ਅਤੇ 0.5018 ਦੇ 95 ਪ੍ਰਤੀਸ਼ਤ ਭਰੋਸੇ ਅੰਤਰਾਲ ਹੇਠਲੇ ਸੀਮਾਵਾਂ ਦੇ ਨਾਲ, ਬੇਤਰਤੀਬ ਚੋਣ ਵਿੱਚ ਸੁਧਾਰ ਦੀ ਸੰਭਾਵਨਾ ਸਿਰਫ-ਅੰਤਰਾਲ ਰੂਪ ਲਈ 0.5923 ਅਤੇ ਏਜੰਟਿਕ ਇੱਕ ਲਈ 0.5913 ਸੀ - ਅੰਕੜਾਤਮਕ ਲਈ 0.5 ਥ੍ਰੈਸ਼ਹੋਲਡ ਤੋਂ ਉੱਪਰ, ਹਾਲਾਂਕਿ ਟੀਮ ਦੇ ਮਾਪਦੰਡ ਨਾਲੋਂ ਮਾਮੂਲੀ ਹਨ। ਪਰਿਵਰਤਨਸ਼ੀਲ
ਕੁਸ਼ਲਤਾ ਵਧੇਰੇ ਵਿਹਾਰਕ ਨਤੀਜਾ ਹੈ. ਸਿਰਫ਼-ਅੰਦਾਜ਼ਾ RPM 14.88 ਘੰਟਿਆਂ ਵਿੱਚ 0.684 ਦੇ ਬੇਤਰਤੀਬੇ ਬੇਸਲਾਈਨ ਦੇ ਅੰਤਮ ਸਕੋਰ 'ਤੇ ਪਹੁੰਚ ਗਿਆ, ਇੱਕ 1.61x ਸਪੀਡਅੱਪ, ਜਦੋਂ ਕਿ ਏਜੰਟ ਵੇਰੀਐਂਟ ਨੂੰ 15.50 ਘੰਟੇ, ਇੱਕ 1.55x ਸਪੀਡਅੱਪ ਦੀ ਲੋੜ ਹੈ। ਇੱਥੋਂ ਤੱਕ ਕਿ ਸਵੈ-ਮੇਜ਼ਬਾਨੀ ਜੱਜ ਅਨੁਮਾਨ ਦੇ ਓਵਰਹੈੱਡ ਲਈ ਲੇਖਾ ਜੋਖਾ, ਐਡਜਸਟ ਕੀਤੇ ਨੰਬਰ ਅਨੁਕੂਲ ਰਹੇ।
ਖੁੱਲ੍ਹੇ ਵਜ਼ਨ ਅਤੇ ਇਮਾਨਦਾਰ ਚੇਤਾਵਨੀਆਂ
ਟੀਮ ਸਪੱਸ਼ਟ ਹੈ ਕਿ RPM ਅੱਜ ਸਿਰਫ਼ ਅੰਸ਼ਕ ਤੌਰ 'ਤੇ ਤੈਨਾਤ ਕਰਨ ਯੋਗ ਹਨ। ਕੰਪੋਨੈਂਟ ਖੁੱਲ੍ਹੇ ਹਨ — ਬਿਨਾਂ ਫਾਈਨ-ਟਿਊਨਿੰਗ, ਇੱਕ ਓਪਨ-ਸੋਰਸ ਸਕੈਫੋਲਡ ਅਤੇ ਬੈਂਚਮਾਰਕ, ਅਤੇ ਓਪਨ-ਵੇਟ ਬੈਕਬੋਨ ਮਾਡਲਾਂ ਦੇ ਨਾਲ ਜੰਮੇ ਹੋਏ ਪ੍ਰੀ-ਟ੍ਰੇਨਡ ਬੈਕਬੋਨਸ — ਪਰ ਏਜੰਟਿਕ ਵੇਰੀਐਂਟ ਦੀ ਸੈਂਡਬੌਕਸ ਲੋੜ ਅਤੇ ਇਸਦੇ ਪਾਇਲਟ-ਪ੍ਰਯੋਗ ਓਵਰਹੈੱਡ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਜ਼ਿਆਦਾਤਰ ਲੈਬਾਂ ਸਿਰਫ਼-ਅੰਤਰਨਾਕ ਸੰਸਕਰਣ ਨਾਲ ਸ਼ੁਰੂ ਹੋਣਗੀਆਂ। ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਇਹ ਵੀ ਨੋਟ ਕੀਤਾ ਹੈ ਕਿ ਡੀਬੱਗ ਪੜਾਅ ਏਜੰਟ ਦੇ ਰੂਪ ਵਿੱਚ ਬੇਤਰਤੀਬ ਚੋਣ ਵੱਲ ਮੁੜ ਜਾਂਦੇ ਹਨ ਕਿਉਂਕਿ ਪਾਇਲਟ ਸਮਾਂ ਏਜੰਟ ਦੀ ਆਪਣੀ ਘੜੀ ਨਾਲ ਮੁਕਾਬਲਾ ਕਰਦਾ ਹੈ।
ਵੱਡਾ ਮਹੱਤਵ ਦਿਸ਼ਾਤਮਕ ਹੋ ਸਕਦਾ ਹੈ। ਜਿਵੇਂ ਕਿ ਆਟੋਨੋਮਸ ਰਿਸਰਚ ਏਜੰਟ ਉਦਯੋਗਿਕ ਲੈਬਾਂ ਵਿੱਚ ਡੈਮੋ ਤੋਂ ਰੋਜ਼ਾਨਾ ਵਰਤੋਂ ਵਿੱਚ ਚਲੇ ਜਾਂਦੇ ਹਨ, ਦੁਰਲੱਭ ਸਰੋਤ ਹੁਣ ਵਿਚਾਰ ਨਹੀਂ ਹਨ ਪਰ GPU ਘੰਟੇ, ਅਤੇ ਢੰਗ ਹਨ ਜੋ ਸਮੇਂ ਦੇ ਨਾਲ ਇੱਕ ਨਿਸ਼ਚਿਤ ਗਣਨਾ ਬਜਟ ਮਿਸ਼ਰਣ ਤੋਂ ਵੱਧ ਤਰੱਕੀ ਕਰਦੇ ਹਨ। ਦੌੜਨ ਤੋਂ ਪਹਿਲਾਂ ਦਰਜਾਬੰਦੀ ਕਰਨਾ ਇੱਕ ਸਧਾਰਨ ਵਿਚਾਰ ਹੈ, ਅਤੇ AIRS-ਬੈਂਚ ਨੰਬਰ ਸੁਝਾਅ ਦਿੰਦੇ ਹਨ ਕਿ ਇਹ ਇੱਕ ਅਜਿਹਾ ਵਿਚਾਰ ਹੈ ਜੋ ਮਹੱਤਵਪੂਰਨ ਢੰਗ ਨਾਲ ਕੰਮ ਕਰਦਾ ਹੈ।
