NVIDIA ਦੀ NeMo ਟੀਮ ਨੇ Molt ਨੂੰ ਜਾਰੀ ਕੀਤਾ ਹੈ, ਇੱਕ ਅਸਾਧਾਰਨ ਡਿਜ਼ਾਈਨ ਟੀਚੇ ਦੇ ਨਾਲ ਏਜੰਟਿਕ ਰੀਨਫੋਰਸਮੈਂਟ ਸਿੱਖਣ ਲਈ ਇੱਕ PyTorch-ਨੇਟਿਵ ਫਰੇਮਵਰਕ: ਇੱਕ ਕੋਡਬੇਸ ਇੰਨਾ ਛੋਟਾ ਹੈ ਕਿ ਇੱਕ ਖੋਜਕਰਤਾ ਇਸਨੂੰ ਆਪਣੇ ਸਿਰ ਵਿੱਚ ਰੱਖ ਸਕਦਾ ਹੈ — ਅਤੇ ਇੱਕ AI ਕੋਡਿੰਗ ਸਹਾਇਕ ਇਸ ਬਾਰੇ ਪੂਰੀ ਤਰ੍ਹਾਂ ਪੜ੍ਹ ਅਤੇ ਤਰਕ ਕਰ ਸਕਦਾ ਹੈ। ਏਜੰਟ RL ਦੇ ਰੂਪ ਵਿੱਚ ਰੀਲੀਜ਼ ਮਾਡਲਾਂ ਨੂੰ ਸਾਧਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨ, ਕੋਡ ਲਿਖਣ, ਅਤੇ ਵਾਤਾਵਰਣ ਨੂੰ ਨੈਵੀਗੇਟ ਕਰਨ ਲਈ ਸਿਖਾਉਣ ਲਈ ਪ੍ਰਮੁੱਖ ਵਿਅੰਜਨ ਬਣ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਇਹ ਕਈ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਦੇ ਪ੍ਰੋਜੈਕਟਾਂ ਵਿੱਚੋਂ ਇੱਕ ਹੈ ਜੋ ਕਿ ਫਰੰਟੀਅਰ ਏਜੰਟਾਂ ਨੂੰ ਕਿਵੇਂ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ। ਅਸੀਂ ਇਹਨਾਂ ਤਬਦੀਲੀਆਂ ਨੂੰ ਆਪਣੀਆਂ ਬ੍ਰੇਕਿੰਗ ਏਆਈ ਨਿਊਜ਼ ਵਿੱਚ ਕਵਰ ਕਰਦੇ ਹਾਂ।

ਪੜ੍ਹਨ ਲਈ ਬਣਾਇਆ ਗਿਆ, ਸਿਰਫ਼ ਦੌੜਨ ਲਈ ਨਹੀਂ

ਜਿਵੇਂ ਕਿ ਮਾਰਕਟੈਕਪੋਸਟ ਰਿਪੋਰਟ ਕਰਦਾ ਹੈ, ਮੋਲਟ ਹਰ ਫਰੇਮਵਰਕ ਦੇ RL ਐਂਟਰੀ ਪੁਆਇੰਟ ਤੋਂ ਆਯਾਤ ਗ੍ਰਾਫ ਨੂੰ ਟਰੇਸ ਕਰਕੇ ਗਿਣਿਆ ਜਾਂਦਾ ਹੈ, RL ਕੋਡ ਦੀਆਂ ਲਗਭਗ 8.6K ਲਾਈਨਾਂ ਨੂੰ ਮਾਪਦਾ ਹੈ। ਇਹੀ ਤਰੀਕਾ ਵਰਲ ਲਈ ਲਗਭਗ 62K ਲਾਈਨਾਂ, ਸਲਾਈਮ ਲਈ 25K, ਅਤੇ OpenRLHF ਲਈ 7.2K ਲਾਈਨਾਂ ਨੂੰ ਲੰਮਾ ਕਰਦਾ ਹੈ। ਉਹ ਜਾਣਬੁੱਝ ਕੇ ਸੰਖੇਪਤਾ ਪ੍ਰੋਜੈਕਟ ਦੀ ਕੇਂਦਰੀ ਪਿੱਚ ਹੈ: ਏਜੰਟ RL ਖੋਜ ਨਿਰੰਤਰ ਐਲਗੋਰਿਦਮ ਸੋਧ ਹੈ — ਨਵੇਂ ਅਨੁਮਾਨ, ਨਵੇਂ ਪਾਈਪਲਾਈਨ ਪੜਾਅ, ਨਵੀਂ ਰੋਲਆਉਟ ਸਕੀਮਾਂ — ਅਤੇ ਮੁੱਖ ਧਾਰਾ ਫਰੇਮਵਰਕ ਵਿੱਚ ਟ੍ਰੇਨਰ, ਡਿਸਟ੍ਰੀਬਿਊਟਡ-ਬੈਕਐਂਡ, ਅਤੇ ਰੋਲਆਉਟ ਗੂੰਦ ਦੀਆਂ ਲੇਅਰਾਂ ਰਾਹੀਂ ਹਰ ਤਬਦੀਲੀ ਥ੍ਰੈਡਸ। ਮੋਲਟ ਦਾ ਉਦੇਸ਼ ਉਸ ਰਗੜ ਨੂੰ ਦੂਰ ਕਰਨਾ ਹੈ।

ਫਰੇਮਵਰਕ Apache 2.0 ਲਾਇਸੰਸਸ਼ੁਦਾ ਹੈ ਅਤੇ ਲਾਂਚ ਕੋਡ, ਸਲਰਮ ਸਕ੍ਰਿਪਟਾਂ, ਅਤੇ ਇੱਕ ਪਹਿਲਾਂ ਤੋਂ ਬਣੇ ਕੰਟੇਨਰ ਦੇ ਨਾਲ ਜਹਾਜ਼ ਹੈ। NVIDIA ਸਪੱਸ਼ਟ ਹੈ, ਹਾਲਾਂਕਿ, ਨਾਲ ਮੌਜੂਦ ਖੋਜ ਪੱਤਰ ਮੋਲਟ ਨੂੰ ਉਤਪਾਦਨ ਸਿਖਲਾਈ ਸੇਵਾ ਦੀ ਬਜਾਏ ਖੋਜ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਦੇ ਤੌਰ 'ਤੇ ਰੱਖਦਾ ਹੈ, ਅਤੇ ਹਾਰਡਵੇਅਰ ਅਸਲ ਗੇਟਕੀਪਰ ਹੈ। ਭੇਜੀਆਂ ਗਈਆਂ ਪਕਵਾਨਾਂ ਵਿੱਚ 8 H100 GPUs ਦੇ 2 ਨੋਡਸ, ਸਿਖਲਾਈ ਲਈ 8 ਅਤੇ ਰੋਲਆਊਟ ਲਈ 8 ਵੰਡੇ ਜਾਂਦੇ ਹਨ। ਇਹ ਇਸਨੂੰ ਫਰੰਟੀਅਰ ਅਤੇ ਫਰੰਟੀਅਰ-ਨਾਲ ਲੱਗਦੀਆਂ ਲੈਬਾਂ, ਪੋਸਟ-ਟ੍ਰੇਨਿੰਗ ਕਰਨ ਵਾਲੇ ਚੰਗੀ ਤਰ੍ਹਾਂ ਫੰਡ ਪ੍ਰਾਪਤ ਸ਼ੁਰੂਆਤ, ਐਂਟਰਪ੍ਰਾਈਜ਼ ਏਆਈ ਖੋਜ ਸਮੂਹਾਂ, ਅਤੇ ਮਲਟੀ-ਨੋਡ H100 ਜਾਂ H200 ਐਕਸੈਸ ਵਾਲੇ ਅਕਾਦਮਿਕ ਸਮੂਹਾਂ ਦੀ ਪਹੁੰਚ ਵਿੱਚ ਰੱਖਦਾ ਹੈ।

ਕੰਪੋਜ਼ਡ, ਫੋਰਕਡ ਨਹੀਂ

ਮੋਲਟ ਦਾ ਆਰਕੀਟੈਕਚਰ ਉਹਨਾਂ ਵਿੱਚੋਂ ਕਿਸੇ ਨੂੰ ਵੀ ਫੋਕੇ ਕੀਤੇ ਬਿਨਾਂ ਤਿੰਨ ਮੌਜੂਦਾ ਟੂਲ ਬਣਾਉਂਦਾ ਹੈ, ਇਸਲਈ ਅੱਪਸਟਰੀਮ ਸੁਧਾਰ ਇੱਕ ਦਰਦਨਾਕ ਰੀਬੇਸ ਦੀ ਬਜਾਏ ਇੱਕ ਕੰਟੇਨਰ ਪਿੰਨ ਦੇ ਰੂਪ ਵਿੱਚ ਆਉਂਦੇ ਹਨ। ਇਹ ਪਲੇਸਮੈਂਟ ਅਤੇ ਅਸਿੰਕਰੋਨਸ ਕਤਾਰਾਂ ਲਈ ਰੇ, ਰੋਲਆਊਟ ਲਈ vLLM, ਅਤੇ ਸਿਖਲਾਈ ਲਈ FSDP2 ਨਾਲ NVIDIA AutoModel ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ। ਰਨਟਾਈਮ ਵਿੱਚ ਇੱਕ ਏਜੰਟ ਪੂਲ, ਇੱਕ ਬੇਨਤੀ ਰਾਊਟਰ ਦੇ ਪਿੱਛੇ vLLM ਇੰਜਣਾਂ ਦਾ ਇੱਕ ਸੈੱਟ, ਅਤੇ ਇੱਕ ਸਿੰਗਲ ਸਿਖਲਾਈ ਯੋਗ ਪਾਲਿਸੀ ਐਕਟਰ ਸ਼ਾਮਲ ਹੁੰਦੇ ਹਨ। ਇੱਕ ਸਟ੍ਰੀਮਿੰਗ ਪੂਲ ਫਲਾਈਟ ਵਿੱਚ ਪ੍ਰੋਂਪਟ ਸਮੂਹਾਂ ਨੂੰ ਰੱਖਦਾ ਹੈ ਤਾਂ ਜੋ ਅਭਿਨੇਤਾ ਦੇ ਟ੍ਰੇਨਿੰਗ ਦੌਰਾਨ ਇੰਜਣ ਕਦੇ ਵੀ ਨਿਕਾਸ ਨਾ ਹੋਣ।

ਅੰਸ਼ਕ ਰੋਲਆਊਟ ਨਾਮਕ ਵਿਸ਼ੇਸ਼ਤਾ ਕੁਸ਼ਲਤਾ ਲਈ ਕੇਂਦਰੀ ਹੈ। ਜਦੋਂ ਪਾਲਿਸੀ ਅੱਪਡੇਟ ਹੁੰਦੀ ਹੈ, ਮੋਲਟ ਇੰਜਣਾਂ ਨੂੰ ਰੋਕਦਾ ਹੈ, NCCL ਉੱਤੇ ਅਦਾਕਾਰ ਦੇ ਅੱਪਡੇਟ ਕੀਤੇ ਸ਼ਾਰਡਾਂ ਨੂੰ ਸਿੱਧੇ ਹਰੇਕ ਇੰਜਣ ਵਿੱਚ ਪ੍ਰਸਾਰਿਤ ਕਰਦਾ ਹੈ, ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਰੱਦ ਕਰਨ ਦੀ ਬਜਾਏ ਬਰਕਰਾਰ ਬੇਨਤੀਆਂ ਨੂੰ ਮੁੜ ਸ਼ੁਰੂ ਕਰਦਾ ਹੈ। ਇਹ ਹਰ ਵਾਰ ਮਾਡਲ ਬਦਲਣ 'ਤੇ ਪ੍ਰਗਤੀਸ਼ੀਲ ਰੋਲਆਊਟਸ ਨੂੰ ਸੁੱਟਣ ਦੇ ਫਾਲਤੂ ਪੈਟਰਨ ਤੋਂ ਬਚਦਾ ਹੈ।

ਇੱਕ ਮੋਡੀਊਲ, ਦੋ ਏਜੰਟ ਫਾਰਮ

ਮੋਲਟ ਵਿੱਚ ਚੱਲਦਾ ਇੱਕ RL ਇੱਕ ਸਿੰਗਲ ਪਾਈਥਨ ਮੋਡੀਊਲ ਦਾ ਨਾਮ ਦਿੰਦਾ ਹੈ ਜੋ ਇੱਕ ਏਜੈਂਟਰਨਰ ਨੂੰ ਨਿਰਯਾਤ ਕਰਦਾ ਹੈ, ਅਤੇ ਬਾਕੀ ਸਭ ਕੁਝ — ਇਨਾਮ ਫੰਕਸ਼ਨ ਸਮੇਤ — ਸਧਾਰਨ ਕੋਡ ਹੈ। ਫਰੇਮਵਰਕ ਦੋ ਰੂਪਾਂ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ। Env ਦੇ ਨਾਲ, ਫਰੇਮਵਰਕ ਇੱਕ ਜਿਮਨੇਜ਼ੀਅਮ-ਅਲਾਈਨਡ `ਸਟੈਪ()` ਦੇ ਅੰਦਰ LLM ਲੂਪ ਦਾ ਮਾਲਕ ਹੈ, ਜੋ ਜਾਣੇ-ਪਛਾਣੇ ਰੀਨਫੋਰਸਮੈਂਟ-ਲਰਨਿੰਗ ਪੈਟਰਨ ਨੂੰ ਫਿੱਟ ਕਰਦਾ ਹੈ। ChatAgent ਦੇ ਨਾਲ, ਉਪਭੋਗਤਾ ਇੱਕ ਸਟਾਕ OpenAI ਜਾਂ Anthropic SDK ਦੁਆਰਾ ਲੂਪ ਦਾ ਮਾਲਕ ਹੁੰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਮੌਜੂਦਾ ਏਜੰਟ ਨੂੰ ਸਮੇਟਣਾ ਆਸਾਨ ਹੋ ਜਾਂਦਾ ਹੈ।

ਦੋਵਾਂ ਨੂੰ ਬ੍ਰਿਜ ਕਰਨ ਲਈ, ਮੋਲਟ ਇੱਕ ਲੂਪਬੈਕ ਸਰਵਰ ਲਾਂਚ ਕਰਦਾ ਹੈ ਜੋ ਦੋਵੇਂ ਵਾਇਰ ਪ੍ਰੋਟੋਕੋਲ ਬੋਲਦਾ ਹੈ, ਅਤੇ ਹਰੇਕ ਬੇਨਤੀ ਨੂੰ ਸਰਵਰ-ਸਾਈਡ ਨੂੰ ਇੱਕ ਟੋਕਨ-ਸਹੀ ਸੰਚਵ ਵਿੱਚ ਡੀਕੋਡ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। ਜਦੋਂ ਇੱਕ ਲੰਮਾ-ਹੋਰੀਜ਼ਨ ਏਜੰਟ ਆਪਣੇ ਸੰਦਰਭ ਨੂੰ ਸੰਕੁਚਿਤ ਕਰਦਾ ਹੈ ਅਤੇ ਅਗੇਤਰ ਨੂੰ ਮੁੜ-ਲਿਖਦਾ ਹੈ — ਏਜੰਟਾਂ ਲਈ ਇੱਕ ਆਮ ਕਾਰਵਾਈ ਜੋ ਕਈ ਮੋੜਾਂ ਲਈ ਚਲਦੀ ਹੈ — ਸਰਵਰ ਮੌਜੂਦਾ ਹਿੱਸੇ ਨੂੰ ਸੀਲ ਕਰਦਾ ਹੈ ਅਤੇ ਆਪਣੇ ਆਪ ਹੀ ਇੱਕ ਤਾਜ਼ਾ ਖੋਲ੍ਹਦਾ ਹੈ। ਇਹ ਪਲੰਬਿੰਗ ਵੇਰਵੇ ਦੀ ਇੱਕ ਕਿਸਮ ਹੈ ਜੋ ਇਹ ਨਿਰਧਾਰਤ ਕਰਦੀ ਹੈ ਕਿ ਕੀ ਇੱਕ ਏਜੰਟਿਕ RL ਰਨ ਅਭਿਆਸ ਵਿੱਚ ਸਹੀ ਹੈ ਜਾਂ ਸਿਰਫ ਸਹੀ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ।

ਤਿੰਨ ਸ਼ੁੱਧਤਾ ਅਵਰੋਧਕ

ਮੋਲਟ ਦੇ ਡਿਜ਼ਾਈਨ ਨੂੰ ਤਿੰਨ ਸ਼ੁੱਧਤਾ ਇਨਵੈਰੀਐਂਟਸ ਦੇ ਆਲੇ-ਦੁਆਲੇ ਸੰਗਠਿਤ ਕੀਤਾ ਗਿਆ ਹੈ ਜੋ ਅਸਿੰਕ੍ਰੋਨਸ ਏਜੰਟਿਕ ਸਿਖਲਾਈ ਦੀਆਂ ਸੂਖਮ ਅਸਫਲਤਾਵਾਂ ਨੂੰ ਸੰਬੋਧਿਤ ਕਰਦੇ ਹਨ। ਟੋਕਨ ਪਛਾਣ ਦਾ ਮਤਲਬ ਹੈ ਨਮੂਨੇ ਵਾਲੇ ਟੋਕਨ ਆਈਡੀ ਟ੍ਰੈਜੈਕਟਰੀ ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕਰਦੇ ਹਨ, ਨਾ ਕਿ ਮੁੜ-ਟੋਕਨਾਈਜ਼ਡ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ — ਮਹੱਤਵਪੂਰਨ ਕਿਉਂਕਿ ਟੈਕਸਟ ਨੂੰ ਟੋਕਨਾਂ ਵਿੱਚ ਸਿਲਾਈ ਕਰਨਾ ਚੁੱਪਚਾਪ ਡੇਟਾ ਨੂੰ ਬਦਲ ਸਕਦਾ ਹੈ। ਨੀਤੀ-ਵਰਜਨ ਅਰਥ-ਵਿਗਿਆਨ ਇਹ ਯਕੀਨੀ ਬਣਾਉਂਦਾ ਹੈ ਕਿ ਸਿਖਲਾਈਯੋਗ ਟੋਕਨ ਉਹਨਾਂ ਦੇ ਵਿਵਹਾਰ-ਨੀਤੀ ਲੌਗ-ਸੰਭਾਵਨਾਵਾਂ ਨੂੰ ਕਾਇਮ ਰੱਖਦੇ ਹਨ, ਇੱਕ ਕ੍ਰਮ-ਪੱਧਰ ਦੇ ਗੇਟ ਦੇ ਪਿੱਛੇ ਪ੍ਰਤੀ ਟੋਕਨ ਨੂੰ ਸਹੀ ਕੀਤੇ ਅਸਿੰਕ੍ਰੋਨਸ ਵਰਤੋਂ ਦੇ ਨਾਲ। ਅੱਗੇ ਇਕਸਾਰਤਾ ਲਈ ਇਹ ਲੋੜ ਹੈ ਕਿ ਰੋਲਆਊਟ ਇੰਜਣ ਅਤੇ ਸਿਖਲਾਈ ਐਕਟਰ ਮਾਡਲ ਸਿਮੈਂਟਿਕਸ 'ਤੇ ਸਹਿਮਤ ਹੋਣ।

ਮਾਹਰਾਂ ਦੇ ਮਿਸ਼ਰਣ (MoE) ਨੀਤੀਆਂ ਲਈ ਇਹ ਆਖਰੀ ਅਦਲਾ-ਬਦਲੀ ਸਭ ਤੋਂ ਵੱਧ ਮਹੱਤਵ ਰੱਖਦਾ ਹੈ, ਜੋ ਕਿ ਲਗਾਤਾਰ ਆਮ ਹੋ ਰਹੀਆਂ ਹਨ। ਰੋਲਆਉਟ ਅਤੇ ਸਿਖਲਾਈ ਰਾਊਟਰ ਸੁਤੰਤਰ ਤੌਰ 'ਤੇ ਮਾਹਰਾਂ ਦੀ ਚੋਣ ਕਰਦੇ ਹਨ, ਅਤੇ ਛੋਟੇ ਸੰਖਿਆਤਮਕ ਅੰਤਰ ਟਾਪ-ਕੇ ਵਿਕਲਪਾਂ ਨੂੰ ਫਲਿੱਪ ਕਰ ਸਕਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਨਮੂਨਾ ਲਿਆ ਗਿਆ ਸੀ ਅਤੇ ਕਿਸ 'ਤੇ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾ ਰਹੀ ਹੈ ਵਿਚਕਾਰ ਇੱਕ ਮੇਲ ਨਹੀਂ ਖਾਂਦਾ ਹੈ। ਮੋਲਟ ਇਸਨੂੰ ਰੋਲਆਉਟ ਰਾਊਟਿੰਗ ਰੀਪਲੇ ਨਾਲ ਸੰਬੋਧਿਤ ਕਰਦਾ ਹੈ: vLLM ਇਸਦੇ ਪ੍ਰਤੀ-ਟੋਕਨ ਮਾਹਰ ਆਈਡੀ ਵਾਪਸ ਕਰਦਾ ਹੈ, ਅਤੇ ਟਰੇਨਿੰਗ ਫਾਰਵਰਡ ਪਾਸ ਉਹਨਾਂ ਸਹੀ ਰੂਟਿੰਗ ਫੈਸਲਿਆਂ ਨੂੰ ਮੁੜ-ਪ੍ਰਾਪਤ ਕਰਨ ਦੀ ਬਜਾਏ ਉਹਨਾਂ ਨੂੰ ਰੀਪਲੇ ਕਰਦਾ ਹੈ।

ਇਹ ਕਿਸ ਲਈ ਹੈ

ਭੇਜੇ ਗਏ ਪਕਵਾਨਾਂ ਅਤੇ ਵਰਤੋਂ ਦੇ ਮਾਮਲੇ ਉਸ ਵੱਲ ਇਸ਼ਾਰਾ ਕਰਦੇ ਹਨ ਜਿੱਥੇ NVIDIA ਮੋਲਟ ਨੂੰ ਅਪਣਾਏ ਜਾਣ ਦੀ ਉਮੀਦ ਕਰਦਾ ਹੈ: ਮਲਟੀ-ਟਰਨ ਟੂਲ-ਯੂਜ਼ ਏਜੰਟ, ਕੋਡ-ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਏਜੰਟ, ਵਿਜ਼ਨ-ਲੈਂਗਵੇਜ ਐਨਵਾਇਰਮੈਂਟ (ਫ੍ਰੇਮਵਰਕ ਵਿੱਚ ਇੱਕ ਭੇਜੀ ਗਈ geo3k ਰੈਸਿਪੀ ਸ਼ਾਮਲ ਹੈ), LLM-ਅਜ਼-ਜੱਜ ਰਿਵਾਰਡ ਲੂਪਸ, ਅਤੇ ਵਿਦਿਆਰਥੀ ਲਈ ਇੱਕ ਛੋਟਾ ਜਿਹਾ ਨੀਤੀਗਤ ਮਾਡਲ। ਇਹ ਬਿਲਕੁਲ ਉਹ ਵਰਕਲੋਡ ਹਨ ਜਿਨ੍ਹਾਂ ਨੇ ਪੂਰੇ ਉਦਯੋਗ ਵਿੱਚ ਏਜੰਟਿਕ RL ਵਿੱਚ ਵਾਧਾ ਕੀਤਾ ਹੈ, ਅਤੇ ਹਰ ਇੱਕ ਨੂੰ ਅੰਸ਼ਕ-ਰੋਲਆਊਟ, ਅਸਿੰਕ-ਸੈਂਪਲਿੰਗ ਦੀਆਂ ਸਥਿਤੀਆਂ ਦੇ ਤਹਿਤ ਸਹੀ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਬਦਨਾਮ ਹੈ ਜੋ ਅਸਲ ਸਿਖਲਾਈ ਲਾਗੂ ਕਰਦੇ ਹਨ।

ਵਿਆਪਕ ਸੰਕੇਤ ਇਹ ਹੈ ਕਿ NVIDIA ਨਾ ਸਿਰਫ਼ ਉਹਨਾਂ GPUs ਵਿੱਚ ਨਿਵੇਸ਼ ਕਰ ਰਿਹਾ ਹੈ ਜੋ ਏਜੰਟਾਂ ਨੂੰ ਸਿਖਲਾਈ ਦਿੰਦੇ ਹਨ, ਬਲਕਿ ਉਹਨਾਂ ਨੂੰ ਬਣਾਉਣ ਲਈ ਖੋਜਕਰਤਾਵਾਂ ਦੁਆਰਾ ਵਰਤੇ ਜਾਂਦੇ ਸੌਫਟਵੇਅਰ ਸਟੈਕ ਵਿੱਚ ਵੀ ਨਿਵੇਸ਼ ਕੀਤਾ ਜਾਂਦਾ ਹੈ। ਕੋਡਬੇਸ ਨੂੰ ਛੋਟਾ ਅਤੇ ਪੜ੍ਹਨਯੋਗ ਰੱਖ ਕੇ — ਅਤੇ ਸਪੱਸ਼ਟ ਤੌਰ 'ਤੇ ਇਸ ਨੂੰ ਡਿਜ਼ਾਈਨ ਕਰਨ ਨਾਲ ਤਾਂ ਕਿ ਇੱਕ AI ਕੋਡਿੰਗ ਸਹਾਇਕ ਇਸਨੂੰ ਸੰਸ਼ੋਧਿਤ ਕਰ ਸਕੇ — ਮੋਲਟ ਇੱਕ ਸ਼ਰਤ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਏਜੰਟ RL ਟੂਲਿੰਗ ਦਾ ਭਵਿੱਖ ਉਹਨਾਂ ਮਾਡਲਾਂ ਨਾਲ ਸਹਿ-ਵਿਕਸਤ ਕੀਤਾ ਜਾਵੇਗਾ ਜੋ ਇਸਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ।

AI ਤੋਂ ਅੱਗੇ ਰਹੋ

ਫਰੰਟੀਅਰ ਏਜੰਟਾਂ ਨੂੰ ਕਿਵੇਂ ਸਿਖਲਾਈ ਦਿੱਤੀ ਜਾਂਦੀ ਹੈ ਇਸ ਬਾਰੇ ਫਰੇਮਵਰਕ ਨੂੰ ਮੁੜ ਆਕਾਰ ਦੇਣ ਲਈ, ਨਵੀਨਤਮ AI ਵਿਕਾਸ ਲਈ ਸਾਡੇ ਹੱਬ ਦੀ ਪਾਲਣਾ ਕਰੋ।

ਹੋਰ AI ਖਬਰਾਂ ਪੜ੍ਹੋ →