ਇੱਕ ਨਵਾਂ ਓਪਨ-ਸੋਰਸ ਪ੍ਰੋਜੈਕਟ ਮਸ਼ੀਨ ਸਿਖਲਾਈ ਦੀਆਂ ਜ਼ਿੱਦੀ ਸੀਮਾਵਾਂ ਵਿੱਚੋਂ ਇੱਕ ਨਾਲ ਨਜਿੱਠਣ ਲਈ ਧਿਆਨ ਖਿੱਚ ਰਿਹਾ ਹੈ: ਇੱਕ ਭਾਸ਼ਾ ਮਾਡਲ ਬਣਾਉਣਾ ਜੋ ਕਦੇ ਵੀ ਸਿੱਖਣਾ ਬੰਦ ਨਹੀਂ ਕਰਦਾ। ਮਿੰਨੀ-ਏਜੀਆਈ ਕਿਹਾ ਜਾਂਦਾ ਹੈ, ਇਹ ਪ੍ਰੋਜੈਕਟ ਆਪਣੇ ਆਪ ਨੂੰ ਇੱਕ ਨਿਰੰਤਰ ਸਿਖਲਾਈ, ਬਾਈਟ-ਪੱਧਰ ਦੇ ਭਾਸ਼ਾ ਮਾਡਲ ਵਜੋਂ ਦਰਸਾਉਂਦਾ ਹੈ ਜੋ ਆਪਣੀ ਖੁਦ ਦੀ ਆਰਕੀਟੈਕਚਰ ਨੂੰ ਇਕੱਠਾ ਕਰਦਾ ਹੈ, 8GB VRAM ਦੇ ਨਾਲ ਇੱਕ ਸਿੰਗਲ GPU 'ਤੇ ਸਕ੍ਰੈਚ ਤੋਂ ਟ੍ਰੇਨ ਕਰਦਾ ਹੈ, ਅਤੇ ਇਸ ਦੁਆਰਾ ਪੜ੍ਹੀ ਜਾਂਦੀ ਹਰ ਚੀਜ਼ ਤੋਂ ਸਿੱਖਦਾ ਰਹਿੰਦਾ ਹੈ।
ਪ੍ਰੋਜੈਕਟ ਹਫਤੇ ਦੇ ਅੰਤ ਵਿੱਚ ਹੈਕਰ ਨਿਊਜ਼ 'ਤੇ ਪ੍ਰਗਟ ਹੋਇਆ, ਜਿੱਥੇ ਇਹ ਸੌ ਤੋਂ ਵੱਧ ਅੰਕਾਂ 'ਤੇ ਚੜ੍ਹ ਗਿਆ, ਅਤੇ GitHub 'ਤੇ ਇਸਦਾ ਭੰਡਾਰ MIT ਲਾਇਸੈਂਸ ਦੇ ਅਧੀਨ ਜਾਰੀ ਕੀਤਾ ਗਿਆ ਹੈ। ਪ੍ਰੋਜੈਕਟ ਦੇ README ਦੇ ਅਨੁਸਾਰ, ਟੀਚਾ ਇਹ ਪ੍ਰਦਰਸ਼ਿਤ ਕਰਨਾ ਹੈ ਕਿ ਡੇਟਾ ਦੀ ਇੱਕ ਸਿੰਗਲ ਸਟ੍ਰੀਮ ਤੋਂ ਨਿਰੰਤਰ ਸਿੱਖਣਾ - ਬਿਨਾਂ ਕਿਸੇ ਵਿਨਾਸ਼ਕਾਰੀ ਭੁੱਲ ਦੇ - ਮਾਮੂਲੀ, ਖਪਤਕਾਰ-ਗਰੇਡ ਹਾਰਡਵੇਅਰ 'ਤੇ ਵੀ ਸੰਭਵ ਹੈ। For more context on this story, see our ongoing breaking AI news.
ਡਿਸਕ 'ਤੇ ਭਾਰ, VRAM ਵਿੱਚ ਨਹੀਂ
ਮਿੰਨੀ-ਏਜੀਆਈ ਦੇ ਪਿੱਛੇ ਕੇਂਦਰੀ ਚਾਲ ਇੱਕ ਗੈਰ-ਰਵਾਇਤੀ ਮੈਮੋਰੀ ਪ੍ਰਬੰਧਨ ਯੋਜਨਾ ਹੈ। GPU ਮੈਮੋਰੀ ਵਿੱਚ ਸਾਰੇ ਮਾਡਲ ਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਰੱਖਣ ਦੀ ਬਜਾਏ, ਸਿਸਟਮ ਆਪਣੇ ਵਜ਼ਨ ਨੂੰ ਡਿਸਕ 'ਤੇ ਸਧਾਰਨ ਫਾਈਲਾਂ ਦੇ ਰੂਪ ਵਿੱਚ ਸਟੋਰ ਕਰਦਾ ਹੈ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਲੋੜ ਅਨੁਸਾਰ ਗ੍ਰਾਫਿਕਸ ਕਾਰਡ 'ਤੇ ਪੇਜ ਕਰਦਾ ਹੈ।
ਉਸ ਡਿਜ਼ਾਇਨ ਚੋਣ ਦਾ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਨਤੀਜਾ ਹੈ: ਮਾਡਲ ਦੀ ਪੈਰਾਮੀਟਰ ਗਿਣਤੀ VRAM ਦੀ ਬਜਾਏ ਖਾਲੀ ਡਿਸਕ ਸਪੇਸ ਦੁਆਰਾ ਸੀਮਿਤ ਹੈ। README ਦੱਸਦਾ ਹੈ ਕਿ ਮਾਡਲ ਸਿਖਲਾਈ ਦੇ ਦੌਰਾਨ ਨਵੀਂ ਸਮਰੱਥਾ ਵਧਾ ਸਕਦਾ ਹੈ ਜਦੋਂ ਇਹ ਘੱਟ ਚੱਲਦਾ ਹੈ, ਅਤੇ ਸਮਰੱਥਾ ਨੂੰ ਕੱਟਦਾ ਹੈ ਜਿਸ ਲਈ ਕੁਝ ਨਹੀਂ ਮੰਗਦਾ। ਸਿਖਲਾਈ ਅਤੇ ਅਨੁਮਾਨ ਬਿਲਕੁਲ ਉਸੇ ਕੋਡ ਮਾਰਗ ਰਾਹੀਂ ਚੱਲਦੇ ਹਨ, ਇਸਲਈ ਕੋਈ ਵੱਖਰੀ ਫਾਈਨ-ਟਿਊਨਿੰਗ ਪ੍ਰਣਾਲੀ ਨਹੀਂ ਹੈ ਅਤੇ ਕੋਈ ਫ੍ਰੀਜ਼ ਕੀਤਾ ਬੇਸ ਮਾਡਲ ਨਹੀਂ ਹੈ — ਪੜ੍ਹਨਾ ਅਤੇ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਕਰਨਾ, ਪ੍ਰੋਜੈਕਟ ਦੇ ਸ਼ਬਦਾਂ ਵਿੱਚ, ਇੱਕੋ ਘਟਨਾ ਹੈ।
ਸਿਸਟਮ ਨੂੰ ਘੱਟੋ-ਘੱਟ ਇੱਕ 8GB VRAM GPU, ਹਾਰਡਵੇਅਰ ਦੇ ਨਾਲ ਇੱਕ PC ਜਾਂ ਲੈਪਟਾਪ 'ਤੇ ਨਿਸ਼ਾਨਾ ਬਣਾਇਆ ਗਿਆ ਹੈ, ਜੋ ਕਿ ਬਹੁਤ ਸਾਰੇ ਡਿਵੈਲਪਰਾਂ ਦੇ ਕੋਲ ਹੈ।
ਲਗਾਤਾਰ ਸਿੱਖਣਾ ਔਖਾ ਕਿਉਂ ਹੈ
ਅੱਜ ਉਪਲਬਧ ਜ਼ਿਆਦਾਤਰ ਭਾਸ਼ਾ ਮਾਡਲ ਉਸੇ ਜੀਵਨ ਚੱਕਰ ਦੀ ਪਾਲਣਾ ਕਰਦੇ ਹਨ: ਇੱਕ ਲੈਬ ਇੱਕ ਮਾਡਲ ਨੂੰ ਸਿਖਲਾਈ ਦਿੰਦੀ ਹੈ, ਇਸਨੂੰ ਫ੍ਰੀਜ਼ ਕਰਦੀ ਹੈ, ਅਤੇ ਇਸਨੂੰ ਭੇਜਦੀ ਹੈ। ਉਪਭੋਗਤਾ ਕਿਨਾਰਿਆਂ ਦੇ ਆਲੇ ਦੁਆਲੇ ਵਧੀਆ-ਟਿਊਨ ਕਰ ਸਕਦੇ ਹਨ, ਪਰ ਬੇਸ ਵੇਟ ਦੁਬਾਰਾ ਕਦੇ ਨਹੀਂ ਬਦਲਦੇ ਹਨ। ਪ੍ਰੋਜੈਕਟ ਦਾ ਪ੍ਰੇਰਣਾ ਸੈਕਸ਼ਨ ਇਹ ਦਲੀਲ ਦਿੰਦਾ ਹੈ ਕਿ ਇਹ ਹਰੇਕ ਨਿੱਜੀ ਮਲਕੀਅਤ ਵਾਲਾ ਮਾਡਲ ਬਣਾਉਂਦਾ ਹੈ "ਤੁਹਾਡੀ ਸਿਖਰ 'ਤੇ ਇੱਕ ਪਤਲੀ ਪਰਤ ਵਾਲਾ ਕਿਸੇ ਹੋਰ ਦਾ ਮਾਡਲ" - ਇੱਕ ਜੋ ਇਸ ਨੂੰ ਭੇਜਣ ਵਾਲੇ ਦਿਨ ਸਿੱਖਣਾ ਬੰਦ ਕਰ ਦਿੰਦਾ ਹੈ।
ਮਸ਼ੀਨ ਲਰਨਿੰਗ ਖੋਜ ਵਿੱਚ ਰੁਕਾਵਟ ਇੱਕ ਜਾਣੀ-ਪਛਾਣੀ ਹੈ: ਵਿਨਾਸ਼ਕਾਰੀ ਭੁੱਲਣਾ, ਨਵੇਂ ਡੇਟਾ 'ਤੇ ਸਿਖਲਾਈ ਦਿੱਤੇ ਜਾਣ 'ਤੇ ਪਹਿਲਾਂ ਤੋਂ ਸਿੱਖੇ ਗਏ ਗਿਆਨ ਨੂੰ ਓਵਰਰਾਈਟ ਕਰਨ ਲਈ ਨਿਊਰਲ ਨੈਟਵਰਕਸ ਦੀ ਪ੍ਰਵਿਰਤੀ। ਇੱਕ ਮਾਡਲ ਜੋ ਜਾਣਕਾਰੀ ਦੀ ਰੋਜ਼ਾਨਾ ਸਟ੍ਰੀਮ ਤੋਂ ਲਗਾਤਾਰ ਸਿੱਖਦਾ ਹੈ, ਆਮ ਤੌਰ 'ਤੇ ਉਹ ਸਭ ਕੁਝ ਘਟਾਉਂਦਾ ਹੈ ਜੋ ਇਹ ਪਹਿਲਾਂ ਜਾਣਦਾ ਸੀ।
README ਉਹਨਾਂ ਰੁਕਾਵਟਾਂ ਦੀ ਰੂਪਰੇਖਾ ਦਿੰਦਾ ਹੈ ਜੋ ਡਿਜ਼ਾਈਨ ਨੂੰ ਆਕਾਰ ਦਿੰਦੇ ਹਨ। ਮਾਡਲ ਨੂੰ 8GB VRAM 'ਤੇ ਫਿੱਟ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ - ਕੁਆਂਟਾਈਜ਼ੇਸ਼ਨ ਦੇ ਨਾਲ ਨਹੀਂ, ਕਿਉਂਕਿ ਸਿਖਲਾਈ ਲਈ ਗਰੇਡੀਐਂਟ ਅਤੇ ਆਪਟੀਮਾਈਜ਼ਰ ਸਟੇਟ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ ਜੋ ਆਪਣੇ ਆਪ ਵਜ਼ਨ ਦੀ ਮੈਮੋਰੀ ਤੋਂ ਲਗਭਗ ਤਿੰਨ ਗੁਣਾ ਜੋੜਦੇ ਹਨ। ਅਤੇ ਇਸ ਨੂੰ ਭੁੱਲਣਾ ਨਹੀਂ ਚਾਹੀਦਾ, ਪਾਠ ਦੀ ਇੱਕ ਬੇਅੰਤ ਧਾਰਾ ਤੋਂ ਨਵੀਂ ਸਮੱਗਰੀ ਨੂੰ ਜਜ਼ਬ ਕਰਦੇ ਹੋਏ ਪਹਿਲਾਂ ਹੀ ਜੋ ਕੁਝ ਸਿੱਖਿਆ ਹੈ ਉਸ ਨੂੰ ਫੜੀ ਰੱਖਣਾ।
ਇੱਕ ਬਾਈਟ-ਪੱਧਰ ਦਾ ਮਾਡਲ ਜੋ ਆਪਣੇ ਆਪ ਬਣਾਉਂਦਾ ਹੈ
ਮਿਨੀ-ਏਜੀਆਈ ਟੋਕਨਾਂ ਦੀ ਬਜਾਏ ਬਾਈਟ ਪੱਧਰ 'ਤੇ ਕੰਮ ਕਰਦਾ ਹੈ, ਅੱਖਰਾਂ ਦੀ ਇੱਕ ਧਾਰਾ ਨੂੰ ਇੱਕ ਸਮੇਂ ਵਿੱਚ ਇੱਕ ਹਿੱਸਾ ਪੜ੍ਹਦਾ ਹੈ ਅਤੇ ਹਰੇਕ ਹਿੱਸੇ 'ਤੇ ਇੱਕ ਗਰੇਡੀਐਂਟ ਕਦਮ ਚੁੱਕਦਾ ਹੈ। ਪ੍ਰੋਜੈਕਟ ਇਹ ਵੀ ਕਹਿੰਦਾ ਹੈ ਕਿ ਮਾਡਲ "ਆਪਣੀ ਖੁਦ ਦੀ ਆਰਕੀਟੈਕਚਰ ਨੂੰ ਇਕੱਠਾ ਕਰਦਾ ਹੈ," ਇਸ ਨੂੰ ਰਵਾਇਤੀ ਮਾਡਲਾਂ ਤੋਂ ਵੱਖ ਕਰਦਾ ਹੈ ਜਿਸਦੀ ਬਣਤਰ ਸਿਖਲਾਈ ਸ਼ੁਰੂ ਹੋਣ ਤੋਂ ਪਹਿਲਾਂ ਉਹਨਾਂ ਦੇ ਸਿਰਜਣਹਾਰਾਂ ਦੁਆਰਾ ਨਿਸ਼ਚਿਤ ਕੀਤੀ ਜਾਂਦੀ ਹੈ।
ਪਹੁੰਚ ਜਾਣਬੁੱਝ ਕੇ ਪ੍ਰਯੋਗਾਤਮਕ ਹੈ। ਇਹ ਇੱਕ ਸਿਖਲਾਈ ਪ੍ਰਣਾਲੀ ਦਾ ਇੱਕ ਛੋਟੇ ਪੱਧਰ ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਹੈ, ਨਾ ਕਿ ਸਰਹੱਦੀ ਪ੍ਰਣਾਲੀਆਂ ਲਈ ਇੱਕ ਚੁਣੌਤੀ।
ਮਹੱਤਵਪੂਰਨ ਚੇਤਾਵਨੀਆਂ
ਪ੍ਰੋਜੈਕਟ ਦਾ ਲੇਖਕ ਸਿਸਟਮ ਦੀ ਮੌਜੂਦਾ ਸਥਿਤੀ ਬਾਰੇ ਸਪੱਸ਼ਟ ਹੈ। README ਦੇ ਆਪਣੇ ਸ਼ਬਦਾਂ ਵਿੱਚ, ਮਿੰਨੀ-ਏਜੀਆਈ "ਇੱਕ ਛੋਟਾ ਖਿਡੌਣਾ-ਪੱਧਰ ਦਾ ਮਾਡਲ" ਹੈ, ਅਤੇ ਪਾਠਕਾਂ ਨੂੰ ਫਰੰਟੀਅਰ-ਪੱਧਰ ਦੀਆਂ ਸਮਰੱਥਾਵਾਂ ਦੀ ਉਮੀਦ ਨਹੀਂ ਕਰਨੀ ਚਾਹੀਦੀ। ਅਭਿਆਸ ਦਾ ਬਿੰਦੂ ਇਹ ਦਰਸਾਉਣਾ ਹੈ ਕਿ ਬਿਨਾਂ ਕਿਸੇ ਵਿਨਾਸ਼ਕਾਰੀ ਭੁੱਲ ਦੇ ਇੱਕ ਸਿੰਗਲ ਡੇਟਾ ਸਟ੍ਰੀਮ ਤੋਂ ਨਿਰੰਤਰ ਸਿੱਖਣਾ ਬਿਲਕੁਲ ਸੰਭਵ ਹੈ - ਅਤੇ ਹਾਰਡਵੇਅਰ 'ਤੇ ਵੀ ਸੰਭਵ ਹੈ ਜਿਸ ਤੱਕ ਲਗਭਗ ਕੋਈ ਵੀ ਪਹੁੰਚ ਕਰ ਸਕਦਾ ਹੈ।
ਮਾਡਲ ਦਾ ਵਜ਼ਨ ਅਜੇ ਪ੍ਰਕਾਸ਼ਿਤ ਨਹੀਂ ਕੀਤਾ ਗਿਆ ਹੈ। ਟ੍ਰੇਨਿੰਗ ਰਨ ਅਜੇ ਵੀ ਉਸ ਕਾਰਪਸ ਤੋਂ ਆਪਣਾ ਪਹਿਲਾ ਪਾਸ ਪੂਰਾ ਕਰ ਰਿਹਾ ਹੈ ਜਿਸ ਤੋਂ ਇਹ ਸਿੱਖ ਰਿਹਾ ਹੈ, ਅਤੇ ਲੇਖਕ ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਪਾਸ ਪੂਰਾ ਹੋਣ 'ਤੇ ਵਜ਼ਨ ਜਾਰੀ ਕੀਤਾ ਜਾਵੇਗਾ, ਜੋ ਮੌਜੂਦਾ ਦਰ 'ਤੇ ਕੁਝ ਹਫ਼ਤੇ ਦੂਰ ਹੈ। ਉਦੋਂ ਤੱਕ, ਨਿਰੀਖਕ ਪ੍ਰੋਜੈਕਟ ਪੰਨੇ 'ਤੇ ਸਿਖਲਾਈ ਦੇ ਇਤਿਹਾਸ ਦੇ ਨਮੂਨਿਆਂ ਦਾ ਨਿਰੀਖਣ ਕਰ ਸਕਦੇ ਹਨ ਇਹ ਦੇਖਣ ਲਈ ਕਿ ਪੜ੍ਹਨ ਦੇ ਦੌਰਾਨ ਮਾਡਲ ਵਿੱਚ ਕਿਵੇਂ ਸੁਧਾਰ ਹੋਇਆ ਹੈ।
ਇਹ ਕਿਉਂ ਮਾਇਨੇ ਰੱਖਦਾ ਹੈ
ਜੇਕਰ ਪਹੁੰਚ ਮਾਡਲ ਸਕੇਲ ਦੇ ਰੂਪ ਵਿੱਚ ਵਧੇਰੇ ਸਮਰੱਥ ਆਕਾਰਾਂ ਤੱਕ ਪਹੁੰਚਦੀ ਹੈ, ਤਾਂ ਇਹ ਇੱਕ ਵੱਖਰੀ ਕਿਸਮ ਦੀ AI ਮਾਲਕੀ ਵੱਲ ਇਸ਼ਾਰਾ ਕਰਦੀ ਹੈ: ਨਿੱਜੀ ਮਾਡਲ ਜੋ ਤੁਹਾਡੀ ਆਪਣੀ ਮਸ਼ੀਨ 'ਤੇ ਰਹਿੰਦੇ ਹਨ, ਉਹਨਾਂ ਦਸਤਾਵੇਜ਼ਾਂ ਅਤੇ ਡੇਟਾ ਤੋਂ ਸਿੱਖਦੇ ਰਹਿੰਦੇ ਹਨ ਜੋ ਤੁਸੀਂ ਉਹਨਾਂ ਨੂੰ ਫੀਡ ਕਰਦੇ ਹੋ, ਅਤੇ ਕਦੇ ਵੀ ਵਿਕਰੇਤਾ ਦੇ ਰੀਲੀਜ਼ ਅਨੁਸੂਚੀ ਦੁਆਰਾ ਉਹਨਾਂ ਦੇ ਭਾਰ ਨੂੰ ਫ੍ਰੀਜ਼ ਨਹੀਂ ਕੀਤਾ ਜਾਂਦਾ ਹੈ।
ਪ੍ਰੋਜੈਕਟ ਇਹ ਵੀ ਯਾਦ ਦਿਵਾਉਂਦਾ ਹੈ ਕਿ AI ਵਿੱਚ ਸਾਰੇ ਦਿਲਚਸਪ ਕੰਮ ਸਰਹੱਦ 'ਤੇ ਨਹੀਂ ਹੋ ਰਹੇ ਹਨ। ਇੱਕ ਸਿੰਗਲ ਖਪਤਕਾਰ GPU, ਆਮ ਡਿਸਕ ਸਪੇਸ ਅਤੇ ਇੱਕ MIT ਲਾਇਸੈਂਸ ਦੇ ਨਾਲ, ਮਿੰਨੀ-ਏਜੀਆਈ ਇੱਕ ਸਵਾਲ ਦਾ ਜਵਾਬ ਦੇਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰ ਰਿਹਾ ਹੈ ਕਿ ਵੱਡੀਆਂ ਲੈਬਾਂ ਵੱਡੇ ਪੱਧਰ 'ਤੇ ਪਾਸੇ ਹੋ ਗਈਆਂ ਹਨ - ਕੀ ਲੋਕਾਂ ਦੇ ਤਰੀਕੇ ਨੂੰ ਸਿੱਖਣ ਲਈ ਇੱਕ ਮਾਡਲ ਬਣਾਇਆ ਜਾ ਸਕਦਾ ਹੈ: ਲਗਾਤਾਰ, ਅੱਗੇ ਜੋ ਵੀ ਇਸਦਾ ਸਾਹਮਣਾ ਹੁੰਦਾ ਹੈ।
ਕੋਡ ਅਤੇ ਦਸਤਾਵੇਜ਼ ਅਨੁਕੂਲ ਹਾਰਡਵੇਅਰ ਵਾਲੇ ਕਿਸੇ ਵੀ ਵਿਅਕਤੀ ਲਈ GitHub 'ਤੇ ਉਪਲਬਧ ਹਨ ਜੋ ਉਸ ਦੇ ਨਾਲ ਪਾਲਣਾ ਕਰਨਾ ਚਾਹੁੰਦਾ ਹੈ, ਪ੍ਰੋਜੈਕਟ ਨੂੰ ਫੋਰਕ ਕਰਨਾ ਚਾਹੁੰਦਾ ਹੈ, ਜਾਂ ਮਾਡਲ ਦੀ ਸਿਖਲਾਈ ਜਾਰੀ ਰੱਖਣਾ ਚਾਹੁੰਦਾ ਹੈ ਜਿਵੇਂ ਕਿ ਉਹ ਢੁਕਵਾਂ ਸਮਝਦਾ ਹੈ।
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →