ਜਰਮਨ ਖੋਜ ਸੰਸਥਾਵਾਂ ਅਤੇ AI ਕੰਪਨੀਆਂ ਦੇ ਇੱਕ ਕਨਸੋਰਟੀਅਮ ਨੇ Soofi S 30B-A3B, ਇੱਕ ਓਪਨ ਭਾਸ਼ਾ ਮਾਡਲ ਜਾਰੀ ਕੀਤਾ ਹੈ ਜੋ ਪ੍ਰੋਜੈਕਟ ਕਹਿੰਦਾ ਹੈ ਕਿ ਪੂਰੀ ਤਰ੍ਹਾਂ ਖੁੱਲੇ ਮਾਡਲਾਂ ਵਿੱਚ ਅੰਗਰੇਜ਼ੀ ਅਤੇ ਜਰਮਨ ਬੈਂਚਮਾਰਕ ਦੋਵਾਂ 'ਤੇ ਸਭ ਤੋਂ ਵੱਧ ਸਕੋਰ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ। KI Bundesverband, ਜਰਮਨੀ ਦੀ ਰਾਸ਼ਟਰੀ AI ਐਸੋਸੀਏਸ਼ਨ ਦੁਆਰਾ ਤਾਲਮੇਲ ਕੀਤਾ ਗਿਆ, ਰੀਲੀਜ਼ ਮਿਊਨਿਖ ਵਿੱਚ Deutsche Telekom ਦੇ ਉਦਯੋਗਿਕ AI ਕਲਾਉਡ 'ਤੇ ਪੂਰੀ ਤਰ੍ਹਾਂ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਪਹਿਲੇ ਵੱਡੇ ਭਾਸ਼ਾ ਮਾਡਲਾਂ ਵਿੱਚੋਂ ਇੱਕ ਹੈ ਅਤੇ ਸੰਯੁਕਤ ਰਾਜ ਅਮਰੀਕਾ ਅਤੇ ਚੀਨੀ ਓਪਨ-ਵੇਟ ਰੀਲੀਜ਼ਾਂ ਲਈ ਇੱਕ ਸੰਪੂਰਨ ਯੂਰਪੀਅਨ ਵਿਕਲਪ ਵਜੋਂ ਸਥਿਤ ਹੈ। [ਨਵੀਨਤਮ AI ਵਿਕਾਸ] (https://aibuzzwire.news) ਨੂੰ ਟਰੈਕ ਕਰਨ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ ਲਈ, ਆਰਕੀਟੈਕਚਰ ਵਿੱਚ ਬੇਕਡ ਅਸਾਧਾਰਨ ਕੁਸ਼ਲਤਾ ਅਤੇ ਭਾਸ਼ਾ ਫੋਕਸ ਦੀ ਤੁਲਨਾ ਵਿੱਚ, ਲਾਂਚ ਕੱਚੇ ਪੈਮਾਨੇ ਲਈ ਘੱਟ ਮਹੱਤਵਪੂਰਨ ਹੈ।

ਸਿਰਫ਼ 3.2 ਬਿਲੀਅਨ ਸਰਗਰਮ ਪੈਰਾਮੀਟਰਾਂ ਵਾਲਾ ਇੱਕ ਹਾਈਬ੍ਰਿਡ ਡਿਜ਼ਾਈਨ

Soofi S ਕੁੱਲ ਮਿਲਾ ਕੇ 31.6 ਬਿਲੀਅਨ ਪੈਰਾਮੀਟਰਾਂ ਵਾਲਾ ਇੱਕ ਮਿਸ਼ਰਣ-ਵਿਗਿਆਨ (MoE) ਮਾਡਲ ਹੈ, ਪਰ ਇਹ ਪ੍ਰਤੀ ਉਤਪੰਨ ਟੋਕਨ ਸਿਰਫ਼ 3.2 ਬਿਲੀਅਨ ਨੂੰ ਕਿਰਿਆਸ਼ੀਲ ਕਰਦਾ ਹੈ। ਇਹ ਇਸਦੀ ਗਣਨਾ ਦੀ ਲਾਗਤ ਨੂੰ ਇੱਕ ਰਵਾਇਤੀ 30-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਸੰਘਣੇ ਮਾਡਲ ਨਾਲੋਂ ਇੱਕ 3-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਮਾਡਲ ਦੇ ਨੇੜੇ ਰੱਖਦਾ ਹੈ, ਇੱਕ ਡਿਜ਼ਾਈਨ ਵਿਕਲਪ ਜਿਸਦਾ ਉਦੇਸ਼ ਵਿਦੇਸ਼ੀ ਕਲਾਉਡ ਪ੍ਰਦਾਤਾਵਾਂ 'ਤੇ ਭਰੋਸਾ ਕੀਤੇ ਬਿਨਾਂ ਯੂਰਪੀਅਨ ਬੁਨਿਆਦੀ ਢਾਂਚੇ 'ਤੇ ਚੱਲਣ ਲਈ ਕਾਫ਼ੀ ਸਸਤਾ ਰੱਖਣਾ ਹੈ।

ਆਰਕੀਟੈਕਚਰ ਨੂੰ Nvidia ਦੇ Nemotron 3 Nano ਤੋਂ ਉਧਾਰ ਲਿਆ ਗਿਆ ਹੈ, Mamba-2 ਲੇਅਰਾਂ ਨੂੰ ਇੱਕ ਹਾਈਬ੍ਰਿਡ ਲੇਆਉਟ ਵਿੱਚ ਮਿਆਰੀ ਧਿਆਨ ਪਰਤਾਂ ਦੇ ਨਾਲ ਜੋੜਦਾ ਹੈ। ਪ੍ਰੋਜੈਕਟ ਦੀ ਪ੍ਰੀਟ੍ਰੇਨਿੰਗ ਰਿਪੋਰਟ ਦੇ ਅਨੁਸਾਰ, ਮਾਡਲ ਦੀਆਂ 52 ਲੇਅਰਾਂ ਵਿੱਚੋਂ ਸਿਰਫ 6 ਹੀ ਇੱਕ ਮੁੱਖ-ਮੁੱਲ (KV) ਕੈਸ਼ ਬਣਾਈ ਰੱਖਦੀਆਂ ਹਨ - ਮੈਮੋਰੀ ਬਣਤਰ ਜੋ ਧਿਆਨ ਦੀ ਗਣਨਾ ਲਈ ਪਿਛਲੇ ਟੋਕਨਾਂ ਨੂੰ ਸਟੋਰ ਕਰਦੀ ਹੈ। ਪਰੰਪਰਾਗਤ ਟ੍ਰਾਂਸਫਾਰਮਰਾਂ ਵਿੱਚ, ਉਹ ਕੈਸ਼ ਸੰਦਰਭ ਲੰਬਾਈ ਦੇ ਨਾਲ ਰੇਖਿਕ ਰੂਪ ਵਿੱਚ ਵਧਦਾ ਹੈ ਅਤੇ ਲੰਬੇ-ਸੰਦਰਭ ਅਨੁਮਾਨ ਦੇ ਦੌਰਾਨ ਇੱਕ ਵੱਡੀ ਰੁਕਾਵਟ ਬਣ ਜਾਂਦਾ ਹੈ।

ਵਿਹਾਰਕ ਅਦਾਇਗੀ ਥ੍ਰੋਪੁੱਟ ਵਿੱਚ ਦਿਖਾਈ ਦਿੰਦੀ ਹੈ। 32 ਸਮਾਨਾਂਤਰ ਬੇਨਤੀਆਂ ਦੇ ਨਾਲ 40,000 ਟੋਕਨਾਂ ਦੀ ਸੰਦਰਭ ਲੰਬਾਈ 'ਤੇ, Soofi S 14-ਤੋਂ-24-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਰੇਂਜ ਵਿੱਚ ਸੰਘਣੇ ਮਾਡਲਾਂ ਨਾਲੋਂ ਪ੍ਰਤੀ ਸਕਿੰਟ ਪ੍ਰਤੀ GPU ਲਗਭਗ ਅੱਠ ਗੁਣਾ ਜ਼ਿਆਦਾ ਟੋਕਨ ਤਿਆਰ ਕਰਦਾ ਹੈ। ਜਦੋਂ ਕਿ ਸੰਦਰਭ ਵਧਣ ਨਾਲ ਰਵਾਇਤੀ ਮਾਡਲਾਂ ਲਈ ਪੀੜ੍ਹੀ ਦੀ ਗਤੀ ਤੇਜ਼ੀ ਨਾਲ ਘਟਦੀ ਹੈ, Soofi S 4,000 ਟੋਕਨਾਂ ਤੋਂ 256,000 ਟੋਕਨਾਂ ਤੱਕ ਲਗਭਗ ਫਲੈਟ ਰਹਿੰਦਾ ਹੈ। ਕੰਸੋਰਟੀਅਮ ਦੇ ਮਾਪਾਂ ਵਿੱਚ ਇੱਕੋ ਇੱਕ ਤੁਲਨਾਤਮਕ ਮਾਡਲ ਅਲੀਬਾਬਾ ਦਾ Qwen3.5 35B-A3B ਹੈ, ਜੋ ਇੱਕ ਹਾਈਬ੍ਰਿਡ ਆਰਕੀਟੈਕਚਰ ਦੀ ਵਰਤੋਂ ਵੀ ਕਰਦਾ ਹੈ।

ਅੰਗਰੇਜ਼ੀ ਦੀ ਬਲੀ ਦਿੱਤੇ ਬਿਨਾਂ, ਜਰਮਨ ਲਈ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ

ਜਰਮਨ 'ਤੇ ਜਾਣਬੁੱਝ ਕੇ ਫੋਕਸ ਪ੍ਰੋਜੈਕਟ ਦਾ ਕੇਂਦਰ ਹੈ। ਪਹਿਲੇ ਸਿਖਲਾਈ ਪੜਾਅ ਵਿੱਚ, ਜਰਮਨ ਡਾਟਾ ਮਿਸ਼ਰਣ ਦਾ 7.2 ਪ੍ਰਤੀਸ਼ਤ ਬਣਾਉਂਦਾ ਹੈ; ਦੂਜੇ ਪੜਾਅ ਵਿੱਚ, ਇਹ ਸ਼ੇਅਰ ਵਧ ਕੇ 15.3 ਪ੍ਰਤੀਸ਼ਤ ਹੋ ਗਿਆ ਹੈ। ਤੁਲਨਾ ਕਰਕੇ, ਐਨਵੀਡੀਆ ਦੇ ਨੇਮੋਟ੍ਰੋਨ ਸੰਦਰਭ ਵਿਅੰਜਨ ਵਿੱਚ ਸਾਰੀਆਂ ਗੈਰ-ਅੰਗਰੇਜ਼ੀ ਭਾਸ਼ਾਵਾਂ ਮਿਲਾ ਕੇ ਸਿਖਲਾਈ ਮਿਸ਼ਰਣ ਦੇ ਲਗਭਗ 5 ਪ੍ਰਤੀਸ਼ਤ ਲਈ ਖਾਤੇ ਹਨ।

ਡਾਟਾ ਸਰੋਤਾਂ ਵਿੱਚ HPLT ਕਾਰਪਸ ਤੋਂ ਜਰਮਨ ਵੈੱਬ ਟੈਕਸਟ, ਖੁੱਲ੍ਹੇ ਤੌਰ 'ਤੇ ਲਾਇਸੰਸਸ਼ੁਦਾ ਜਰਮਨ ਕਾਮਨਜ਼ ਕਾਰਪਸ, FinePDFs ਅਤੇ FineWiki ਦੇ ਜਰਮਨ ਹਿੱਸੇ, ਅਤੇ 916 ਜਰਮਨ ਪ੍ਰਕਾਸ਼ਨਾਂ ਤੋਂ ਖਿੱਚੇ ਗਏ 193 ਮਿਲੀਅਨ ਅਖਬਾਰ ਲੇਖਾਂ ਦਾ ਵਪਾਰਕ ਤੌਰ 'ਤੇ ਲਾਇਸੰਸਸ਼ੁਦਾ Genios ਪੁਰਾਲੇਖ ਸ਼ਾਮਲ ਹਨ। ਮਸ਼ੀਨ-ਅਨੁਵਾਦਿਤ ਅਤੇ ਸਿੰਥੈਟਿਕ ਤੌਰ 'ਤੇ ਤਿਆਰ ਕੀਤੇ ਗਏ ਜਰਮਨ ਟੈਕਸਟ ਮਿਸ਼ਰਣ ਨੂੰ ਪੂਰਾ ਕਰਦੇ ਹਨ।

ਮਾਡਲ ਨੇ ਤਿੰਨ ਸਿਖਲਾਈ ਪੜਾਵਾਂ ਵਿੱਚ ਲਗਭਗ 27 ਟ੍ਰਿਲੀਅਨ ਟੋਕਨਾਂ ਦੀ ਪ੍ਰਕਿਰਿਆ ਕੀਤੀ: ਪਹਿਲੇ ਪੜਾਅ ਵਿੱਚ ਵਿਆਪਕ ਵੈੱਬ, ਕੋਡ, ਗਣਿਤ, ਅਤੇ ਡੋਮੇਨ-ਵਿਸ਼ੇਸ਼ ਟੈਕਸਟ ਦੇ ਲਗਭਗ 20 ਟ੍ਰਿਲੀਅਨ ਟੋਕਨ; ਦੂਜੇ ਵਿੱਚ ਲਗਭਗ 6 ਟ੍ਰਿਲੀਅਨ ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲੇ ਟੋਕਨ; ਅਤੇ ਇੱਕ ਛੋਟਾ ਤੀਜਾ ਪੜਾਅ 10 ਲੱਖ ਟੋਕਨਾਂ ਤੱਕ ਲੰਬੇ ਦਸਤਾਵੇਜ਼ਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ ਸੰਦਰਭ ਵਿੰਡੋ ਨੂੰ ਵਧਾਉਂਦਾ ਹੈ।

ਬੈਂਚਮਾਰਕ ਨਤੀਜੇ: ਜਰਮਨ ਅਤੇ ਅੰਗਰੇਜ਼ੀ 'ਤੇ ਅੱਗੇ, ਗਣਿਤ 'ਤੇ ਕਮਜ਼ੋਰ

ਕਨਸੋਰਟੀਅਮ ਦੇ ਅਨੁਸਾਰ, 16 ਹੋਰ ਓਪਨ ਮਾਡਲਾਂ ਦੇ ਮੁਕਾਬਲੇ ਮੁਲਾਂਕਣ ਵਿੱਚ, Soofi S ਜਰਮਨ ਅਤੇ ਅੰਗਰੇਜ਼ੀ ਦੋਵਾਂ ਲਈ ਕੁੱਲ ਸਕੋਰਾਂ 'ਤੇ ਸਾਰੇ ਪੂਰੀ ਤਰ੍ਹਾਂ ਖੁੱਲ੍ਹੇ ਮਾਡਲਾਂ ਦੀ ਅਗਵਾਈ ਕਰਦਾ ਹੈ। ਇਸ ਵਿੱਚ AI ਲਈ ਐਲਨ ਇੰਸਟੀਚਿਊਟ ਤੋਂ OLMo 3 32B ਅਤੇ ETH ਜ਼ਿਊਰਿਖ ਅਤੇ EPFL ਤੋਂ ਐਪਰਟਸ 70B ਸ਼ਾਮਲ ਹਨ। ਹਰ ਯੂਰਪੀ ਸੰਪ੍ਰਭੂ ਬੇਸਲਾਈਨ ਦੇ ਵਿਰੁੱਧ, ਮਾਡਲ ਸੂਟ ਵਿੱਚ ਸਾਰੇ ਜਰਮਨ ਮਾਪਦੰਡਾਂ 'ਤੇ ਅੱਗੇ ਆਉਂਦਾ ਹੈ, ਕਈ ਵਾਰ ਦੋਹਰੇ ਅੰਕਾਂ ਦੇ ਮਾਰਜਿਨ ਦੁਆਰਾ।

ਕੋਡ ਟਾਸਕਾਂ 'ਤੇ, Soofi S ਨੇ HumanEval 'ਤੇ 73.8 ਪ੍ਰਤੀਸ਼ਤ, MBPP 'ਤੇ 70.2, ਅਤੇ ਜਰਮਨ MBPP ਵੇਰੀਐਂਟ 'ਤੇ 84.2 ਸਕੋਰ ਪ੍ਰਾਪਤ ਕੀਤੇ - ਓਪਨ-ਸੋਰਸ ਸਾਥੀਆਂ ਵਿਚਕਾਰ ਸਭ ਤੋਂ ਵਧੀਆ ਨਤੀਜੇ। INCLUDE-DE 'ਤੇ, ਜਰਮਨੀ-ਵਿਸ਼ੇਸ਼ ਖੇਤਰੀ ਗਿਆਨ ਲਈ ਇੱਕ ਟੈਸਟ, Soofi S ਵੱਡੇ Qwen3.5 35B-A3B ਨਾਲ 61.2 ਪੁਆਇੰਟਾਂ 'ਤੇ ਪਹਿਲੇ ਸਥਾਨ ਲਈ ਹੈ। ਨੇਮੋਟ੍ਰੋਨ ਬੇਸਲਾਈਨ ਦੇ ਨਾਲ ਤੁਲਨਾ ਕੀਤੀ ਗਈ, ਜਰਮਨ-ਭਾਰਿਤ ਡਾਟਾ ਵਿਅੰਜਨ ਅੰਗਰੇਜ਼ੀ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਨੁਕਸਾਨ ਪਹੁੰਚਾਏ ਬਿਨਾਂ, ਭਾਸ਼ਾ ਦੀ ਮੁਹਾਰਤ ਵਿੱਚ 15.1 ਪੁਆਇੰਟ ਅਤੇ GPQA-ਡਾਇਮੰਡ ਸਾਇੰਸ ਬੈਂਚਮਾਰਕ ਨੂੰ 9.6 ਪੁਆਇੰਟਾਂ ਦੁਆਰਾ ਸੁਧਾਰਦਾ ਹੈ।

ਸਪੱਸ਼ਟ ਕਮਜ਼ੋਰੀਆਂ ਹਨ. ਜਰਮਨ ਮੁਕਾਬਲੇ ਦੇ ਗਣਿਤ (ਮਿਨਰਵਾ MATH-DE) 'ਤੇ, Soofi S ਨੇ 56 ਅੰਕ ਹਾਸਲ ਕੀਤੇ, Qwen3.5 35B-A3B ਤੋਂ 76.5 'ਤੇ ਅਤੇ ਜੇਮਾ 3 27B ਤੋਂ 65.6 'ਤੇ ਬਹੁਤ ਪਿੱਛੇ। ਇਹ NaturalQuestions ਵਿੱਚ ਖੁੱਲੇ ਤੱਥਾਂ ਦੀ ਪੁਨਰ ਪ੍ਰਾਪਤੀ 'ਤੇ ਵੀ ਟ੍ਰੇਲ ਕਰਦਾ ਹੈ, ਜਿਸਦਾ ਟੀਮ ਸਿਰਫ 3 ਬਿਲੀਅਨ ਸਰਗਰਮ ਮਾਪਦੰਡ ਹੋਣ ਦਾ ਕਾਰਨ ਬਣਦੀ ਹੈ ਅਤੇ ਇਸਲਈ ਸੰਘਣੇ 27B ਮਾਡਲ ਨਾਲੋਂ ਘੱਟ ਸਟੋਰ ਕੀਤੇ ਵਿਸ਼ਵ ਗਿਆਨ ਹੈ। RULER ਲੰਬੇ-ਸੰਦਰਭ ਟੈਸਟ ਇੱਕ ਹੋਰ ਪਾੜੇ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ: ਜਦੋਂ ਮਾਡਲ ਨੂੰ ਇੱਕ ਲੰਬੇ ਟੈਕਸਟ ਤੋਂ ਅਕਸਰ ਆਉਣ ਵਾਲੇ ਸ਼ਬਦਾਂ ਨੂੰ ਕੱਢਣਾ ਹੁੰਦਾ ਹੈ, ਤਾਂ ਇਸਦੀ ਹਿੱਟ ਰੇਟ 32,000 ਟੋਕਨਾਂ ਤੋਂ ਲਗਭਗ 3 ਪ੍ਰਤੀਸ਼ਤ ਤੱਕ ਘੱਟ ਜਾਂਦੀ ਹੈ, ਜਦੋਂ ਕਿ ਤੁਲਨਾਤਮਕ ਨਿਮੋਟ੍ਰੋਨ ਮਾਡਲ ਅਜੇ ਵੀ 60 ਤੋਂ 64 ਪ੍ਰਤੀਸ਼ਤ ਦਾ ਪ੍ਰਬੰਧਨ ਕਰਦਾ ਹੈ।

ਮਿਊਨਿਖ ਵਿੱਚ 512 Nvidia B200 GPUs 'ਤੇ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ

ਟ੍ਰੇਨਿੰਗ ਰਨ ਮਾਰਚ ਅਤੇ ਮਈ 2026 ਦੇ ਵਿਚਕਾਰ ਮਿਊਨਿਖ ਵਿੱਚ Deutsche Telekom ਦੇ ਉਦਯੋਗਿਕ AI ਕਲਾਉਡ ਵਿੱਚ 512 Nvidia B200 GPUs 'ਤੇ ਹੋਈ, ਕੁੱਲ 253,000 GPU-ਘੰਟੇ। ਇਹ ਸਹੂਲਤ ਪੂਰੀ ਤਰ੍ਹਾਂ ਨਵਿਆਉਣਯੋਗ ਊਰਜਾ 'ਤੇ ਚੱਲਦੀ ਹੈ, ਇਸ ਨੂੰ ਈਸਬੈਚ ਨਹਿਰ ਦੇ ਪਾਣੀ ਨਾਲ ਠੰਢਾ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਕੂੜੇ ਦੀ ਗਰਮੀ ਨੂੰ ਆਲੇ-ਦੁਆਲੇ ਦੇ ਟਿਊਚਰਪਾਰਕ ਇਲਾਕੇ ਵਿੱਚ ਫੀਡ ਕਰਦਾ ਹੈ, ਰਿਪੋਰਟ ਦੇ ਅਨੁਸਾਰ। ਸੂਫੀ ਐਸ ਇਸ ਬੁਨਿਆਦੀ ਢਾਂਚੇ 'ਤੇ ਕੀਤੀਆਂ ਗਈਆਂ ਪਹਿਲੀਆਂ ਪ੍ਰਮੁੱਖ ਸਿਖਲਾਈਆਂ ਵਿੱਚੋਂ ਇੱਕ ਸੀ।

ਮਾਡਲ ਦੇ ਪਿੱਛੇ ਕੰਸੋਰਟੀਅਮ ਨੂੰ ਯੂਰਪੀਅਨ IPCEI-CIS ਪ੍ਰੋਗਰਾਮ ਦੇ ਹਿੱਸੇ ਵਜੋਂ ਆਰਥਿਕ ਮਾਮਲਿਆਂ ਅਤੇ ਊਰਜਾ ਲਈ ਜਰਮਨ ਸੰਘੀ ਮੰਤਰਾਲੇ ਦੁਆਰਾ ਫੰਡ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ। ਭਾਗੀਦਾਰਾਂ ਵਿੱਚ ਫਰੌਨਹੋਫਰ ਇੰਸਟੀਚਿਊਟਸ IAIS ਅਤੇ IIS, ਜਰਮਨ ਰਿਸਰਚ ਸੈਂਟਰ ਫਾਰ ਆਰਟੀਫੀਸ਼ੀਅਲ ਇੰਟੈਲੀਜੈਂਸ (DFKI), TU Darmstadt, Würzburg ਯੂਨੀਵਰਸਿਟੀ, L3S ਰਿਸਰਚ ਸੈਂਟਰ, ਬਰਲਿਨ ਯੂਨੀਵਰਸਿਟੀ ਆਫ ਅਪਲਾਈਡ ਸਾਇੰਸਜ਼, ਅਤੇ AI ਕੰਪਨੀਆਂ Ellamind ਅਤੇ Merantix Momentum ਸ਼ਾਮਲ ਹਨ।

'ਓਵਰਟ੍ਰੇਨਿੰਗ' 'ਤੇ ਬਹਿਸ

ਲਾਂਚ ਤੋਂ ਤੁਰੰਤ ਬਾਅਦ, ਆਲੋਚਕਾਂ ਨੇ ਦਲੀਲ ਦਿੱਤੀ ਕਿ ਸੂਫੀ ਐਸ ਨੂੰ 2022 ਵਿੱਚ ਗੂਗਲ ਡੀਪਮਾਈਂਡ ਦੁਆਰਾ ਪ੍ਰਕਾਸ਼ਿਤ ਕਲਾਸਿਕ ਚਿਨਚਿਲਾ ਸਕੇਲਿੰਗ ਕਾਨੂੰਨਾਂ ਦੇ ਮਾਪਦੰਡਾਂ ਦੁਆਰਾ ਬਹੁਤ ਜ਼ਿਆਦਾ ਸਿਖਲਾਈ ਦਿੱਤੀ ਗਈ ਸੀ, ਜਿਸ ਵਿੱਚ ਪ੍ਰਤੀ ਪੈਰਾਮੀਟਰ 20 ਟੋਕਨਾਂ ਦੇ ਇੱਕ ਮੋਟੇ ਮਿੱਠੇ ਸਥਾਨ ਦਾ ਸੁਝਾਅ ਦਿੱਤਾ ਗਿਆ ਸੀ। 27 ਟ੍ਰਿਲੀਅਨ ਟੋਕਨਾਂ ਅਤੇ ਲਗਭਗ 30 ਬਿਲੀਅਨ ਪੈਰਾਮੀਟਰਾਂ ਦੇ ਨਾਲ, Soofi S ਕਈ ਸੌ ਟੋਕਨ ਪ੍ਰਤੀ ਪੈਰਾਮੀਟਰ 'ਤੇ ਉਤਰਦਾ ਹੈ; ਸਿਰਫ਼ 3.2 ਬਿਲੀਅਨ ਸਰਗਰਮ ਪੈਰਾਮੀਟਰਾਂ ਦੀ ਗਿਣਤੀ ਕਰਨ ਨਾਲ ਅਨੁਪਾਤ ਹਜ਼ਾਰਾਂ ਵਿੱਚ ਧੱਕਦਾ ਹੈ।

ਮਾਈਕਲ ਫਰੌਮ, ਪ੍ਰੋਜੈਕਟ ਦੀ ਤਕਨੀਕੀ ਲੀਡਰਸ਼ਿਪ ਦਾ ਹਿੱਸਾ, ਨੇ ਉਸ ਆਲੋਚਨਾ ਨੂੰ ਪਿੱਛੇ ਛੱਡ ਦਿੱਤਾ, ਇਹ ਦਲੀਲ ਦਿੱਤੀ ਕਿ ਉਹ ਨਿਯਮ MoE ਆਰਕੀਟੈਕਚਰ ਦੇ ਅਧੀਨ ਨਹੀਂ ਆਉਂਦੇ। "ਇੱਥੇ ਨਵੀਂ ਖੋਜ ਦਰਸਾਉਂਦੀ ਹੈ ਕਿ ਸੰਘਣੇ ਮਾਡਲਾਂ ਦੇ ਪੁਰਾਣੇ ਸਕੇਲਿੰਗ ਕਾਨੂੰਨ ਹੁਣ MoE ਆਰਕੀਟੈਕਚਰ 'ਤੇ ਲਾਗੂ ਨਹੀਂ ਹੁੰਦੇ ਹਨ," ਫਰੌਮ ਨੇ ਕਿਹਾ, ਇਹ ਨੋਟ ਕਰਦੇ ਹੋਏ ਕਿ ਵਿਅਕਤੀਗਤ ਮਾਹਿਰਾਂ ਨੂੰ ਇੱਕ ਵੱਡੇ, ਉੱਚ-ਗੁਣਵੱਤਾ ਡੇਟਾਸੈਟ ਵਿੱਚ ਇੱਕੋ ਦਸਤਾਵੇਜ਼ ਨੂੰ ਵਾਰ-ਵਾਰ ਦੇਖਣ ਦਾ ਫਾਇਦਾ ਹੁੰਦਾ ਹੈ। ਤੁਲਨਾ ਦੇ ਇੱਕ ਬਿੰਦੂ ਦੇ ਰੂਪ ਵਿੱਚ, ਉਸਨੇ ਐਨਵੀਡੀਆ ਵੱਲ ਇਸ਼ਾਰਾ ਕੀਤਾ, ਜਿਸ ਨੇ ਆਪਣੇ ਮਾਡਲਾਂ ਨੂੰ 25 ਟ੍ਰਿਲੀਅਨ ਟੋਕਨਾਂ ਤੱਕ ਸਿਖਲਾਈ ਦਿੱਤੀ ਹੈ।

ਕੀ ਜਾਰੀ ਹੁੰਦਾ ਹੈ, ਅਤੇ ਕੀ ਨਹੀਂ ਹੁੰਦਾ

ਖੋਜਕਰਤਾ ਚੁਣੇ ਹੋਏ ਵਿਚਕਾਰਲੇ ਚੈਕਪੁਆਇੰਟਸ, ਸੰਪੂਰਨ ਸਿਖਲਾਈ ਅਤੇ ਮੁਲਾਂਕਣ ਕੋਡ, ਅਤੇ ਕੱਚੀ ਟੋਕਨ ਗਿਣਤੀ, ਯੁੱਗ ਸੰਖਿਆਵਾਂ, ਅਤੇ ਪ੍ਰਤੀ ਸਰੋਤ ਪ੍ਰਭਾਵੀ ਯੋਗਦਾਨਾਂ ਨੂੰ ਸੂਚੀਬੱਧ ਕਰਨ ਵਾਲੀ ਇੱਕ ਵਿਸਤ੍ਰਿਤ ਡੇਟਾ ਵਸਤੂ ਸੂਚੀ ਦੇ ਨਾਲ ਮਾਡਲ ਵੇਟ ਜਾਰੀ ਕਰ ਰਹੇ ਹਨ। ਟੀਮ ਦੇ ਅਨੁਸਾਰ, ਇਸਦਾ ਮਤਲਬ ਹੈ Soofi S ਓਪਨ ਸੋਰਸ ਇਨੀਸ਼ੀਏਟਿਵ ਤੋਂ ਓਪਨ ਸੋਰਸ AI ਪਰਿਭਾਸ਼ਾ 1.0 ਨੂੰ ਪੂਰਾ ਕਰਦਾ ਹੈ।

ਇੱਕ ਯੂਰਪੀਅਨ ਓਪਨ-ਡੇਟਾ ਪਰਿਭਾਸ਼ਾ ਲਈ ਇੱਕ ਸਖ਼ਤ ਪ੍ਰਸਤਾਵ, ਜਿਸ ਲਈ ਹਰੇਕ ਸਿਖਲਾਈ ਟੋਕਨ ਨੂੰ ਮੁਫ਼ਤ ਵਿੱਚ ਵੰਡਣ ਦੀ ਲੋੜ ਹੋਵੇਗੀ, ਨੂੰ ਪੂਰਾ ਨਹੀਂ ਕੀਤਾ ਗਿਆ ਹੈ ਕਿਉਂਕਿ ਮਿਸ਼ਰਣ ਦਾ 1.3 ਪ੍ਰਤੀਸ਼ਤ ਵਪਾਰਕ ਲਾਇਸੰਸਸ਼ੁਦਾ Genios ਕਾਰਪਸ ਤੋਂ ਆਉਂਦਾ ਹੈ। ਰਿਪੋਰਟ ਕਹਿੰਦੀ ਹੈ ਕਿ ਲਗਭਗ 99 ਪ੍ਰਤੀਸ਼ਤ ਸਿਖਲਾਈ ਡੇਟਾ ਅਜੇ ਵੀ ਸੁਤੰਤਰ ਤੌਰ 'ਤੇ ਪੁਨਰਗਠਨ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ। ਪ੍ਰਕਾਸ਼ਨ ਦੇ ਸਮੇਂ ਮਾਡਲ ਦੀ ਰਿਲੀਜ਼ ਲਈ ਸਹੀ ਲਾਇਸੈਂਸ ਨੂੰ ਅੰਤਿਮ ਰੂਪ ਨਹੀਂ ਦਿੱਤਾ ਗਿਆ ਸੀ।

ਕੰਸੋਰਟੀਅਮ ਹੁਣ ਤਕਨੀਕੀ ਦਸਤਾਵੇਜ਼ਾਂ, ਕੋਡ ਜਨਰੇਸ਼ਨ, ਅਤੇ ਏਜੰਟ-ਆਧਾਰਿਤ ਪ੍ਰਣਾਲੀਆਂ ਨੂੰ ਸ਼ਾਮਲ ਕਰਨ ਵਾਲੀਆਂ ਐਪਲੀਕੇਸ਼ਨਾਂ ਵਿੱਚ ਸੂਫੀ ਐਸ ਦੀ ਜਾਂਚ ਕਰਨ ਲਈ ਅਗਲੇ ਪੜਾਅ ਲਈ ਉਦਯੋਗ ਦੇ ਭਾਈਵਾਲਾਂ ਦੀ ਭਾਲ ਕਰ ਰਿਹਾ ਹੈ। ਓਪਨ-ਵੇਟ ਮਾਡਲ ਰੀਲੀਜ਼ਾਂ, ਸਾਵਰੇਨ AI ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਅਤੇ ਯੂਰਪੀਅਨ AI ਈਕੋਸਿਸਟਮ ਬਾਰੇ ਹੋਰ ਜਾਣਕਾਰੀ ਲਈ, ਇੱਥੇ ਪ੍ਰਕਾਸ਼ਿਤ AI ਉਦਯੋਗ ਕਵਰੇਜ ਨਾਲ ਜੁੜੇ ਰਹੋ।

ਓਪਨ-ਸੋਰਸ AI 'ਤੇ ਅੱਗੇ ਰਹੋ

ਓਪਨ-ਵੇਟ ਰੀਲੀਜ਼ ਸੰਯੁਕਤ ਰਾਜ, ਚੀਨ ਅਤੇ ਹੁਣ ਯੂਰਪ ਦੀਆਂ ਲੈਬਾਂ ਤੋਂ ਲਗਭਗ ਹਫਤਾਵਾਰੀ ਆ ਰਹੀਆਂ ਹਨ, ਅਤੇ ਸਭ ਤੋਂ ਵੱਡੇ ਮਲਕੀਅਤ ਵਾਲੇ ਮਾਡਲਾਂ ਅਤੇ ਸਭ ਤੋਂ ਵਧੀਆ ਖੁੱਲੇ ਵਿਕਲਪਾਂ ਵਿਚਕਾਰ ਪਾੜਾ ਘਟਦਾ ਜਾ ਰਿਹਾ ਹੈ। ਪੂਰੀ ਤਸਵੀਰ ਲਈ ਇੱਥੇ ਬ੍ਰੇਕਿੰਗ ਏਆਈ ਨਿਊਜ਼ ਅਤੇ ਬੈਂਚਮਾਰਕ ਵਿਸ਼ਲੇਸ਼ਣ ਦਾ ਪਾਲਣ ਕਰੋ।

ਹੋਰ AI ਮਾਡਲ ਕਵਰੇਜ ਪੜ੍ਹੋ →