ਇੱਕ ਛੋਟਾ-ਜਾਣਿਆ ਓਪਨ-ਸੋਰਸ ਪ੍ਰੋਜੈਕਟ ਜਿਸਨੂੰ Strata ਕਿਹਾ ਜਾਂਦਾ ਹੈ ਇੱਕ ਪਲ ਆ ਰਿਹਾ ਹੈ। ਐਮਆਈਟੀ-ਲਾਇਸੰਸਸ਼ੁਦਾ ਇੰਜਣ, ਜੋ ਅਲੀਬਾਬਾ ਦੇ Qwen3.8-Flash-Next ਨੂੰ ਚਲਾਉਂਦਾ ਹੈ - ਇੱਕ 125-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਮਿਸ਼ਰਣ-ਦਾ-ਮਾਹਰਾਂ ਦਾ ਮਾਡਲ - ਸਾਧਾਰਨ ਗੇਮਿੰਗ ਪੀਸੀ 'ਤੇ, 4 ਅਕਤੂਬਰ ਨੂੰ 640 ਤੋਂ ਵੱਧ ਪੁਆਇੰਟਾਂ ਦੇ ਨਾਲ ਹੈਕਰ ਨਿਊਜ਼ ਦੇ ਪਹਿਲੇ ਪੰਨੇ 'ਤੇ ਸ਼ੂਟ ਹੋਇਆ, ਅਤੇ ਇਸਦੇ GitHub ਨੇ ਸਤੰਬਰ 01 ਤੋਂ ਵੱਧ ਸੰਗ੍ਰਹਿ ਕੀਤੇ ਸਨ। 24.

ਪਿੱਚ ਸਧਾਰਨ ਹੈ: ਇੱਕ 125-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਮਾਡਲ ਜੋ ਆਮ ਤੌਰ 'ਤੇ ਸਰਵਰ 'ਤੇ ਰਹਿੰਦਾ ਹੈ, ਚੈਟ ਕਰ ਸਕਦਾ ਹੈ, ਕੋਡ ਲਿਖ ਸਕਦਾ ਹੈ, ਚਿੱਤਰ ਪੜ੍ਹ ਸਕਦਾ ਹੈ ਅਤੇ ਕੋਡਿੰਗ ਏਜੰਟਾਂ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਉਪਭੋਗਤਾ ਗ੍ਰਾਫਿਕਸ ਕਾਰਡ 'ਤੇ ਚਲਾ ਸਕਦਾ ਹੈ, ਮਸ਼ੀਨ ਨੂੰ ਕੁਝ ਵੀ ਨਹੀਂ ਛੱਡਦਾ।

ਸਟਰੈਟ ਅਸਲ ਵਿੱਚ ਕੀ ਕਰਦਾ ਹੈ

ਸਟ੍ਰੈਟਾ ਵਿੰਡੋਜ਼ ਅਤੇ ਲੀਨਕਸ ਲਈ ਇੱਕ ਅਨੁਮਾਨ ਇੰਜਣ ਅਤੇ ਇੱਕ-ਕਲਿੱਕ ਇੰਸਟਾਲਰ ਦੋਵੇਂ ਹਨ। ਇਸਦੇ ਦਸਤਾਵੇਜ਼ਾਂ ਦੇ ਅਨੁਸਾਰ, ਲੋੜਾਂ ਫਰੰਟੀਅਰ-ਮਾਡਲ ਮਾਪਦੰਡਾਂ ਦੁਆਰਾ ਮਾਮੂਲੀ ਹਨ: NVIDIA ਦੇ RTX 20, 30, 40 ਜਾਂ 50 ਸੀਰੀਜ਼ ਜਾਂ AMD ਦੀ Radeon RX 6000, 7000 ਜਾਂ 9000 ਸੀਰੀਜ਼ ਤੋਂ ਘੱਟੋ-ਘੱਟ 12GB VRAM ਵਾਲਾ GPU, ਘੱਟੋ-ਘੱਟ 32GB RAM, 8GB RAM ਅਤੇ 32GB ਖਾਲੀ ਥਾਂ।

ਇੰਜਣ Qwen3.8-Flash-Next ਦੇ ਕਈ ਕੰਪਰੈਸ਼ਨ ਪੱਧਰਾਂ 'ਤੇ, Q2_0 ਤੋਂ IQ3_S ਤੱਕ, ਨਾਲ ਹੀ ਇੱਕ ਕੋਡ-ਵਿਸ਼ੇਸ਼ ਰੂਪਾਂਤਰਾਂ ਨੂੰ ਭੇਜਦਾ ਹੈ। ਇਹ ਲੋਕਲਹੋਸਟ 'ਤੇ ਓਪਨਏਆਈ ਅਤੇ ਐਂਥਰੋਪਿਕ-ਅਨੁਕੂਲ API ਦਾ ਪਰਦਾਫਾਸ਼ ਕਰਦਾ ਹੈ, ਭਾਵ ChatGPT ਜਾਂ ਕਲਾਉਡ ਲਈ ਬਣਾਏ ਗਏ ਟੂਲ - ਜਿਸ ਵਿੱਚ ਕਲੌਡ ਕੋਡ, ਕਰਸਰ ਅਤੇ ਕੋਡੈਕਸ ਵਰਗੇ ਕੋਡਿੰਗ ਏਜੰਟ ਸ਼ਾਮਲ ਹਨ - ਨੂੰ ਸਥਾਨਕ ਸਰਵਰ 'ਤੇ ਨਿਊਨਤਮ ਤਬਦੀਲੀਆਂ ਨਾਲ ਦਰਸਾਇਆ ਜਾ ਸਕਦਾ ਹੈ। ਵਿਕਲਪਿਕ ਚਿੱਤਰ ਇੰਪੁੱਟ ਅਤੇ ਮਲਟੀ-GPU ਸਮਰਥਨ ਸ਼ਾਮਲ ਕੀਤਾ ਗਿਆ ਹੈ, ਅਤੇ ਇੰਸਟੌਲਰ ਇੱਕ ਏਆਈ-ਸਹਾਇਕ ਸੈੱਟਅੱਪ ਮੋਡ ਵੀ ਪੇਸ਼ ਕਰਦਾ ਹੈ ਜੋ ਇੱਕ ਕੋਡਿੰਗ ਸਹਾਇਕ ਨੂੰ ਇੱਕ ਸਿੰਗਲ ਪੇਸਟ ਕੀਤੇ ਪ੍ਰੋਂਪਟ ਤੋਂ ਮਸ਼ੀਨ ਨੂੰ ਕੌਂਫਿਗਰ ਕਰਨ ਦਿੰਦਾ ਹੈ।

ਸਪੀਡ ਨੰਬਰ

ਪ੍ਰੋਜੈਕਟ ਦੇ ਪ੍ਰਕਾਸ਼ਿਤ ਬੈਂਚਮਾਰਕ, ਦੋ ਉਪਭੋਗਤਾ ਡੈਸਕਟਾਪਾਂ 'ਤੇ ਮਾਪੇ ਗਏ, ਰੀਲੀਜ਼ ਫੈਲਣ ਦਾ ਕਾਰਨ ਹਨ। ਇੱਕ NVIDIA RTX 5070 'ਤੇ 12GB VRAM ਦੇ ਨਾਲ ਇੱਕ Ryzen 5 7600 ਅਤੇ 64GB RAM ਦੇ ਨਾਲ, ਸਟ੍ਰੈਟਾ ਰਿਪੋਰਟ ਕਰਦਾ ਹੈ:

  • Q2_0 ਕੁਆਂਟਾਇਜ਼ੇਸ਼ਨ: ਪੀੜ੍ਹੀ ਲਈ 94 ਟੋਕਨ ਪ੍ਰਤੀ ਸਕਿੰਟ ਅਤੇ 32K-ਟੋਕਨ ਦਸਤਾਵੇਜ਼ 'ਤੇ ਤੁਰੰਤ ਪ੍ਰਕਿਰਿਆ ਲਈ 2,650 ਟੋਕਨ ਪ੍ਰਤੀ ਸਕਿੰਟ
  • IQ3_S: 53 ਟੋਕਨ ਪ੍ਰਤੀ ਸੈਕਿੰਡ ਪੀੜ੍ਹੀ, 1,620 ਟੋਕਨ ਪ੍ਰਤੀ ਸਕਿੰਟ ਪ੍ਰੋਂਪਟ ਪ੍ਰੋਸੈਸਿੰਗ
  • ਕੋਡਰ ਰੂਪ: 55 ਟੋਕਨ ਪ੍ਰਤੀ ਦੂਜੀ ਪੀੜ੍ਹੀ

AMD ਵਾਲੇ ਪਾਸੇ, 16GB VRAM ਵਾਲਾ RX 9070 XT Q2_0 'ਤੇ 60 ਟੋਕਨ ਪ੍ਰਤੀ ਸਕਿੰਟ ਦਾ ਪ੍ਰਬੰਧਨ ਕਰਦਾ ਹੈ। ਦਸਤਾਵੇਜ਼ਾਂ ਦਾ ਅੰਦਾਜ਼ਾ ਹੈ ਕਿ 24GB VRAM ਦੇ ਨਾਲ ਇੱਕ RTX 3090 100 ਤੋਂ 140 ਟੋਕਨ ਪ੍ਰਤੀ ਸਕਿੰਟ ਤੱਕ ਪਹੁੰਚਣਾ ਚਾਹੀਦਾ ਹੈ - ਜ਼ਿਆਦਾਤਰ ਲੋਕ ਪੜ੍ਹ ਸਕਦੇ ਹਨ ਨਾਲੋਂ ਤੇਜ਼।

ਤੁਲਨਾ ਕਰਨ ਲਈ, ਛੇ ਮਹੀਨੇ ਪਹਿਲਾਂ, ਸਥਾਨਕ ਤੌਰ 'ਤੇ ਵਰਤੋਂਯੋਗ ਸਪੀਡਾਂ 'ਤੇ 70-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਸੰਘਣੇ ਮਾਡਲ ਨੂੰ ਚਲਾਉਣ ਲਈ ਸੈਂਕੜੇ ਗੀਗਾਬਾਈਟ ਯੂਨੀਫਾਈਡ ਮੈਮੋਰੀ ਜਾਂ ਹਮਲਾਵਰ ਸੱਟੇਬਾਜ਼ੀ ਡੀਕੋਡਿੰਗ ਟ੍ਰਿਕਸ ਦੇ ਨਾਲ ਵਰਕਸਟੇਸ਼ਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।

ਇੱਕ 125B ਮਾਡਲ ਇੱਕ ਗੇਮਿੰਗ ਕਾਰਡ 'ਤੇ ਕਿਉਂ ਫਿੱਟ ਹੁੰਦਾ ਹੈ

ਤਕਨਾਲੋਜੀ ਦੇ ਦੋ ਟੁਕੜੇ ਇਸ ਨੂੰ ਸੰਭਵ ਬਣਾਉਂਦੇ ਹਨ. ਪਹਿਲਾ ਮਾਡਲ ਖੁਦ ਹੈ। ਜਿਵੇਂ ਕਿ AI Buzz ਵਾਇਰ ਨੇ ਇਸਦੀ ਰੀਲੀਜ਼ 'ਤੇ ਕਵਰ ਕੀਤਾ, Qwen3.8-Flash-Next ਲਗਭਗ 125 ਬਿਲੀਅਨ ਕੁੱਲ ਮਾਪਦੰਡਾਂ ਵਾਲਾ ਇੱਕ ਮਿਸ਼ਰਨ-ਦਾ-ਵਿਸ਼ੇਸ਼ ਆਰਕੀਟੈਕਚਰ ਹੈ ਪਰ ਪ੍ਰਤੀ ਟੋਕਨ ਸਿਰਫ 6 ਬਿਲੀਅਨ ਕਿਰਿਆਸ਼ੀਲ — ਇਸ ਲਈ ਹਰੇਕ ਤਿਆਰ ਕੀਤਾ ਸ਼ਬਦ ਨੈੱਟਵਰਕ ਦੇ ਇੱਕ ਛੋਟੇ ਜਿਹੇ ਹਿੱਸੇ ਨੂੰ ਛੂਹਦਾ ਹੈ, ਨਾਟਕੀ ਢੰਗ ਨਾਲ ਪ੍ਰਤੀ ਟੋਕਨ ਗਣਨਾ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ।

ਦੂਜਾ ਹੈ ਕੁਆਂਟਾਇਜ਼ੇਸ਼ਨ। ਸਟ੍ਰੈਟਾ ਦੇ ਸਭ ਤੋਂ ਤੇਜ਼ ਪ੍ਰੀਸੈੱਟ ਮਾਡਲ ਦੇ ਵਜ਼ਨ ਨੂੰ ਦੋ ਜਾਂ ਤਿੰਨ ਬਿੱਟ ਪ੍ਰਤੀ ਪੈਰਾਮੀਟਰ ਤੱਕ ਸੰਕੁਚਿਤ ਕਰਦੇ ਹਨ, ਇੱਕ ਫੁੱਟਪ੍ਰਿੰਟ ਲਈ ਕੁਝ ਸ਼ੁੱਧਤਾ ਦਾ ਵਪਾਰ ਕਰਦੇ ਹਨ ਜੋ ਇੱਕ 12GB GPU ਅਤੇ ਸਿਸਟਮ ਰੈਮ ਵਿੱਚ ਫਿੱਟ ਹੁੰਦਾ ਹੈ। ਇਹ ਟ੍ਰੇਡਆਫ ਮੁੱਖ ਚੇਤਾਵਨੀ ਹੈ: Q2-ਕਲਾਸ ਅਤੇ IQ2-ਸ਼੍ਰੇਣੀ ਦੀ ਮਾਤਰਾ ਤਰਕ-ਭਾਰੀ ਕਾਰਜਾਂ 'ਤੇ ਗੁਣਵੱਤਾ ਨੂੰ ਘਟਾਉਂਦੀ ਹੈ, ਅਤੇ ਖਰੀਦਦਾਰਾਂ ਨੂੰ ਹਰ ਕੰਮ ਦੇ ਬੋਝ ਲਈ ਗਰੰਟੀ ਦੀ ਬਜਾਏ ਸਿਰਲੇਖ ਸਪੀਡ ਨੰਬਰਾਂ ਨੂੰ ਸ਼ੁਰੂਆਤੀ ਬਿੰਦੂ ਵਜੋਂ ਮੰਨਣਾ ਚਾਹੀਦਾ ਹੈ। ਰਿਪੋਜ਼ਟਰੀ ਵਿੱਚ ਕਮਿਊਨਿਟੀ ਬੈਂਚਮਾਰਕ ਪੰਨੇ ਅਕਾਰ ਵਿੱਚ ਗੁਣਵੱਤਾ ਦੇ ਨਤੀਜਿਆਂ ਨੂੰ ਟਰੈਕ ਕਰਦੇ ਹਨ।

ਇੱਕ ਵੱਡੀ ਸਥਾਨਕ-AI ਵੇਵ ਦਾ ਹਿੱਸਾ

ਸਟ੍ਰੈਟਾ ਸਥਾਨਕ ਅਨੁਮਾਨ ਲਈ ਤੇਜ਼ ਰਫ਼ਤਾਰ ਦੇ ਵਿਚਕਾਰ ਪਹੁੰਚਦਾ ਹੈ। ਅਲੀਬਾਬਾ ਦਾ ਕਵੇਨ ਪਰਿਵਾਰ ਸਭ ਤੋਂ ਵੱਧ-ਡਾਊਨਲੋਡ ਕੀਤੀ ਗਈ ਓਪਨ-ਵੇਟ ਮਾਡਲ ਲਾਈਨ ਬਣ ਗਈ ਹੈ, ਮੈਟਾ ਅਤੇ ਗੂਗਲ ਕੋਲ ਆਪਣੇ ਖੁਦ ਦੇ ਓਪਨ-ਸੋਰਸਡ ਪ੍ਰਤੀਯੋਗੀ ਮਾਡਲ ਹਨ, ਅਤੇ ਸਾਧਨਾਂ ਦੀ ਇੱਕ ਲਹਿਰ ਹੁਣ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਉਹਨਾਂ ਦੀਆਂ ਡਿਵਾਈਸਾਂ ਨੂੰ ਛੱਡ ਕੇ ਗਾਹਕੀ ਜਾਂ ਡੇਟਾ ਦੇ ਬਿਨਾਂ ਸਮਰੱਥ ਸਹਾਇਕ ਚਲਾਉਣ ਦਿੰਦੀ ਹੈ।

ਪ੍ਰੋਜੈਕਟ ਇਹ ਵੀ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ "ਖਪਤਕਾਰ ਹਾਰਡਵੇਅਰ" ਦੀ ਪਰਿਭਾਸ਼ਾ ਕਿਵੇਂ ਬਦਲ ਰਹੀ ਹੈ। VRAM ਦੇ 12GB ਦੇ ਨਾਲ ਇੱਕ ਮੱਧ-ਰੇਂਜ 2026 ਗ੍ਰਾਫਿਕਸ ਕਾਰਡ, ਜੋ ਮੁੱਖ ਤੌਰ 'ਤੇ ਗੇਮਿੰਗ ਲਈ ਭੇਜਿਆ ਗਿਆ ਸੀ, ਹੁਣ ਸਾਈਜ਼ ਕਲਾਸ ਵਿੱਚ ਇੱਕ ਮਾਡਲ ਲਈ ਇੱਕ ਵਿਹਾਰਕ ਅਨੁਮਾਨ ਐਕਸਲੇਟਰ ਹੈ ਜਿਸਨੇ ਸਿਰਫ਼ ਦੋ ਸਾਲ ਪਹਿਲਾਂ ਸਰਹੱਦੀ ਪ੍ਰਣਾਲੀਆਂ ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕੀਤਾ ਸੀ।

ਸਟ੍ਰੈਟਾ ਸ਼ੁਰੂਆਤੀ ਸੌਫਟਵੇਅਰ ਬਣਿਆ ਹੋਇਆ ਹੈ - ਰਿਪੋਜ਼ਟਰੀ ਦੇ ਮੁੱਦੇ ਟਰੈਕਰ ਪੁਰਾਣੇ GPUs ਅਤੇ ਗੈਰ-AVX2 ਪ੍ਰੋਸੈਸਰਾਂ 'ਤੇ ਮੋਟੇ ਕਿਨਾਰਿਆਂ ਦੇ ਦਸਤਾਵੇਜ਼ਾਂ ਨੂੰ ਜਾਰੀ ਕਰਦੇ ਹਨ - ਪਰ ਪ੍ਰੋਜੈਕਟ MIT-ਲਾਇਸੰਸਸ਼ੁਦਾ, ਮੁਫਤ, ਅਤੇ ਖੁੱਲ੍ਹੇ ਵਿੱਚ ਵਿਕਸਤ ਕੀਤਾ ਗਿਆ ਹੈ, Intel Arc, ਪੁਰਾਣੇ Tesla ਅਤੇ Radeon ਕਾਰਡਾਂ ਲਈ ਪ੍ਰਯੋਗਾਤਮਕ ਸਮਰਥਨ ਦੇ ਨਾਲ, ਅਤੇ ਕਮਿਊਨਿਟੀ ਮੈਂਬਰਾਂ ਦੁਆਰਾ ਦਸਤਾਵੇਜ਼ੀ ਮਲਟੀ-GPU ਰਿਗਸ।

ਡਿਵੈਲਪਰਾਂ ਲਈ, ਸਭ ਤੋਂ ਵਿਹਾਰਕ ਉਪਾਅ ਲੋਕਲਹੋਸਟ API ਅਨੁਕੂਲਤਾ ਹੋ ਸਕਦਾ ਹੈ: ਓਪਨਏਆਈ ਜਾਂ ਐਂਥਰੋਪਿਕ SDK ਦੇ ਵਿਰੁੱਧ ਲਿਖੀ ਗਈ ਕੋਈ ਵੀ ਸਕ੍ਰਿਪਟ ਜਾਂ ਏਜੰਟ ਇੱਕ ਬੇਸ URL ਨੂੰ ਬਦਲ ਕੇ, ਸਟ੍ਰੈਟਾ ਨੂੰ ਗੋਪਨੀਯਤਾ-ਸੰਵੇਦਨਸ਼ੀਲ ਪ੍ਰੋਟੋਟਾਈਪਿੰਗ, ਔਫਲਾਈਨ ਵਰਤੋਂ, ਜਾਂ ਸਿਰਫ਼ API ਖਰਚਿਆਂ ਲਈ ਇੱਕ ਘੱਟ-ਰੱਖੜ ਵਿਕਲਪ ਬਣਾ ਕੇ ਇੱਕ ਸਥਾਨਕ ਕਵੇਨ ਤੈਨਾਤੀ ਲਈ ਰੀਡਾਇਰੈਕਟ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ।

ਇਸਨੂੰ ਕਿਵੇਂ ਅਜ਼ਮਾਉਣਾ ਹੈ

ਸ਼ੁਰੂਆਤ ਕਰਨ ਲਈ ਮੈਨੂਅਲ ਨਾਲ ਟਰਮੀਨਲ ਸੈਸ਼ਨ ਦੀ ਲੋੜ ਨਹੀਂ ਹੈ। ਇੰਸਟੌਲਰ ਇੱਕ ਪਾਸ ਵਿੱਚ ਡ੍ਰਾਈਵਰਾਂ, ਮਾਡਲ ਵੇਟ ਅਤੇ ਸਥਾਨਕ ਸਰਵਰ ਦਾ ਪ੍ਰਬੰਧ ਕਰਦਾ ਹੈ, ਅਤੇ ਰਿਪੋਜ਼ਟਰੀ ਵਿੱਚ ਇੱਕ ਸੈੱਟਅੱਪ ਫਾਈਲ ਸ਼ਾਮਲ ਹੁੰਦੀ ਹੈ ਜੋ ਸਿੱਧੇ ਇੱਕ AI ਕੋਡਿੰਗ ਸਹਾਇਕ ਵਿੱਚ ਪੇਸਟ ਕਰਨ ਲਈ ਤਿਆਰ ਕੀਤੀ ਗਈ ਹੈ, ਜੋ ਫਿਰ ਮਸ਼ੀਨ ਨੂੰ ਖੁਦਮੁਖਤਿਆਰ ਰੂਪ ਵਿੱਚ ਕੌਂਫਿਗਰ ਕਰਦੀ ਹੈ। ਡਿਸਕ ਤੋਂ ਭਾਰ ਲੋਡ ਹੋਣ ਦੇ ਦੌਰਾਨ ਪਹਿਲੀ ਲਾਂਚ ਹੌਲੀ ਹੁੰਦੀ ਹੈ; ਦਸਤਾਵੇਜ਼ ਇੱਕ SSD ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕਰਦਾ ਹੈ ਅਤੇ ਚੇਤਾਵਨੀ ਦਿੰਦਾ ਹੈ ਕਿ ਲੰਮੀ ਗੱਲਬਾਤ ਸਿਸਟਮ RAM 'ਤੇ ਹੋਰ ਕੰਮ ਬਦਲਦੀ ਹੈ।

ਏਆਈ ਤੋਂ ਅੱਗੇ ਰਹੋ

ਓਪਨ-ਸੋਰਸ ਮਾਡਲਾਂ, ਸਥਾਨਕ AI ਟੂਲਸ, ਅਤੇ ਇਨਫਰੈਂਸ ਹਾਰਡਵੇਅਰ ਬਾਰੇ ਨਵੀਨਤਮ ਜਾਣਕਾਰੀ ਲਈ AI Buzz Wire ਦਾ ਅਨੁਸਰਣ ਕਰੋ।

ਹੋਰ AI ਖਬਰਾਂ ਪੜ੍ਹੋ →