ਅਲੀਬਾਬਾ ਦੀ Qwen ਟੀਮ ਨੇ ਬੁੱਧਵਾਰ ਨੂੰ Qwen3.8-Flash-Next ਜਾਰੀ ਕੀਤਾ, ਇੱਕ ਮਲਟੀਮੋਡਲ ਮਿਸ਼ਰਣ-ਔਫ-ਮਾਹਰਾਂ ਦਾ ਮਾਡਲ ਜੋ ਆਉਣ ਵਾਲੇ Qwen4 ਦੇ ਆਰਕੀਟੈਕਚਰ ਪੂਰਵਦਰਸ਼ਨ ਦੇ ਰੂਪ ਵਿੱਚ ਦੁੱਗਣਾ ਹੋ ਜਾਂਦਾ ਹੈ — ਅਤੇ ਇਹ ਨਤੀਜੇ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ ਕਿ ਕੰਪਨੀ ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਸਿਖਲਾਈ ਦੀ ਕੀਮਤ ਦੇ ਲਗਭਗ ਇੱਕ ਨੌਵੇਂ ਹਿੱਸੇ ਵਿੱਚ ਇਸਦੇ ਬਹੁਤ ਵੱਡੇ Qwen3.7-Plus ਨੂੰ ਹਰਾਇਆ ਗਿਆ ਹੈ। ਰਾਇਟਰਜ਼, ਬਲੂਮਬਰਗ, ਅਤੇ ਦ ਡੀਕੋਡਰ ਨੇ ਸਾਰੇ ਲਾਂਚ ਨੂੰ ਕਵਰ ਕੀਤਾ, ਜੋ ਹੱਗਿੰਗ ਫੇਸ ਅਤੇ ਮਾਡਲਸਕੋਪ 'ਤੇ ਓਪਨ ਵੇਟ ਰੱਖਦਾ ਹੈ ਉਸੇ ਦਿਨ Z.ai ਨੇ ਆਪਣਾ ਫਰੰਟੀਅਰ-ਨਾਲ ਲੱਗਦੇ ਓਪਨ ਮਾਡਲ ਨੂੰ ਭੇਜਿਆ। ਬ੍ਰੇਕਿੰਗ ਏਆਈ ਨਿਊਜ਼* ਦੀ ਪਾਲਣਾ ਕਰੋ ਕਿਉਂਕਿ ਓਪਨ-ਵੇਟ ਦੌੜ ਤੇਜ਼ ਹੁੰਦੀ ਹੈ।
ਲਘੂ ਰੂਪ ਵਿੱਚ ਇੱਕ ਨਵਾਂ ਆਰਕੀਟੈਕਚਰ
ਸਿਰਲੇਖ ਨਿਰਧਾਰਨ ਕੁਸ਼ਲਤਾ ਹੈ. Qwen3.8-Flash-Next ਦੇ ਕੁੱਲ 125 ਬਿਲੀਅਨ ਪੈਰਾਮੀਟਰ ਹਨ ਪਰ ਸਿਰਫ 6 ਬਿਲੀਅਨ ਪ੍ਰਤੀ ਟੋਕਨ ਨੂੰ ਸਰਗਰਮ ਕਰਦਾ ਹੈ। ਤੁਲਨਾ ਲਈ, Qwen3.7-Plus - ਮਾਡਲ ਜੋ ਇਹ ਅਲੀਬਾਬਾ ਦੇ ਪ੍ਰਕਾਸ਼ਿਤ ਬੈਂਚਮਾਰਕਾਂ ਵਿੱਚ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ - ਵਿੱਚ 397 ਬਿਲੀਅਨ ਕੁੱਲ ਮਾਪਦੰਡ ਹਨ, 17 ਬਿਲੀਅਨ ਪ੍ਰਤੀ ਟੋਕਨ ਐਕਟੀਵੇਟ ਕੀਤੇ ਗਏ ਹਨ, ਫਲੈਸ਼-ਨੈਕਸਟ ਦੀ ਸਰਗਰਮ ਗਿਣਤੀ ਤੋਂ ਲਗਭਗ ਤਿੰਨ ਗੁਣਾ।
ਸਭ ਤੋਂ ਤਕਨੀਕੀ ਤੌਰ 'ਤੇ ਦਿਲਚਸਪ ਹਿੱਸਾ 51 ਬਿਲੀਅਨ ਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਲੈ ਕੇ ਇੱਕ ਨਾਵਲ ਐਨ-ਗ੍ਰਾਮ ਏਮਬੈਡਿੰਗ ਪਰਤ ਹੈ। ਲੇਅਰ ਆਮ ਸ਼ਬਦ ਸਮੂਹਾਂ ਨੂੰ ਸਟੈਂਡਅਲੋਨ ਐਂਟਰੀਆਂ ਦੇ ਰੂਪ ਵਿੱਚ ਸਟੋਰ ਕਰਦੀ ਹੈ ਜਿਸ ਵਿੱਚ ਡੀਕੋਡਰ ਦੇ ਮੈਥਿਆਸ ਬਾਸਟੀਅਨ ਨੇ ਇੱਕ ਕਿਸਮ ਦੇ "ਵਾਕਾਂਸ਼ ਸ਼ਬਦਕੋਸ਼" ਵਜੋਂ ਵਰਣਿਤ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਨੈਟਵਰਕ ਦੀ ਸ਼ੁਰੂਆਤ ਵਿੱਚ ਵਾਕਾਂਸ਼-ਪੱਧਰ ਦੀ ਜਾਣਕਾਰੀ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ। ਮਹੱਤਵਪੂਰਨ ਤੌਰ 'ਤੇ, ਇਹ ਮਹਿੰਗੇ GPU ਮੈਮੋਰੀ ਦੀ ਬਜਾਏ ਨਿਯਮਤ ਸਿਸਟਮ ਰੈਮ ਵਿੱਚ ਬੈਠਦਾ ਹੈ, ਜਿਸ ਨੂੰ ਕਿਵੇਨ ਟੀਮ ਮੁਕਾਬਲਤਨ ਘੱਟ ਵਾਧੂ ਲਾਗਤ ਕਹਿੰਦੀ ਹੈ - ਇੱਕ ਆਰਕੀਟੈਕਚਰਲ ਨਵੀਨਤਾ ਜੋ ਕਿ Qwen4 ਵਿੱਚ ਲੈ ਜਾਣ ਲਈ ਤਿਆਰ ਕੀਤੀ ਗਈ ਹੈ।
ਮਾਡਲ ਮੂਲ ਰੂਪ ਵਿੱਚ ਇੱਕ 262,144-ਟੋਕਨ ਪ੍ਰਸੰਗ ਵਿੰਡੋ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ ਅਤੇ YaRN ਲੰਬੇ-ਸੰਦਰਭ ਐਕਸਟੈਂਸ਼ਨ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ ਇੱਕ ਮਿਲੀਅਨ ਟੋਕਨਾਂ ਤੱਕ ਸਕੇਲ ਕਰਦਾ ਹੈ। ਇੱਕ ਤਕਨੀਕੀ ਰਿਪੋਰਟ GitHub 'ਤੇ ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤੀ ਗਈ ਹੈ.
ਬੈਂਚਮਾਰਕ: ਕੋਡਿੰਗ ਅਤੇ ਦਫਤਰ ਦਾ ਕੰਮ
ਅਲੀਬਾਬਾ ਦੇ ਬੈਂਚਮਾਰਕ ਫਲੈਸ਼-ਨੈਕਸਟ ਨੂੰ ਡੀਪਸੀਕ-ਵੀ4-ਫਲੈਸ਼ (284 ਬਿਲੀਅਨ ਪੈਰਾਮੀਟਰ, 13 ਬਿਲੀਅਨ ਐਕਟਿਵ) ਅਤੇ ਐਂਥਰੋਪਿਕ ਦੇ ਕਲੌਡ ਓਪਸ 4.6 (ਮੈਕਸ) ਦੇ ਵਿਰੁੱਧ ਹਨ। ਦੋਵੇਂ ਵਿਰੋਧੀ ਬਹੁਤ ਵੱਡੇ ਜਾਂ ਵਧੇਰੇ ਮਹਿੰਗੇ ਹੋਣ ਦੇ ਬਾਵਜੂਦ, ਫਲੈਸ਼-ਨੈਕਸਟ ਜ਼ਿਆਦਾਤਰ ਟੈਸਟ ਕੀਤੇ ਕੰਮਾਂ ਵਿੱਚ ਅਗਵਾਈ ਕਰਦਾ ਹੈ, ਕੋਡਿੰਗ ਅਤੇ ਦਫ਼ਤਰ ਉਤਪਾਦਕਤਾ ਵਿੱਚ ਸਭ ਤੋਂ ਵੱਧ ਲਾਭਾਂ ਦੇ ਨਾਲ।
ਏਜੰਟਿਕ ਕੋਡਿੰਗ 'ਤੇ, ਫਲੈਸ਼-ਨੈਕਸਟ ਨੇ DeepSWE 1.1 'ਤੇ 58.7 ਅਤੇ SWE-ਬੈਂਚ ਪ੍ਰੋ 'ਤੇ 62.5 ਸਕੋਰ ਕੀਤੇ, ਜਿਸ ਨੇ DeepSeek-V4-Flash ਅਤੇ Claude Opus 4.6 ਦੋਵਾਂ ਨੂੰ ਹਰਾਇਆ। ਦਫਤਰੀ ਕੰਮਾਂ ਦਾ ਪਾੜਾ ਅਜੇ ਵੀ ਚੌੜਾ ਹੈ: ਡੀਪਸੀਕ-ਵੀ4-ਫਲੈਸ਼ ਲਈ 45.1 ਦੇ ਮੁਕਾਬਲੇ CoWorkBench 'ਤੇ 73.9, ਅਤੇ JobBench 'ਤੇ 55.7 — Qwen3.7-Plus ਦੇ 27.6 ਦੇ ਲਗਭਗ ਦੁੱਗਣੇ। GPQA ਡਾਇਮੰਡ 'ਤੇ Flash-Next 91.7 ਅਤੇ LiveCodeBench v6 'ਤੇ 91.9 ਦੇ ਨਾਲ, ਵਿਗਿਆਨਕ ਤਰਕ ਪੂਰੇ ਖੇਤਰ ਵਿੱਚ ਨੇੜਿਓਂ ਮੇਲ ਖਾਂਦਾ ਹੈ। ਕਲਾਉਡ ਓਪਸ 4.6 ਸਿਰਫ ਹਿਊਮੈਨਿਟੀਜ਼ ਲਾਸਟ ਐਗਜ਼ਾਮ, 40.0 ਤੋਂ 35.9 ਤੱਕ ਅੱਗੇ ਆਉਂਦਾ ਹੈ, ਅਤੇ ਇਹ ਫਰਵਰੀ 2026 ਤੋਂ ਇੱਕ ਪੁਰਾਣਾ ਮਾਨਵ-ਪ੍ਰਬੰਧਕ ਮਾਡਲ ਹੈ। ਹਮੇਸ਼ਾ ਵਾਂਗ, ਪ੍ਰਕਾਸ਼ਿਤ ਬੈਂਚਮਾਰਕ ਸਕੋਰ ਅਤੇ ਅਸਲ-ਸੰਸਾਰ ਪ੍ਰਦਰਸ਼ਨ ਵਿੱਚ ਅੰਤਰ ਹੋ ਸਕਦਾ ਹੈ।
ਹਰ ਵਿਰੋਧੀ 'ਤੇ ਕੀਮਤ ਦਾ ਦਬਾਅ
ਉਤਪਾਦਨ ਸੰਸਕਰਣ Qwen3.8-Flash ਦੇ ਰੂਪ ਵਿੱਚ QwenCloud ਦੁਆਰਾ ਭੇਜਿਆ ਜਾਂਦਾ ਹੈ, ਜਿਸਦੀ ਕੀਮਤ $0.16 ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਇਨਪੁਟ ਟੋਕਨ ਅਤੇ $0.47 ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਆਉਟਪੁੱਟ ਟੋਕਨ ਹੈ। ਇਹ Z.ai ਦੇ GLM-5.3-ਫਲੈਸ਼ ਨੂੰ ਵੀ ਘਟਾਉਂਦਾ ਹੈ, ਉਸੇ ਦਿਨ ਕ੍ਰਮਵਾਰ $0.15 ਅਤੇ $0.50 'ਤੇ ਜਾਰੀ ਕੀਤਾ ਗਿਆ - ਮਾਰਕੀਟ ਦੇ ਹੇਠਲੇ ਪੱਧਰ 'ਤੇ ਪ੍ਰਭਾਵੀ ਤੌਰ 'ਤੇ ਸਮਾਨਤਾ।
ਅਲੀਬਾਬਾ ਦੇ ਆਪਣੇ ਫਲੈਗਸ਼ਿਪ ਦਾ ਪਾੜਾ ਬਹੁਤ ਜ਼ਿਆਦਾ ਹੈ। Qwen3.8-Max, Claude Opus 4.8, Gemini 3.1 Pro, ਅਤੇ GPT-5.6 Sol ਨਾਲ ਮੁਕਾਬਲਾ ਕਰਨ ਲਈ ਅਗਸਤ ਦੇ ਸ਼ੁਰੂ ਵਿੱਚ ਪੇਸ਼ ਕੀਤਾ ਗਿਆ, ਦੀ ਕੀਮਤ $2.00 ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਇਨਪੁਟ ਟੋਕਨ ਅਤੇ $6.00 ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਆਉਟਪੁੱਟ ਟੋਕਨ ਹੈ। ਫਲੈਸ਼-ਨੈਕਸਟ ਫਲੈਗਸ਼ਿਪ ਦੇ ਬਿਲਕੁਲ ਹੇਠਾਂ, ਅਲੀਬਾਬਾ ਦੇ ਆਪਣੇ ਸੰਖਿਆਵਾਂ ਦੇ ਅਨੁਸਾਰ, ਇਨਪੁਟ ਅਤੇ ਆਉਟਪੁੱਟ ਦੋਵਾਂ ਦੀ ਕੀਮਤ ਦੇ ਲਗਭਗ ਇੱਕ-ਬਾਰ੍ਹਵੇਂ ਹਿੱਸੇ 'ਤੇ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ।
ਲੰਮਾ ਸੰਦਰਭ ਵਿਸ਼ੇਸ਼ ਸ਼ੀਟ ਤੋਂ ਪਰੇ ਵਿਹਾਰਕ ਮੁੱਲ ਜੋੜਦਾ ਹੈ। 262,144 ਮੂਲ ਟੋਕਨਾਂ 'ਤੇ, ਇੱਕ ਸਿੰਗਲ ਬੇਨਤੀ ਕਈ ਵੱਡੇ ਕੋਡ ਰਿਪੋਜ਼ਟਰੀਆਂ, ਇੱਕ ਪੂਰਾ ਇਕਰਾਰਨਾਮਾ ਸੈੱਟ, ਜਾਂ ਪ੍ਰਤੀਲਿਪੀ ਮੀਟਿੰਗਾਂ ਦੇ ਘੰਟੇ ਰੱਖ ਸਕਦੀ ਹੈ; YaRN ਦੇ ਨਾਲ 10 ਲੱਖ ਟੋਕਨਾਂ ਤੱਕ ਵਧਾਇਆ ਗਿਆ ਹੈ, ਪੂਰੇ-ਕਾਰਪਸ ਵਿਸ਼ਲੇਸ਼ਣ ਨੂੰ ਮੁੜ ਪ੍ਰਾਪਤੀ ਸਕੈਫੋਲਡਿੰਗ ਤੋਂ ਬਿਨਾਂ ਸੰਭਵ ਹੋ ਜਾਂਦਾ ਹੈ। ਏਜੰਟਿਕ ਕੋਡਿੰਗ ਵਰਕਲੋਡਾਂ ਲਈ ਜਿੱਥੇ ਫਲੈਸ਼-ਨੈਕਸਟ ਆਪਣੇ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ਸਕੋਰ ਪੋਸਟ ਕਰਦਾ ਹੈ — ਅਸਲ ਸੌਫਟਵੇਅਰ ਪ੍ਰੋਜੈਕਟਾਂ ਵਿੱਚ ਸੁਤੰਤਰ ਤੌਰ 'ਤੇ ਬੱਗਾਂ ਨੂੰ ਲੱਭਣਾ ਅਤੇ ਠੀਕ ਕਰਨਾ — ਇੱਕ ਵੱਡੀ ਵਿੰਡੋ ਦਾ ਮਤਲਬ ਹੈ ਘੱਟ ਸੰਦਰਭ-ਪ੍ਰਬੰਧਨ ਅਸਫਲਤਾਵਾਂ ਮੱਧ-ਕਾਰਜ। Qwen ਟੀਮ ਨੇ GitHub 'ਤੇ ਤਕਨੀਕੀ ਰਿਪੋਰਟ ਵੀ ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤੀ ਹੈ, ਬਿਲਕੁਲ ਉਸੇ ਤਰ੍ਹਾਂ ਦੀ ਸੁਤੰਤਰ ਆਰਕੀਟੈਕਚਰ ਜਾਂਚ ਨੂੰ ਸੱਦਾ ਦਿੰਦੀ ਹੈ ਜਿਸ ਤੋਂ ਮਲਕੀਅਤ ਲੈਬਾਂ ਬਚਦੀਆਂ ਹਨ।
ਇਹ ਰਿਲੀਜ਼ ਮਹੱਤਵਪੂਰਨ ਕਿਉਂ ਹੈ
Qwen3.8-Flash-Next ਨੂੰ Qwen4 ਲਈ ਜਨਤਕ ਡਰੈੱਸ ਰਿਹਰਸਲ ਵਜੋਂ ਸਭ ਤੋਂ ਵਧੀਆ ਸਮਝਿਆ ਜਾਂਦਾ ਹੈ। ਐਨ-ਗ੍ਰਾਮ ਏਮਬੈਡਿੰਗ ਲੇਅਰ, ਹਮਲਾਵਰ ਸਰਗਰਮ-ਪੈਰਾਮੀਟਰ ਅਨੁਪਾਤ, ਅਤੇ ਭਾਰੀ-ਪਰ-ਕਦਾਈਂ-ਲੋੜੀਂਦੇ ਮਾਪਦੰਡਾਂ ਦੀ RAM-ਆਫਲੋਡਿੰਗ ਇੱਕ ਡਿਜ਼ਾਈਨ ਫਲਸਫੇ ਨੂੰ ਦਰਸਾਉਂਦੀ ਹੈ: ਪ੍ਰਤੀ ਡਾਲਰ ਇੰਟੈਲੀਜੈਂਸ ਨੂੰ ਮੂਵ ਕਰੋ, ਨਾ ਕਿ ਪ੍ਰਤੀ GPU ਪ੍ਰਤੀ ਬੁੱਧੀ। Qwen3.7-ਪਲੱਸ-ਬੀਟਿੰਗ ਮਾਡਲ ਨੂੰ ਇੱਕ-ਨੌਂਵੇਂ ਹਿੱਸੇ ਲਈ ਸਿਖਲਾਈ ਦੇਣਾ ਬਿਲਕੁਲ ਉਹ ਸਮਰੱਥਾ ਹੈ ਜੋ ਤੇਜ਼ ਦੁਹਰਾਓ ਚੱਕਰਾਂ ਨੂੰ ਕਿਫਾਇਤੀ ਬਣਾਉਂਦੀ ਹੈ — ਅਤੇ ਦੁਹਰਾਓ ਦੀ ਗਤੀ, ਕਿਸੇ ਵੀ ਸਿੰਗਲ ਬੈਂਚਮਾਰਕ ਤੋਂ ਵੱਧ, ਇਹ ਫੈਸਲਾ ਕਰਦੀ ਹੈ ਕਿ ਹੁਣ ਤੋਂ ਇੱਕ ਸਾਲ ਬਾਅਦ ਕੌਣ ਸਰਹੱਦ 'ਤੇ ਖੜ੍ਹਾ ਹੈ।
ਚੀਨੀ ਪ੍ਰਯੋਗਸ਼ਾਲਾਵਾਂ - Z.ai ਦੇ GLM-5.3-ਫਲੈਸ਼ ਅਤੇ ਅਲੀਬਾਬਾ ਦੇ ਫਲੈਸ਼-ਨੈਕਸਟ - ਦੇ ਦੋ ਫਰੰਟੀਅਰ-ਨਾਲ ਲੱਗਦੇ ਓਪਨ-ਵੇਟ ਮਾਡਲਾਂ ਦੀ ਉਸੇ ਦਿਨ ਦੀ ਆਮਦ ਵੀ ਇੱਕ ਕੈਡੈਂਸ ਸ਼ਿਫਟ ਨੂੰ ਦਰਸਾਉਂਦੀ ਹੈ, ਜਿਵੇਂ ਕਿ ਫੋਰਵੀਕਐਮਬੀਏ ਨੇ ਦੇਖਿਆ ਹੈ। ਪੱਛਮੀ ਪ੍ਰਯੋਗਸ਼ਾਲਾਵਾਂ ਅਜੇ ਵੀ ਬੈਂਚਮਾਰਕ ਸਿਖਰਾਂ ਨੂੰ ਰੱਖਦੀਆਂ ਹਨ, ਪਰ ਓਪਨ-ਵੇਟ ਟੀਅਰ ਹੁਣ ਹਫਤਾਵਾਰੀ ਨੇੜੇ-ਸਰਹੱਦੀ ਕੁਆਲਿਟੀ ਭੇਜਦਾ ਹੈ, ਕੀਮਤਾਂ ਘੱਟ ਹੋਣ ਦੇ ਕ੍ਰਮ 'ਤੇ।
ਡਿਵੈਲਪਰਾਂ ਲਈ, ਵਿਹਾਰਕ ਟੇਕਵੇਅ ਸਧਾਰਨ ਹੈ: ਕਿਸੇ ਇੱਕ ਪ੍ਰਦਾਤਾ ਦੇ ਵਿਰੁੱਧ ਬੀਮੇ ਵਜੋਂ ਡਾਊਨਲੋਡ ਕਰਨ ਯੋਗ ਵਜ਼ਨ ਦੇ ਨਾਲ, ਇੱਕ ਸਮਰੱਥ, ਲੰਬੇ-ਸੰਦਰਭ, ਮਲਟੀਮੋਡਲ ਮਾਡਲ ਦੀ ਲਾਗਤ ਹੁਣੇ ਹੀ ਘਟੀ ਹੈ। ਪ੍ਰਤੀਯੋਗੀਆਂ ਲਈ, ਸੁਨੇਹਾ ਘੱਟ ਅਰਾਮਦਾਇਕ ਹੈ - ਕੁਸ਼ਲਤਾ ਸਰਹੱਦ ਹੁਣ ਫਲੈਗਸ਼ਿਪ ਕੀਮਤ ਦੇ ਅਸਲ ਵਿੱਚ ਪਾਲਣਾ ਕਰਨ ਨਾਲੋਂ ਤੇਜ਼ੀ ਨਾਲ ਅੱਗੇ ਵਧ ਰਹੀ ਹੈ, ਅਤੇ ਅਲੀਬਾਬਾ ਨੇ ਹੌਲੀ ਹੋਣ ਦਾ ਕੋਈ ਸੰਕੇਤ ਨਹੀਂ ਦਿਖਾਇਆ ਹੈ।
---
AI ਤੋਂ ਅੱਗੇ ਰਹੋਨਵੀਨਤਮ AI ਖਬਰਾਂ, ਵਿਸ਼ਲੇਸ਼ਣ ਅਤੇ ਸਫਲਤਾਵਾਂ ਪ੍ਰਾਪਤ ਕਰੋ - ਸਭ ਇੱਕ ਥਾਂ 'ਤੇ।
ਹੋਰ AI ਖਬਰਾਂ ਪੜ੍ਹੋ →