ਗੂਗਲ ਨੇ ਚੁੱਪਚਾਪ ਇਸ ਹਫਤੇ 48 ਘੰਟਿਆਂ ਦੇ ਅੰਦਰ ਦੋ ਮਹੱਤਵਪੂਰਨ ਜੈਮਿਨੀ ਮਾਡਲ ਅਪਡੇਟਸ ਭੇਜੇ, ਅਤੇ ਦੋਵਾਂ ਦਾ ਉਦੇਸ਼ ਉਤਪਾਦਨ ਐਪਲੀਕੇਸ਼ਨ ਬਣਾਉਣ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ 'ਤੇ ਹੈ। ਗੂਗਲ ਦੇ ਅਧਿਕਾਰਤ ਬਲੌਗ ਦੇ ਅਨੁਸਾਰ, Gemini 3.5 ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ, 26 ਅਗਸਤ ਨੂੰ ਪੇਸ਼ ਕੀਤਾ ਗਿਆ, ਕੰਪਨੀ ਦਾ ਹੁਣ ਤੱਕ ਦਾ ਸਭ ਤੋਂ ਸਟੀਕ ਸਪੀਚ-ਟੂ-ਟੈਕਸਟ ਮਾਡਲ ਹੈ। ਜੈਮਿਨੀ ਓਮਨੀ 1.1 ਫਲੈਸ਼, 27 ਅਗਸਤ ਨੂੰ ਘੋਸ਼ਿਤ ਕੀਤੀ ਗਈ, 40 ਸਕਿੰਟਾਂ ਤੱਕ ਸੀਨ ਐਕਸਟੈਂਸ਼ਨ ਅਤੇ 4K ਅਪਸਕੇਲਿੰਗ ਸਮੇਤ, ਜਨਰੇਟਿਵ ਵੀਡੀਓ ਵਿੱਚ ਪੇਸ਼ੇਵਰ-ਗਰੇਡ ਨਿਯੰਤਰਣ ਲਿਆਉਂਦਾ ਹੈ। ਦੋਵੇਂ ਮਾਡਲ Google AI ਸਟੂਡੀਓ ਅਤੇ Gemini Enterprise Agent ਪਲੇਟਫਾਰਮ ਵਿੱਚ Gemini API ਰਾਹੀਂ ਉਪਲਬਧ ਹਨ।

ਮਿਥੁਨ 3.5 ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ: ਸਪੀਚ-ਟੂ-ਟੈਕਸਟ ਜੋ ਆਪਣੇ ਆਪ ਨੂੰ ਸਾਫ਼ ਕਰਦਾ ਹੈ For more context on this story, see our ongoing artificial intelligence updates.

ਗੂਗਲ ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਕੀ ਮਿਥੁਨ 3.5 ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਨੂੰ ਰਵਾਇਤੀ ਭਾਸ਼ਣ ਪਛਾਣ ਤੋਂ ਵੱਖ ਕਰਦਾ ਹੈ, ਇਹ ਹੈ ਕਿ ਇਹ ਕੱਚੀ ਪ੍ਰਤੀਲਿਪੀ ਦੀ ਬਜਾਏ ਸਿੱਧੇ ਆਡੀਓ ਨੂੰ ਪਾਲਿਸ਼ ਕੀਤੇ, ਫਾਰਮੈਟ ਕੀਤੇ ਟੈਕਸਟ ਵਿੱਚ ਬਦਲਦਾ ਹੈ। ਮਾਡਲ ਬੈਕਗ੍ਰਾਊਂਡ ਸ਼ੋਰ, ਗੁੰਝਲਦਾਰ ਸ਼ਬਦਾਵਲੀ, ਅਤੇ ਅਸਥਿਰਤਾ ਦੀ ਸਫਾਈ ਨੂੰ ਨੇਟਿਵ ਤੌਰ 'ਤੇ ਹੈਂਡਲ ਕਰਦਾ ਹੈ — ਇਹ "ums" ਅਤੇ "ahs" ਵਰਗੇ ਫਿਲਰ ਸ਼ਬਦਾਂ ਨੂੰ ਹਟਾਉਂਦਾ ਹੈ, "ਆਓ ਮੰਗਲਵਾਰ-ਨਹੀਂ, ਬੁੱਧਵਾਰ" ਵਰਗੇ ਸਵੈ-ਸੁਧਾਰਾਂ ਨੂੰ ਹੱਲ ਕਰਦਾ ਹੈ ਅਤੇ ਆਉਟਪੁੱਟ ਨੂੰ ਆਟੋ-ਫਾਰਮੈਟ ਕਰਦਾ ਹੈ।

ਗੂਗਲ ਵੱਲੋਂ ਦਿੱਤੇ ਗਏ ਬੈਂਚਮਾਰਕ ਨੰਬਰ ਜ਼ਿਕਰਯੋਗ ਹਨ। ਜਿਵੇਂ ਕਿ ਨਕਲੀ ਵਿਸ਼ਲੇਸ਼ਣ ਦੁਆਰਾ ਮਾਪਿਆ ਗਿਆ ਹੈ, ਮਾਡਲ ਸਟ੍ਰੀਮਿੰਗ ਵਰਤੋਂ ਦੇ ਕੇਸਾਂ ਲਈ 4.0 ਪ੍ਰਤੀਸ਼ਤ ਅਤੇ ਗੈਰ-ਸਟ੍ਰੀਮਿੰਗ ਆਡੀਓ ਲਈ 2.6 ਪ੍ਰਤੀਸ਼ਤ ਦੀ ਔਸਤ ਸ਼ਬਦ ਗਲਤੀ ਦਰ (WER) ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ। ਚੋਟੀ ਦੀਆਂ ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ FLEURS ਬਹੁ-ਭਾਸ਼ਾਈ ਬੈਂਚਮਾਰਕ 'ਤੇ, ਇਹ ਸਟ੍ਰੀਮਿੰਗ ਮੋਡ ਵਿੱਚ 5.50 ਪ੍ਰਤੀਸ਼ਤ WER ਅਤੇ 5.04 ਪ੍ਰਤੀਸ਼ਤ ਗੈਰ-ਸਟ੍ਰੀਮਿੰਗ ਪੋਸਟ ਕਰਦਾ ਹੈ, ਜੋ ਕਿ Google ਦੇ ਪਿਛਲੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਮਾਡਲ, Chirp 3 ਵਿੱਚ ਸੁਧਾਰ ਕਰਦਾ ਹੈ। Chirp 3 ਦੇ ਮੁਕਾਬਲੇ ਫਾਈਨਲ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਦਾ ਸਮਾਂ 70 ਪ੍ਰਤੀਸ਼ਤ ਤੱਕ ਸੁਧਾਰ ਕਰਦਾ ਹੈ, ਜਿਵੇਂ ਕਿ ਦੁਬਾਰਾ ਨਕਲੀ ਵਿਸ਼ਲੇਸ਼ਣ ਦੁਆਰਾ ਮਾਪਿਆ ਗਿਆ ਹੈ।

ਮਾਡਲ ਦੋ ਵਰਕਫਲੋ ਲਈ ਦੋ ਰੂਪਾਂ ਵਿੱਚ ਭੇਜਦਾ ਹੈ। ਲਾਈਵ ਐਪਲੀਕੇਸ਼ਨਾਂ ਲਈ, `ਜੇਮਿਨੀ-3.5-ਟਰਾਂਸਕ੍ਰਾਈਬ-ਲਾਈਵ` ਲਾਈਵ ਏਪੀਆਈ ਦੁਆਰਾ ਸਬ-ਸੈਕਿੰਡ ਲੇਟੈਂਸੀ ਦੇ ਨਾਲ ਲਗਾਤਾਰ ਦੋ-ਦਿਸ਼ਾਵੀ ਸਟ੍ਰੀਮਿੰਗ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ, ਵੌਇਸ ਏਜੰਟਾਂ ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾਉਂਦਾ ਹੈ ਅਤੇ ਰੀਅਲ-ਟਾਈਮ ਕੈਪਸ਼ਨਿੰਗ। ਰਿਕਾਰਡ ਕੀਤੇ ਆਡੀਓ ਲਈ — ਮੀਟਿੰਗਾਂ, ਕਾਲ ਲੌਗਸ, ਆਰਕਾਈਵ — `ਜੇਮਿਨੀ-3.5-ਟਰਾਂਸਕ੍ਰਾਈਬ` ਤਿੰਨ ਸਪੀਕਰਾਂ (ਪ੍ਰਯੋਗਾਤਮਕ ਮੋਡ ਵਿੱਚ ਹੋਰ ਲਈ ਸਮਰਥਨ ਦੇ ਨਾਲ) ਅਤੇ ਇੰਟਰਐਕਸ਼ਨ API ਰਾਹੀਂ ਸ਼ਬਦ-ਪੱਧਰ ਦੇ ਟਾਈਮਸਟੈਂਪਾਂ ਲਈ ਸਪੀਕਰ ਵਿਸ਼ੇਸ਼ਤਾ ਦੀ ਪੇਸ਼ਕਸ਼ ਕਰਦਾ ਹੈ।

ਹੋਰ ਸਮਰੱਥਾਵਾਂ ਵਿੱਚ ਆਟੋਮੈਟਿਕ ਖੋਜ ਅਤੇ 85 ਤੋਂ ਵੱਧ ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਲਹਿਜ਼ਾ ਅਤੇ ਉਪਭਾਸ਼ਾ ਹੈਂਡਲਿੰਗ, ਅਤੇ ਕਸਟਮ ਸ਼ਬਦਾਵਲੀ ਸਹਾਇਤਾ ਸ਼ਾਮਲ ਹੈ ਤਾਂ ਜੋ ਮਾਡਲ ਵਿਸ਼ੇਸ਼ ਸ਼ਬਦਾਵਲੀ ਅਤੇ ਵਿਲੱਖਣ ਸ਼ਬਦ-ਜੋੜਾਂ ਦੇ ਅਨੁਕੂਲ ਹੋਵੇ। ਗੂਗਲ ਨੇ ਇੱਕ ਕਿਸਮ ਦੀਆਂ ਮਾਡਲ ਅੱਖਾਂ ਵੀ ਦਿੱਤੀਆਂ: ਫੰਕਸ਼ਨ ਕਾਲਿੰਗ ਦੁਆਰਾ, ਇਹ ਹੋਰ ਜੇਮਿਨੀ ਮਾਡਲਾਂ ਨੂੰ ਚਿੱਤਰ ਬਣਾਉਣ ਜਾਂ ਫਾਈਲ ਵਿਸ਼ਲੇਸ਼ਣ ਵਰਗੇ ਕਾਰਜ ਸੌਂਪ ਸਕਦਾ ਹੈ - ਇੱਕ ਵਿਸ਼ੇਸ਼ਤਾ ਜੋ ਵਰਤਮਾਨ ਵਿੱਚ ਮੈਕੋਸ 'ਤੇ ਜੈਮਿਨੀ ਐਪ ਵਿੱਚ ਉਪਲਬਧ ਹੈ।

ਜੇਮਿਨੀ ਓਮਨੀ 1.1 ਫਲੈਸ਼: ਵੀਡੀਓ ਪੀੜ੍ਹੀ ਇੱਕ ਸਮਾਂ-ਰੇਖਾ ਵਧਾਉਂਦੀ ਹੈ

ਦੂਜਾ ਲਾਂਚ ਏਆਈ ਵੀਡੀਓ: ਨਿਯੰਤਰਣ ਬਾਰੇ ਸਭ ਤੋਂ ਆਮ ਸ਼ਿਕਾਇਤ ਨੂੰ ਸੰਬੋਧਿਤ ਕਰਦਾ ਹੈ। Gemini Omni 1.1 Flash ਇੱਕ ਉਤਪਾਦਨ-ਕੇਂਦ੍ਰਿਤ ਅੱਪਡੇਟ ਹੈ ਜੋ ਜਨਰੇਟਿਵ ਵੀਡੀਓ ਨੂੰ ਉਹਨਾਂ ਤਰੀਕਿਆਂ ਨਾਲ ਸਟੀਅਰੇਬਲ ਬਣਾਉਂਦਾ ਹੈ ਜਿਵੇਂ ਕਿ ਇਸਦੇ ਪੂਰਵਜ ਨਹੀਂ ਸਨ, Google DeepMind ਉਤਪਾਦ ਪ੍ਰਬੰਧਕ ਅਨੀਸ਼ ਨੰਗੀਆ ਅਤੇ ਅਲੀਸਾ ਫੋਰਟਿਨ ਨੇ ਰਿਲੀਜ਼ ਨੂੰ Omni 1.1 ਨੂੰ "ਪੇਸ਼ੇਵਰ ਵਰਤੋਂ ਲਈ ਉਤਪਾਦਨ-ਤਿਆਰ" ਬਣਾਉਣ ਦੇ ਰੂਪ ਵਿੱਚ ਵਰਣਨ ਕੀਤਾ ਹੈ।

ਸੀਨ ਐਕਸਟੈਂਸ਼ਨ ਹੈੱਡਲਾਈਨ ਵਿਸ਼ੇਸ਼ਤਾ ਹੈ। ਡਿਵੈਲਪਰ ਹੁਣ ਇੱਕ ਮੌਜੂਦਾ ਕਲਿੱਪ ਤੋਂ ਨਿਰਵਿਘਨ ਫੁਟੇਜ ਬਣਾਉਣਾ ਜਾਰੀ ਰੱਖ ਸਕਦੇ ਹਨ, ਮਾਡਲ 10 ਸਕਿੰਟਾਂ ਦੇ ਪੁਰਾਣੇ ਸੰਦਰਭ ਦੇ ਵਿਸ਼ਲੇਸ਼ਣ ਦੇ ਨਾਲ - ਪਿਛਲੇ ਮਾਡਲਾਂ ਤੋਂ ਇੱਕ ਲੀਪ ਜੋ ਸਿਰਫ਼ ਅੰਤਿਮ ਸਕਿੰਟ ਦਾ ਹਵਾਲਾ ਦਿੰਦਾ ਹੈ। ਵਿਡੀਓਜ਼ ਨੂੰ 10-ਸਕਿੰਟ ਦੇ ਵਾਧੇ ਵਿੱਚ 40 ਸਕਿੰਟਾਂ ਦੀ ਸੰਚਤ ਲੰਬਾਈ ਤੱਕ ਵਧਾਇਆ ਜਾ ਸਕਦਾ ਹੈ, ਵਿਜ਼ੂਅਲ ਇਕਸਾਰਤਾ ਵਿੱਚ ਸੁਧਾਰ ਅਤੇ ਲੰਬੀਆਂ ਕਹਾਣੀਆਂ ਲਈ ਬਿਰਤਾਂਤ ਦੀ ਪਾਲਣਾ।

ਅੱਪਡੇਟ ਪਹਿਲੇ-ਅਤੇ-ਆਖਰੀ-ਫ੍ਰੇਮ ਇੰਟਰਪੋਲੇਸ਼ਨ ਨੂੰ ਵੀ ਜੋੜਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਨਿਰਵਿਘਨ, ਜਾਣਬੁੱਝ ਕੇ ਕੈਮਰੇ ਦੀਆਂ ਹਰਕਤਾਂ ਅਤੇ ਸ਼ਾਟਸ ਦੇ ਵਿਚਕਾਰ ਪਰਿਵਰਤਨ ਬਣਾਉਣ ਲਈ ਸ਼ੁਰੂਆਤ ਅਤੇ ਅੰਤ ਦੇ ਫਰੇਮਾਂ ਨੂੰ ਨਿਰਧਾਰਤ ਕਰਨ ਦਿੰਦਾ ਹੈ। ਡਿਲੀਵਰੀ ਲਈ, ਮੁਕੰਮਲ ਹੋਏ ਪ੍ਰੋਜੈਕਟਾਂ ਨੂੰ 4K ਰੈਜ਼ੋਲਿਊਸ਼ਨ ਤੱਕ ਵਧਾਇਆ ਜਾ ਸਕਦਾ ਹੈ, ਜਦੋਂ ਕਿ ਇੱਕ 360p ਪੂਰਵਦਰਸ਼ਨ ਮੋਡ ਸਿਰਜਣਹਾਰਾਂ ਨੂੰ ਅੰਤਮ ਰੈਂਡਰ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਜਲਦੀ ਅਤੇ ਸਸਤੇ ਢੰਗ ਨਾਲ ਪ੍ਰੋਂਪਟ 'ਤੇ ਦੁਹਰਾਉਣ ਦਿੰਦਾ ਹੈ।

API ਤੋਂ ਰੋਜ਼ਾਨਾ ਸਤਹਾਂ ਤੱਕ

ਗੂਗਲ ਦੋਵਾਂ ਮਾਡਲਾਂ ਨੂੰ ਆਪਣੇ ਖਪਤਕਾਰ ਉਤਪਾਦਾਂ ਵਿੱਚ ਵੀ ਜੋੜ ਰਿਹਾ ਹੈ, ਜਿੱਥੇ ਇਸਦਾ ਵਿਤਰਣ ਲਾਭ ਦਿਖਾਉਂਦਾ ਹੈ। ਐਂਡਰੌਇਡ 'ਤੇ, Gboard ਵਿੱਚ ਨਵੀਂ "ਰੈਂਬਲਰ" ਵਿਸ਼ੇਸ਼ਤਾ ਫਿਲਰ ਸ਼ਬਦਾਂ ਨੂੰ ਫਿਲਟਰ ਕਰਦੇ ਸਮੇਂ ਬੋਲੇ ​​ਗਏ ਵਿਚਾਰਾਂ ਨੂੰ ਚੰਗੀ ਤਰ੍ਹਾਂ ਫਾਰਮੈਟ ਕੀਤੇ ਟੈਕਸਟ ਵਿੱਚ ਬਦਲਣ ਲਈ 3.5 ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਦੀ ਵਰਤੋਂ ਕਰਦੀ ਹੈ — ਉਪਭੋਗਤਾ ਆਵਾਜ਼ ਦੁਆਰਾ ਸੰਪਾਦਨ ਵੀ ਕਰ ਸਕਦੇ ਹਨ। ਇਹ ਮਾਡਲ ਮੈਕੋਸ 'ਤੇ ਜੇਮਿਨੀ ਐਪ ਵਿੱਚ ਡਿਕਸ਼ਨ ਦੀ ਸ਼ਕਤੀ ਵੀ ਦਿੰਦਾ ਹੈ, ਗੂਗਲ ਐਂਟੀਗਰੇਵਿਟੀ ਵਿੱਚ ਸਕ੍ਰੀਨ ਸੰਦਰਭ ਦੇ ਨਾਲ ਕੰਮ ਕਰਦਾ ਹੈ, ਅਤੇ ਕ੍ਰੋਮ ਵਿੱਚ ਏਕੀਕ੍ਰਿਤ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ।

ਡਿਵੈਲਪਰਾਂ ਲਈ, ਦੋ ਲਾਂਚਾਂ ਨੂੰ ਇੱਕ ਰਣਨੀਤੀ ਦੇ ਰੂਪ ਵਿੱਚ ਪੜ੍ਹਿਆ ਗਿਆ ਹੈ: ਗੂਗਲ ਇੱਕ ਚੈਟਬੋਟ ਤੋਂ ਜੇਮਿਨੀ ਨੂੰ ਤੁਹਾਡੇ ਦੁਆਰਾ ਗੱਲ ਕਰਨ ਵਾਲੇ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਵਿੱਚ ਧੱਕ ਰਿਹਾ ਹੈ ਜੋ ਮੀਡੀਆ ਨੂੰ ਦੇਖਦਾ, ਸੁਣਦਾ ਅਤੇ ਪੈਦਾ ਕਰਦਾ ਹੈ। OpenAI, ElevenLabs, ਅਤੇ ਉਸੇ ਖੇਤਰ ਵਿੱਚ ਮੁਕਾਬਲਾ ਕਰਨ ਵਾਲੇ ਵੀਡੀਓ ਸਟਾਰਟਅਪਸ ਦੇ ਇੱਕ ਸਮੂਹ ਦੇ ਨਾਲ, 2.6 ਪ੍ਰਤੀਸ਼ਤ ਸ਼ਬਦ ਗਲਤੀ ਦਰ ਅਤੇ 40-ਸਕਿੰਟ ਦੇ ਅਨੁਕੂਲ ਦ੍ਰਿਸ਼ ਉਤਪਾਦਨ ਵਰਕਲੋਡ ਲਈ Google ਦੀ ਸ਼ੁਰੂਆਤੀ ਬੋਲੀ ਹਨ ਜੋ ਅਸਲ ਵਿੱਚ ਮਾਲੀਆ ਪੈਦਾ ਕਰਦੇ ਹਨ — ਵੌਇਸ ਏਜੰਟ, ਕੈਪਸ਼ਨਿੰਗ ਪਾਈਪਲਾਈਨਾਂ, ਅਤੇ ਰਚਨਾਤਮਕ ਸਾਧਨ। ਡਿਵੈਲਪਰ ਅੱਜ ਗੂਗਲ ਏਆਈ ਸਟੂਡੀਓ ਵਿੱਚ ਦੋਵਾਂ ਮਾਡਲਾਂ ਨਾਲ ਬਿਲਡਿੰਗ ਸ਼ੁਰੂ ਕਰ ਸਕਦੇ ਹਨ।

ਸ਼ਬਦ ਗਲਤੀ ਦਰ ਅਜੇ ਵੀ ਮਹੱਤਵਪੂਰਨ ਕਿਉਂ ਹੈ

ਸ਼ਬਦ ਅਸ਼ੁੱਧੀ ਦਰ ਇੱਕ ਅਕਾਦਮਿਕ ਅੰਕੜਿਆਂ ਵਾਂਗ ਜਾਪਦੀ ਹੈ, ਪਰ ਉਤਪਾਦਨ ਵਿੱਚ ਇਹ ਇੱਕ ਵੌਇਸ ਉਤਪਾਦ ਜੋ ਕੰਮ ਕਰਦਾ ਹੈ ਅਤੇ ਇੱਕ ਜੋ ਨਿਰਾਸ਼ ਕਰਦਾ ਹੈ ਵਿੱਚ ਅੰਤਰ ਹੈ। ਇੱਕ ਵੌਇਸ ਏਜੰਟ ਵਿੱਚ ਹਰ ਗਲਤ ਸਮਝਿਆ ਗਿਆ ਵਾਕ ਇੱਕ ਕੰਮ ਨੂੰ ਤੋੜਦਾ ਹੈ: ਇੱਕ ਗਲਤ ਸੁਣਾਈ ਗਈ ਆਰਡਰ ਆਈਡੀ ਇੱਕ ਅਸਫਲ ਖੋਜ ਨੂੰ ਚਾਲੂ ਕਰਦੀ ਹੈ, ਇੱਕ ਖਰਾਬ ਪਤਾ ਗਲਤ ਸ਼ਹਿਰ ਨੂੰ ਇੱਕ ਪੈਕੇਜ ਭੇਜਦਾ ਹੈ। ਇਹੀ ਕਾਰਨ ਹੈ ਕਿ ਗੈਰ-ਸਟ੍ਰੀਮਿੰਗ ਆਡੀਓ 'ਤੇ 2.6 ਪ੍ਰਤੀਸ਼ਤ WER ਅਤੇ ਉੱਚ-ਸਿੰਗਲ-ਅੰਕ ਦੀਆਂ ਦਰਾਂ ਜੋ ਕਿ ਮਾਡਲਾਂ ਦੀ ਇੱਕ ਪੀੜ੍ਹੀ ਤੋਂ ਪਹਿਲਾਂ ਆਮ ਸਨ, ਵਰਤੋਂਯੋਗਤਾ ਵਿੱਚ ਇੱਕ ਕ੍ਰਮ-ਦੇ-ਮਾਣ ਦੇ ਅੰਤਰ ਵਿੱਚ ਮਿਸ਼ਰਤ ਹਨ।

ਗੂਗਲ ਨੇ ਰਿਪੋਰਟ ਕੀਤੇ ਦੋ ਮੋਡਾਂ ਵਿਚਕਾਰ ਅੰਤਰ ਆਰਕੀਟੈਕਟਾਂ ਲਈ ਵੀ ਮਾਇਨੇ ਰੱਖਦਾ ਹੈ। ਸਟ੍ਰੀਮਿੰਗ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ — 4.0 ਪ੍ਰਤੀਸ਼ਤ WER ਅੰਕੜਾ — ਸਬ-ਸੈਕਿੰਡ ਲੇਟੈਂਸੀ ਲਈ ਕੁਝ ਸ਼ੁੱਧਤਾ ਦਾ ਵਪਾਰ ਕਰਦਾ ਹੈ, ਜੋ ਕਿ ਲਾਈਵ ਵੌਇਸ ਏਜੰਟਾਂ ਵਰਗੇ ਇੰਟਰਐਕਟਿਵ ਵਰਤੋਂ ਦੇ ਮਾਮਲਿਆਂ ਲਈ ਲੋੜੀਂਦਾ ਹੈ। ਰਿਕਾਰਡ ਕੀਤੇ ਆਡੀਓ ਦਾ ਬੈਚ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਹੌਲੀ ਚੱਲਦਾ ਹੈ ਪਰ 2.6 ਪ੍ਰਤੀਸ਼ਤ ਤੱਕ ਪਹੁੰਚਦਾ ਹੈ, ਜਿਸ ਕਾਰਨ ਪੋਸਟ-ਕਾਲ ਵਿਸ਼ਲੇਸ਼ਣ ਅਤੇ ਆਰਕਾਈਵ ਪ੍ਰੋਸੈਸਿੰਗ ਵਧੇਰੇ ਮੰਗ ਨੂੰ ਬਰਦਾਸ਼ਤ ਕਰ ਸਕਦੀ ਹੈ। ਇੱਕ ਵਿਵਸਥਿਤ ਸੈਟਿੰਗ ਦੀ ਬਜਾਏ ਦੋਨਾਂ ਨੂੰ ਵੱਖਰੇ ਮਾਡਲ ਅੰਤਮ ਬਿੰਦੂਆਂ ਦੇ ਰੂਪ ਵਿੱਚ ਉਜਾਗਰ ਕਰਨ ਦਾ Google ਦਾ ਫੈਸਲਾ ਇਹ ਮੰਨਦਾ ਹੈ ਕਿ ਡਿਵੈਲਪਰ ਉਸ ਵਪਾਰ ਦੇ ਦੋਵੇਂ ਪਾਸੇ ਵੱਖ-ਵੱਖ ਉਤਪਾਦ ਬਣਾਉਂਦੇ ਹਨ।

ਵੀਡੀਓ ਉਤਪਾਦਨ ਲਈ ਇੱਕ ਟਾਇਰਡ ਵਰਕਫਲੋ

ਓਮਨੀ 1.1 ਫਲੈਸ਼ ਅੱਪਡੇਟ ਇਸ ਬਾਰੇ ਬਰਾਬਰ ਵਿਹਾਰਕ ਹੈ ਕਿ ਰਚਨਾਤਮਕ ਕੰਮ ਅਸਲ ਵਿੱਚ ਕਿਵੇਂ ਹੁੰਦਾ ਹੈ। ਜਨਰੇਟਿਵ ਵੀਡੀਓ ਨੂੰ ਦੁਹਰਾਉਣਾ ਮਹਿੰਗਾ ਰਿਹਾ ਹੈ: ਹਰ ਪ੍ਰੋਂਪਟ ਪ੍ਰਯੋਗ ਦਾ ਮਤਲਬ ਇੱਕ ਪੂਰਾ ਰੈਂਡਰ ਹੁੰਦਾ ਹੈ। ਨਵਾਂ 360p ਪੂਰਵਦਰਸ਼ਨ ਮੋਡ ਖੋਜ ਨੂੰ ਡਿਲੀਵਰੀ ਤੋਂ ਵੱਖ ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਸਿਰਜਣਹਾਰਾਂ ਨੂੰ ਸਸਤੇ ਰੂਪ ਵਿੱਚ ਤਤਕਾਲ ਭਿੰਨਤਾਵਾਂ ਰਾਹੀਂ ਚੱਕਰ ਲਗਾਉਣ ਦੀ ਇਜਾਜ਼ਤ ਮਿਲਦੀ ਹੈ ਅਤੇ ਸਮੀਖਿਆ ਤੋਂ ਬਚਣ ਵਾਲੇ ਸ਼ਾਟਸ 'ਤੇ ਸਿਰਫ਼ 4K ਅੱਪਸਕੇਲਿੰਗ ਲਈ ਭੁਗਤਾਨ ਕੀਤਾ ਜਾਂਦਾ ਹੈ।

ਸੀਨ ਐਕਸਟੈਂਸ਼ਨ ਮਕੈਨਿਕਸ ਤਾਲਮੇਲ ਦੀ ਸਮੱਸਿਆ ਨੂੰ ਸੰਬੋਧਿਤ ਕਰਦੇ ਹਨ ਜਿਸ ਨੇ ਏਆਈ ਵੀਡੀਓ ਨੂੰ ਕਲਿੱਪ-ਆਕਾਰ ਦੇ ਗੇਟੋ ਵਿੱਚ ਰੱਖਿਆ ਹੈ। ਸਿਰਫ਼ ਅੰਤਿਮ ਫ੍ਰੇਮ ਦੀ ਬਜਾਏ 10 ਸਕਿੰਟਾਂ ਦੇ ਪੁਰਾਣੇ ਸੰਦਰਭ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰਕੇ, ਮਾਡਲ ਅੱਖਰਾਂ, ਰੋਸ਼ਨੀ ਅਤੇ ਵਿਜ਼ੂਅਲ ਸ਼ੈਲੀ ਨੂੰ ਇਕਸਾਰ ਰੱਖਦੇ ਹੋਏ 10-ਸਕਿੰਟ ਦੇ ਵਾਧੇ ਵਿੱਚ 40 ਸਕਿੰਟਾਂ ਤੱਕ ਇੱਕ ਦ੍ਰਿਸ਼ ਨੂੰ ਵਧਾ ਸਕਦਾ ਹੈ। ਪਹਿਲੇ-ਅਤੇ-ਆਖਰੀ-ਫ੍ਰੇਮ ਇੰਟਰਪੋਲੇਸ਼ਨ ਦੇ ਨਾਲ ਮਿਲਾ ਕੇ - ਜੋ ਸੰਪਾਦਕਾਂ ਨੂੰ ਨਿਰਣਾਇਕ ਨਿਯੰਤਰਣ ਪੁਆਇੰਟ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ, ਰਵਾਇਤੀ ਸੰਪਾਦਨ ਵਿੱਚ ਮਾਰਕਰਸ ਦੇ ਅੰਦਰ ਅਤੇ ਬਾਹਰ ਕੰਮ ਕਰਨ ਦਾ ਤਰੀਕਾ - AI-ਤਿਆਰ ਫੁਟੇਜ ਉਹਨਾਂ ਨੂੰ ਥੋਕ ਵਿੱਚ ਬਦਲਣ ਦੀ ਬਜਾਏ ਅਸਲ ਪੋਸਟ-ਪ੍ਰੋਡਕਸ਼ਨ ਪਾਈਪਲਾਈਨਾਂ ਵਿੱਚ ਫਿੱਟ ਹੋਣਾ ਸ਼ੁਰੂ ਕਰਦਾ ਹੈ।

ਮੁਕਾਬਲੇ ਵਾਲੀ ਤਸਵੀਰ

ਦੋਵੇਂ ਗੂਗਲ ਨੂੰ ਮੰਜ਼ਿਲ ਦੀ ਬਜਾਏ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਦੇ ਤੌਰ 'ਤੇ ਲਾਂਚ ਕਰਦੇ ਹਨ। ਭਾਸ਼ਣ ਵਿੱਚ, ਗੂਗਲ ਵਿਸ਼ੇਸ਼ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਵਿਕਰੇਤਾਵਾਂ ਅਤੇ ਆਪਣੇ ਕਲਾਉਡ ਵਿਰੋਧੀਆਂ ਦੇ ਵੌਇਸ ਸਟੈਕ ਨੂੰ ਜੈਮਿਨੀ API ਵਿੱਚ ਅਤਿ-ਆਧੁਨਿਕ ਸ਼ੁੱਧਤਾ ਨਾਲ ਜੋੜ ਕੇ ਲੈ ਰਿਹਾ ਹੈ ਜੋ ਇਸਦੇ ਡਿਵੈਲਪਰ ਪਹਿਲਾਂ ਹੀ ਵਰਤ ਰਹੇ ਹਨ। ਵੀਡੀਓ ਵਿੱਚ, ਇਹ ਕੱਚੇ ਤਮਾਸ਼ੇ 'ਤੇ ਨਿਯੰਤਰਣ ਅਤੇ ਵਰਕਫਲੋ ਏਕੀਕਰਣ 'ਤੇ ਜ਼ੋਰ ਦੇ ਕੇ ਚੰਗੀ ਤਰ੍ਹਾਂ ਫੰਡ ਪ੍ਰਾਪਤ ਸਟਾਰਟਅਪਸ ਨਾਲ ਭਰੀ ਮਾਰਕੀਟ ਵਿੱਚ ਮੁਕਾਬਲਾ ਕਰ ਰਿਹਾ ਹੈ।

ਵੰਡ ਲਾਭ ਨਿਰਣਾਇਕ ਕਾਰਕ ਹੋ ਸਕਦਾ ਹੈ। ਉਹੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਮਾਡਲ ਜਿਸ ਨੂੰ ਡਿਵੈਲਪਰ Gemini API ਤੋਂ ਕਾਲ ਕਰ ਸਕਦੇ ਹਨ, ਪਹਿਲਾਂ ਹੀ Android 'ਤੇ Gboard ਦੇ Rambler dictation, macOS 'ਤੇ Gemini ਐਪ, Google Antigravity, ਅਤੇ Chrome ਨੂੰ ਸ਼ਕਤੀ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ — ਭਾਵ Google ਵਿਭਿੰਨ ਰੀਅਲ-ਵਰਲਡ ਆਡੀਓ ਨੂੰ ਇਕੱਠਾ ਕਰਦੇ ਹੋਏ ਅਰਬਾਂ ਉਪਭੋਗਤਾ ਇੰਟਰੈਕਸ਼ਨਾਂ ਵਿੱਚ ਮਾਡਲ ਵਿਕਾਸ ਨੂੰ ਸੋਧ ਸਕਦਾ ਹੈ ਜੋ ਇਸਨੂੰ ਸੁਧਾਰਦਾ ਰਹਿੰਦਾ ਹੈ। 2026 ਵਿੱਚ ਇੱਕ ਭਾਸ਼ਣ ਜਾਂ ਵੀਡੀਓ ਸਟੈਕ ਦੀ ਚੋਣ ਕਰਨ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ ਲਈ, ਉਹ ਫਲਾਈਵ੍ਹੀਲ ਹੁਣ ਪਿੱਚ ਦਾ ਹਿੱਸਾ ਹੈ।

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →