Baidu ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਇੱਕ ਆਪਟੀਕਲ ਅੱਖਰ ਪਛਾਣ (OCR) ਮਾਡਲ ਵਿਕਸਿਤ ਕੀਤਾ ਹੈ ਜੋ ਲਗਾਤਾਰ ਮੈਮੋਰੀ ਵਰਤੋਂ ਅਤੇ ਨਿਰੰਤਰ ਗਤੀ ਨੂੰ ਕਾਇਮ ਰੱਖਦੇ ਹੋਏ ਇੱਕ ਸਿੰਗਲ ਇਨਫਰੈਂਸ ਪਾਸ ਵਿੱਚ ਦਰਜਨਾਂ ਦਸਤਾਵੇਜ਼ ਪੰਨਿਆਂ ਨੂੰ ਪ੍ਰੋਸੈਸ ਕਰਨ ਦੇ ਸਮਰੱਥ ਹੈ। ਸਿਸਟਮ, ਜਿਸਨੂੰ ਅਸੀਮਤ OCR ਕਿਹਾ ਜਾਂਦਾ ਹੈ, ਇਸ ਨੂੰ ਇੱਕ ਨਵੀਂ ਧਿਆਨ ਵਿਧੀ ਦੁਆਰਾ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ ਜਿਸ ਤੋਂ ਪ੍ਰੇਰਿਤ ਹੈ ਕਿ ਕਿਵੇਂ ਮਨੁੱਖ ਹੱਥਾਂ ਦੁਆਰਾ ਟੈਕਸਟ ਦੀ ਨਕਲ ਕਰਦੇ ਹਨ, ਦਸਤਾਵੇਜ਼ AI ਵਿੱਚ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਤਰੱਕੀ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ। AI ਖੋਜ ਅਤੇ ਤਕਨਾਲੋਜੀ ਵਿੱਚ ਨਵੀਨਤਮ ਵਿਕਾਸ ਲਈ, AI Buzz Wire 'ਤੇ ਜਾਓ।

ਕੇਵੀ ਕੈਸ਼ ਬੋਟਲਨੇਕ ਨੂੰ ਦੂਰ ਕਰਨਾ

ਮੌਜੂਦਾ ਐਂਡ-ਟੂ-ਐਂਡ ਓ.ਸੀ.ਆਰ ਸਿਸਟਮ ਜੋ ਭਾਸ਼ਾ ਮਾਡਲਾਂ ਨੂੰ ਉਹਨਾਂ ਦੇ ਡੀਕੋਡਰਾਂ ਵਜੋਂ ਵਰਤਦੇ ਹਨ, ਇੱਕ ਬੁਨਿਆਦੀ ਆਰਕੀਟੈਕਚਰਲ ਸੀਮਾ ਦਾ ਸਾਹਮਣਾ ਕਰਦੇ ਹਨ। ਜਿਵੇਂ ਕਿ ਇੱਕ ਮਾਡਲ ਟੈਕਸਟ ਦੀ ਪ੍ਰਕਿਰਿਆ ਕਰਦਾ ਹੈ, ਇਹ ਪਹਿਲਾਂ ਪ੍ਰੋਸੈਸ ਕੀਤੇ ਟੋਕਨਾਂ ਬਾਰੇ ਜਾਣਕਾਰੀ ਨੂੰ KV ਕੈਸ਼ ਨਾਮਕ ਇੱਕ ਬਫਰ ਵਿੱਚ ਸਟੋਰ ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਇਹ ਪੀੜ੍ਹੀ ਦੇ ਦੌਰਾਨ ਪੁਰਾਣੀ ਸਮੱਗਰੀ ਦਾ ਹਵਾਲਾ ਦਿੰਦਾ ਹੈ। ਇਹ ਬਫਰ ਟੈਕਸਟ ਦੀ ਹਰ ਨਵੀਂ ਲਾਈਨ ਦੇ ਨਾਲ ਵਧਦਾ ਹੈ, ਲਗਾਤਾਰ ਮੈਮੋਰੀ ਦੀ ਖਪਤ ਵਧਾਉਂਦਾ ਹੈ ਅਤੇ ਪੀੜ੍ਹੀ ਦੀ ਗਤੀ ਨੂੰ ਹੌਲੀ ਕਰਦਾ ਹੈ।

ਅਭਿਆਸ ਵਿੱਚ, ਮੌਜੂਦਾ ਸਿਸਟਮ ਇੱਕ ਲੂਪ ਵਿੱਚ ਇੱਕ ਪੰਨੇ ਦੁਆਰਾ ਦਸਤਾਵੇਜ਼ਾਂ ਦੇ ਪੰਨੇ ਦੀ ਪ੍ਰਕਿਰਿਆ ਕਰਕੇ, ਹਰੇਕ ਪੰਨੇ ਦੇ ਪੂਰਾ ਹੋਣ ਤੋਂ ਬਾਅਦ ਕੈਸ਼ ਨੂੰ ਰੀਸੈਟ ਕਰਕੇ ਇਸ ਰੁਕਾਵਟ ਦੇ ਆਲੇ-ਦੁਆਲੇ ਕੰਮ ਕਰਦੇ ਹਨ। ਇਹ ਪਹੁੰਚ ਕੰਮ ਕਰਦੀ ਹੈ ਪਰ ਅਕੁਸ਼ਲਤਾਵਾਂ ਨੂੰ ਪੇਸ਼ ਕਰਦੀ ਹੈ ਅਤੇ ਮਾਡਲ ਨੂੰ ਪੰਨੇ ਦੀਆਂ ਸੀਮਾਵਾਂ ਵਿੱਚ ਸੰਦਰਭ ਬਣਾਈ ਰੱਖਣ ਤੋਂ ਰੋਕਦੀ ਹੈ। Baidu ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਆਪਣੀ ਤਕਨੀਕੀ ਰਿਪੋਰਟ ਵਿੱਚ ਨੋਟ ਕੀਤਾ ਹੈ ਕਿ ਕੋਈ ਵੀ ਮੌਜੂਦਾ OCR ਮਾਡਲ ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਵਿੱਚ ਲਗਭਗ ਦਸ ਪੰਨਿਆਂ ਤੋਂ ਵੱਧ ਹੈਂਡਲ ਨਹੀਂ ਕਰਦਾ।

ਅਸੀਮਤ OCR ਇਸ ਰੁਕਾਵਟ ਨੂੰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਖਤਮ ਕਰ ਦਿੰਦਾ ਹੈ। ਧਿਆਨ ਵਿਧੀ ਨੂੰ ਮੁੜ-ਡਿਜ਼ਾਇਨ ਕਰਕੇ ਜੋ ਇਹ ਨਿਯੰਤ੍ਰਿਤ ਕਰਦਾ ਹੈ ਕਿ ਮਾਡਲ ਇਸਦੇ ਕੈਸ਼ ਤੱਕ ਕਿਵੇਂ ਪਹੁੰਚਦਾ ਹੈ, ਸਿਸਟਮ ਮੈਮੋਰੀ ਦੀ ਵਰਤੋਂ ਨੂੰ ਨਿਰੰਤਰ ਰੱਖਦਾ ਹੈ ਭਾਵੇਂ ਇਹ ਕਿੰਨੇ ਪੰਨਿਆਂ 'ਤੇ ਪ੍ਰਕਿਰਿਆ ਕਰਦਾ ਹੈ।

ਹਵਾਲਾ ਸਲਾਈਡਿੰਗ ਵਿੰਡੋ ਅਟੈਂਸ਼ਨ ਕਿਵੇਂ ਕੰਮ ਕਰਦੀ ਹੈ

ਮੁੱਖ ਨਵੀਨਤਾ ਉਹ ਹੈ ਜਿਸ ਨੂੰ Baidu ਟੀਮ ਰੈਫਰੈਂਸ ਸਲਾਈਡਿੰਗ ਵਿੰਡੋ ਅਟੈਂਸ਼ਨ (R-SWA) ਕਹਿੰਦੀ ਹੈ। ਇਹ ਵਿਧੀ ਮਨੁੱਖੀ ਸਮਾਨਤਾ ਤੋਂ ਖਿੱਚੀ ਗਈ ਇੱਕ ਸਧਾਰਨ ਪਰ ਸ਼ਕਤੀਸ਼ਾਲੀ ਸੂਝ 'ਤੇ ਬਣਾਈ ਗਈ ਹੈ: ਜਦੋਂ ਕੋਈ ਵਿਅਕਤੀ ਕਿਸੇ ਕਿਤਾਬ ਤੋਂ ਟੈਕਸਟ ਦੀ ਨਕਲ ਕਰਦਾ ਹੈ, ਤਾਂ ਉਹ ਪਹਿਲਾਂ ਤੋਂ ਲਿਖੀ ਗਈ ਹਰ ਚੀਜ਼ ਨੂੰ ਲਗਾਤਾਰ ਦੁਬਾਰਾ ਨਹੀਂ ਪੜ੍ਹਦਾ ਹੈ। ਇਸ ਦੀ ਬਜਾਏ, ਉਹ ਆਪਣਾ ਧਿਆਨ ਸਰੋਤ ਸਮੱਗਰੀ 'ਤੇ ਕੇਂਦ੍ਰਿਤ ਰੱਖਦੇ ਹਨ, ਪਿਛਲੇ ਕੁਝ ਅੱਖਰ ਜੋ ਉਹਨਾਂ ਨੇ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕੀਤੇ ਹਨ, ਅਤੇ ਅਗਲੇ ਅੱਖਰ ਨੂੰ ਲਿਖਣਾ ਹੈ। ਪੁਰਾਣੇ ਅੰਸ਼ ਕੁਦਰਤੀ ਤੌਰ 'ਤੇ ਇੱਕ ਕਿਸਮ ਦੀ ਨਰਮ ਭੁੱਲਣ ਦੁਆਰਾ ਕਿਰਿਆਸ਼ੀਲ ਮੈਮੋਰੀ ਤੋਂ ਫਿੱਕੇ ਪੈ ਜਾਂਦੇ ਹਨ।

R-SWA ਵੱਖ-ਵੱਖ ਕਿਸਮਾਂ ਦੇ ਟੋਕਨਾਂ ਨੂੰ ਵੱਖਰੇ ਢੰਗ ਨਾਲ ਵਰਤ ਕੇ ਇਸ ਸਿਧਾਂਤ ਨੂੰ ਲਾਗੂ ਕਰਦਾ ਹੈ। ਹਰੇਕ ਤਿਆਰ ਕੀਤਾ ਟੋਕਨ ਸਾਰੇ ਸੰਦਰਭ ਟੋਕਨਾਂ ਵੱਲ ਪੂਰਾ ਧਿਆਨ ਰੱਖਦਾ ਹੈ - ਵਿਜ਼ੂਅਲ ਚਿੱਤਰ ਟੋਕਨ ਜੋ ਦਸਤਾਵੇਜ਼ ਅਤੇ ਪ੍ਰੋਸੈਸਿੰਗ ਪ੍ਰੋਂਪਟ ਨੂੰ ਏਨਕੋਡ ਕਰਦੇ ਹਨ। ਪਰ ਜਦੋਂ ਇਹ ਪਹਿਲਾਂ ਤਿਆਰ ਕੀਤੇ ਆਉਟਪੁੱਟ ਟੈਕਸਟ ਦੀ ਗੱਲ ਆਉਂਦੀ ਹੈ, ਤਾਂ ਮਾਡਲ ਸਿਰਫ ਸਭ ਤੋਂ ਤਾਜ਼ਾ 128 ਟੋਕਨਾਂ ਨੂੰ ਵੇਖਦਾ ਹੈ.

ਇਹ ਡਿਜ਼ਾਈਨ KV ਕੈਸ਼ ਨੂੰ ਅਗੇਤਰ ਦੀ ਲੰਬਾਈ ਅਤੇ ਵਿੰਡੋ ਦੇ ਆਕਾਰ ਦੇ ਜੋੜ ਦੇ ਬਰਾਬਰ ਨਿਸ਼ਚਿਤ ਆਕਾਰ 'ਤੇ ਰੱਖਦਾ ਹੈ, ਭਾਵੇਂ ਕਿੰਨਾ ਵੀ ਟੈਕਸਟ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੋਵੇ। ਕੈਸ਼ ਇੱਕ ਕਤਾਰ ਦੇ ਰੂਪ ਵਿੱਚ ਕੰਮ ਕਰਦਾ ਹੈ, ਹਰੇਕ ਨਵੇਂ ਟੋਕਨ ਦੇ ਨਾਲ ਸਭ ਤੋਂ ਪੁਰਾਣੇ ਨੂੰ ਬਾਹਰ ਧੱਕਦਾ ਹੈ, ਬੇਅੰਤ ਮੈਮੋਰੀ ਵਿਕਾਸ ਨੂੰ ਰੋਕਦਾ ਹੈ ਜੋ ਮਿਆਰੀ ਧਿਆਨ ਦੇ ਤੰਤਰ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਦਾ ਹੈ।

ਵਿਜ਼ੂਅਲ ਜਾਣਕਾਰੀ ਦੀ ਰੱਖਿਆ ਕਰਨਾ

R-SWA ਵਿੱਚ ਇੱਕ ਨਾਜ਼ੁਕ ਡਿਜ਼ਾਈਨ ਵਿਕਲਪ ਇਹ ਹੈ ਕਿ ਇਹ ਵਿਜ਼ੂਅਲ ਟੋਕਨਾਂ ਨੂੰ ਕਿਵੇਂ ਸੰਭਾਲਦਾ ਹੈ। ਸਟੈਂਡਰਡ ਸਲਾਈਡਿੰਗ ਵਿੰਡੋ ਦਾ ਧਿਆਨ ਸਾਰੇ ਟੋਕਨਾਂ ਨੂੰ ਮੌਜੂਦਾ ਸਥਿਤੀ ਤਬਦੀਲੀਆਂ ਦੇ ਅਧੀਨ ਕਰੇਗਾ, ਹੌਲੀ-ਹੌਲੀ ਚਿੱਤਰ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਨੂੰ ਧੁੰਦਲਾ ਕਰਨਾ ਅਤੇ ਸਮੇਂ ਦੇ ਨਾਲ ਪਛਾਣ ਦੀ ਸ਼ੁੱਧਤਾ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ। R-SWA ਇਹਨਾਂ ਪਰਿਵਰਤਨਾਂ ਤੋਂ ਵਿਜ਼ੂਅਲ ਟੋਕਨਾਂ ਨੂੰ ਛੋਟ ਦਿੰਦਾ ਹੈ — ਇਹ ਇੱਕ ਵਾਰ ਏਨਕੋਡ ਕੀਤੇ ਜਾਂਦੇ ਹਨ ਅਤੇ ਪੂਰੀ ਡੀਕੋਡਿੰਗ ਪ੍ਰਕਿਰਿਆ ਦੌਰਾਨ ਬਦਲਦੇ ਰਹਿੰਦੇ ਹਨ।

OCR ਸ਼ੁੱਧਤਾ ਲਈ ਵਿਜ਼ੂਅਲ ਜਾਣਕਾਰੀ ਦੀ ਇਹ ਸੰਭਾਲ ਜ਼ਰੂਰੀ ਹੈ। ਅਸਲ ਚਿੱਤਰ ਦੀ ਨੁਮਾਇੰਦਗੀ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦੇ ਹੋਏ ਇਹ ਸੀਮਤ ਕਰਦੇ ਹੋਏ ਕਿ ਮਾਡਲ ਆਪਣੇ ਆਉਟਪੁੱਟ ਵਿੱਚ ਕਿੰਨਾ ਪਿੱਛੇ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ, R-SWA ਦੋਵਾਂ ਸੰਸਾਰਾਂ ਵਿੱਚ ਸਭ ਤੋਂ ਵਧੀਆ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ: ਸਥਿਰ ਮੈਮੋਰੀ ਵਰਤੋਂ ਅਤੇ ਭਰੋਸੇਯੋਗ ਟੈਕਸਟ ਪਛਾਣ।

ਆਰਕੀਟੈਕਚਰ ਅਤੇ ਸਿਖਲਾਈ

ਅਸੀਮਤ OCR ਓਪਨ-ਸੋਰਸ ਡੀਪਸੀਕ OCR ਮਾਡਲ ਦੇ ਸਿਖਰ 'ਤੇ ਬਣਾਇਆ ਗਿਆ ਹੈ। Baidu ਆਪਣੇ DeepEncoder ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦਾ ਹੈ, ਜੋ ਇੱਕ 1024-by-1024-ਪਿਕਸਲ PDF ਚਿੱਤਰ ਨੂੰ 256 ਟੋਕਨਾਂ ਤੱਕ ਸੰਕੁਚਿਤ ਕਰਦਾ ਹੈ, ਅਤੇ ਇਸਨੂੰ ਮਾਹਿਰਾਂ ਦੇ ਮਿਸ਼ਰਣ (MoE) ਆਰਕੀਟੈਕਚਰ ਨਾਲ ਜੋੜਦਾ ਹੈ। ਡੀਕੋਡਰ ਦੇ ਕੁੱਲ ਤਿੰਨ ਬਿਲੀਅਨ ਮਾਪਦੰਡ ਹਨ, ਪਰ ਗਣਨਾਤਮਕ ਖਰਚਿਆਂ ਨੂੰ ਪ੍ਰਬੰਧਨ ਯੋਗ ਰੱਖਦੇ ਹੋਏ, ਅਨੁਮਾਨ ਦੇ ਦੌਰਾਨ ਸਿਰਫ ਲਗਭਗ 500 ਮਿਲੀਅਨ ਕਿਰਿਆਸ਼ੀਲ ਹਨ।

ਸਿਸਟਮ ਦੋ ਰੈਜ਼ੋਲਿਊਸ਼ਨ ਮੋਡ ਪੇਸ਼ ਕਰਦਾ ਹੈ। ਬੇਸ ਮੋਡ ਮਲਟੀ-ਪੇਜ ਦਸਤਾਵੇਜ਼ਾਂ ਲਈ ਅਨੁਕੂਲਿਤ ਕੀਤਾ ਗਿਆ ਹੈ, ਜਦੋਂ ਕਿ ਗੁੰਡਮ ਮੋਡ ਸਿੰਗਲ-ਪੇਜ ਪ੍ਰੋਸੈਸਿੰਗ ਲਈ ਡਾਇਨਾਮਿਕ ਰੈਜ਼ੋਲਿਊਸ਼ਨ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ। ਡੀਕੋਡਰ ਵਿੱਚ ਹਰ ਮਿਆਰੀ ਧਿਆਨ ਪਰਤ ਨੂੰ R-SWA ਨਾਲ ਬਦਲਿਆ ਗਿਆ ਸੀ।

ਸਿਖਲਾਈ ਲਗਭਗ 20 ਲੱਖ ਦਸਤਾਵੇਜ਼ਾਂ ਦੇ ਨਮੂਨਿਆਂ 'ਤੇ ਆਯੋਜਿਤ ਕੀਤੀ ਗਈ ਸੀ, ਸਿੰਗਲ-ਪੇਜ ਅਤੇ ਮਲਟੀ-ਪੇਜ ਡੇਟਾ ਦੇ ਵਿਚਕਾਰ ਨੌ-ਤੋਂ-ਇੱਕ ਨੂੰ ਵੰਡਿਆ ਗਿਆ ਸੀ। PaddleOCR ਨੇ ਸਿੰਗਲ ਪੰਨਿਆਂ ਲਈ ਐਨੋਟੇਸ਼ਨ ਨੂੰ ਸੰਭਾਲਿਆ, ਜਦੋਂ ਕਿ ਬਹੁ-ਪੰਨਿਆਂ ਦੇ ਡੇਟਾ ਨੂੰ ਦੋ ਤੋਂ ਪੰਜਾਹ ਪੰਨਿਆਂ ਤੱਕ ਦੇ ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚ ਸਿੰਗਲ ਪੰਨਿਆਂ ਨੂੰ ਜੋੜ ਕੇ ਸਿੰਥੈਟਿਕ ਰੂਪ ਵਿੱਚ ਬਣਾਇਆ ਗਿਆ ਸੀ। ਸਾਰੇ ਸਿਖਲਾਈ ਡੇਟਾ ਨੂੰ 32,000 ਟੋਕਨਾਂ ਦੇ ਕ੍ਰਮ ਵਿੱਚ ਪੈਕ ਕੀਤਾ ਗਿਆ ਸੀ, ਅਤੇ ਸਿਖਲਾਈ 16 Nvidia A800 GPU ਦੇ 8 ਸੈੱਟਾਂ 'ਤੇ 4,000 ਕਦਮਾਂ ਲਈ ਚੱਲੀ ਸੀ। DeepEncoder ਸਿਖਲਾਈ ਦੌਰਾਨ ਫ੍ਰੀਜ਼ ਕੀਤਾ ਗਿਆ, ਸਿਰਫ਼ ਭਾਸ਼ਾ ਮਾਡਲ ਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਅੱਪਡੇਟ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ।

ਬੈਂਚਮਾਰਕ ਨਤੀਜੇ

ਅਸੀਮਤ OCR ਮਲਟੀਪਲ ਮੁਲਾਂਕਣ ਮੈਟ੍ਰਿਕਸ ਵਿੱਚ ਮਜ਼ਬੂਤ ਪ੍ਰਦਰਸ਼ਨ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ। OmniDocBench v1.5 ਦਸਤਾਵੇਜ਼ ਬੈਂਚਮਾਰਕ 'ਤੇ, ਮਾਡਲ ਨੇ ਕੁੱਲ ਮਿਲਾ ਕੇ 93 ਪ੍ਰਤੀਸ਼ਤ ਸਕੋਰ ਕੀਤਾ, ਡੀਪਸੀਕ OCR ਬੇਸਲਾਈਨ ਤੋਂ ਛੇ ਪ੍ਰਤੀਸ਼ਤ ਅੰਕ ਵੱਧ।

ਨਾਜ਼ੁਕ ਲੰਬੇ-ਹਰੀਜੋਨ ਟੈਸਟ ਵਿੱਚ - ਜਿੱਥੇ ਮਾਡਲ ਇੱਕ ਸਿੰਗਲ ਪਾਸ ਵਿੱਚ ਬਹੁਤ ਸਾਰੇ ਪੰਨਿਆਂ ਦੀ ਪ੍ਰਕਿਰਿਆ ਕਰਦਾ ਹੈ - ਗਲਤੀ ਦਰ 40 ਪੰਨਿਆਂ ਤੋਂ ਬਾਅਦ ਵੀ 0.11 ਤੋਂ ਹੇਠਾਂ ਰਹਿੰਦੀ ਹੈ। ਖੋਜਕਰਤਾ ਬਾਕੀ ਬਚੀਆਂ ਗਲਤੀਆਂ ਦਾ ਕਾਰਨ ਗੁੰਮ ਹੋਏ ਸੰਦਰਭ ਨੂੰ ਨਹੀਂ ਬਲਕਿ ਬੇਸ ਮੋਡ ਵਿੱਚ ਡੀਪ ਐਨਕੋਡਰ ਦੀ ਰੈਜ਼ੋਲੂਸ਼ਨ ਸੀਮਾ ਨੂੰ ਦਿੰਦੇ ਹਨ, ਜਿੱਥੇ ਬਹੁਤ ਛੋਟੇ ਟੈਕਸਟ ਨੂੰ ਪਛਾਣਨਾ ਮੁਸ਼ਕਲ ਹੋ ਜਾਂਦਾ ਹੈ।

ਪ੍ਰਤਿਬੰਧਿਤ ਧਿਆਨ ਵਿੰਡੋ ਇੱਕ ਅਚਾਨਕ ਲਾਭ ਵੀ ਦਿੰਦੀ ਹੈ। ਸਿੰਗਲ-ਪੰਨੇ ਦੇ ਦਸਤਾਵੇਜ਼ਾਂ 'ਤੇ, ਵਿੰਡੋ ਨੂੰ 128 ਟੋਕਨਾਂ ਤੱਕ ਸੀਮਿਤ ਕਰਨਾ ਸ਼ੁੱਧਤਾ ਨੂੰ ਨੁਕਸਾਨ ਨਹੀਂ ਪਹੁੰਚਾਉਂਦਾ ਅਤੇ ਅਸਲ ਵਿੱਚ ਇਸ ਵਿੱਚ ਥੋੜ੍ਹਾ ਸੁਧਾਰ ਕਰਦਾ ਹੈ। ਖੋਜਕਰਤਾ ਇਹ ਅਨੁਮਾਨ ਲਗਾਉਂਦੇ ਹਨ ਕਿ R-SWA ਮਾਡਲ ਨੂੰ ਸੰਘਣੇ OCR ਟਾਸਕ 'ਤੇ ਜ਼ਿਆਦਾ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਨ ਲਈ ਮਜ਼ਬੂਰ ਕਰਦਾ ਹੈ, ਜਦੋਂ ਕਿ ਆਉਟਪੁੱਟ ਦੀ ਲੰਬਾਈ ਵਧਣ ਨਾਲ ਪੂਰਾ ਧਿਆਨ ਵਿਭਿੰਨਤਾ ਵੱਲ ਜਾਂਦਾ ਹੈ।

ਸਪੀਡ ਸੁਧਾਰ ਵੀ ਬਰਾਬਰ ਧਿਆਨ ਦੇਣ ਯੋਗ ਹਨ। ਬੇਸ ਮੋਡ ਵਿੱਚ, ਅਸੀਮਤ OCR ਡੀਪਸੀਕ OCR ਲਈ 4,951 ਦੇ ਮੁਕਾਬਲੇ 5,580 ਟੋਕਨ ਪ੍ਰਤੀ ਸਕਿੰਟ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ, ਇੱਕ 12.7 ਪ੍ਰਤੀਸ਼ਤ ਸੁਧਾਰ। ਆਦਰਸ਼ ਸਮਾਨਤਾ ਦੇ ਨਾਲ ਸਿਧਾਂਤਕ ਉੱਪਰੀ-ਬਾਉਂਡ ਤੁਲਨਾ ਵਿੱਚ, ਮਾਡਲ ਲਗਭਗ 6,000 ਆਉਟਪੁੱਟ ਟੋਕਨਾਂ 'ਤੇ 35 ਪ੍ਰਤੀਸ਼ਤ ਦੁਆਰਾ ਬੇਸਲਾਈਨ ਦੀ ਅਗਵਾਈ ਕਰਦਾ ਹੈ।

ਵਿਆਪਕ ਮਹੱਤਤਾ

ਅਸੀਮਤ OCR ਆਰਕੀਟੈਕਚਰ ਦਸਤਾਵੇਜ਼ ਪ੍ਰੋਸੈਸਿੰਗ ਤੋਂ ਪਰੇ ਪ੍ਰਭਾਵਾਂ ਦੇ ਨਾਲ ਇੱਕ ਸਿਧਾਂਤ ਪ੍ਰਦਰਸ਼ਿਤ ਕਰਦਾ ਹੈ। ਚੋਣਵੇਂ ਧਿਆਨ ਦੁਆਰਾ ਯਾਦਦਾਸ਼ਤ ਨੂੰ ਸਥਿਰ ਰੱਖਣ ਦਾ ਵਿਚਾਰ - ਸ਼ੁੱਧ ਸਕੇਲਿੰਗ ਦੀ ਬਜਾਏ ਬੋਧਾਤਮਕ ਵਿਗਿਆਨ ਦੁਆਰਾ ਪ੍ਰੇਰਿਤ - ਐਪਲੀਕੇਸ਼ਨਾਂ ਦੀ ਇੱਕ ਸ਼੍ਰੇਣੀ ਵਿੱਚ ਵਧੇਰੇ ਕੁਸ਼ਲ AI ਪ੍ਰਣਾਲੀਆਂ ਦੇ ਡਿਜ਼ਾਈਨ ਨੂੰ ਸੂਚਿਤ ਕਰ ਸਕਦਾ ਹੈ।

ਜਿਵੇਂ ਕਿ ਸੰਸਥਾਵਾਂ ਵੱਡੇ ਭਾਸ਼ਾ ਮਾਡਲਾਂ ਨੂੰ ਤੈਨਾਤ ਕਰਨ ਦੇ ਕੰਪਿਊਟੇਸ਼ਨਲ ਖਰਚਿਆਂ ਨਾਲ ਜੂਝਦੀਆਂ ਹਨ, ਉਹ ਪਹੁੰਚ ਜੋ ਗੁਣਵੱਤਾ ਦੀ ਕੁਰਬਾਨੀ ਕੀਤੇ ਬਿਨਾਂ ਮੈਮੋਰੀ ਦੀ ਖਪਤ ਨੂੰ ਘਟਾਉਂਦੇ ਹਨ, ਵੱਧ ਤੋਂ ਵੱਧ ਕੀਮਤੀ ਹੁੰਦੇ ਹਨ। Baidu ਦਾ ਕੰਮ ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ ਕਿ ਜੀਵ-ਵਿਗਿਆਨਕ ਅਲੰਕਾਰ, ਜਦੋਂ ਗਣਿਤਿਕ ਵਿਧੀਆਂ ਵਿੱਚ ਅਨੁਵਾਦ ਕੀਤੇ ਜਾਂਦੇ ਹਨ, ਵਿਹਾਰਕ ਇੰਜੀਨੀਅਰਿੰਗ ਸਫਲਤਾਵਾਂ ਪ੍ਰਦਾਨ ਕਰ ਸਕਦੇ ਹਨ।

ਖੋਜ ਬੁਨਿਆਦੀ AI ਖੋਜ ਵਿੱਚ ਚੀਨ ਦੇ ਵਧ ਰਹੇ ਪ੍ਰਭਾਵ ਨੂੰ ਵੀ ਉਜਾਗਰ ਕਰਦੀ ਹੈ। ਹਾਲਾਂਕਿ ਵੱਡੇ ਭਾਸ਼ਾ ਮਾਡਲਾਂ ਵਿੱਚ ਚੀਨੀ ਪ੍ਰਾਪਤੀਆਂ 'ਤੇ ਬਹੁਤ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕੀਤਾ ਗਿਆ ਹੈ, ਅਸੀਮਤ OCR ਵਰਗੇ ਕੰਮ ਇਹ ਦਰਸਾਉਂਦੇ ਹਨ ਕਿ ਚੀਨੀ ਖੋਜਕਰਤਾ ਤੁਰੰਤ ਵਿਹਾਰਕ ਐਪਲੀਕੇਸ਼ਨਾਂ ਦੇ ਨਾਲ ਵਿਸ਼ੇਸ਼ AI ਪ੍ਰਣਾਲੀਆਂ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਯੋਗਦਾਨ ਪਾ ਰਹੇ ਹਨ।

AI ਤੋਂ ਅੱਗੇ ਰਹੋ

AI ਖੋਜ, ਦਸਤਾਵੇਜ਼ AI, ਅਤੇ ਤਕਨਾਲੋਜੀ ਦੀਆਂ ਸਫਲਤਾਵਾਂ ਦੀ ਵਧੇਰੇ ਕਵਰੇਜ ਲਈ, AI Buzz Wire 'ਤੇ ਜਾਓ।

ਹੋਰ AI ਖਬਰਾਂ ਪੜ੍ਹੋ →