Sakana AI ਨੇ "Beyond Imitation," ਪ੍ਰਕਾਸ਼ਿਤ ਕੀਤਾ ਹੈ ਟਰਾਂਜੈਕਸ਼ਨਜ਼ ਆਨ ਮਸ਼ੀਨ ਲਰਨਿੰਗ ਰਿਸਰਚ (TMLR) ਜਰਨਲ ਵਿੱਚ ਇੱਕ ਖੋਜ ਪੱਤਰ ਜਿਸ ਵਿੱਚ ਮਨੁੱਖੀ ਸਮੀਖਿਆਵਾਂ ਦੀ ਨਕਲ ਕਰਨ ਦੀ ਬਜਾਏ ਗਲਤੀ ਖੋਜਣ ਦੇ ਆਲੇ ਦੁਆਲੇ ਬਣੇ ਇੱਕ LLM-ਸਹਾਇਤਾ ਪ੍ਰਾਪਤ ਪੀਅਰ ਸਮੀਖਿਆ ਪ੍ਰਣਾਲੀ ਦਾ ਵਰਣਨ ਕੀਤਾ ਗਿਆ ਹੈ, MarkTechPost ਨੇ 10 ਅਕਤੂਬਰ ਨੂੰ ਰਿਪੋਰਟ ਕੀਤੀ। ਕੇਂਦਰੀ ਸਵਾਲ ਟੋਕੀਓ-ਅਧਾਰਿਤ ਏਆਈ ਦੀ ਸਮੀਖਿਆ ਦੇ ਜਵਾਬ ਦੇਣ ਦੀ ਬਜਾਏ: ਏਆਈ ਨੂੰ ਕਿਵੇਂ ਬੰਦ ਕਰਨਾ ਹੈ। ਇਸਦਾ ਆਉਟਪੁੱਟ ਮਨੁੱਖੀ ਸਮੀਖਿਆਵਾਂ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ, ਕੀ ਇਹ ਲਗਾਏ ਗਏ ਗਲਤੀ ਨੂੰ ਲੱਭ ਸਕਦਾ ਹੈ?

ਟੀਮ ਨੇ ਦੋ ਕਲਾਕ੍ਰਿਤੀਆਂ ਭੇਜੀਆਂ: ਗਲਤੀ ਖੋਜ ਨੂੰ ਮਾਪਣ ਲਈ ਇੱਕ ਵਿਰੋਧਾਭਾਸੀ ਬੈਂਚਮਾਰਕ, ਅਤੇ ਇੱਕ ਮਲਟੀ-ਲੇਅਰਡ ਰਿਵਿਊ (MLR) ਸਿਸਟਮ ਜੋ ਹਰ ਬੇਸਲਾਈਨ ਟੈਸਟ ਦੀ ਅਗਵਾਈ ਕਰਦਾ ਹੈ। ਪੀਅਰ ਸਮੀਖਿਆ ਨੂੰ ਅੱਗੇ ਵਧਾਉਣ ਲਈ AI ਦੀ ਵਰਤੋਂ ਕਰਨ ਵਿੱਚ ਵਧ ਰਹੀ ਦਿਲਚਸਪੀ ਦੇ ਵਿਚਕਾਰ ਨਤੀਜੇ ਆਉਂਦੇ ਹਨ - ਇੱਕ ਪ੍ਰਕਿਰਿਆ ਜੋ ਸਬਮਿਸ਼ਨ ਦੀ ਵੱਧ ਰਹੀ ਮਾਤਰਾ ਦੇ ਦਬਾਅ ਹੇਠ ਹੈ। ਇਸ ਬਾਰੇ ਹੋਰ ਜਾਣਨ ਲਈ ਕਿ ਕਿਵੇਂ AI ਖੋਜ ਨੂੰ ਆਪਣੇ ਆਪ ਨੂੰ ਮੁੜ ਆਕਾਰ ਦੇ ਰਿਹਾ ਹੈ, ਸਾਡੇ नवीनतम AI ਵਿਕਾਸ ਦੀ ਪਾਲਣਾ ਕਰੋ।

ਲਗਾਏ ਗਏ ਗਲਤੀਆਂ ਦਾ ਇੱਕ ਬੈਂਚਮਾਰਕ

ਕੰਟਰੈਡੀਕਸ਼ਨ ਬੈਂਚਮਾਰਕ ਗਲਤੀਆਂ ਨੂੰ ਅਸਲ ਕਾਗਜ਼ਾਂ ਵਿੱਚ ਪਾਉਂਦਾ ਹੈ ਅਤੇ ਜਾਂਚ ਕਰਦਾ ਹੈ ਕਿ ਕੀ ਸਮੀਖਿਅਕ ਉਹਨਾਂ ਨੂੰ ਫੜਦੇ ਹਨ। ਖੋਜਕਰਤਾਵਾਂ ਨੇ ACL, AISTATS, CVPR, ਅਤੇ ICML 2025, ਪਲੱਸ NeurIPS 2024 ਤੋਂ 257 CC-ਲਾਇਸੰਸਸ਼ੁਦਾ ਕਾਗਜ਼ ਇਕੱਠੇ ਕੀਤੇ, ਫਿਰ ਹਰੇਕ ਪੇਪਰ ਦੇ ਦਾਅਵਿਆਂ, ਸਬੂਤਾਂ ਅਤੇ ਤਰੀਕਿਆਂ ਦਾ ਗਿਆਨ ਗ੍ਰਾਫ ਬਣਾਉਣ ਲਈ Gemini 2.5 Pro ਦੀ ਵਰਤੋਂ ਕੀਤੀ।

ਗੰਭੀਰਤਾ ਨੂੰ ਢਾਂਚਾਗਤ ਤੌਰ 'ਤੇ ਪਰਿਭਾਸ਼ਿਤ ਕੀਤਾ ਗਿਆ ਹੈ: ਕਾਗਜ਼ ਦੇ "ਮੁੱਖ ਦਾਅਵੇ" ਤੋਂ ਇੱਕ ਨੋਡ ਦੀ ਦੂਰੀ ਇਹ ਨਿਰਧਾਰਤ ਕਰਦੀ ਹੈ ਕਿ ਗਲਤੀ ਕਿੰਨੀ ਕੇਂਦਰੀ ਹੈ। ਦੂਰੀ ਜ਼ੀਰੋ ਇੱਕ ਮੁੱਖ ਦਾਅਵੇ ਨੂੰ ਮਾਰਦੀ ਹੈ; ਵੱਡੀਆਂ ਦੂਰੀਆਂ ਸਹਾਇਕ ਵੇਰਵਿਆਂ ਨੂੰ ਮਾਰਦੀਆਂ ਹਨ। GPT-4.1 ਫਿਰ ਇੱਕ ਨੋਡ ਪ੍ਰਤੀ ਦੂਰੀ ਨੂੰ ਇੱਕ ਵਿਰੋਧਾਭਾਸ ਵਿੱਚ ਦੁਬਾਰਾ ਲਿਖਦਾ ਹੈ, ਕੁੱਲ ਮਿਲਾ ਕੇ 1,164 ਡਾਟਾ ਪੁਆਇੰਟ ਪੈਦਾ ਕਰਦਾ ਹੈ। ਇੱਕ o3 ਜੱਜ ਹਰੇਕ ਸਮੀਖਿਆ ਨੂੰ ਦਸ ਵਾਰ ਸਕੋਰ ਕਰਦਾ ਹੈ। ਸਾਫ਼ ਕਾਗਜ਼ਾਂ 'ਤੇ ਜੱਜ 99.9% ਸ਼ੁੱਧਤਾ 'ਤੇ ਪਹੁੰਚਿਆ, ਅਤੇ ਇਸਨੇ ਹੱਥੀਂ ਪੁਸ਼ਟੀ ਕੀਤੇ ਕੈਚਾਂ 'ਤੇ 86.8% ਸੰਵੇਦਨਸ਼ੀਲਤਾ ਦਿਖਾਈ - ਮਤਲਬ ਕਿ ਰਿਪੋਰਟ ਕੀਤੇ ਖੋਜ ਸਕੋਰ ਅਸਲ ਵਿੱਚ ਰੂੜੀਵਾਦੀ ਹੋ ਸਕਦੇ ਹਨ।

ਮਲਟੀ-ਲੇਅਰਡ ਸਮੀਖਿਆ ਕਿਵੇਂ ਕੰਮ ਕਰਦੀ ਹੈ

MLR ਇੱਕ ਏਜੰਟਿਕ ਪ੍ਰਣਾਲੀ ਹੈ ਜੋ ਇੱਕ ਕਾਗਜ਼ ਦੀ ਆਲੋਚਨਾ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਇਸਨੂੰ ਸਮਝਦੀ ਹੈ, ਤਿੰਨ ਵਿਸ਼ੇਸ਼ ਏਜੰਟਾਂ ਦੁਆਰਾ ਇਕੱਠੇ ਕੀਤੇ ਗਏ ਹਨ ਜੋ ਆਫ-ਦੀ-ਸ਼ੈਲਫ ਕਲੌਡ ਮਾਡਲਾਂ 'ਤੇ ਚੱਲ ਰਹੇ ਹਨ - ਕੋਈ GPU ਕਲੱਸਟਰ ਅਤੇ ਕੋਈ ਫਾਈਨ-ਟਿਊਨਿੰਗ ਦੀ ਲੋੜ ਨਹੀਂ ਹੈ:

  • ਅਪੈਂਡਿਕਸ ਏਜੰਟ (ਕਲਾਡ ਹਾਇਕੂ 3.5): ਅੰਤਿਕਾ ਤੋਂ ਪ੍ਰਯੋਗਾਂ ਅਤੇ ਲਾਗੂ ਕਰਨ ਦੇ ਵੇਰਵਿਆਂ ਦਾ ਸਾਰ ਦਿੰਦਾ ਹੈ।
  • ਲਿਟਰੇਚਰ ਰਿਵਿਊ ਏਜੰਟ (ਕਲਾਡ ਸੋਨੈੱਟ 4, ਵਿਕਲਪਿਕ): ਪੇਪਰ ਨੂੰ ਪੁਰਾਣੇ ਕੰਮ ਦੇ ਸੰਦਰਭ ਵਿੱਚ ਰੱਖਣ ਲਈ ਵੈੱਬ ਖੋਜ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ।
  • ਰੀਵਿਊ ਏਜੰਟ (ਕਲਾਡ ਸੋਨੈੱਟ 4): ਕੰਪਿਊਟਰ ਵਿਗਿਆਨੀ ਐਸ. ਕੇਸ਼ਵ ਦੇ ਜਾਣੇ-ਪਛਾਣੇ "ਥ੍ਰੀ-ਪਾਸ ਅਪ੍ਰੋਚ" ਤੋਂ ਪ੍ਰੇਰਿਤ ਇੱਕ ਤਿੰਨ-ਪਾਸ ਪ੍ਰੋਂਪਟ ਚੇਨ ਚਲਾਉਂਦਾ ਹੈ — ਪਹਿਲਾਂ ਇੱਕ ਉੱਚ-ਪੱਧਰੀ ਰੂਪਰੇਖਾ, ਫਿਰ ਇੱਕ ਵਿਸਤ੍ਰਿਤ ਪੜ੍ਹਿਆ ਗਿਆ ਫਲੈਗਿੰਗ ਕਮਜ਼ੋਰੀਆਂ, ਧਾਰਨਾਵਾਂ, ਅਤੇ ਅੰਤਰਾਲ, ਅਤੇ ਅੰਤ ਵਿੱਚ ਇੱਕ ਕਮਜ਼ੋਰੀ, ਇੱਕ ਕਮਜ਼ੋਰੀ, ਇੱਕ ਕਮਜ਼ੋਰ ਸਵਾਲਾਂ ਨੂੰ ਬਾਹਰ ਕੱਢਦਾ ਹੈ। ਸਿਫ਼ਾਰਸ਼, ਇੱਕ ਸਕੋਰ, ਅਤੇ ਇੱਕ ਕਰਨਯੋਗ ਸੂਚੀ।

PDF ਨੂੰ ਮਾਡਲਾਂ ਨੂੰ ਸਿੱਧੇ ਪਾਸ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਇਸਲਈ ਅੰਕੜੇ ਅਤੇ ਸਮੀਕਰਨਾਂ ਦੀ ਪ੍ਰੋਸੈਸਿੰਗ ਬਚ ਜਾਂਦੀ ਹੈ। ਸਿਸਟਮ ਮੁੱਖ ਪਾਠ ਦੇ 10 ਪੰਨਿਆਂ ਤੱਕ ਪੜ੍ਹਦਾ ਹੈ, ਅਤੇ ਸਕਾਨਾ ਪ੍ਰਤੀ ਸਮੀਖਿਆ ਲਗਭਗ $0.47 ਦੀ ਲਾਗਤ ਦਾ ਅਨੁਮਾਨ ਲਗਾਉਂਦਾ ਹੈ।

ਨਤੀਜੇ: ਡਿਜ਼ਾਈਨ ਅਤੇ ਮਾਡਲ ਦੀ ਚੋਣ ਦੋਵੇਂ ਮਾਇਨੇ ਰੱਖਦੇ ਹਨ

MLR ਨੇ ਬੈਂਚਮਾਰਕ 'ਤੇ ਟੈਸਟ ਕੀਤੇ ਸਾਰੇ ਚਾਰ ਪ੍ਰਣਾਲੀਆਂ ਦੀ ਅਗਵਾਈ ਕੀਤੀ। ਚਾਰ ਸੁਤੰਤਰ ਸਮੀਖਿਆਵਾਂ ਦੇ ਨਾਲ, ਇਸਨੇ 73.43% ਕੋਰ-ਦਾਅਵਿਆਂ (ਦੂਰੀ-ਜ਼ੀਰੋ) ਵਿਰੋਧਤਾਈਆਂ ਅਤੇ ਕੁੱਲ ਮਿਲਾ ਕੇ 40.95% ਨੂੰ ਫੜਿਆ। ਸਭ ਤੋਂ ਵਧੀਆ ਬੇਸਲਾਈਨ, ਇੱਕ ਸਿਸਟਮ ਜਿਸਨੂੰ AgentReview ਕਿਹਾ ਜਾਂਦਾ ਹੈ, ਨੇ ਕੋਰ ਦਾਅਵਿਆਂ 'ਤੇ ਸਿਰਫ 14.81% ਦਾ ਪ੍ਰਬੰਧਨ ਕੀਤਾ। ਇੱਥੋਂ ਤੱਕ ਕਿ ਇੱਕ ਸਿੰਗਲ ਐਮਐਲਆਰ ਸਮੀਖਿਆ ਵਿੱਚ 60.79% ਕੋਰ-ਦਾਅਵਿਆਂ ਦੀਆਂ ਗਲਤੀਆਂ ਫੜੀਆਂ ਗਈਆਂ।

ਇੱਕ ਐਬਲੇਸ਼ਨ ਅਧਿਐਨ ਮਾਡਲ ਦੀ ਚੋਣ ਤੋਂ ਡਿਜ਼ਾਈਨ ਦੇ ਯੋਗਦਾਨ ਨੂੰ ਵੱਖ ਕਰਦਾ ਹੈ। ਮੌਜੂਦਾ ਸਮੀਖਿਆ ਪਾਈਪਲਾਈਨ ਦੇ ਅੰਦਰ ਕਲਾਉਡ ਸੋਨੇਟ 4 ਲਈ GPT-4.1 ਨੂੰ ਬਦਲਣ ਨਾਲ ਕੋਰ-ਦਾਅਵਿਆਂ ਦੀ ਖੋਜ ਨੂੰ 14.56% ਤੋਂ 35.40% ਤੱਕ ਵਧਾ ਦਿੱਤਾ ਗਿਆ ਹੈ, ਜਦੋਂ ਕਿ MLR ਦੇ ਮਲਟੀ-ਏਜੰਟ ਡਿਜ਼ਾਈਨ ਨੇ ਇੱਕ ਸਿੰਗਲ ਸਮੀਖਿਆ ਲਈ ਸਿਖਰ 'ਤੇ ਲਗਭਗ 25 ਹੋਰ ਪ੍ਰਤੀਸ਼ਤ ਅੰਕ ਸ਼ਾਮਲ ਕੀਤੇ ਹਨ। ਖੋਜ ਦੀ ਸ਼ੁੱਧਤਾ ਘਟਦੀ ਹੈ ਕਿਉਂਕਿ ਤਰੁੱਟੀਆਂ ਮੁੱਖ ਦਾਅਵੇ ਤੋਂ ਦੂਰ ਹੋ ਜਾਂਦੀਆਂ ਹਨ, ਜੋ ਲੇਖਕ ਕਹਿੰਦੇ ਹਨ ਕਿ ਗੰਭੀਰਤਾ ਸਕੋਰਿੰਗ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ।

ਤਸਵੀਰ ਗੁੰਝਲਦਾਰ, ਅਸਲ-ਸੰਸਾਰ ਡੇਟਾ 'ਤੇ ਗੂੜ੍ਹੀ ਹੋ ਜਾਂਦੀ ਹੈ। WithdrarXiv-Check 'ਤੇ, 211 ਅਸਲ ਵਿੱਚ ਵਾਪਸ ਲਏ ਗਏ arXiv ਪੇਪਰਾਂ ਦਾ ਇੱਕ ਸੈੱਟ, MLR ਨੇ "ਸਮਾਨ" ਮੈਚਾਂ 'ਤੇ 26.07% ਅਤੇ ਸਟੀਕ ਮੈਚਾਂ 'ਤੇ 16.11% ਸਕੋਰ ਕੀਤੇ — ਅਤੇ ਸਿਸਟਮ ਹੱਥ-ਲਿਖਤ ਟੈਕਸਟ ਵਿੱਚ ਲਗਾਏ ਗਏ ਲੁਕਵੇਂ ਪ੍ਰੋਂਪਟ ਇੰਜੈਕਸ਼ਨ ਲਈ ਕਮਜ਼ੋਰ ਰਹਿੰਦਾ ਹੈ। ਅਸਲ ਵਾਪਸ ਲਏ ਕਾਗਜ਼ਾਂ ਨੂੰ ਪੜ੍ਹਨਾ, ਦੂਜੇ ਸ਼ਬਦਾਂ ਵਿੱਚ, ਸਿੰਥੈਟਿਕ ਵਿਰੋਧਾਭਾਸ ਨੂੰ ਫੜਨ ਨਾਲੋਂ ਬਹੁਤ ਔਖਾ ਹੈ।

ਪੀਅਰ ਸਮੀਖਿਆ ਲਈ ਇਸਦਾ ਕੀ ਅਰਥ ਹੈ

ਅਧਿਐਨ ਦਾ ਸਭ ਤੋਂ ਪ੍ਰੈਕਟੀਕਲ ਟੇਕਅਵੇ ਇਸ ਦਾ ਘੱਟ ਤੋਂ ਘੱਟ ਗਲੈਮਰਸ ਹੋ ਸਕਦਾ ਹੈ: ਸਿਸਟਮ ਡਿਜ਼ਾਈਨ ਅਤੇ ਮਾਡਲ ਵਿਕਲਪ ਦੋਵੇਂ ਗਲਤੀ ਖੋਜ ਨੂੰ ਭੌਤਿਕ ਤੌਰ 'ਤੇ ਮੂਵ ਕਰਦੇ ਹਨ, ਅਤੇ ਸਮੀਖਿਅਕ ਜੋ ਨਿਰਣਾ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਪੜ੍ਹਦੇ ਹਨ ਉਨ੍ਹਾਂ ਨਾਲੋਂ ਕਿਤੇ ਜ਼ਿਆਦਾ ਗੰਭੀਰ ਗਲਤੀਆਂ ਲੱਭਦੇ ਹਨ ਜੋ ਮਨੁੱਖੀ ਸਮੀਖਿਆ ਟੈਕਸਟ 'ਤੇ ਪੈਟਰਨ ਨਾਲ ਮੇਲ ਖਾਂਦੇ ਹਨ। ਇਹ ਅੰਤਰ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿਉਂਕਿ AI-ਸਹਾਇਤਾ ਪ੍ਰਾਪਤ ਸਮੀਖਿਆ 'ਤੇ ਜ਼ਿਆਦਾਤਰ ਪੁਰਾਣੇ ਕੰਮ ਮਨੁੱਖੀ ਨਿਰਣੇ ਨਾਲ ਸਮਝੌਤੇ ਲਈ ਅਨੁਕੂਲਿਤ ਕੀਤੇ ਗਏ ਹਨ - ਇੱਕ ਮੈਟ੍ਰਿਕ ਜੋ ਅਸਲ ਜਾਂਚ ਦੀ ਬਜਾਏ ਆਤਮ-ਵਿਸ਼ਵਾਸ ਭਰਪੂਰ ਅਨੁਕੂਲਤਾ ਨੂੰ ਇਨਾਮ ਦਿੰਦਾ ਹੈ।

ਸਕਾਨਾ ਦੇ ਨਤੀਜੇ ਇਹ ਸੁਝਾਅ ਨਹੀਂ ਦਿੰਦੇ ਹਨ ਕਿ AI ਮਨੁੱਖੀ ਰੈਫਰੀ ਨੂੰ ਬਦਲਣ ਲਈ ਤਿਆਰ ਹੈ - ਇੱਕ ਪ੍ਰਣਾਲੀ ਜੋ ਅਸਲ ਵਾਪਸ ਲਏ ਗਏ ਕਾਗਜ਼ਾਂ 'ਤੇ ਜ਼ਿਆਦਾਤਰ ਗਲਤੀਆਂ ਨੂੰ ਖੁੰਝਾਉਂਦੀ ਹੈ ਅਤੇ ਏਮਬੈਡਡ ਪ੍ਰੋਂਪਟ ਦੁਆਰਾ ਹੇਰਾਫੇਰੀ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ, ਇੱਕ ਸਹਾਇਕ ਪਰਤ ਵਜੋਂ ਸਭ ਤੋਂ ਵਧੀਆ ਮੰਨਿਆ ਜਾਂਦਾ ਹੈ, ਨਾ ਕਿ ਇੱਕ ਅਥਾਰਟੀ। ਬੈਂਚਮਾਰਕ ਦੀਆਂ ਸਿੰਥੈਟਿਕ ਤਰੁਟੀਆਂ ਅੰਕੜਾਤਮਕ ਅਸਪਸ਼ਟਤਾਵਾਂ ਅਤੇ ਮੁਕਾਬਲੇ ਵਾਲੀਆਂ ਵਿਆਖਿਆਵਾਂ ਨਾਲੋਂ ਵੀ ਸਾਫ਼ ਹਨ ਜੋ ਪੀਅਰ ਸਮੀਖਿਆ ਵਿੱਚ ਅਸਲ ਅਸਹਿਮਤੀ 'ਤੇ ਹਾਵੀ ਹੁੰਦੀਆਂ ਹਨ, ਇਸਲਈ ਲਗਾਏ ਗਏ ਵਿਰੋਧਾਭਾਸਾਂ 'ਤੇ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਇੱਕ ਸੀਲਿੰਗ ਵਜੋਂ ਪੜ੍ਹਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ, ਨਾ ਕਿ ਵਾਅਦੇ ਦੇ ਤੌਰ 'ਤੇ।

ਪਰ ਲਗਭਗ $0.47 ਪ੍ਰਤੀ ਸਮੀਖਿਆ 'ਤੇ, ਟੈਸਟ ਕੀਤੇ ਗਏ ਕਿਸੇ ਵੀ ਸਿਸਟਮ ਦੀ ਸਭ ਤੋਂ ਵੱਧ ਤਰੁੱਟੀ-ਖੋਜ ਦਰ ਦੇ ਨਾਲ, MLR ਇੱਕ ਨਜ਼ਦੀਕੀ ਮਿਆਦ ਵੱਲ ਇਸ਼ਾਰਾ ਕਰਦਾ ਹੈ ਜਿੱਥੇ AI ਸਮੀਖਿਅਕ ਵਿਰੋਧਾਭਾਸ ਲਈ ਇੱਕ ਪਹਿਲੀ-ਪਾਸ ਸਕ੍ਰੀਨ ਨੂੰ ਸੰਭਾਲਦੇ ਹਨ ਜਦੋਂ ਕਿ ਮਨੁੱਖੀ ਸਮੀਖਿਅਕ ਨਿਰਣੇ ਦੀਆਂ ਕਾਲਾਂ 'ਤੇ ਕੇਂਦ੍ਰਤ ਕਰਦੇ ਹਨ ਜੋ ਮਸ਼ੀਨਾਂ ਅਜੇ ਵੀ ਨਹੀਂ ਕਰ ਸਕਦੀਆਂ। LLM-ਸਹਾਇਤਾ ਪ੍ਰਾਪਤ ਸਮੀਖਿਆ ਦੇ ਨਾਲ ਪ੍ਰਯੋਗ ਕਰਨ ਵਾਲੇ ਰਸਾਲਿਆਂ ਅਤੇ ਕਾਨਫਰੰਸ ਪ੍ਰਬੰਧਕਾਂ ਕੋਲ ਹੁਣ ਜਨਤਕ ਮਾਪਦੰਡ ਅਤੇ ਉਹਨਾਂ ਦੇ ਆਪਣੇ ਸਿਸਟਮਾਂ ਨੂੰ ਮਾਪਣ ਲਈ ਇੱਕ ਮਜ਼ਬੂਤ ​​ਬੇਸਲਾਈਨ ਦੋਵੇਂ ਹਨ - ਅਤੇ, ਜੇਕਰ 73.43% ਅਤੇ 14.81% ਵਿਚਕਾਰ ਪਾੜਾ ਬਣਿਆ ਰਹਿੰਦਾ ਹੈ, ਤਾਂ ਇੱਕ ਸਪੱਸ਼ਟ ਸੰਕੇਤ ਹੈ ਕਿ ਆਰਕੀਟੈਕਚਰ ਨੂੰ ਪੜ੍ਹਨਾ ਕੱਚੇ ਮਾਡਲ ਆਕਾਰ ਤੋਂ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਹੈ।

---

AI ਤੋਂ ਅੱਗੇ ਰਹੋ

ਨਵੀਨਤਮ AI ਖਬਰਾਂ, ਵਿਸ਼ਲੇਸ਼ਣ ਅਤੇ ਸਫਲਤਾਵਾਂ ਪ੍ਰਾਪਤ ਕਰੋ - ਸਭ ਇੱਕ ਥਾਂ 'ਤੇ।

ਹੋਰ AI ਖਬਰਾਂ ਪੜ੍ਹੋ →