ਇੱਕ ਨਵਾਂ ਬੈਂਚਮਾਰਕ ਚੁਣੌਤੀ ਦੇ ਰਿਹਾ ਹੈ ਕਿ ਕਿਵੇਂ AI ਉਦਯੋਗ ਵਿਗਿਆਨਕ ਸਮਰੱਥਾ ਨੂੰ ਮਾਪਦਾ ਹੈ, ਅਤੇ ਇਸਦੇ ਪਹਿਲੇ ਨਤੀਜੇ ਫਰੰਟੀਅਰ ਲੈਬਾਂ ਲਈ ਨਿਮਰ ਹਨ। ਟਰਮੀਨਲ-ਬੈਂਚ-ਸਾਇੰਸ 0.1, ਸਟੈਨਫੋਰਡ ਯੂਨੀਵਰਸਿਟੀ ਦੇ ਖੋਜਕਰਤਾਵਾਂ ਅਤੇ ਪ੍ਰਸਿੱਧ ਟਰਮੀਨਲ-ਬੈਂਚ ਕੋਡਿੰਗ ਬੈਂਚਮਾਰਕ ਦੇ ਪਿੱਛੇ ਦੀ ਟੀਮ ਦੁਆਰਾ ਇਸ ਹਫਤੇ ਲਾਂਚ ਕੀਤਾ ਗਿਆ, ਕੰਮ ਕਰਨ ਵਾਲੇ ਵਿਗਿਆਨੀਆਂ ਦੁਆਰਾ ਯੋਗਦਾਨ ਕੀਤੇ ਅਸਲ ਵਿਗਿਆਨਕ ਖੋਜ ਕਾਰਜਪ੍ਰਵਾਹਾਂ 'ਤੇ AI ਏਜੰਟਾਂ ਦਾ ਮੁਲਾਂਕਣ ਕਰਦਾ ਹੈ — ਅਤੇ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ​​ਮਾਡਲ ਟੈਸਟ ਕੀਤਾ ਗਿਆ, ਕਲਾਉਡ ਓਪਸ 5, ਕਲਾਉਡ ਓਪਸ 5 ਦੁਆਰਾ ਹੁਣੇ ਹੀ ਕੰਮ ਪੂਰਾ ਕੀਤਾ ਗਿਆ%3.

ਬੈਂਚਮਾਰਕ ਦਾ ਘੋਸ਼ਣਾ ਪੰਨਾ ਇਸ ਦੇ ਮਾਰਗਦਰਸ਼ਕ ਸਿਧਾਂਤ ਨੂੰ ਸਪੱਸ਼ਟ ਤੌਰ 'ਤੇ ਬਿਆਨ ਕਰਦਾ ਹੈ: ਵਿਗਿਆਨੀਆਂ ਨੂੰ, ਮਾਡਲ ਡਿਵੈਲਪਰਾਂ ਜਾਂ ਡੇਟਾ ਵਿਕਰੇਤਾਵਾਂ ਨੂੰ ਨਹੀਂ, ਨੂੰ AI ਵਿੱਚ ਵਿਗਿਆਨਕ ਸਮਰੱਥਾ ਲਈ ਪੱਟੀ ਸੈੱਟ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ। ਇਹ ਪ੍ਰੋਜੈਕਟ ਦੁਨੀਆ ਭਰ ਦੀਆਂ ਖੋਜ ਸੰਸਥਾਵਾਂ ਦੇ ਡੋਮੇਨ ਮਾਹਿਰਾਂ ਦੇ ਸਹਿਯੋਗ ਨਾਲ ਬਣਾਇਆ ਗਿਆ ਸੀ, ਅਤੇ ਇਸਦੀ ਪਹਿਲੀ ਰੀਲੀਜ਼ ਵਿੱਚ ਜੀਵਨ ਵਿਗਿਆਨ, ਭੌਤਿਕ ਵਿਗਿਆਨ, ਧਰਤੀ ਵਿਗਿਆਨ, ਗਣਿਤ, ਅਤੇ ਇੰਜੀਨੀਅਰਿੰਗ ਵਿੱਚ ਫੈਲੇ 70 ਕਾਰਜ ਸ਼ਾਮਲ ਹਨ।

ਇਹ ਪਾਠ ਪੁਸਤਕ ਦੇ ਬੈਂਚਮਾਰਕਾਂ ਤੋਂ ਕਿਵੇਂ ਵੱਖਰਾ ਹੈ

ਜ਼ਿਆਦਾਤਰ ਵਿਗਿਆਨਕ AI ਮੁਲਾਂਕਣ ਗਿਆਨ ਦੀ ਜਾਂਚ ਕਰਦੇ ਹਨ: ਬਹੁ-ਚੋਣ ਵਾਲੇ ਪ੍ਰਸ਼ਨ, ਪਾਠ ਪੁਸਤਕ ਦੀਆਂ ਸਮੱਸਿਆਵਾਂ, ਪ੍ਰਮਾਣਿਤ ਅਭਿਆਸ। ਟਰਮੀਨਲ-ਬੈਂਚ-ਸਾਇੰਸ ਇਸ ਦੀ ਬਜਾਏ ਇਹ ਮਾਪਦਾ ਹੈ ਕਿ ਕੀ ਏਜੰਟ ਤਕਨੀਕੀ ਤੌਰ 'ਤੇ ਮੰਗ ਕਰਨ ਵਾਲੇ, ਸਮਾਂ ਬਰਬਾਦ ਕਰਨ ਵਾਲੇ ਵਰਕਫਲੋਜ਼ ਨੂੰ ਲਾਗੂ ਕਰ ਸਕਦੇ ਹਨ ਜੋ ਅਸਲ ਖੋਜਕਰਤਾਵਾਂ ਦੇ ਦਿਨਾਂ ਨੂੰ ਭਰਦੇ ਹਨ - ਉਸ ਕਿਸਮ ਦਾ ਕੰਮ ਜੋ ਬਿਨਾਂ ਪ੍ਰੀਖਿਆ ਵਿੱਚ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ। ਕਾਰਜ ਯਥਾਰਥਵਾਦੀ ਵਾਤਾਵਰਣ ਵਿੱਚ ਚਲਦੇ ਹਨ, ਅਤੇ ਗਰੇਡਿੰਗ ਠੋਸ ਕਲਾਤਮਕ ਚੀਜ਼ਾਂ 'ਤੇ ਅਧਾਰਤ ਹੁੰਦੀ ਹੈ: ਵਿਸ਼ਲੇਸ਼ਣ, ਸਿਮੂਲੇਸ਼ਨ, ਸਬੂਤ, ਕੋਡ, ਅਤੇ ਡੇਟਾ ਉਤਪਾਦ, ਜੱਜ ਮਾਡਲਾਂ ਜਾਂ ਬਹੁ-ਚੋਣ ਸਕੋਰਿੰਗ ਦੀ ਬਜਾਏ ਪ੍ਰਜਨਨਯੋਗ ਕਾਰਜ-ਵਿਸ਼ੇਸ਼ ਟੈਸਟਾਂ ਨਾਲ ਜਾਂਚੇ ਜਾਂਦੇ ਹਨ।

ਇਹ ਡਿਜ਼ਾਈਨ ਇਸ ਸਿਧਾਂਤ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ AI ਸਹਾਇਕਾਂ ਨੂੰ ਆਖਰਕਾਰ ਵਿਗਿਆਨ ਲਈ ਕੀ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ। ਵਿਗਿਆਨਕ ਨਿਰਣੇ ਨੂੰ ਬਦਲਣ ਦੀ ਬਜਾਏ, ਬੈਂਚਮਾਰਕ ਦੇ ਲੇਖਕ ਦਲੀਲ ਦਿੰਦੇ ਹਨ, ਏਜੰਟਾਂ ਨੂੰ ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਲੇਅਰ ਨੂੰ ਸੰਭਾਲਣਾ ਚਾਹੀਦਾ ਹੈ — ਪ੍ਰਯੋਗਾਂ-ਇਨ-ਸਿਲਿਕੋ ਨੂੰ ਚਲਾਉਣਾ, ਡੇਟਾ ਦੀ ਪ੍ਰਕਿਰਿਆ ਕਰਨਾ, ਸਬੂਤਾਂ ਦੀ ਜਾਂਚ ਕਰਨਾ — ਵਿਗਿਆਨੀਆਂ ਨੂੰ ਖੋਜ ਦੇ ਉਹਨਾਂ ਹਿੱਸਿਆਂ ਲਈ ਮੁਕਤ ਕਰਨ ਲਈ ਜਿੱਥੇ ਮਨੁੱਖੀ ਨਿਰਣੇ ਸਭ ਤੋਂ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਹਨ: ਪ੍ਰਸ਼ਨਾਂ ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕਰਨਾ, ਪਰਿਭਾਸ਼ਾਵਾਂ ਬਣਾਉਣਾ, ਪਰਿਭਾਸ਼ਾਵਾਂ ਨੂੰ ਲੱਭਣਾ, ਨਤੀਜੇ ਲੱਭਣਾ ਅਤੇ ਅੰਤਰ-ਕਾਮਨਾਵਾਂ।

ਪ੍ਰੋਜੈਕਟ ਨੂੰ ਸਪੱਸ਼ਟ ਤੌਰ 'ਤੇ ਇੱਕ ਮੂਵਿੰਗ ਟੀਚੇ ਵਜੋਂ ਵੀ ਬਣਾਇਆ ਗਿਆ ਹੈ। ਜਿੱਥੇ ਬਹੁਤ ਸਾਰੇ ਬੈਂਚਮਾਰਕ ਇੱਕ ਵਾਰ ਜਾਰੀ ਕੀਤੇ ਜਾਂਦੇ ਹਨ ਅਤੇ ਛੱਡ ਦਿੱਤੇ ਜਾਂਦੇ ਹਨ — ਘੋਸ਼ਣਾ ਇਸ ਨੂੰ "ਪਬਲਿਸ਼ ਕਰਨ ਲਈ ਪੇਪਰ" ਸਮੱਸਿਆ ਕਹਿੰਦੀ ਹੈ — ਟਰਮੀਨਲ-ਬੈਂਚ-ਸਾਇੰਸ ਨੂੰ ਇੱਕ ਨਿਰੰਤਰ ਬੈਂਚਮਾਰਕ ਵਜੋਂ ਡਿਜ਼ਾਇਨ ਕੀਤਾ ਗਿਆ ਹੈ ਜੋ ਸਰਹੱਦ ਦੇ ਨਾਲ-ਨਾਲ ਵਿਕਸਤ ਹੁੰਦਾ ਹੈ, ਨਿਯਮਤ ਰੀਲੀਜ਼ਾਂ ਦੇ ਨਾਲ ਮੁਲਾਂਕਣ ਨੂੰ ਮਾਡਲ ਪ੍ਰਗਤੀ ਤੋਂ ਅੱਗੇ ਰੱਖਣ ਅਤੇ ਗੰਦਗੀ-ਸੰਚਾਲਿਤ ਸਕੋਰ ਮਹਿੰਗਾਈ ਨੂੰ ਰੋਕਣ ਦਾ ਇਰਾਦਾ ਹੈ।

ਪਹਿਲਾ ਲੀਡਰਬੋਰਡ: ਭਰੋਸੇਮੰਦ ਤੋਂ ਇੱਕ ਲੰਮਾ ਰਸਤਾ

v0.1 ਲੀਡਰਬੋਰਡ, ਜਿਸ ਨੇ ਇਸ ਹਫ਼ਤੇ ਹੈਕਰ ਨਿਊਜ਼ 'ਤੇ ਪਹੁੰਚਣ 'ਤੇ ਮਹੱਤਵਪੂਰਨ ਧਿਆਨ ਖਿੱਚਿਆ ਸੀ, ਸਿਖਰ ਤੋਂ ਬਹੁਤ ਜ਼ਿਆਦਾ ਡਰਾਪ-ਆਫ ਦਿਖਾਉਂਦਾ ਹੈ:

  • ਕਲਾਉਡ ਓਪਸ 5 (ਕਲਾਉਡ ਕੋਡ): 30.0%
  • GPT-5.6 ਸੋਲ (ਕੋਡੈਕਸ): 22.4%
  • ਕਲੌਡ ਫੇਬਲ 5 (ਕਲਾਡ ਕੋਡ): 21.4%
  • ਕਲੌਡ ਓਪਸ 4.8 (ਕਲਾਡ ਕੋਡ): 10.5%
  • GPT-5.6 ਟੈਰਾ (ਕੋਡੈਕਸ): 8.6%
  • GLM 5.3 (ਕਲਾਉਡ ਕੋਡ): 8.1%
  • Kimi K3 (ਕਲਾਡ ਕੋਡ): 7.1%
  • Grok 4.6 (Grok ਬਿਲਡ): 7.1%
  • GPT-5.6 ਲੂਨਾ (ਕੋਡੈਕਸ): 3.3%

ਨਤੀਜੇ ਸੁਝਾਅ ਦਿੰਦੇ ਹਨ ਕਿ ਸਾੱਫਟਵੇਅਰ ਇੰਜਨੀਅਰਿੰਗ ਨਾਲੋਂ ਏਜੰਟਾਂ ਲਈ ਵਿਗਿਆਨਕ ਵਰਕਫਲੋ ਕਾਫ਼ੀ ਔਖਾ ਰਹਿੰਦਾ ਹੈ, ਜਿੱਥੇ ਅਸਲ ਟਰਮੀਨਲ-ਬੈਂਚ ਅਤੇ ਵਿਰੋਧੀ ਕੋਡਿੰਗ ਬੈਂਚਮਾਰਕਾਂ ਨੇ ਸਕੋਰ ਤੇਜ਼ੀ ਨਾਲ ਵਧਦੇ ਦੇਖਿਆ ਹੈ। ਸਭ ਤੋਂ ਵਧੀਆ ਉਪਲਬਧ ਪ੍ਰਣਾਲੀ ਲਈ ਇੱਕ 30% ਰੈਜ਼ੋਲਿਊਸ਼ਨ ਦਰ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਦਸ ਅਸਲ ਖੋਜ ਕਾਰਜਾਂ ਵਿੱਚੋਂ ਸੱਤ 'ਤੇ, ਇੱਕ ਉੱਚ-ਪੱਧਰੀ ਏਜੰਟ ਵੀ ਇੱਕ ਮਜ਼ਬੂਤ ​​​​ਹਾਨੇਸ ਨਾਲ ਜੋੜਿਆ ਗਿਆ ਹੈ, ਪ੍ਰਮਾਣਿਤ ਤੌਰ 'ਤੇ ਸਹੀ ਕੰਮ ਕਰਨ ਵਿੱਚ ਅਸਫਲ ਰਹਿੰਦਾ ਹੈ।

ਮਾਡਲ ਪਰਿਵਾਰਾਂ ਦੇ ਅੰਦਰ ਫੈਲਣਾ ਵੀ ਸਿੱਖਿਆਦਾਇਕ ਹੈ। Claude Opus 5 ਅਤੇ Claude Opus 4.8 — ਲਗਭਗ ਵੀਹ ਪੁਆਇੰਟ — ਅਤੇ GPT-5.6 ਵੇਰੀਐਂਟਸ Sol, Terra, ਅਤੇ Luna ਵਿਚਕਾਰ ਅੰਤਰ ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਨਤੀਜਾ ਗੁਣਵੱਤਾ ਮਾਡਲ ਅਤੇ ਏਜੰਟ ਹਾਰਨੈੱਸ ਦੇ ਆਪਸੀ ਤਾਲਮੇਲ 'ਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ, ਨਾ ਕਿ ਕੱਚੇ ਮਾਡਲ ਦੀ ਖੁਫੀਆ ਜਾਣਕਾਰੀ। ਹਰ ਉੱਚ-ਸਕੋਰਿੰਗ ਇੰਦਰਾਜ਼ ਇੱਕ ਏਜੰਟਿਕ ਕੋਡਿੰਗ ਹਾਰਨੈੱਸ (ਕਲਾਉਡ ਕੋਡ, ਕੋਡੈਕਸ, ਗ੍ਰੋਕ ਬਿਲਡ) ਦੀ ਵਰਤੋਂ ਕਰਦੀ ਹੈ, ਜੋ ਉਭਰ ਰਹੀ ਸਹਿਮਤੀ ਨੂੰ ਮਜ਼ਬੂਤ ​​ਕਰਦੀ ਹੈ ਕਿ ਸਕੈਫੋਲਡਿੰਗ ਅੰਡਰਲਾਈੰਗ ਵਜ਼ਨ ਜਿੰਨਾ ਹੀ ਨਿਰਣਾਇਕ ਹੈ।

ਵਿਗਿਆਨੀਆਂ ਨੇ ਆਪਣਾ ਬੈਂਚਮਾਰਕ ਕਿਉਂ ਬਣਾਇਆ

ਬੈਂਚਮਾਰਕ ਦੇ ਫਰੇਮਿੰਗ ਵਿੱਚ ਇੱਕ ਸੂਖਮ ਸੰਸਥਾਗਤ ਦਲੀਲ ਹੁੰਦੀ ਹੈ। ਘੋਸ਼ਣਾ ਵਿੱਚ ਕਿਹਾ ਗਿਆ ਹੈ, "ਵਿਗਿਆਨ ਵਿੱਚ ਦਾਅ ਬਹੁਤ ਉੱਚੇ ਹਨ, ਅਤੇ ਇਸਦੇ ਮਾਪਦੰਡਾਂ ਨੂੰ ਬਾਹਰੀ ਹਿੱਤਾਂ ਦੀ ਬਜਾਏ ਵਿਗਿਆਨਕ ਭਾਈਚਾਰੇ ਦੀਆਂ ਤਰਜੀਹਾਂ ਨੂੰ ਦਰਸਾਉਣਾ ਚਾਹੀਦਾ ਹੈ।" ਪ੍ਰੋਜੈਕਟ ਕੰਮ ਕਰਨ ਵਾਲੇ ਖੋਜਕਰਤਾਵਾਂ ਨੂੰ ਉਹਨਾਂ ਕਾਰਜਾਂ ਨੂੰ ਏਨਕੋਡ ਕਰਨ ਲਈ ਇੱਕ ਸਿੱਧੀ ਵਿਧੀ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਦੀ ਉਹਨਾਂ ਨੂੰ ਅਸਲ ਵਿੱਚ ਸਵੈਚਲਿਤ ਲੋੜ ਹੁੰਦੀ ਹੈ - ਅਤੇ ਇੱਕ ਪ੍ਰਮਾਣਿਤ ਮਿਆਰ ਦੇ ਵਿਰੁੱਧ "ਵਿਗਿਆਨਕ ਖੋਜ ਨੂੰ ਤੇਜ਼ ਕਰਨ" ਦੇ ਵਿਕਰੇਤਾ ਦੇ ਦਾਅਵਿਆਂ ਨੂੰ ਰੱਖਣ ਲਈ।

ਇਹ ਮਾਇਨੇ ਰੱਖਦਾ ਹੈ ਕਿਉਂਕਿ ਮਾਰਕੀਟਿੰਗ ਅਤੇ ਹਕੀਕਤ ਵਿਚਕਾਰ ਪਾੜੇ ਦੇ ਅਸਲ ਨਤੀਜੇ ਹੁੰਦੇ ਹਨ. ਜੇਕਰ ਫਰੰਟੀਅਰ ਲੈਬਾਂ ਦਾਅਵਾ ਕਰਦੀਆਂ ਹਨ ਕਿ ਉਹਨਾਂ ਦੇ ਏਜੰਟ ਸੁਤੰਤਰ ਹੋਣ ਦੇ ਦੌਰਾਨ ਖੋਜ ਨੂੰ ਤੇਜ਼ ਕਰ ਸਕਦੇ ਹਨ, ਮਾਹਰ ਦੁਆਰਾ ਤਿਆਰ ਕੀਤੇ ਮੁਲਾਂਕਣ ਸਿੰਗਲ-ਡਿਜੀਟ-ਤੋਂ-30% ਰੈਜ਼ੋਲਿਊਸ਼ਨ ਦਰਾਂ, ਫੰਡਿੰਗ ਫੈਸਲੇ, ਭਰਤੀ ਦੀਆਂ ਯੋਜਨਾਵਾਂ, ਅਤੇ ਉਹਨਾਂ ਦਾਅਵਿਆਂ 'ਤੇ ਬਣੀਆਂ ਲੈਬ ਨੀਤੀਆਂ ਨੂੰ ਗਲਤੀ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ। ਨਿਰੰਤਰ, ਕਮਿਊਨਿਟੀ ਦੀ ਮਲਕੀਅਤ ਵਾਲੇ ਬੈਂਚਮਾਰਕ ਇੱਕ ਸੁਧਾਰਾਤਮਕ ਹਨ: ਉਹ ਅਸਪਸ਼ਟ ਦਾਅਵਿਆਂ ਨੂੰ ਪੁਨਰ-ਉਤਪਾਦਨਯੋਗ ਸੰਖਿਆਵਾਂ ਵਿੱਚ ਬਦਲਦੇ ਹਨ।

ਖੋਜ ਸੰਸਥਾਵਾਂ ਲਈ ਇੱਕ ਸੰਕੇਤ

ਯੂਨੀਵਰਸਿਟੀਆਂ, ਰਾਸ਼ਟਰੀ ਪ੍ਰਯੋਗਸ਼ਾਲਾਵਾਂ, ਅਤੇ R&D ਟੀਮਾਂ ਲਈ ਇਹ ਤੋਲਿਆ ਜਾਂਦਾ ਹੈ ਕਿ ਏਜੰਟਾਂ ਨੂੰ ਕਦੋਂ ਤੈਨਾਤ ਕਰਨਾ ਹੈ, ਬੈਂਚਮਾਰਕ ਕੁਝ ਅਜਿਹਾ ਪੇਸ਼ ਕਰਦਾ ਹੈ ਜੋ ਵਿਕਰੇਤਾ ਡੈਮੋ ਨਹੀਂ ਕਰ ਸਕਦੇ: ਭਰੋਸੇਯੋਗਤਾ ਲਾਈਨ ਅਸਲ ਵਿੱਚ ਕਿੱਥੇ ਬੈਠਦੀ ਹੈ ਦਾ ਇੱਕ ਭਾਈਚਾਰਾ-ਸੰਭਾਲ ਮਾਪ। ਕਿਸ਼ੋਰਾਂ ਜਾਂ ਵੀਹਵਿਆਂ ਵਿੱਚ ਇੱਕ ਰੈਜ਼ੋਲੂਸ਼ਨ ਦਰ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਇਹਨਾਂ ਪ੍ਰਣਾਲੀਆਂ ਨੂੰ ਅੱਜ ਸਹਾਇਕਾਂ ਵਜੋਂ ਸਭ ਤੋਂ ਵਧੀਆ ਮੰਨਿਆ ਜਾਂਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਲਈ ਸਮੀਖਿਆ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, ਨਾ ਕਿ ਪ੍ਰਯੋਗਾਤਮਕ ਪਾਈਪਲਾਈਨਾਂ ਦੇ ਖੁਦਮੁਖਤਿਆਰ ਕਾਰਜਕਰਤਾਵਾਂ ਵਜੋਂ। ਕਾਰਜ ਸ਼੍ਰੇਣੀਆਂ — ਫੈਲੇ ਜੀਵਨ, ਭੌਤਿਕ, ਧਰਤੀ, ਗਣਿਤ, ਅਤੇ ਇੰਜੀਨੀਅਰਿੰਗ ਵਿਗਿਆਨ — ਡੋਮੇਨ ਮਾਹਿਰਾਂ ਨੂੰ ਉਹਨਾਂ ਖੇਤਰਾਂ ਤੋਂ ਵਰਕਫਲੋ ਦਾ ਯੋਗਦਾਨ ਦੇਣ ਲਈ ਇੱਕ ਟੈਮਪਲੇਟ ਵੀ ਦਿੰਦੀਆਂ ਹਨ ਜਿਹਨਾਂ ਨੂੰ ਆਮ ਮਾਪਦੰਡ ਨਿਯਮਿਤ ਤੌਰ 'ਤੇ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰਦੇ ਹਨ।

ਵਿਆਪਕ ਉਦਯੋਗ ਸੰਦਰਭ ਇਸ ਗੱਲ ਨੂੰ ਮਜ਼ਬੂਤ ​​ਕਰਦਾ ਹੈ ਕਿ ਸਮਾਂ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ। ਵਿਗਿਆਨ ਫਰੰਟੀਅਰ AI ਲਈ ਸਭ ਤੋਂ ਵੱਧ ਪ੍ਰਮੋਟ ਕੀਤੇ ਗਏ ਵਰਤੋਂ ਦੇ ਮਾਮਲਿਆਂ ਵਿੱਚੋਂ ਇੱਕ ਬਣ ਗਿਆ ਹੈ, ਜਿਸ ਵਿੱਚ ਪ੍ਰਯੋਗਸ਼ਾਲਾਵਾਂ ਸਮੱਗਰੀ ਦੀ ਖੋਜ, ਪ੍ਰੋਟੀਨ ਵਿਗਿਆਨ, ਅਤੇ ਗਣਿਤ ਵਿੱਚ ਯੋਗਦਾਨ ਪਾਉਂਦੀਆਂ ਹਨ। ਉਹਨਾਂ ਦਾਅਵਿਆਂ ਦਾ ਆਡਿਟ ਕਰਨਾ ਔਖਾ ਹੈ: ਵਿਗਿਆਨਕ ਆਉਟਪੁੱਟ ਪ੍ਰਮਾਣਿਤ ਕਰਨ ਲਈ ਹੌਲੀ ਹੈ, ਅਤੇ ਜੋਸ਼ ਪ੍ਰਤੀਕ੍ਰਿਤੀ ਨਾਲੋਂ ਤੇਜ਼ੀ ਨਾਲ ਅੱਗੇ ਵਧਦਾ ਹੈ। ਇੱਕ ਬੈਂਚਮਾਰਕ ਜੋ ਅਸਲ ਵਰਕਫਲੋਜ਼ 'ਤੇ ਪ੍ਰਮਾਣਿਤ ਕਲਾਤਮਕ ਚੀਜ਼ਾਂ ਨੂੰ ਗ੍ਰੇਡ ਕਰਦਾ ਹੈ, ਖੋਜ ਸੰਸਥਾਵਾਂ ਨੂੰ ਪ੍ਰਦਰਸ਼ਨੀ ਥੀਏਟਰ ਤੋਂ ਪ੍ਰਦਰਸ਼ਿਤ ਸਮਰੱਥਾ ਨੂੰ ਵੱਖ ਕਰਨ ਦਾ ਤਰੀਕਾ ਦਿੰਦਾ ਹੈ — ਅਤੇ ਟਰੈਕ ਕਰਨ, ਰੀਲੀਜ਼ ਦੁਆਰਾ ਜਾਰੀ ਕਰਨ ਲਈ, ਕੀ ਵਿਗਿਆਨ ਵਿੱਚ ਏਜੰਟਿਕ ਪ੍ਰਗਤੀ ਸੌਫਟਵੇਅਰ ਇੰਜਨੀਅਰਿੰਗ ਵਿੱਚ ਜਿੰਨੀ ਤੇਜ਼ੀ ਨਾਲ ਵਧ ਰਹੀ ਹੈ, ਜਿੱਥੇ ਟਰਮੀਨਲ-ਬੈਂਚ ਨੇ ਪਹਿਲਾਂ ਆਪਣਾ ਨਾਮ ਬਣਾਇਆ ਹੈ।

AI ਉਦਯੋਗ ਲਈ, v0.1 ਦਾ ਸੁਨੇਹਾ ਦੋ-ਧਾਰੀ ਹੈ। ਸਰਹੱਦ ਸਪੱਸ਼ਟ ਤੌਰ 'ਤੇ ਅੱਗੇ ਵਧ ਰਹੀ ਹੈ — ਓਪਸ 5 ਦੇ 30% ਟਾਵਰ ਪੁਰਾਣੇ ਓਪਸ 4.8 ਦੇ 10.5% ਤੋਂ ਵੱਧ — ਪਰ ਛੱਤ ਅਸਲ ਪ੍ਰਯੋਗਸ਼ਾਲਾਵਾਂ ਲਈ ਲੋੜੀਂਦੀ ਭਰੋਸੇਯੋਗਤਾ ਤੋਂ ਬਹੁਤ ਦੂਰ ਹੈ। ਬੈਂਚਮਾਰਕ ਦੇ ਡਿਜ਼ਾਈਨਰਾਂ ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਨਿਯਮਤ ਰੀਲੀਜ਼ ਇਹ ਪਤਾ ਲਗਾਉਣਗੇ ਕਿ ਇਹ ਪਾੜਾ ਕਿੰਨੀ ਤੇਜ਼ੀ ਨਾਲ ਬੰਦ ਹੁੰਦਾ ਹੈ। ਏਜੰਟ ਖੋਜ ਟੂਲਾਂ ਵਿੱਚ ਉਭਰ ਰਹੇ AI ਰੁਝਾਨਾਂ ਨੂੰ ਦੇਖਣ ਵਾਲੇ ਵਿਗਿਆਨੀਆਂ ਕੋਲ ਹੁਣ ਇੱਕ ਮਾਪਦੰਡ ਹੈ ਜੋ ਉਹਨਾਂ ਨੇ ਖੁਦ ਬਣਾਇਆ ਹੈ।

---

AI ਤੋਂ ਅੱਗੇ ਰਹੋ

ਨਵੀਨਤਮ AI ਖਬਰਾਂ, ਵਿਸ਼ਲੇਸ਼ਣ ਅਤੇ ਸਫਲਤਾਵਾਂ ਪ੍ਰਾਪਤ ਕਰੋ - ਸਭ ਇੱਕ ਥਾਂ 'ਤੇ।

ਹੋਰ AI ਖਬਰਾਂ ਪੜ੍ਹੋ →