Amazon Web Services ਨੇ Amazon Bedrock AgentCore Evaluations ਨੂੰ ਲਾਂਚ ਕੀਤਾ ਹੈ, ਇੱਕ ਨਵੀਂ ਸਮਰੱਥਾ ਜੋ ਕਿਸੇ ਵੀ ਵੱਡੇ ਫਰੇਮਵਰਕ ਨਾਲ ਬਣੇ AI ਏਜੰਟਾਂ ਨੂੰ ਸਕੋਰ ਕਰਦੀ ਹੈ — ਨਾ ਕਿ ਸਿਰਫ AWS ਦੀ ਆਪਣੀ ਟੂਲਿੰਗ — ਓਪਨਟੈਲੀਮੈਟਰੀ ਟਰੇਸ ਨੂੰ ਮੁਲਾਂਕਣ ਲਈ ਇੱਕ ਯੂਨੀਵਰਸਲ ਇੰਟਰਫੇਸ ਵਜੋਂ ਵਰਤ ਕੇ। ਇਹ ਘੋਸ਼ਣਾ 26 ਅਗਸਤ ਨੂੰ ਸਵਰਨੀਮ ਸਿੰਘਲ, ਭਾਰਤੀ ਸ਼੍ਰੀਨਿਵਾਸਨ ਅਤੇ ਰੇਨਿਆ ਕੁਜੀਰਦਾ ਦੁਆਰਾ ਪ੍ਰਕਾਸ਼ਿਤ ਇੱਕ AWS ਮਸ਼ੀਨ ਲਰਨਿੰਗ ਬਲਾਗ ਪੋਸਟ ਵਿੱਚ ਆਈ ਹੈ।

ਪਿੱਚ ਉਸ ਨੂੰ ਸੰਬੋਧਿਤ ਕਰਦੀ ਹੈ ਜਿਸਨੂੰ AWS ਉਤਪਾਦਨ AI ਕੰਮ ਵਿੱਚ ਇੱਕ ਨਿਰਾਸ਼ਾਜਨਕ ਅਸਮਾਨਤਾ ਕਹਿੰਦਾ ਹੈ: ਏਜੰਟ ਫਰੇਮਵਰਕ ਦੀ ਵਿਭਿੰਨਤਾ ਵਧਦੀ ਰਹਿੰਦੀ ਹੈ ਜਦੋਂ ਕਿ ਮੁਲਾਂਕਣ ਟੂਲਿੰਗ ਨੇ ਗਤੀ ਨਹੀਂ ਰੱਖੀ ਹੈ। ਵਿਆਪਕ AI ਉਦਯੋਗ ਖਬਰਾਂ ਦੇ ਚੱਕਰ ਦੇ ਨਾਲ ਜਾਰੀ ਰੱਖਣ ਲਈ, ਟੀਮਾਂ ਹੁਣ ਨਿਯਮਿਤ ਤੌਰ 'ਤੇ ਟੂਲਸ ਨੂੰ ਮਿਲਾਉਂਦੀਆਂ ਹਨ ਅਤੇ ਮੇਲ ਕਰਦੀਆਂ ਹਨ — ਇਹ ਬਿਲਕੁਲ ਸਹੀ ਹੈ ਜਿੱਥੇ ਰਵਾਇਤੀ ਮੁਲਾਂਕਣ ਪਾਈਪਲਾਈਨਾਂ ਵੱਖ ਹੋ ਜਾਂਦੀਆਂ ਹਨ।

ਫਰੈਗਮੈਂਟੇਸ਼ਨ ਸਮੱਸਿਆ

ਜਿਵੇਂ ਕਿ AWS ਟੀਮ ਇਸਨੂੰ ਫ੍ਰੇਮ ਕਰਦੀ ਹੈ, ਜ਼ਿਆਦਾਤਰ ਮੁਲਾਂਕਣ ਸਿਸਟਮ ਇਹ ਮੰਨਦੇ ਹਨ ਕਿ ਤੁਸੀਂ ਆਪਣੇ ਏਜੰਟ ਨੂੰ ਇੱਕ ਖਾਸ ਤਰੀਕੇ ਨਾਲ ਬਣਾਇਆ ਹੈ: ਇੱਕ ਖਾਸ SDK, ਇੱਕ ਖਾਸ ਵੱਡੀ ਭਾਸ਼ਾ ਮਾਡਲ ਕਲਾਇੰਟ, ਇੱਕ ਖਾਸ ਟਰੇਸਿੰਗ ਪੈਟਰਨ। ਉਸ ਤੰਗ ਅਨੁਕੂਲਤਾ ਜ਼ੋਨ ਤੋਂ ਬਾਹਰ ਜਾਓ ਅਤੇ ਮੁਲਾਂਕਣ ਪਾਈਪਲਾਈਨ ਟੁੱਟ ਜਾਂਦੀ ਹੈ।

ਰੀਅਲ-ਵਰਲਡ ਸਟੈਕ ਘੱਟ ਹੀ ਇੱਕ ਵਿਕਰੇਤਾ ਦੀ ਲੇਨ ਦੇ ਅੰਦਰ ਰਹਿੰਦੇ ਹਨ। ਬਲੌਗ ਪੋਸਟ ਦੇ ਖਾਤੇ ਵਿੱਚ, ਟੀਮਾਂ ਵਰਕਫਲੋ ਆਰਕੈਸਟੇਸ਼ਨ ਲਈ ਲੈਂਗਗ੍ਰਾਫ 'ਤੇ, ਸਖ਼ਤ ਪੁਨਰ-ਪ੍ਰਾਪਤੀ ਪਾਈਪਲਾਈਨ ਏਕੀਕਰਣ ਲਈ LlamaIndex 'ਤੇ, ਅਤੇ OpenAI ਏਜੰਟ SDK 'ਤੇ ਬਣਾਉਂਦੀਆਂ ਹਨ ਜਦੋਂ ਕੋਈ ਸੰਗਠਨ GPT ਮਾਡਲਾਂ 'ਤੇ ਮਾਨਕੀਕਰਨ ਕਰਦਾ ਹੈ। ਉਹ ਮਲਟੀ-ਏਜੰਟ ਤਾਲਮੇਲ ਲਈ Google ADK ਜਾਂ ਮੂਲ ਐਂਥਰੋਪਿਕ ਸਮਰੱਥਾ ਲਈ ਕਲਾਉਡ ਏਜੰਟ SDK ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ, ਅਤੇ ਉਹ ਸਟ੍ਰੈਂਡਜ਼ ਏਜੰਟਾਂ ਤੱਕ ਪਹੁੰਚਦੇ ਹਨ ਜਦੋਂ ਇਸਦਾ ਮਾਡਲ-ਸੰਚਾਲਿਤ ਲੂਪ ਦਿਨਾਂ ਦੀ ਬਜਾਏ ਮਿੰਟਾਂ ਵਿੱਚ ਐਮਾਜ਼ਾਨ ਬੈਡਰੋਕ ਏਜੰਟਕੋਰ 'ਤੇ ਚੱਲ ਰਹੇ ਇੱਕ ਕਾਰਜਕਾਰੀ ਏਜੰਟ ਨੂੰ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦਾ ਹੈ।

ਇਹਨਾਂ ਫਰੇਮਵਰਕ ਵਿੱਚੋਂ ਹਰ ਇੱਕ ਏਜੰਟ ਨੇ ਕੀ ਕੀਤਾ ਇਸਦੀ ਆਪਣੀ ਅੰਦਰੂਨੀ ਨੁਮਾਇੰਦਗੀ ਤਿਆਰ ਕਰਦਾ ਹੈ — ਉਪ-ਏਜੰਟਾਂ ਵਿਚਕਾਰ ਟੂਲ ਕਾਲਾਂ, ਪ੍ਰਾਪਤੀਆਂ, ਹੈਂਡਆਫ। ਇਤਿਹਾਸਕ ਤੌਰ 'ਤੇ, ਉਹਨਾਂ ਦਾ ਮੁਲਾਂਕਣ ਕਰਨ ਦਾ ਮਤਲਬ ਹੈ ਹਰ ਇੱਕ ਲਈ ਯੰਤਰ ਨੂੰ ਦੁਬਾਰਾ ਬਣਾਉਣਾ, ਜਾਂ ਇਹ ਸਵੀਕਾਰ ਕਰਨਾ ਕਿ ਕੁਝ ਫਰੇਮਵਰਕ ਨੂੰ ਬਿਲਕੁਲ ਵੀ ਦਰਜਾ ਨਹੀਂ ਦਿੱਤਾ ਜਾ ਸਕਦਾ ਹੈ।

ਇਹ ਕਿਵੇਂ ਕੰਮ ਕਰਦਾ ਹੈ: ਟੈਲੀਮੈਟਰੀ ਓਵਰ ਟਾਈਟ ਕਪਲਿੰਗ

AgentCore ਮੁਲਾਂਕਣ ਇੱਕ ਇੰਟਰਫੇਸ ਚੁਣ ਕੇ ਉਸ ਕਪਲਿੰਗ ਨੂੰ ਭੰਗ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਦਾ ਹੈ ਜੋ ਪਹਿਲਾਂ ਹੀ ਬੋਲਦਾ ਹੈ ਹਰ ਮੁੱਖ ਫਰੇਮਵਰਕ. ਲਗਭਗ ਸਾਰੇ ਓਪਨਟੈਲੀਮੇਟਰੀ ਦਾ ਸਮਰਥਨ ਕਰਦੇ ਹਨ, ਜਾਂ ਤਾਂ ਨੇਟਿਵ ਤੌਰ 'ਤੇ ਜਾਂ ਕਮਿਊਨਿਟੀ ਇੰਸਟਰੂਮੈਂਟੇਸ਼ਨ ਲਾਇਬ੍ਰੇਰੀਆਂ ਦੁਆਰਾ - ਡੀ ਫੈਕਟੋ ਸਟੈਂਡਰਡ ਜੋ ਕਿ ਕਲਾਉਡ ਅਤੇ ਐਪਲੀਕੇਸ਼ਨ ਆਬਜ਼ਰਵੇਬਿਲਟੀ ਟੂਲ ਸਾਲ ਪਹਿਲਾਂ ਇਕੱਠੇ ਹੋਏ ਸਨ।

ਤਰਕ ਸਿੱਧਾ ਹੈ: ਜਿੰਨਾ ਚਿਰ ਇੱਕ ਏਜੰਟ ਦੀ ਟੈਲੀਮੈਟਰੀ OpenTelemetry ਵਿੱਚੋਂ ਲੰਘਦੀ ਹੈ, ਮੁਲਾਂਕਣ ਸੇਵਾ ਇਸ ਨੂੰ ਸਕੋਰ ਕਰ ਸਕਦੀ ਹੈ, ਭਾਵੇਂ SDK ਹੇਠਾਂ ਬੈਠਦਾ ਹੈ। ਬਲੌਗ ਪੋਸਟ ਸੇਵਾ ਕਿਸ ਟੈਲੀਮੈਟਰੀ ਨੂੰ ਪੜ੍ਹਦੀ ਹੈ, ਇਹ ਕਿਵੇਂ ਫੈਸਲਾ ਕਰਦੀ ਹੈ ਕਿ ਸਪੈਨ ਦੀ ਵਿਆਖਿਆ ਕਿਵੇਂ ਕਰਨੀ ਹੈ, ਕਿਹੜੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਮੁਲਾਂਕਣ ਡੇਟਾ ਨੂੰ ਲੈ ਕੇ ਜਾਂਦੀਆਂ ਹਨ, ਅਤੇ ਕਵਰੇਜ AWS ਦੀ ਨਾਮੀ ਸੂਚੀ ਤੋਂ ਪਰੇ ਫਰੇਮਵਰਕ ਤੱਕ ਕਿਵੇਂ ਫੈਲਦੀ ਹੈ - ਫਰੇਮਵਰਕ ਦੀ ਬਜਾਏ, ਇਕਰਾਰਨਾਮੇ ਦੀ ਬਜਾਏ ਫਾਰਮੈਟ ਨੂੰ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਢੰਗ ਨਾਲ ਬਣਾਉਂਦੀ ਹੈ।

ਇੰਜਨੀਅਰਿੰਗ ਸੰਸਥਾਵਾਂ ਲਈ, ਇਹ ਮੁਲਾਂਕਣ ਨੂੰ ਪ੍ਰਤੀ-ਪ੍ਰੋਜੈਕਟ ਬਿਲਡ ਦੀ ਬਜਾਏ ਇੱਕ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਦੇ ਫੈਸਲੇ ਵਿੱਚ ਬਦਲ ਦਿੰਦਾ ਹੈ। ਕਿਸੇ ਏਜੰਟ ਦੀ ਗ੍ਰੇਡ ਕੀਤੀ ਗਈ ਜਿਸ ਦਿਨ ਇਹ ਸਮੁੰਦਰੀ ਜ਼ਹਾਜ਼ ਭੇਜਦਾ ਹੈ ਉਸ ਦੀ ਤੁਲਨਾ ਉਸੇ ਮੈਟ੍ਰਿਕਸ ਨਾਲ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ ਭਾਵੇਂ ਇਸਦੇ ਲੇਖਕਾਂ ਨੇ ਇਸਨੂੰ ਲੈਂਗਗ੍ਰਾਫ ਜਾਂ ਕਲਾਉਡ ਏਜੰਟ SDK ਵਿੱਚ ਲਿਖਿਆ ਹੋਵੇ।

ਜਿੱਥੇ ਇਹ AgentCore ਵਿੱਚ ਫਿੱਟ ਬੈਠਦਾ ਹੈ

ਵਿਆਪਕ ਐਮਾਜ਼ਾਨ ਬੈਡਰੋਕ ਏਜੰਟਕੋਰ ਪਲੇਟਫਾਰਮ ਵਿੱਚ ਮੁਲਾਂਕਣ ਸਲਾਟ, ਜਿਸਦਾ ਰਨਟਾਈਮ ਪਹਿਲਾਂ ਹੀ ਹੋਸਟਿੰਗ, ਸਕੇਲਿੰਗ, ਮੈਮੋਰੀ ਅਤੇ ਨਿਰੀਖਣਯੋਗਤਾ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਦੇ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਹੈਂਡਲ ਕਰਦਾ ਹੈ ਨਹੀਂ ਤਾਂ ਹਰੇਕ ਪ੍ਰੋਜੈਕਟ ਲਈ ਦੁਬਾਰਾ ਬਣਾਇਆ ਜਾਵੇਗਾ। ਉਸੇ ਸਤਹ 'ਤੇ ਮੁਲਾਂਕਣ ਜੋੜਨ ਦੇ ਨਾਲ, AWS ਏਜੰਟਾਂ ਲਈ ਇੱਕ ਪੂਰੇ ਜੀਵਨ-ਚੱਕਰ ਦੀ ਮਾਤਰਾ ਨੂੰ ਇਕੱਠਾ ਕਰ ਰਿਹਾ ਹੈ: ਉਹਨਾਂ ਨੂੰ ਰਨਟਾਈਮ 'ਤੇ ਤੈਨਾਤ ਕਰੋ, ਉਹਨਾਂ ਨੂੰ ਬਿਲਟ-ਇਨ ਅਬਜ਼ਰਵੇਬਿਲਟੀ ਦੁਆਰਾ ਦੇਖੋ, ਅਤੇ ਹੁਣ ਉਹਨਾਂ ਨੂੰ ਪਲੇਟਫਾਰਮ ਨੂੰ ਛੱਡੇ ਬਿਨਾਂ ਇਕਸਾਰ ਮਾਪਦੰਡਾਂ ਦੇ ਵਿਰੁੱਧ ਮਾਪੋ।

ਸਮਾਂ ਇਤਫਾਕਨ ਨਹੀਂ ਹੈ। ਪੂਰੇ ਉਦਯੋਗ ਵਿੱਚ, ਇਸ ਬਾਰੇ ਸਵਾਲ ਕਿ ਕੀ ਏਜੰਟ ਅਸਲ ਵਿੱਚ ਇਰਾਦੇ ਅਨੁਸਾਰ ਵਿਵਹਾਰ ਕਰਦੇ ਹਨ, ਅਕਾਦਮਿਕ ਚਿੰਤਾ ਤੋਂ ਬੋਰਡ-ਪੱਧਰ ਦੇ ਜੋਖਮ ਵਿੱਚ ਚਲੇ ਗਏ ਹਨ, ਉੱਚ-ਪ੍ਰੋਫਾਈਲ ਐਪੀਸੋਡਾਂ ਜਿਵੇਂ ਕਿ ਹੱਗਿੰਗ ਫੇਸ ਉਲੰਘਣਾ ਜਾਂਚ ਵਿੱਚ ਦਰਜ ਕੀਤੇ ਗਏ ਤਾਲਮੇਲ ਵਾਲੇ ਦੁਰਵਿਵਹਾਰ ਅਤੇ ਵਧ ਰਹੇ ਸਬੂਤਾਂ ਤੋਂ ਬਾਅਦ ਕਿ ਬੈਂਚਮਾਰਕ ਹੀ ਏਜੰਟ ਭਰੋਸੇਯੋਗਤਾ ਦੀ ਇੱਕ ਅਧੂਰੀ ਤਸਵੀਰ ਪੇਂਟ ਕਰਦੇ ਹਨ। ਟੂਲਿੰਗ ਜੋ ਮੁਲਾਂਕਣ ਨੂੰ ਨਿਰੰਤਰ, ਸਸਤੀ ਅਤੇ ਫਰੇਮਵਰਕ-ਸੁਤੰਤਰ ਬਣਾਉਂਦੀ ਹੈ, ਉਸ ਚਿੰਤਾ ਨੂੰ ਸਿੱਧਾ ਬੋਲਦੀ ਹੈ।

ਇਹ ਮਾਇਨੇ ਕਿਉਂ ਰੱਖਦਾ ਹੈ

ਮੁਲਾਂਕਣ ਚੁੱਪਚਾਪ ਐਂਟਰਪ੍ਰਾਈਜ਼ ਏਜੰਟ ਗੋਦ ਲੈਣ ਦੀ ਰੁਕਾਵਟ ਬਣ ਗਿਆ ਹੈ। ਵਿਕਾਸ ਵੇਗ ਹੁਣ ਕੋਈ ਰੁਕਾਵਟ ਨਹੀਂ ਹੈ - ਰੁਕਾਵਟ ਵਿਸ਼ਵਾਸ ਹੈ: ਇਹ ਜਾਣਦੇ ਹੋਏ ਕਿ ਗਾਹਕਾਂ ਨੂੰ ਜਵਾਬ ਦੇਣ ਵਾਲਾ ਏਜੰਟ, ਡੇਟਾ ਨੂੰ ਮੂਵ ਕਰਨਾ ਜਾਂ ਵਰਕਫਲੋ ਨੂੰ ਚਲਾਉਣਾ ਅਜਿਹੇ ਸ਼ਰਤਾਂ ਵਿੱਚ ਸਹੀ ਢੰਗ ਨਾਲ ਕਰੇਗਾ ਜਿਸ ਦੀ ਵਿਅਕਤੀਗਤ ਤੌਰ 'ਤੇ ਜਾਂਚ ਨਹੀਂ ਕੀਤੀ ਗਈ ਹੈ।

ਕਿਸੇ ਇੱਕ SDK ਦੀ ਬਜਾਏ OpenTelemetry ਵਿੱਚ ਮੁਲਾਂਕਣ ਨੂੰ ਐਂਕਰਿੰਗ ਕਰਕੇ, AWS ਸੱਟੇਬਾਜ਼ੀ ਕਰ ਰਿਹਾ ਹੈ ਕਿ ਉਦਯੋਗ ਦੀ ਨਿਰੀਖਣਤਾ ਸਹਿਮਤੀ ਇਸਦੀ ਗੁਣਵੱਤਾ-ਭਰੋਸੇ ਦੀ ਪਰਤ ਦੇ ਰੂਪ ਵਿੱਚ ਦੁੱਗਣੀ ਹੋ ਸਕਦੀ ਹੈ। ਕੀ ਪ੍ਰਤੀਯੋਗੀ ਬਰਾਬਰ ਫਰੇਮਵਰਕ-ਅਗਨੋਸਟਿਕ ਸਕੋਰਿੰਗ ਦੇ ਨਾਲ ਪਾਲਣਾ ਕਰਦੇ ਹਨ ਇਸ ਬਾਰੇ ਬਹੁਤ ਕੁਝ ਦੱਸੇਗਾ ਕਿ ਏਜੰਟ AI ਡੈਮੋ ਤੋਂ ਭਰੋਸੇਯੋਗ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਵਿੱਚ ਕਿੰਨੀ ਜਲਦੀ ਪਰਿਪੱਕ ਹੁੰਦਾ ਹੈ।

ਵਿਭਿੰਨ ਫਲੀਟਾਂ ਨੂੰ ਚਲਾਉਣ ਵਾਲੀਆਂ ਟੀਮਾਂ ਲਈ, ਵਿਹਾਰਕ ਪ੍ਰਭਾਵ ਤੁਲਨਾਤਮਕਤਾ ਹੈ। ਜਦੋਂ ਹਰ ਏਜੰਟ ਉਸੇ ਟੈਲੀਮੈਟਰੀ ਫਾਰਮੈਟ ਵਿੱਚ ਰਿਪੋਰਟ ਕਰਦਾ ਹੈ, ਤਾਂ ਗੁਣਵੱਤਾ ਇੱਕ ਅਜਿਹੀ ਚੀਜ਼ ਬਣ ਜਾਂਦੀ ਹੈ ਜੋ ਇੱਕ ਸੰਸਥਾ ਪ੍ਰਤੀ ਪ੍ਰੋਜੈਕਟ ਨੂੰ ਮੁੜ ਪ੍ਰਾਪਤ ਕਰਨ ਦੀ ਬਜਾਏ ਸਮੇਂ ਦੇ ਨਾਲ ਅਤੇ ਟੀਮਾਂ ਵਿੱਚ ਟਰੈਕ ਕਰ ਸਕਦੀ ਹੈ - ਏਜੰਟ ਪ੍ਰਣਾਲੀਆਂ ਵਿੱਚ ਕਾਰਜਸ਼ੀਲ ਪਰਿਪੱਕਤਾ ਵਰਗੀ ਕਿਸੇ ਵੀ ਚੀਜ਼ ਲਈ ਇੱਕ ਪੂਰਵ ਸ਼ਰਤ। LangGraph-LlamaIndex ਹਾਈਬ੍ਰਿਡ ਸਟੈਕ ਵਿੱਚ ਡੂੰਘੇ ਉੱਦਮਾਂ ਲਈ, ਜਾਂ ਜਦੋਂ ਵੀ ਇੱਕ ਬਿਹਤਰ ਫਰੇਮਵਰਕ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ ਤਾਂ ਸਿਰਫ਼ ਇੰਸਟਰੂਮੈਂਟੇਸ਼ਨ ਨੂੰ ਮੁੜ ਲਿਖਣ ਤੋਂ ਸਾਵਧਾਨ, ਹੁਣ ਉਹਨਾਂ ਦੇ ਕਲਾਉਡ ਪ੍ਰਦਾਤਾ ਤੋਂ ਇੱਕ ਪਹਿਲੀ-ਪਾਰਟੀ ਵਿਕਲਪ ਹੈ ਜੋ ਉਹਨਾਂ ਨੂੰ ਪਾਸਿਆਂ ਦੀ ਚੋਣ ਕਰਨ ਲਈ ਨਹੀਂ ਕਹਿੰਦਾ ਹੈ।

---

AI ਤੋਂ ਅੱਗੇ ਰਹੋ

ਨਵੀਨਤਮ AI ਖਬਰਾਂ, ਵਿਸ਼ਲੇਸ਼ਣ ਅਤੇ ਸਫਲਤਾਵਾਂ ਪ੍ਰਾਪਤ ਕਰੋ - ਸਭ ਇੱਕ ਥਾਂ 'ਤੇ।

ਹੋਰ AI ਖਬਰਾਂ ਪੜ੍ਹੋ →