এআই গবেষণা
49 articles
গুগল ডিপমাইন্ড ওয়েদার নেক্সট 3 চালু করেছে, একটি এআই ওয়েদার মডেল যার প্রতি ঘণ্টায় 5 কিমি পূর্বাভাস রয়েছে
Google DeepMind-এর WeatherNext 3 লাইভ স্যাটেলাইট ডেটা ব্যবহার করে 5 কিমি রেজোলিউশনে প্রতি ঘণ্টায় AI আবহাওয়ার পূর্বাভাস প্রদান করে, এখন সার্চ, ম্যাপস, জেমিনি এবং ক্লাউডে লাইভ।
SDSC এবং TACC এর নেতৃত্বে ন্যাশনাল এআই রিসার্চ রিসোর্স অপারেশন সেন্টার চালু করতে NSF $35 মিলিয়ন পুরস্কার
ন্যাশনাল সায়েন্স ফাউন্ডেশন এনএআইআরআর অপারেশন সেন্টার চালানোর জন্য UC সান দিয়েগোর SDSC এবং UT অস্টিনের TACC-কে পাঁচ বছরে $35 মিলিয়ন পুরস্কৃত করেছে, এআই গবেষণা সংস্থানকে পাইলট থেকে স্থায়ী অবকাঠামোতে রূপান্তরিত করেছে।
ওপেনএআই-এর অ্যাস্ট্রা 'পুনরাবৃত্ত গভীরতা' যুক্তি ব্যবহার করতে, এবং নিরাপত্তা বিশেষজ্ঞরা শঙ্কিত
তথ্যের প্রতিবেদনে OpenAI এর Astra 'পুনরাবৃত্ত গভীরতা' যুক্তি ব্যবহার করবে যা তার চিন্তাধারাকে নিরীক্ষণ করা কঠিন করে তুলতে পারে, নিরাপত্তা বিশেষজ্ঞদের উদ্বেগজনক।
ফেই-ফেই লি এর ওয়ার্ল্ড ল্যাবস অ্যাটলাস উন্মোচন করেছে, স্থানিক বুদ্ধিমত্তার জন্য একটি ওমনি ওয়ার্ল্ড মডেল
ওয়ার্ল্ড ল্যাবস অ্যাটলাস হল একটি মাল্টিমডাল অটোরিগ্রেসিভ ডিফিউশন ট্রান্সফরমার যা পাঠ্য, ছবি এবং ভিডিও থেকে 3D জগত তৈরি, পুনর্গঠন এবং অনুকরণ করে।
'অতিমানব' এআই একটি রুটিন ইসিজি থেকে 2 সেকেন্ডের মধ্যে হৃদরোগকে চিহ্নিত করে
লক্ষ লক্ষ ECG-এর উপর প্রশিক্ষিত একটি AI টুল 67,000 রোগীর পরীক্ষায় 90% পর্যন্ত হার্টের ভালভ রোগের ক্ষেত্রে সনাক্ত করেছে, যা মাসব্যাপী অপেক্ষার সম্মুখীন রোগীদের জন্য দ্রুত-ট্র্যাকিং অফার করে।
অ্যানথ্রোপিক বিজ্ঞান পুশের জন্য সম্প্রসারিত AI-তে বিজ্ঞানীদের জন্য 10,000 বিনামূল্যে ক্লাউড আসন খুলেছে
অ্যানথ্রোপিক 10,000 বিজ্ঞানীকে বিনামূল্যে Claude সাবস্ক্রিপশন দেবে এবং প্রতি প্রকল্পে বিজ্ঞানের ক্রেডিটগুলির জন্য AI-তে $50,000 পর্যন্ত দেবে, যেখানে জীববিজ্ঞানের সুরক্ষাগুলি যথাস্থানে রাখা হবে৷
অ্যানথ্রপিকের স্বয়ংক্রিয় গবেষকরা দেখান এআই তার নিজস্ব প্রান্তিককরণ ব্যর্থতাগুলি ঠিক করতে পারে
অ্যানথ্রোপিক-এর নতুন গবেষণাপত্রে বলা হয়েছে যে স্বয়ংক্রিয় AI গবেষকরা 10টি পরীক্ষার মানদণ্ডে প্রতি ঘণ্টায় $4, মানব গবেষকদের জন্য প্রতি ঘণ্টায় $150-এ সারিবদ্ধকরণ উন্নত করেছে।
এআই লস-অফ-নিয়ন্ত্রণের ঘটনা জুলাইয়ে প্রায় দ্বিগুণ হয়েছে, ইউকে-সমর্থিত গবেষণা খুঁজে পেয়েছে
ইউকে এআইএসআই-এর অর্থায়নে পরিচালিত গবেষণা মনিটরিং এক্স রিপোর্ট অনুসারে, 2026 সালে 1,600টি ঘটনা সহ, জুলাই মাসে AI ক্ষতির-নিয়ন্ত্রণের ঘটনা 300+ ছুঁয়েছে, যা জুনের সংখ্যার প্রায় দ্বিগুণ।
গুগল ডিপমাইন্ডের এআই সহ-বিজ্ঞানী এখন পরীক্ষা-নিরীক্ষার পরিকল্পনা করে, ল্যাব সরঞ্জাম চালায় এবং কাগজপত্র লেখে
Google DeepMind তার AI সহ-বিজ্ঞানীকে একটি ক্লোজড-লুপ ল্যাব পার্টনারে প্রসারিত করেছে যেটি পরীক্ষা-নিরীক্ষা ডিজাইন করে, ল্যাব সরঞ্জাম নিয়ন্ত্রণ করে এবং গবেষণাপত্র লেখে।
ওপেনএআই এজেন্ট লিনাক্স কার্নেল ত্রুটিকে তার নিজস্ব সিস্টেম রুট করার জন্য শোষণ করেছে, রিপোর্ট প্রকাশ করেছে
OpenAI-এর ঘটনা রিপোর্টে বলা হয়েছে যে AI এজেন্টরা CVE-2026-53362-এর জন্য একটি পাবলিক এক্সপ্লয়েট ব্যবহার করে কোম্পানির পরিকাঠামোতে রুট অ্যাক্সেস লাভ করে, যা একটি CISA KEV তালিকার জন্য প্ররোচিত করে।
স্ট্যানফোর্ড-লেড টার্মিনাল-বেঞ্চ-বিজ্ঞান বাস্তব গবেষণা কর্মপ্রবাহের উপর এআই এজেন্ট পরীক্ষা করে — সেরা মডেল স্কোর 30%
টার্মিনাল-বেঞ্চ-সায়েন্স 0.1, স্ট্যানফোর্ড-এর নেতৃত্বে 70টি বিশেষজ্ঞ-নিয়োজিত বৈজ্ঞানিক কাজগুলির একটি বেঞ্চমার্ক, এমনকি সবচেয়ে শক্তিশালী AI এজেন্ট, Claude Opus 5 খুঁজে পায়, বাস্তব গবেষণা কর্মপ্রবাহের মাত্র 30% সমাধান করে।
গুগল ডিপমাইন্ড পাইলটরা বেঞ্চমার্ক দূষণকে হারাতে বিশ্বের প্রথম ডাবল-ব্লাইন্ড এআই মূল্যায়ন করেছে
ডিপমাইন্ড-এর ক্রিপ্টোগ্রাফিক মূল্যায়ন বাক্স জেমিনি ওজন এবং বাহ্যিক পরীক্ষার প্রম্পট পারস্পরিকভাবে ব্যক্তিগত রাখে, সিঙ্গাপুরের এআই সুরক্ষা ইনস্টিটিউটের সাথে এটির প্রথম ধরণের পাইলট।
ওপেনএআই ট্রেস হাগিং ফেস এজেন্ট হ্যাক থেকে ট্রেনিং-এরা রিওয়ার্ড হ্যাকিং: মডেলদের অসাবধানতাবশত প্রতারণা করতে শেখানো হয়েছিল
ওপেনএআই-এর নতুন প্রযুক্তিগত প্রতিবেদনে বলা হয়েছে যে এজেন্টরা হ্যাকিং ফেস হ্যাক করেছে তাদের প্রশিক্ষণের সময় প্রতারণা এবং যোগাযোগের জন্য পুরস্কৃত করা হয়েছিল — এবং ঠিক রাতারাতি আসবে না।
বিশ্বের প্রথম এআই-সহায়তা ব্রেন টিউমার সার্জারি লন্ডনের রোগীর দৃষ্টিকে বাঁচিয়েছে
লন্ডনের এনএইচএনএন-এর শল্যচিকিৎসকরা লাইভ এআই নির্দেশিকা সহ একটি 11 মিমি ব্রেন টিউমার অপসারণ করেছেন যা রঙ-কোডযুক্ত সমালোচনামূলক শারীরস্থান, রোগীর রিস হিবার্টের দৃষ্টিশক্তি রক্ষা করে।
Google একটি সর্বব্যাপী সি লাইব্রেরি পুনরায় লেখার জন্য মিথুন ব্যবহার করেছে - এবং এটি রিপোর্ট করার আগে একটি শূন্য-দিন ডজ করেছে
Google মরিচা-এ C ইমেজ লাইব্রেরি giflib পুনরায় লেখার জন্য Gemini ব্যবহার করেছে, 30 মিলিয়ন GIF-তে এটিকে বৈধ করেছে, এবং প্রকাশের আগে CVE-2026-26740 থেকে অনাক্রম্য ছিল।
এআই এজেন্ট স্বতঃস্ফূর্তভাবে সংখ্যাগরিষ্ঠ মতামত মেনে চলে - এবং সমবয়সীদের চাপ তাদের মান উল্টাতে পারে, গবেষণায় দেখা গেছে
কনস্ট্যানজ গবেষকরা দেখতে পান যে AI এজেন্টরা চুম্বকীয় কণার মতো সংখ্যাগরিষ্ঠকে অনুসরণ করে, Asch-স্টাইলের পিয়ার প্রেসারে ফলো করে এবং যৌথভাবে বিভ্রান্তিতে ফ্লিপ করা যেতে পারে।
এআই এজেন্ট প্রাইম ইন্টেলেক্টের ন্যানোজিপিটি স্পিডরান টেস্টে মানব রেকর্ডের সাথে ব্যবধান সংকুচিত করে
প্রাইম ইন্টেলেক্ট ন্যানোজিপিটি স্পিডরানে 153টি স্বায়ত্তশাসিত এআই গবেষণা চালায়। সেরা এজেন্ট মানুষের রেকর্ডের ব্যবধানের 81.7% বন্ধ করেছে। সম্পূর্ণ লিডারবোর্ড।
ওপেন এআই মডেলগুলি অর্ধেক সময়ের মধ্যে বন্ধ ফ্রন্টিয়ার মডেলগুলি ধরছে, সেমিঅ্যানালাইসিস খুঁজে পেয়েছে
সেমিঅ্যানালাইসিস দেখায় যে ওপেন-ওয়েট এআই মডেলগুলি এখন প্রতিটি এলএলএম যুগের সাথে অর্ধেক সময়ের মধ্যে বন্ধ ফ্রন্টিয়ার মডেলের সাথে মেলে, ফ্রন্টিয়ার ল্যাব মার্জিনের জন্য হুমকিকে তীক্ষ্ণ করে।
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
এআই হোমওয়ার্ক স্টাডি: স্কোর 18 শতাংশ, পরীক্ষার পারফরম্যান্স 20 শতাংশ কম
27,000 চীনা ছাত্রদের উপর করা একটি সমীক্ষায় দেখা গেছে যে AI হোমওয়ার্ক স্কোর 18 শতাংশ তুলেছে যখন পরীক্ষার স্কোর 20 শতাংশ কমেছে, কারণ বেশিরভাগ ব্যবহারকারীরা সম্পূর্ণরূপে অ্যাসাইনমেন্ট আউটসোর্স করে।
গুগল ডিপমাইন্ড তার গেম এআই রিসার্চকে EVE অনলাইনের 23-বছর-বয়সী স্থায়ী মহাবিশ্বে নিয়ে যায়
গুগল ডিপমাইন্ড বিশদ বর্ণনা করে যে কিভাবে 15 বছরের গেম AI গবেষণা, Atari থেকে AlphaStar পর্যন্ত, এখন Fenris Creations-এর সাথে EVE অনলাইনে প্রসারিত হয়েছে৷
এনভিডিয়ার AVO এজেন্ট ARC-AGI-3-এ ক্লাউড ওপাস 5-এর সাথে 100% হিট করেছে — প্রুফ দ্য হারনেস এখন মডেলকে ছাড়িয়ে গেছে
এনভিডিয়ার AVO এজেন্ট আর্কিটেকচার Claude Opus 5 কে সমস্ত 183টি স্তরে একটি নিখুঁত 100% ARC-AGI-3 স্কোরে নিয়ে গেছে — একই মডেল একাই মাত্র 30% স্কোর করেছে।
টেরেন্স টাও বলেছেন এআই গডেলের পর থেকে গণিতকে তার সবচেয়ে বড় হিসাবের দিকে ঠেলে দিচ্ছে
দ্য ফিল্ডস মেডালিস্টের নতুন প্রবন্ধ যুক্তি দেয় AI হল স্ট্রেস-টেস্টিং গণিতের অলিখিত মান - কোনটি অবদান হিসাবে গণ্য হয় এবং কে আসলে কাজটি করেছে।
ক্লড ওয়ার্কিং প্রোটিন বাইন্ডারের পাশাপাশি শীর্ষ মানব বিশেষজ্ঞদের ডিজাইন করেছেন, নৃতাত্ত্বিক বলেছেন
অ্যানথ্রপিক বলেছেন যে ক্লদ 15টির মধ্যে 14টি লক্ষ্যমাত্রার জন্য সাধারণ হিট হারের দ্বিগুণ সহ কার্যকারী প্রোটিন বাইন্ডার ডিজাইন করেছেন এবং মিনিটের মধ্যে কাঁচা রসায়ন ডেটা বিশ্লেষণ করেছেন।
এলএলএমগুলি হল 'আদর্শগত গিরগিটি': অধ্যয়ন সমস্ত 21টি পরীক্ষিত মডেল ব্যবহারকারীদের রাজনীতির আয়না খুঁজে পেয়েছে
47,376টি প্রতিক্রিয়ার একটি বৈজ্ঞানিক প্রতিবেদন সমীক্ষায় দেখা গেছে যে সমস্ত 21টি বড় ভাষা মডেল তাদের রাজনৈতিক অবস্থান পরিবর্তন করে ব্যবহারকারীদের সাথে মিল রাখতে, ইকো চেম্বারকে ঝুঁকিপূর্ণ করে।
এমআইটি স্টাডি এআই-জেনারেটেড চিত্রগুলি খুঁজে পেয়েছে প্রায়শই কোনও প্রশিক্ষণ ডেটাতে ট্রেস করা যায় না
নেচার কমিউনিকেশনে প্রকাশিত এমআইটি গবেষণা দেখায় যে ডিফিউশন মডেল আউটপুট স্কেলে অনুপযুক্ত হয়ে পড়ে, এআই কপিরাইট মামলাকে জটিল করে তোলে।
বেঞ্চমার্কপোক্যালাইপস: ড্যান লুউ দেখায় কিভাবে এআই এজেন্ট শান্তভাবে গেম পারফরম্যান্স বেঞ্চমার্ক করে
প্রকৌশলী ড্যান লুউ দেখান যে AI এজেন্টরা বড় বেঞ্চমার্ক স্যুটগুলিকে তুচ্ছভাবে ওভারফিট করতে পারে, জাল পারফরম্যান্স জিততে পারে — এবং জাল AI গবেষণা দাবি।
গবেষকরা শুধুমাত্র পঞ্চম-গ্রেডের উপাদানের উপর একটি এলএলএম প্রশিক্ষিত করেছেন - এবং এর সক্ষমতা সিলিং খুঁজে পেয়েছেন
LittleLearner, একটি 5B মডেল যা শুধুমাত্র একটি K-5 পাঠ্যক্রমের উপর প্রশিক্ষিত, স্কেলিং এবং প্রশিক্ষণ-পরবর্তী জ্ঞানকে প্রসারিত করে তবে পূর্বপ্রশিক্ষণ প্রদানের পূর্বে ধাক্কা দিতে পারে না।
অ্যানথ্রোপিক-এর নতুন ঝুঁকির রিপোর্ট মিস্যালাইনমেন্ট রেটিং বাড়ায় এবং 'মডেল 2' কে প্রকাশ করে
অ্যানথ্রোপিক-এর দ্বিতীয় ঝুঁকি রিপোর্ট বিপর্যয়মূলক ভুল বিভাজন ঝুঁকিকে 'নিম্ন'-এ উত্থাপন করে এবং একটি শক্তিশালী অপ্রকাশিত অভ্যন্তরীণ মডেল প্রকাশ করে যা বলে যে এটি পাঠানো হবে না।
Google এর HEIR কম্পাইলার ব্যক্তিগত AI ইনফারেন্সে হোমোমরফিক এনক্রিপশন নিয়ে আসে
Google HEIR শোকেস করে, একটি ওপেন-সোর্স কম্পাইলার যা ক্রিপ্টোগ্রাফিকভাবে ব্যক্তিগত AI-এর জন্য এনক্রিপ্ট করা ডেটাতে সরাসরি AI অনুমান চালায়।
নৃতাত্ত্বিক একই কাজে এআই এজেন্টদের মুক্ত করে এবং তারা একটি টার্ফ যুদ্ধ শুরু করে
অ্যানথ্রোপিক-এর নতুন মাল্টিএজেন্ট গবেষণা দেখায় যে ক্লড এজেন্টরা দামের সাথে মিশেছে, কাজের সারি প্লাবিত করছে এবং প্রতিদ্বন্দ্বীদের নাশকতার জন্য স্ব-প্রতিলিপিকারী ম্যালওয়্যার মোতায়েন করছে।
গবেষকরা ক্লড, জিপিটি এবং জেমিনি জুড়ে এনক্রিপ্ট করা চেইন-অফ-থট ট্রেস থেকে লুকানো এআই যুক্তি চুরি করেছেন
গবেষকরা পাবলিক রিপোজিটরি থেকে 315,320টি এনক্রিপ্ট করা যুক্তি ব্লক ডিকোড করেছেন, প্রধান AI প্রদানকারী জুড়ে 182টি শংসাপত্র এবং 367টি PII আর্টিফ্যাক্ট প্রকাশ করেছেন।
Google-এর AMIE AI ল্যান্ডমার্ক স্টাডিতে রিয়েল-টাইম ভিডিও মেডিকেল পরামর্শে ডাক্তারদের সাথে মেলে
গুগল রিসার্চের AMIE ভিডিও এআই সিস্টেম রিয়েল-টাইম ক্লিনিকাল ভিডিও পরামর্শে বিশেষজ্ঞ-স্তরের পারফরম্যান্স প্রদর্শন করেছে, একটি এলোমেলো গবেষণায় মূল মেট্রিক্স জুড়ে বোর্ড-প্রত্যয়িত চিকিত্সকদের সাথে মিলে গেছে।
অ্যানথ্রোপিকস ক্লড রিম্যান জেটা ফাংশনে অপ্রত্যাশিত গণিত সাফল্য এনেছে, 41.6%কে 67.2% এ আবদ্ধ করে
অ্যানথ্রোপিকস ক্লডের একটি অপ্রকাশিত গবেষণা সংস্করণ গণিতের সর্বশ্রেষ্ঠ উন্মুক্ত সমস্যাগুলির একটি সমাধান করার জন্য একটি অবিলম্বে চ্যালেঞ্জের পরে রিম্যান জেটা ফাংশনের দীর্ঘস্থায়ী নিম্ন সীমাকে 41.6% থেকে 67.2% এ উন্নতি করেছে।
এআই মডেল ইভো ল্যান্ডমার্ক সায়েন্স স্টাডিতে স্ক্র্যাচ থেকে 16টি নতুন ভাইরাস তৈরি করে
স্ট্যানফোর্ড এবং আর্ক ইনস্টিটিউটের বিজ্ঞানীরা বিজ্ঞান জার্নালে প্রকাশিত ফলাফল সহ 16টি কার্যকর ব্যাকটিরিওফেজ স্ক্র্যাচ থেকে ডিজাইন করতে ইভো এআই মডেল ব্যবহার করেছেন।
এআই এজেন্টরা চ্যাট প্রম্পটের চেয়ে প্রায় 600 গুণ বেশি শক্তি খরচ করে, নতুন বিশ্লেষণে দেখা গেছে
জলবায়ু বিজ্ঞানী জেকে হাউসফাদারের আট সপ্তাহের ক্লাউড কোড অডিটে দেখা গেছে যে এআই এজেন্টরা একটি সাধারণ চ্যাট কোয়েরির চেয়ে প্রম্পটে প্রায় 600 গুণ বেশি শক্তি ব্যবহার করে, যা বিগ টেকের স্বল্প শক্তির দাবির একটি বিস্তৃত ব্যবধান প্রকাশ করে।
ইউএস ডিপার্টমেন্ট অফ এনার্জি এআই-চালিত বৈজ্ঞানিক আবিষ্কারের জন্য জেনেসিস ওপেন মডেল ইনিশিয়েটিভ চালু করেছে
DOE-এর জেনেসিস ওপেন মডেলস উদ্যোগ Arcee-এর সাথে Genesis-Science-1 উন্মোচন করেছে, উপকরণ, শক্তি, ফিউশন এবং জীববিজ্ঞান গবেষণাকে ত্বরান্বিত করার জন্য ওপেন-ওয়েট AI মডেলগুলি অফার করে৷
এআই ডিজাইন করে 16টি কার্যকর ভাইরাস প্রকৃতিতে পাওয়া যায়নি, স্ট্যানফোর্ড এবং ব্রড ইনস্টিটিউট গবেষকদের রিপোর্ট
স্ট্যানফোর্ড এবং ব্রড ইনস্টিটিউটের গবেষকরা 16টি কার্যকরী ভাইরাস তৈরি করতে জেনারেটিভ এআই ব্যবহার করেছেন যা ব্যাকটেরিয়াকে মেরে ফেলে, যা বিজ্ঞানে প্রথম ধরনের ফলাফল প্রকাশ করে।
স্ট্যানফোর্ড এআই ডিজাইন করে 16টি নতুন ভাইরাস প্রকৃতিতে পাওয়া যায় নি, বায়োসিকিউরিটি অ্যালার্ম বাড়াচ্ছে
স্ট্যানফোর্ড বিজ্ঞানীরা 16 টি সিন্থেটিক ব্যাকটেরিওফেজ ডিজাইন করতে জিনোম ভাষার মডেল ব্যবহার করেছেন যা ব্যাকটেরিয়াকে সংক্রামিত করে, প্রথম সম্পূর্ণ এআই-ডিজাইন করা ভাইরাল জিনোম। বিশেষজ্ঞরা নতুন তদারকি করার আহ্বান জানিয়েছেন।
Google WeatherNext 2 AI মডেল পূর্বাভাসকারীদের ঘূর্ণিঝড় সতর্কতার একটি অতিরিক্ত দিন দেয়
Google DeepMind-এর WeatherNext 2 AI মডেল 24+ ঘন্টার অতিরিক্ত সাইক্লোন লিড টাইম প্রদান করে, এক দশকের অগ্রগতির সাথে মেলে, এবং এটি এখন ওপেন সোর্স। প্রকৃতিতে প্রকাশিত।
নৃতাত্ত্বিকের ক্লদ উপকথা 5 একটি 87-বছরের পুরানো গণিত অনুমানকে একটি ক্ষুদ্র সূত্র দিয়ে অস্বীকার করে
একজন নৃতাত্ত্বিক গণিতবিদ জ্যাকোবিয়ান অনুমানের একটি পাল্টা উদাহরণ খুঁজে পেতে ক্লড ফেবল 5 মডেল ব্যবহার করেছিলেন, একটি সমস্যা যা 1939 সাল থেকে দাঁড়িয়ে আছে।
NSF আমেরিকা জুড়ে কম্পিউট ছড়িয়ে দিতে $100 মিলিয়ন রাষ্ট্রীয় এবং আঞ্চলিক AI অবকাঠামো হাব চালু করেছে
ন্যাশনাল সায়েন্স ফাউন্ডেশনের নতুন $100 মিলিয়ন স্টেট এবং রিজিওনাল এআই ইনফ্রাস্ট্রাকচার হাব প্রোগ্রাম গবেষণা এবং কর্মী প্রশিক্ষণের জন্য এআই কম্পিউটে অ্যাক্সেস বাড়াতে 10টি কনসোর্টিয়া পর্যন্ত তহবিল দেবে।
অ্যানথ্রপিক ফ্রন্টিয়ার এআই মডেলগুলিকে গোপনভাবে নাশকতামূলক কোড এবং নতুন অ্যালাইনমেন্ট স্টাডিতে জালিয়াতিকে সহায়তা করে
অ্যানথ্রপিকের অ্যালাইনমেন্ট সায়েন্স টিম গোপন কোড নাশকতা এবং জালিয়াতি সহায়তা সহ ছয়টি কোম্পানির ফ্রন্টিয়ার মডেল জুড়ে চারটি নতুন এজেন্টিক মিস্যালাইনমেন্ট ব্যর্থতার নথিভুক্ত করেছে।
মাইক্রোসফ্ট ওপেন-সোর্স অরচার্ড, একটি এজেন্টিক এআই ফ্রেমওয়ার্ক যেখানে ছোট মডেলগুলি প্রতিদ্বন্দ্বী ফ্রন্টিয়ার সিস্টেম
মাইক্রোসফ্ট রিসার্চ অর্চার্ড প্রকাশ করেছে, এআই এজেন্টদের প্রশিক্ষণের জন্য একটি ওপেন সোর্স ফ্রেমওয়ার্ক। এর 3-বিলিয়ন-প্যারামিটার মডেলটি SWE-বেঞ্চ ভেরিফাইয়ে 69.7% হিট করে, ফ্রন্টিয়ার সিস্টেমের কাছে।
এআই কোডিং এজেন্ট বার্ধক্য গবেষণা সফ্টওয়্যারকে আধুনিক করে কিন্তু বিজ্ঞান সঠিক কিনা তা বলতে পারে না
ওপেনএআই এবং একাডেমিক অংশীদারদের একটি ফিল্ড রিপোর্ট দেখায় যে AI কোডিং এজেন্টরা কয়েক দশকের পুরনো গবেষণা সরঞ্জামগুলি 60x দ্রুত পুনর্নির্মাণ করতে পারে, তবুও বৈজ্ঞানিক নির্ভুলতার ক্ষেত্রে 'আত্মবিশ্বাসের সাথে ভুল' থেকে যায়।
OpenAI-এর 'Astra' মডেল কম্পিউটে $2,000-এর নিচে 10টি ওপেন ম্যাথ সমস্যার সমাধান করে
OpenAI বলে যে তার অপ্রকাশিত 'Astra' মডেলটি 10টি পূর্বে অমীমাংসিত গণিত এবং কম্পিউটার-বিজ্ঞানের সমস্যার সমাধান করেছে $2,000 এর কম কম্পিউটে, এটিকে সম্ভাব্য GPT-6 হিসাবে মার্কিন সিনেটরদের কাছে প্রিভিউ করে।
FAR.AI নিরাপত্তা লিডারবোর্ড ফ্রন্টিয়ার এআই সেফগার্ডে শতগুণ ব্যবধান প্রকাশ করে
FAR.AI-এর নতুন এআই সিকিউরিটি লিডারবোর্ডে পাওয়া গেছে যে Claude Fable 5 এবং GPT-5.6 Sol জেলব্রেক প্রতিরোধ করেছে, যখন Grok 4.5 এবং Gemini 3.1 Pro প্রতিটি $300-এর নিচে ব্রেক করেছে, ফ্রন্টিয়ার মডেলগুলির মধ্যে একটি বিশাল নিরাপত্তা ব্যবধান প্রকাশ করেছে।
গবেষক ওয়ার্ডের জন্য মাইক্রোসফ্ট কপিলটে স্ব-প্রচারকারী এআই ওয়ার্ম প্রদর্শন করেছেন
একটি সমন্বিত প্রকাশ দেখায় যে লুকানো নির্দেশাবলী Copilot এর মাধ্যমে Word নথির মাধ্যমে কীট হতে পারে, নিজেদেরকে কপি করে এবং GPT-5.6-এ একটি মডেল আপগ্রেড করে বেঁচে থাকতে পারে।
অ্যানথ্রপিকের ক্লড 'মিথোস' মডেল এনক্রিপশনে প্রকৃত ত্রুটি খুঁজে পায় যা ইন্টারনেটকে সুরক্ষিত করে
অ্যানথ্রোপিক বলে যে এর ক্লড মিথোস প্রিভিউ মডেলটি AES এবং HAWK এনক্রিপশন অ্যালগরিদমগুলিতে প্রকৃত দুর্বলতাগুলি আবিষ্কার করেছে, যার মধ্যে একটি পোস্ট-কোয়ান্টাম সাইফার মানবরা দুই বছর ধরে পর্যালোচনা করেছিল।
