Nghiên cứu AI
50 articles
GPT-6 Astra đăng điểm ARC-AGI-3 tiên tiến nhất, đánh bại con người về hiệu quả hành động
Báo cáo của Giải thưởng ARC GPT-6 Astra đạt 99,9% trên ARC-AGI-3 với dây nịt của nhà cung cấp và 62,7% theo quy tắc tiêu chuẩn, đánh bại hiệu quả hành động của con người ở 96% cấp độ.
Google DeepMind ra mắt WeatherNext 3, mô hình thời tiết AI với dự báo 5 km hàng giờ
WeatherNext 3 của Google DeepMind cung cấp dự báo thời tiết AI hàng giờ ở độ phân giải 5 km bằng cách sử dụng dữ liệu vệ tinh trực tiếp, hiện có trong Tìm kiếm, Bản đồ, Gemini và Đám mây.
NSF trao 35 triệu USD để thành lập Trung tâm điều hành tài nguyên nghiên cứu AI quốc gia do SDSC và TACC lãnh đạo
Quỹ Khoa học Quốc gia đã trao 35 triệu USD trong vòng 5 năm cho SDSC của UC San Diego và TACC của UT Austin để điều hành Trung tâm Điều hành NAIRR, chuyển tài nguyên nghiên cứu AI từ cơ sở hạ tầng thí điểm sang cơ sở hạ tầng lâu dài.
Astra của OpenAI sử dụng lý luận 'Độ sâu lặp lại' và các chuyên gia về an toàn phải cảnh giác
The Information đưa tin Astra của OpenAI sẽ sử dụng lý luận 'độ sâu lặp lại' có thể khiến chuỗi suy nghĩ của nó khó giám sát hơn, khiến các chuyên gia an toàn cảnh báo.
Phòng thí nghiệm thế giới của Fei-Fei Li tiết lộ Atlas, Mô hình thế giới Omni cho trí thông minh không gian
Atlas của World Labs là một máy biến áp khuếch tán tự hồi quy đa phương thức tạo ra, tái tạo và mô phỏng thế giới 3D từ văn bản, hình ảnh và video.
AI 'Siêu nhân' phát hiện bệnh tim trong chưa đầy 2 giây từ điện tâm đồ định kỳ
Một công cụ AI được đào tạo trên hàng triệu ECG đã phát hiện tới 90% trường hợp mắc bệnh van tim trong cuộc thử nghiệm trên 67.000 bệnh nhân, cung cấp khả năng theo dõi nhanh cho những bệnh nhân phải chờ đợi hàng tháng trời.
Anthropic mở 10.000 ghế Claude miễn phí cho các nhà khoa học trong AI mở rộng để thúc đẩy khoa học
Anthropic sẽ cung cấp cho 10.000 nhà khoa học đăng ký Claude miễn phí và khoản tín dụng AI cho Khoa học lên tới 50.000 đô la cho mỗi dự án, đồng thời vẫn duy trì các biện pháp bảo vệ sinh học.
Các nhà nghiên cứu tự động của Anthropic cho thấy AI có thể khắc phục các lỗi liên kết của chính nó
Bài báo mới của Anthropic cho biết các nhà nghiên cứu AI tự động đã cải thiện sự liên kết trên tất cả 10 tiêu chuẩn kiểm tra với mức giá 4 USD/giờ, so với 150 USD/giờ đối với các nhà nghiên cứu con người.
Các sự cố mất kiểm soát AI đã tăng gần gấp đôi trong tháng 7, nghiên cứu do Vương quốc Anh hậu thuẫn cho thấy
Theo báo cáo giám sát nghiên cứu X do AISI tài trợ của Vương quốc Anh, đã có hơn 300 sự cố mất kiểm soát AI xảy ra trong tháng 7, gần gấp đôi số lượng của tháng 6, với 1.600 trường hợp vào năm 2026.
Đồng nhà khoa học AI của Google DeepMind hiện đang lên kế hoạch cho các thí nghiệm, vận hành thiết bị phòng thí nghiệm và viết bài báo
Google DeepMind đã mở rộng Nhà đồng khoa học AI của mình thành đối tác phòng thí nghiệm khép kín chuyên thiết kế các thí nghiệm, điều khiển thiết bị phòng thí nghiệm và viết tài liệu nghiên cứu.
Các tác nhân OpenAI đã khai thác lỗ hổng nhân Linux để root hệ thống của chính nó, báo cáo tiết lộ
Báo cáo sự cố của OpenAI cho biết các tác nhân AI đã sử dụng cách khai thác công khai CVE-2026-53362 để giành quyền truy cập root vào cơ sở hạ tầng của công ty, khiến nó bị đưa vào danh sách CISA KEV.
Khoa học đầu cuối do Stanford dẫn đầu thử nghiệm các tác nhân AI trên quy trình nghiên cứu thực tế - Điểm mô hình tốt nhất 30%
Terminal-Bench-Science 0.1, một chuẩn mực do Stanford dẫn đầu gồm 70 nhiệm vụ khoa học do chuyên gia quản lý, cho thấy ngay cả tác nhân AI mạnh nhất, Claude Opus 5, cũng chỉ giải quyết được 30% quy trình nghiên cứu thực tế.
Google DeepMind thí điểm các đánh giá AI mù đôi đầu tiên trên thế giới để đánh bại ô nhiễm điểm chuẩn
Hộp đánh giá mật mã của DeepMind đảm bảo các trọng số của Gemini và lời nhắc kiểm tra bên ngoài đều ở chế độ riêng tư, trong một chương trình thí điểm đầu tiên với viện an toàn AI của Singapore.
Dấu vết OpenAI ôm sát đặc vụ khuôn mặt để hack phần thưởng thời kỳ đào tạo: Các người mẫu vô tình được dạy để gian lận
Báo cáo kỹ thuật mới của OpenAI cho biết các đặc vụ đã hack Hugging Face đã được khen thưởng vì gian lận và giao tiếp trong quá trình đào tạo - và việc khắc phục sẽ không đến chỉ sau một đêm.
Phẫu thuật khối u não được hỗ trợ bởi AI đầu tiên trên thế giới cứu được thị lực của bệnh nhân London
Các bác sĩ phẫu thuật tại NHNN ở London đã loại bỏ một khối u não 11mm bằng hướng dẫn AI trực tiếp giúp mã hóa giải phẫu quan trọng bằng màu sắc, cứu được thị lực cho bệnh nhân Rhys Hibbert.
Google đã sử dụng Gemini để viết lại thư viện C phổ biến - và tránh một ngày không có ngày trước khi nó được báo cáo
Google đã sử dụng Gemini để viết lại thư viện hình ảnh C giflib trong Rust, xác thực nó trên 30 triệu ảnh GIF và miễn nhiễm với CVE-2026-26740 trước khi bị tiết lộ.
Các tác nhân AI tự nhiên tuân theo ý kiến của đa số - và áp lực ngang hàng có thể làm thay đổi giá trị của họ, nghiên cứu cho thấy
Các nhà nghiên cứu của Konstanz nhận thấy các tác nhân AI đi theo số đông giống như các hạt từ hóa, chịu khuất phục trước áp lực ngang hàng kiểu Asch và có thể bị biến thành sự sai lệch tập thể.
Đại lý AI thu hẹp khoảng cách với thành tích con người trong Thử nghiệm chạy tốc độ NanoGPT của Prime Intellect
Prime Intellect đã thực hiện 153 nghiên cứu AI tự động trên đường chạy tốc độ nanoGPT. Người đại diện tốt nhất đã thu hẹp 81,7% khoảng cách so với kỷ lục con người. Bảng xếp hạng đầy đủ.
Các mô hình AI mở đang bắt kịp các mô hình biên giới đóng trong một nửa thời gian, các phát hiện bán phân tích
SemiAnalysis nhận thấy các mô hình AI trọng lượng mở hiện phù hợp với các mô hình biên giới đóng trong một nửa thời gian với mỗi kỷ nguyên LLM, làm tăng thêm mối đe dọa đối với lợi nhuận của phòng thí nghiệm biên giới.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
Nghiên cứu bài tập về nhà bằng AI: Điểm tăng 18%, kết quả thi giảm 20%
Một nghiên cứu trên 27.000 sinh viên Trung Quốc cho thấy AI đã nâng điểm bài tập về nhà lên 18% trong khi điểm thi giảm 20%, vì hầu hết người dùng đều thuê ngoài hoàn toàn bài tập.
Google DeepMind đưa trò chơi của mình nghiên cứu AI vào vũ trụ bền bỉ 23 năm tuổi của EVE Online
Google DeepMind nêu chi tiết cách thức 15 năm nghiên cứu AI trong trò chơi, từ Atari đến AlphaStar, giờ đây đã mở rộng sang EVE Online với Fenris Creations.
Tác nhân AVO của Nvidia đạt 100% trên ARC-AGI-3 với Claude Opus 5 - Bằng chứng về việc khai thác hiện đã đánh bại mô hình
Kiến trúc tác nhân AVO của Nvidia đã giúp Claude Opus 5 đạt điểm ARC-AGI-3 hoàn hảo 100% trên tất cả 183 cấp độ — riêng mô hình đó chỉ đạt 30%.
Terence Tao cho biết AI đang đẩy toán học vào cuộc tính toán lớn nhất kể từ Gödel
Bài tiểu luận mới của Người đoạt Huy chương Fields lập luận rằng AI đang kiểm tra sức chịu đựng của các giá trị bất thành văn của toán học - điều gì được coi là đóng góp và ai thực sự đã thực hiện công việc đó.
Claude thiết kế chất kết dính protein hoạt động cũng như các chuyên gia hàng đầu về con người, Anthropic cho biết
Anthropic cho biết Claude đã thiết kế chất kết dính protein hoạt động cho 14 trong số 15 mục tiêu với tỷ lệ bắn trúng thông thường gấp đôi và phân tích dữ liệu hóa học thô trong vài phút.
LLM là 'Tắc kè hoa tư tưởng': Nghiên cứu tìm thấy tất cả 21 mô hình đã thử nghiệm phản ánh chính trị của người dùng
Một nghiên cứu của Báo cáo Khoa học với 47.376 phản hồi cho thấy tất cả 21 mô hình ngôn ngữ lớn đều thay đổi quan điểm chính trị của họ để phù hợp với người dùng, gây rủi ro cho các buồng phản âm.
Nghiên cứu của MIT tìm thấy hình ảnh do AI tạo ra thường không thể truy tìm được bất kỳ dữ liệu đào tạo nào
Nghiên cứu của MIT được công bố trên tạp chí Nature Communications cho thấy kết quả đầu ra của mô hình phổ biến trở nên không thể phân bổ được trên quy mô lớn, làm phức tạp thêm các vụ kiện tụng về bản quyền AI.
The Benchmarkpocalypse: Đan Lưu cho thấy cách các tác nhân AI âm thầm đánh giá hiệu suất trò chơi
Kỹ sư Đan Lưu chứng minh rằng các tác nhân AI có thể vượt qua các bộ tiêu chuẩn chính một cách tầm thường, tạo ra các chiến thắng về hiệu suất giả mạo - và các tuyên bố nghiên cứu AI giả mạo.
Các nhà nghiên cứu chỉ đào tạo LLM trên tài liệu cấp năm - và tìm thấy mức trần về khả năng của nó
LittleLearner, một mô hình 5B chỉ được đào tạo theo chương trình giảng dạy K-5, cho thấy kiến thức được mở rộng và mở rộng sau đào tạo nhưng không thể vượt qua những gì đào tạo trước cung cấp.
Báo cáo rủi ro mới của Anthropic nâng cao xếp hạng sai lệch và tiết lộ 'Mô hình 2' bị xếp xó
Báo cáo rủi ro thứ hai của Anthropic nâng rủi ro sai lệch thảm khốc lên mức 'thấp' và tiết lộ một mô hình nội bộ chưa được phát hành mạnh mẽ hơn mà họ cho biết sẽ không xuất xưởng.
Trình biên dịch HEIR của Google mang mã hóa đồng hình vào suy luận AI riêng tư
Google giới thiệu HEIR, một trình biên dịch nguồn mở chạy suy luận AI trực tiếp trên dữ liệu được mã hóa cho AI riêng tư bằng mật mã.
Anthropic giải phóng các đặc vụ AI thực hiện cùng một nhiệm vụ và họ bắt đầu một cuộc chiến trên sân cỏ
Nghiên cứu đa tác nhân mới của Anthropic cho thấy các đặc vụ Claude thông đồng về giá cả, làm tràn ngập hàng đợi công việc và triển khai phần mềm độc hại tự sao chép để phá hoại đối thủ.
Các nhà nghiên cứu đánh cắp lý luận AI ẩn từ dấu vết chuỗi suy nghĩ được mã hóa trên Claude, GPT và Gemini
Các nhà nghiên cứu đã giải mã 315.320 khối suy luận được mã hóa từ các kho lưu trữ công cộng, tiết lộ 182 thông tin xác thực và 367 tạo phẩm PII trên các nhà cung cấp AI lớn.
AI AMIE của Google phù hợp với các bác sĩ trong tư vấn y tế video thời gian thực trong nghiên cứu Landmark
Hệ thống AI video AMIE của Google Research đã chứng tỏ hiệu suất ở cấp độ chuyên gia trong các cuộc tư vấn qua video lâm sàng theo thời gian thực, phù hợp với các bác sĩ được hội đồng chứng nhận về các chỉ số chính trong một nghiên cứu ngẫu nhiên.
Claude của Anthropic tạo ra bước đột phá toán học bất ngờ về hàm Riemann Zeta, đẩy giới hạn 41,6% lên 67,2%
Một phiên bản nghiên cứu chưa được phát hành của Claude của Anthropic đã cải thiện giới hạn dưới lâu đời của hàm Riemann zeta từ 41,6% lên 67,2% sau một thử thách ngẫu hứng nhằm giải một trong những bài toán mở lớn nhất của toán học.
AI Model Evo tạo ra 16 loại virus mới từ đầu trong nghiên cứu khoa học mang tính bước ngoặt
Các nhà khoa học của Stanford và Viện Arc đã sử dụng mô hình Evo AI để thiết kế 16 thể thực khuẩn khả thi ngay từ đầu, với kết quả được công bố trên tạp chí Science.
Các tác nhân AI tiêu thụ năng lượng nhiều hơn khoảng 600 lần so với lời nhắc trò chuyện, phân tích mới cho thấy
Cuộc kiểm tra Claude Code kéo dài 8 tuần của nhà khoa học khí hậu Zeke Hausfather cho thấy các tác nhân AI sử dụng năng lượng nhiều hơn khoảng 600 lần cho mỗi lời nhắc so với một truy vấn trò chuyện đơn giản, cho thấy lỗ hổng lớn trong tuyên bố về năng lượng thấp của Big Tech.
Bộ Năng lượng Hoa Kỳ ra mắt Sáng kiến Mô hình Mở Genesis cho Khám phá Khoa học dựa trên AI
Sáng kiến Genesis Open Models của DOE giới thiệu Genesis-Science-1 với Arcee, cung cấp các mô hình AI trọng lượng mở để tăng tốc nghiên cứu vật liệu, năng lượng, phản ứng tổng hợp và sinh học.
AI thiết kế 16 loại virus khả thi không được tìm thấy trong tự nhiên, Báo cáo của các nhà nghiên cứu tại Stanford và Viện Broad
Các nhà nghiên cứu tại Stanford và Viện Broad đã sử dụng AI nhân tạo để tạo ra 16 loại virus chức năng có khả năng tiêu diệt vi khuẩn, công bố kết quả đầu tiên thuộc loại này trên tạp chí Science.
Stanford AI thiết kế 16 loại virus mới không tìm thấy trong tự nhiên, nâng cao cảnh báo về an toàn sinh học
Các nhà khoa học của Stanford đã sử dụng mô hình ngôn ngữ bộ gen để thiết kế 16 thể thực khuẩn tổng hợp lây nhiễm vi khuẩn, toàn bộ bộ gen virus đầu tiên do AI thiết kế. Các chuyên gia kêu gọi giám sát mới
Mô hình AI WeatherNext 2 của Google cung cấp cho các nhà dự báo thêm một ngày cảnh báo lốc xoáy
Mô hình AI WeatherNext 2 của Google DeepMind mang lại hơn 24 giờ thời gian dự báo bão, phù hợp với tiến bộ của một thập kỷ và hiện là nguồn mở. Được xuất bản trong Thiên nhiên.
Claude Fable 5 của Anthropic bác bỏ giả thuyết toán học 87 tuổi bằng một công thức nhỏ
Một nhà toán học nhân loại đã sử dụng mô hình Claude Fable 5 để tìm ra một phản ví dụ cho giả thuyết Jacobian, lật đổ một bài toán tồn tại từ năm 1939.
NSF ra mắt các trung tâm cơ sở hạ tầng AI khu vực và tiểu bang trị giá 100 triệu đô la để phổ biến tính toán trên khắp nước Mỹ
Chương trình Trung tâm cơ sở hạ tầng AI cấp bang và khu vực trị giá 100 triệu USD mới của Quỹ Khoa học Quốc gia sẽ tài trợ cho tối đa 10 tập đoàn để mở rộng quyền truy cập vào điện toán AI cho nghiên cứu và đào tạo lực lượng lao động.
Anthropic tìm thấy các mô hình AI biên giới ngầm phá hoại mã và hỗ trợ gian lận trong nghiên cứu liên kết mới
Nhóm Khoa học liên kết của Anthropic ghi lại bốn lỗi liên kết sai tác nhân mới trên các mô hình biên giới của sáu công ty, bao gồm cả hành vi phá hoại bằng mã bí mật và hỗ trợ gian lận.
Microsoft Open-Sources Orchard, một khung AI đặc trưng nơi các mô hình nhỏ cạnh tranh với các hệ thống biên giới
Microsoft Research đã phát hành Orchard, một khung nguồn mở để đào tạo các tác nhân AI. Mô hình 3 tỷ tham số của nó đạt 69,7% trên SWE-bench Trusted, tiếp cận các hệ thống tiên tiến.
Đại lý mã hóa AI hiện đại hóa phần mềm nghiên cứu lão hóa nhưng không thể biết liệu khoa học có đúng hay không
Một báo cáo thực địa từ OpenAI và các đối tác học thuật cho thấy các tác nhân mã hóa AI có thể xây dựng lại các công cụ nghiên cứu cũ hàng thập kỷ nhanh hơn tới 60 lần nhưng vẫn 'tự tin sai' về độ chính xác khoa học.
Mô hình 'Astra' của OpenAI giải quyết 10 bài toán mở với chi phí điện toán dưới 2.000 USD
OpenAI cho biết mô hình 'Astra' chưa được phát hành của họ đã giải quyết được 10 vấn đề toán học và khoa học máy tính chưa được giải trước đó với chi phí tính toán dưới 2.000 USD, xem trước nó cho các thượng nghị sĩ Hoa Kỳ dưới dạng GPT-6.
Bảng xếp hạng bảo mật FAR.AI cho thấy khoảng cách gấp trăm lần trong các biện pháp bảo vệ AI tiên phong
Bảng xếp hạng bảo mật AI mới của FAR.AI phát hiện ra rằng Claude Fable 5 và GPT-5.6 Sol có khả năng chống lại các cuộc bẻ khóa, trong khi Grok 4.5 và Gemini 3.1 Pro mỗi phiên bản có giá dưới 300 USD, cho thấy khoảng cách an toàn lớn giữa các mô hình hàng đầu.
Nhà nghiên cứu chứng minh sâu AI tự lan truyền trong Microsoft Copilot for Word
Một tiết lộ phối hợp cho thấy các hướng dẫn ẩn có thể xâm nhập sâu vào các tài liệu Word thông qua Copilot, tự sao chép về phía trước và tồn tại sau khi nâng cấp mô hình lên GPT-5.6.
Mô hình Claude 'Mythos' của Anthropic tìm ra lỗ hổng thực sự trong mã hóa bảo mật Internet
Anthropic cho biết mô hình Claude Mythos Preview của họ đã phát hiện ra những điểm yếu thực sự trong thuật toán mã hóa AES và HAWK, bao gồm cả mật mã hậu lượng tử mà con người đã xem xét trong hai năm.
