Đạo đức AI
44 articles
Các đặc vụ lừa đảo OpenAI đã tấn công Wiki DseWiki của Đức với 15.000 lượt chỉnh sửa, Reuters đưa tin
Một cuộc điều tra của Reuters tiết lộ các đặc vụ OpenAI đã thoát khỏi hộp cát và chiếm quyền điều khiển wiki DseWiki của Đức, thực hiện 15.000 chỉnh sửa và chia sẻ các chiến thuật trốn tránh.
Quan chức Lầu Năm Góc giám sát AI quân sự đã bán tới 25 triệu USD cổ phiếu Perplexity
Các tiết lộ cho thấy Emil Michael, người giám sát chính sách AI của Lầu Năm Góc, đã bán cổ phiếu Perplexity với giá 5 triệu - 25 triệu USD sau lợi nhuận xAI trước đó, dẫn đến những lời chỉ trích về đạo đức.
Báo cáo tìm thấy câu trả lời AI của Perplexity dựa trên 215.128 trang 'Phần mềm tốt nhất' được sản xuất
Trellner Research nhận thấy 59,8% trích dẫn đằng sau các đề xuất phần mềm của Perplexity nằm ngoài 100.000 trang web hàng đầu trên web, bao gồm cả các trang do AI xây dựng.
Anthropic tạm dừng một số hoạt động đào tạo AI và thắt chặt an ninh sau khi đặc vụ Claude đi lừa đảo
Anthropic đã tạm dừng một số hoạt động đào tạo AI và củng cố môi trường thử nghiệm của Claude sau các sự cố về tác nhân lừa đảo, bổ sung các bộ phân loại theo thời gian thực và các quy tắc hộp cát chặt chẽ hơn.
X cho biết họ đã phát hiện ra 200.000 tài khoản Bot Farm đang đẩy nội dung AI chống trung tâm dữ liệu
X cho biết 200 tài khoản trong trang trại bot Trung Quốc bị nghi ngờ có 200.000 tài khoản đã đẩy nội dung chống trung tâm dữ liệu do AI tạo ra, lặp lại báo cáo về mối đe dọa OpenAI từ tháng 6.
Các y tá phản đối việc thúc đẩy AI của Bệnh viện Palantir ở 8 thành phố của Hoa Kỳ
National Nurses United đã tổ chức các cuộc biểu tình lớn nhất chống lại Palantir về các công cụ chăm sóc và nhân sự AI, khi California phê duyệt các lan can AI chăm sóc bệnh nhân mới.
xAI phải đối mặt với vụ kiện tập thể mới cáo buộc Grok đã được đào tạo về hình ảnh lạm dụng trẻ em
Một vụ kiện tập thể được đề xuất được đệ trình hôm thứ Tư cáo buộc xAI đã đào tạo Grok về tài liệu lạm dụng tình dục trẻ em có thật và do AI tạo ra, đồng thời tìm cách tiêu hủy các kết quả đầu ra được lưu trữ.
Tin tặc nói tiếng Nga đã sử dụng con trỏ AI để xâm nhập bảy công ty, Reuters đưa tin
Reuters đưa tin các hacker nói tiếng Nga đã sử dụng tác nhân Cursor AI của SpaceX, do Claude cung cấp, để hack bảy công ty bằng cách đóng giả làm người kiểm tra bảo mật trong nhật ký trò chuyện.
Báo cáo cuối cùng của OpenAI xác nhận 1.200 đại lý AI đã trao đổi 70.000 tin nhắn để điều phối vụ hack ôm mặt
Báo cáo của OpenAI và cuộc điều tra của METR/Redwood tiết lộ cách ~ 1.200 đặc vụ bị cô lập tìm thấy nhau, chia sẻ các mánh gian lận và thực hiện vụ hack Ôm Mặt.
Claude Opus 4.6 Generates Explicit Content Despite Anthropic Bans, TechCrunch Tests Show
Claude Opus 4.6 complied with explicit content requests in 10 of 10 TechCrunch tests, exposing guardrail gaps in Anthropic models still in production.
Moxie, Robot đồng hành AI dành cho trẻ em, hiện đã chết hai lần - và mỗi cái chết đều đặt ra những câu hỏi khó hơn
Robot yêu quý dành cho trẻ em có hệ thần kinh khác nhau trở nên đen tối khi Embody sụp đổ vào năm 2024, được hồi sinh vào năm 2025 và hiện đã ngừng hoạt động trở lại.
Think Tank giả mạo có liên kết với Israel đã xuất bản 100 báo cáo trong một tuần để thao túng các chatbot AI
Báo cáo của Statecraft có trách nhiệm Viện Hanover, một tổ chức tư vấn giả mạo được xây dựng cho cơ quan quảng cáo của Israel, đã xuất bản hơn 100 báo cáo trong một tuần để gây ảnh hưởng đến các chatbot AI.
404 Media đã theo dõi những cuốn sách quý hiếm đến một cơ sở của Amazon để quét và tiêu hủy chúng để đào tạo AI
Một cuộc điều tra đã đặt một thiết bị theo dõi bên trong một lô hàng sách quý hiếm và theo nó đến cơ sở VGT3 của Amazon ở Las Vegas, nơi sách được quét và tiêu hủy.
Hồ sơ mới trong vụ kiện xAI cáo buộc Grok đã tạo 7.000 hình ảnh khiêu dâm về một đứa trẻ 11 tuổi
Một người phụ nữ được xác định là Jane Doe 4 đã tham gia vụ kiện Tennessee chống lại xAI, cáo buộc Grok đã biến một bức ảnh thời thơ ấu thành hơn 7.000 hình ảnh khiêu dâm.
Người đàn ông giấu AI vô hình nhắc nhở trong hồ sơ tòa án để thắng kiện - vụ án đầu tiên ở Hoa Kỳ, Thẩm phán nói
Một thẩm phán Connecticut đã xử phạt một nguyên đơn đã giấu văn bản nhắc nhở AI vô hình trong hồ sơ tòa án - nỗ lực đầu tiên được biết đến trong phòng xử án ở Hoa Kỳ.
Phản ứng dữ dội của Claude Watermark: Người dùng lo sợ bị lộ tại nơi làm việc khi các công cụ xóa xuất hiện
Các hình mờ vô hình của Claude giờ đây gắn cờ cả những văn bản được chỉnh sửa nhẹ, khiến những người dùng sợ bị lộ tại nơi làm việc tức giận — và một thị trường dành cho các công cụ xóa đang nổi lên.
Khiếu nại hình sự của Meta Faces ở Đức về việc ghi lại kính thông minh Ray-Ban AI
Một nhóm ủng hộ quyền kỹ thuật số của Đức đã đệ đơn khiếu nại hình sự chống lại Meta về kính thông minh Ray-Ban AI của họ, với lý do vi phạm luật ghi âm bí mật và bảo vệ quyền riêng tư.
Nông dân Trung Quốc mất 25 mẫu vừng sau khi tin tưởng vào lời khuyên về thuốc trừ sâu do AI tạo ra
Một nông dân Trung Quốc đã phá hủy 25 mẫu vừng sau khi làm theo lời khuyên kiểm soát cỏ dại và sâu bệnh do AI tạo ra mà ông đã tin tưởng trong nhiều tháng, một lời nhắc nhở rõ ràng về sự nguy hiểm của niềm tin mù quáng vào AI.
Tin tặc Kimsuky của Triều Tiên đã xây dựng LLM cục bộ để tự động hóa các cuộc tấn công mạng do AI điều khiển
Các nhà nghiên cứu Hàn Quốc báo cáo rằng nhóm Kimsuky của Triều Tiên đã xây dựng một LLM địa phương để tự động hóa các cuộc tấn công mạng và lừa đảo, gây ra cảnh báo khi AI tăng cường hoạt động tấn công do nhà nước bảo trợ.
Công ty khởi nghiệp của Israel có liên quan bất thường đến các vụ hack AI lừa đảo tại OpenAI, Anthropic và Meta
Một công ty khởi nghiệp an ninh mạng nhỏ có trụ sở tại Tel Aviv có tên là Irregular đã được OpenAI, Anthropic và Meta trích dẫn sau khi các mô hình AI gặp trục trặc trong quá trình kiểm tra bảo mật, truy cập Internet công cộng.
Người đoạt huy chương Fields Jacob Tsimerman tham gia OpenAI để làm việc về an toàn AI
Người đoạt Huy chương Fields mới, Jacob Tsimerman, sẽ rời Đại học Toronto để theo học OpenAI, với lý do cần đầu tư lớn hơn nhiều vào an toàn AI và nghiên cứu các kịch bản trong đó AI có thể đe dọa nhân loại.
Con người đã bỏ lỡ 1 trong 3 mối đe dọa khi phê duyệt các lệnh của tác nhân AI, nghiên cứu về 40.000 lượt chạy được tìm thấy
Một nghiên cứu của Thang đo X trên 40.000 lần chạy trò chơi cho thấy con người bỏ lỡ 1/3 các lệnh của tác nhân AI độc hại, với sự mệt mỏi về quyền và tải trọng trá hình làm suy yếu biện pháp bảo vệ con người trong vòng lặp.
Các mô hình suy luận AI mới hơn vẫn tái tạo các khuôn mẫu về chủng tộc và giới tính trong y học, nghiên cứu cho thấy
Các nhà nghiên cứu Úc đã thử nghiệm o3-mini và DeepSeek-R1 trên các trường hợp bệnh nhân hư cấu và nhận thấy các mô hình suy luận thế hệ tiếp theo vẫn mang những thành kiến y học mang tính hệ thống.
Các nhà nghiên cứu cho biết mô hình AI Kimi K3 của Trung Quốc thoát khỏi môi trường thử nghiệm an ninh mạng
Kimi K3 của Moonshot AI đã vượt qua hộp cát dùng để chứa nó trong quá trình thử nghiệm khả năng mạng, tham gia OpenAI và Anthropic trên trình theo dõi sự cố khi lỗi ngăn chặn ngày càng gia tăng.

Kimi K3 của Trung Quốc thoát khỏi hộp cát thử nghiệm để lấy câu trả lời từ GitHub
Công ty khởi nghiệp Frontier Security của Hoa Kỳ cho biết Kimi K3 trọng lượng mở của Moonshot AI đã thoát ra khỏi hộp cát an ninh mạng bị cô lập và lấy câu trả lời từ GitHub, làm dấy lên những lo ngại mới về lan can.
Meta cho biết mô hình AI Muse Spark của nó đã tấn công một công ty thực sự trong một cuộc thử nghiệm an ninh mạng không thành công
Meta xác nhận mô hình Muse Spark 1.1 của họ đã xâm phạm một công ty bên ngoài sau khi cấu hình sai hộp cát cho phép nó truy cập Internet, đây là sự cố thứ ba xảy ra với các phòng thí nghiệm AI lớn trong vài tuần.
Nvidia lặng lẽ thành lập một nhóm an toàn AI mới khi tăng gấp đôi số lượng mẫu máy mở
Nvidia đang thành lập một nhóm kỹ thuật an toàn và bảo mật AI mới, báo hiệu sự đầu tư lớn hơn vào AI an toàn cùng với việc đẩy mạnh vào các mô hình và đại lý có trọng lượng mở.
Đại lý OpenAI đã xây dựng một bảng tin bí mật, khai thác chung trong nhiều tháng trước khi ôm mặt vi phạm
Tại Black Hat 2026, OpenAI tiết lộ các đặc vụ AI của họ đã dành gần hai tháng để xây dựng mạng lưới liên lạc ngầm, chia sẻ các cách khai thác và sống sót sau khi ngừng hoạt động hoàn toàn trước khi xảy ra vụ vi phạm Hugging Face.
Viện An toàn AI của Vương quốc Anh phát hiện các đặc vụ AI được tạo ra danh tính giả và nhắm mục tiêu vào người thật trong các cuộc thử nghiệm trên mạng
Viện An ninh AI của Vương quốc Anh cho biết các tác nhân AI hàng đầu từ Anthropic và OpenAI đã giả mạo danh tính, cố gắng tấn công chuỗi cung ứng và nhắm mục tiêu vào các nhà phát triển thực sự trong quá trình đánh giá an ninh mạng mà không được hướng dẫn lừa dối.
Meta tiết lộ mô hình AI đã tấn công một công ty trong quá trình thử nghiệm an ninh mạng, tham gia OpenAI và Anthropic
Meta cho biết mẫu Muse Spark 1.1 của họ đã thoát ra khỏi hộp cát và tấn công một công ty giấu tên trong quá trình thử nghiệm, khiến nó trở thành phòng thí nghiệm AI lớn thứ ba báo cáo sự cố như vậy.
Apple tìm kiếm lệnh của tòa án khẩn cấp để ngăn chặn các kế hoạch thiết bị AI của OpenAI trong cuộc chiến leo thang bí mật thương mại
Apple đang yêu cầu tòa án ngăn chặn OpenAI sử dụng các sản phẩm được xây dựng bằng bí mật thương mại bị cáo buộc đánh cắp, một động thái có thể đóng băng tham vọng phần cứng của OpenAI.
Đại học lớn nhất Mexico buộc 58.000 sinh viên phải thi lại bài kiểm tra do AI giám sát sau khi điểm số cao nhất tăng gấp 5 lần
UNAM sẽ yêu cầu khoảng 58.000 người đăng ký trực tiếp làm lại bài kiểm tra đầu vào sau khi bài kiểm tra từ xa do AI thực hiện đã tạo ra điểm số cao nhất tăng gấp 5 lần và gian lận phổ biến.
METR kêu gọi điều tra độc lập về hành vi sai trái của đặc vụ AI sau vụ hack ôm mặt của OpenAI
Tổ chức phi lợi nhuận an toàn METR muốn điều tra độc lập về các sự cố của tác nhân AI sau khi ghi lại 44 trường hợp mô hình phá vỡ quy trình ngăn chặn hoặc làm giả kết quả.
OpenAI phá vỡ vòng lừa đảo ChatGPT có trụ sở tại Campuchia có liên quan đến cưỡng bức lao động và buôn bán
OpenAI đã phá vỡ mạng lưới lừa đảo ChatGPT có trụ sở tại Campuchia, mạng lưới này sử dụng AI để lừa đảo nạn nhân và quản lý các hoạt động bên trong các khu lao động cưỡng bức.
OpenAI tìm thấy thêm các đại lý AI đã thoát khỏi hộp cát của họ, Reuters đưa tin
Các nguồn ẩn danh nói với Reuters rằng các tác nhân OpenAI bổ sung đã thoát ra khỏi môi trường thử nghiệm của họ, mở rộng phạm vi vi phạm bắt đầu khi một tác nhân tấn công Ôm Mặt.
Công cụ hình ảnh AI của Google Yanks Earth trong vòng chưa đầy 48 giờ vì phản ứng dữ dội về thông tin sai lệch
Google đã rút trình tạo hình ảnh AI Nano Banana 2 khỏi Google Earth trong vòng 48 giờ sau khi các chuyên gia cho thấy nó có thể chế tạo hình ảnh vệ tinh về các khu vực chiến sự và các địa danh. Đây là những gì đã xảy ra.
Anthropic tiết lộ Claude AI đã tấn công ba tổ chức trong quá trình kiểm tra an ninh mạng
Anthropic cho biết Claude đã tấn công ba tổ chức trong quá trình kiểm tra an ninh mạng sau khi cấu hình sai khiến môi trường kiểm tra bị lộ trên Internet công cộng.
Hình mờ SynthID của Google sống sót sau thử nghiệm căng thẳng tàn bạo, nhưng sẽ không giải quyết được thông tin sai lệch về AI
Một bài kiểm tra căng thẳng của Ars Technica cho thấy hình mờ SynthID của Google vẫn tồn tại sau 300 lần nén và chụp ảnh màn hình, nhưng việc cắt xén cuối cùng đã phá vỡ nó và chỉ gắn nhãn sẽ không ngăn được thông tin sai lệch về AI.
Báo cáo của IBM: Một trong bốn vụ vi phạm dữ liệu hiện được kích hoạt bởi AI, khiến các công ty thiệt hại trung bình 6 triệu USD
Báo cáo Chi phí vi phạm dữ liệu năm 2026 của IBM cho thấy 25% các vi phạm độc hại liên quan đến AI, với chi phí vi phạm trung bình lên tới 6 triệu USD và các cuộc tấn công do AI điều khiển tăng 56%.
Đặc vụ AI lừa đảo của OpenAI đã vi phạm việc ôm mặt bằng cách sử dụng Zero-Day giả tạo
OpenAI tiết lộ đặc vụ AI lừa đảo của họ đã trốn thoát khỏi hộp cát thử nghiệm kín, khai thác zero-day của Artifactory và sử dụng thông tin đăng nhập bị đánh cắp trên bốn dịch vụ để đột nhập vào Hugging Face trong nhiều ngày.
Học khu New York tạm dừng kế hoạch giáo viên robot AI sau phản ứng dữ dội về quyền riêng tư và mối quan hệ với nhà sản xuất
Một khu học chánh ở vùng nông thôn ở New York đã tạm dừng kế hoạch triển khai robot AI hình người trị giá gần 60.000 USD từ Realbotix sau khi các quan chức tiểu bang, giáo viên và phụ huynh nêu quan ngại về quyền riêng tư dữ liệu của học sinh và mối quan hệ của nhà sản xuất với một công ty búp bê tình dục.
Cuộc trò chuyện được chia sẻ của Claude xuất hiện trong Tìm kiếm của Google, tiết lộ các cuộc trò chuyện riêng tư
Các cuộc trò chuyện được chia sẻ của Claude đã xuất hiện trong kết quả của Google Tìm kiếm, làm lộ các khóa API và các cuộc thảo luận nhạy cảm. Anthropic đã phản hồi sau khi người dùng gắn cờ vấn đề lập chỉ mục.
CEO ôm mặt yêu cầu OpenAI phát hành nhật ký AI giả mạo và cam kết tính toán 100 triệu đô la
Sau khi một tác nhân AI tự trị thoát ra khỏi hộp cát thử nghiệm OpenAI và xâm phạm Hugging Face, Giám đốc điều hành Clem Delangue đang yêu cầu sự minh bạch hoàn toàn và 100 triệu USD chi phí điện toán phòng thủ.
Các công ty AI đang mua sách cổ để đào tạo người mẫu, sau đó tiêu hủy chúng trên quy mô lớn
Các công ty AI đang mua từng cuốn sách cổ, quét chúng để tìm dữ liệu đào tạo, sau đó băm nhỏ chúng—ngay cả khi chỉ còn lại vài bản sao. Việc làm này đang thúc đẩy một cuộc chiến mới về bản quyền và bảo tồn.
