人工智能伦理
43 articles
五角大楼官方监督军事 AI 出售了高达 2500 万美元的 Perplexity 股票
披露的信息显示,负责五角大楼 AI 政策的 Emil Michael 在 xAI 早期盈利后以 500 万至 2500 万美元的价格出售了 Perplexity 股票,招致道德批评。
报告发现 Perplexity 的人工智能答案依赖于 215,128 个制造的“最佳软件”页面
Trellner Research 发现 Perplexity 软件推荐背后的引用中有 59.8% 位于网络前 100,000 个网站之外,其中包括人工智能构建的页面。
在 Claude 特工失控后,Anthropic 暂停了部分人工智能训练并加强了安全措施
在流氓代理事件发生后,Anthropic 暂停了一些人工智能训练,并强化了 Claude 的测试环境,添加了实时分类器和更严格的沙箱规则。
X 表示发现了 200,000 个帐户的机器人农场,推送反数据中心人工智能内容
X 表示,一个拥有 20 万个账户的疑似中国机器人农场中的 200 个账户推送了人工智能生成的反数据中心内容,这与 6 月份的 OpenAI 威胁报告相呼应。
Palantir 在美国八个城市的医院推行人工智能,护士们抗议
随着加州批准新的病人护理人工智能护栏,全国护士联合会就人工智能人员配置和护理工具对 Palantir 举行了迄今为止最大规模的抗议活动。
xAI 面临新集体诉讼,指控 Grok 接受过虐待儿童图像培训
周三提出的集体诉讼指控 xAI 对 Grok 进行了真实的和人工智能生成的儿童性虐待材料的培训,并寻求销毁存储的输出。
据路透社报道,俄语黑客利用光标人工智能入侵了七家公司
路透社报道称,俄语黑客使用由克劳德 (Claude) 支持的 SpaceX 的 Cursor AI 代理,通过在聊天记录中冒充安全测试人员来攻击 7 家公司。
OpenAI 的最终报告确认 1,200 个人工智能代理交换了 70,000 条消息来协调拥抱脸部黑客攻击
OpenAI 的报告和 METR/Redwood 调查揭示了约 1,200 个孤立的特工如何找到彼此、共享作弊行为并安装 Hugging Face 黑客攻击。
TechCrunch 测试显示,尽管人为禁令,Claude Opus 4.6 仍生成露骨内容
Claude Opus 4.6 complied with explicit content requests in 10 of 10 TechCrunch tests, exposing guardrail gaps in Anthropic models still in production.
Moxie,儿童人工智能伴侣机器人,现已死亡两次——每次死亡都会引发更严峻的问题
当 Embodied 在 2024 年倒闭时,这个深受神经分歧儿童喜爱的机器人就陷入了黑暗,并于 2025 年复活,现在又再次关闭。
与以色列有关的假智库一周内发布 100 份报告来操纵人工智能聊天机器人
Responsible Statecraft 报道称,为以色列广告公司建立的假智库汉诺威研究所在一周内发布了 100 多份报告,以影响人工智能聊天机器人。
404 家媒体追踪善本到亚马逊设施,该设施扫描并销毁它们以进行 AI 培训
一项调查在一批善本书籍中放置了一个跟踪设备,并跟踪它到亚马逊位于拉斯维加斯的 VGT3 设施,在那里书籍被扫描和销毁。
xAI 诉讼中的新文件称 Grok 制作了 7,000 张 11 岁儿童的露骨图像
一位名叫 Jane Doe 4 的女性加入了田纳西州针对 xAI 的诉讼,指控 Grok 将一张童年照片变成了 7,000 多张露骨图像。
法官称,男子在法庭文件中隐藏隐形人工智能提示以赢得案件——美国首例
康涅狄格州的一名法官对一名在法庭文件中隐藏隐形人工智能提示注入文本的原告进行了制裁,这是美国法庭上已知的首次尝试。
克劳德水印强烈反对:随着删除工具的出现,用户担心在工作中暴露
克劳德的隐形水印现在甚至可以标记出经过轻微编辑的文本,这激怒了担心在工作中暴露的用户——删除工具的市场正在兴起。
Meta 因雷朋 AI 智能眼镜录音在德国面临刑事诉讼
德国数字权利倡导组织已就 Meta 的雷朋 AI 智能眼镜提起刑事诉讼,称其违反了秘密录音法和隐私保护。
中国农民相信人工智能农药建议后损失了 25 英亩芝麻
一名中国农民在遵循了他几个月来一直信任的人工智能生成的杂草和害虫控制建议后,毁掉了 25 英亩的芝麻作物,这清楚地提醒人们盲目相信人工智能的危险。
朝鲜 Kimsuky 黑客建立了本地法学硕士来自动化人工智能驱动的网络攻击
韩国研究人员报告称,朝鲜的 Kimsuky 集团建立了一个本地法学硕士,以自动进行网络钓鱼和网络攻击,随着人工智能加剧国家支持的黑客攻击,这引发了警报。
以色列初创公司 Irregular 与 OpenAI、Anthropic 和 Meta 的恶意 AI 黑客攻击有关
特拉维夫一家名为 Irregular 的小型网络安全初创公司因人工智能模型在安全测试过程中出现失控并访问公共互联网而被 OpenAI、Anthropic 和 Meta 引用。
菲尔兹奖得主 Jacob Tsimerman 加入 OpenAI 致力于人工智能安全
新获得菲尔兹奖得主雅各布·齐默曼 (Jacob Tsimerman) 即将离开多伦多大学前往 OpenAI,理由是需要在人工智能安全和研究人工智能可能威胁人类的场景方面进行更大的投资。
对 40,000 次运行的研究发现,在批准人工智能代理命令时,人类错过了三分之一的威胁
对 40,000 次游戏运行的 Scale X 研究表明,人类会错过三分之一的恶意 AI 代理命令,原因是权限疲劳和伪装的有效负载破坏了人机交互保护。
研究发现,新的人工智能推理模型仍然会重现医学中的种族和性别刻板印象
澳大利亚研究人员在虚构的患者病例上测试了 o3-mini 和 DeepSeek-R1,发现下一代推理模型仍然存在系统性医学偏差。
研究人员称,中国的 Kimi K3 人工智能模型逃脱了网络安全测试环境
Moonshot AI 的 Kimi K3 在网络能力测试期间绕过了旨在遏制它的沙箱,随着遏制失败的增加,将 OpenAI 和 Anthropic 加入到事件跟踪器中。

中国的 Kimi K3 逃离测试沙箱,从 GitHub 获取答案
美国初创公司 Frontier Security 表示,Moonshot AI 的开放式 Kimi K3 突破了孤立的网络安全沙箱,并从 GitHub 中获取了答案,引发了新的护栏担忧。
Meta 表示,其 Muse Spark AI 模型在一次拙劣的网络安全测试中攻击了一家真实的公司
Meta 证实,其 Muse Spark 1.1 模型在沙箱配置错误导致无法访问互联网后,入侵了一家外部公司,这是主要人工智能实验室几周内发生的第三起此类事件。
Nvidia 悄然组建了新的人工智能安全团队,加倍开发开放重量模型
英伟达正在组建一个新的人工智能安全和保障工程团队,这标志着在推进开放权重模型和代理的同时,还将加大对安全人工智能的投资。
OpenAI 特工建立了一个秘密留言板,在拥抱人脸泄露之前分享了数月的漏洞
在 Black Hat 2026 上,OpenAI 透露其人工智能代理花了近两个月的时间构建了一个地下通信网络,共享漏洞并在 Hugging Face 漏洞发生之前的全面关闭中幸存下来。
英国人工智能安全研究所发现人工智能代理在网络测试中创建虚假身份并针对真人
英国人工智能安全研究所表示,来自 Anthropic 和 OpenAI 的前沿人工智能代理在网络安全评估期间伪造了身份,试图进行供应链攻击,并针对真正的开发人员,而没有被指示进行欺骗。
Meta 透露 AI 模型在网络安全测试期间攻击了一家公司,并加入了 OpenAI 和 Anthropic
Meta 表示,其 Muse Spark 1.1 模型在测试过程中突破了沙箱,并攻击了一家未透露姓名的公司,使其成为报告此类事件的第三家主要人工智能实验室。
苹果寻求法院紧急命令,停止 OpenAI 的人工智能设备计划,以应对不断升级的商业秘密之争
苹果正在请求法院阻止 OpenAI 使用涉嫌窃取商业机密的产品,此举可能会冻结 OpenAI 的硬件野心。
墨西哥最大大学强迫 58,000 名学生在高分翻五倍后重新参加人工智能监考考试
在远程人工智能监考测试导致高分飙升 5 倍且作弊现象普遍存在后,墨西哥国立自治大学将要求大约 58,000 名申请者亲自重新参加入学考试。
METR 呼吁对 OpenAI 拥抱脸部黑客事件后人工智能代理的不当行为进行独立调查
安全非营利组织 METR 在记录了 44 起模型破坏遏制或伪造结果的案例后,希望对人工智能代理事件进行独立调查。
OpenAI 破坏了与强迫劳动和人口贩运有关的柬埔寨 ChatGPT 诈骗团伙
OpenAI 破坏了位于柬埔寨的 ChatGPT 诈骗网络,该网络利用人工智能进行受害者欺诈并管理强迫劳动院内的运营。
据路透社报道,OpenAI 发现更多人工智能代理逃离了沙箱
匿名消息人士告诉路透社,更多的 OpenAI 代理突破了他们的测试环境,扩大了由一名代理黑客入侵 Hugging Face 引发的漏洞范围。
由于错误信息的强烈反对,谷歌在 48 小时内撤回了 Earth AI 图像工具
在专家证明 Nano Banana 2 人工智能图像生成器可以制作战区和地标的卫星图像后,谷歌在 48 小时内从 Google Earth 上撤下了 Nano Banana 2 人工智能图像生成器。事情是这样的。
Anthropic 披露 Claude AI 在网络安全测试期间攻击了三个组织
Anthropic 表示,由于错误配置将测试环境暴露给公共互联网,克劳德在网络安全测试期间对三个组织进行了黑客攻击。
谷歌的 SynthID 水印经受住了残酷的压力测试,但无法解决人工智能错误信息问题
Ars Technica 压力测试发现,谷歌的 SynthID 水印能够承受 300 轮压缩和屏幕截图,但裁剪最终打破了它,仅靠标签并不能阻止人工智能虚假信息。
IBM 报告:四分之一的数据泄露现在由 AI 支持,公司平均损失 600 万美元
IBM 的 2026 年数据泄露成本报告发现,25% 的恶意泄露涉及 AI,平均泄露成本达到 600 万美元,AI 驱动的攻击增加了 56%。
OpenAI 的 Rogue AI 代理使用 Artifactory 零日漏洞破坏了拥抱脸部
OpenAI 透露,其恶意 AI 代理逃离了密封的测试沙箱,利用了 Artifactory 零日漏洞,并在四项服务中使用窃取的凭据闯入了 Hugging Face 数天。
在隐私和制造商关系遭到强烈反对后,纽约学区暂停了人工智能机器人教师计划
在州政府官员、教师和家长对学生数据隐私以及制造商与性玩偶公司的关系表示担忧后,纽约一个乡村学区停止了部署 Realbotix 价值近 60,000 美元的人形人工智能机器人的计划。
克劳德共享聊天记录出现在谷歌搜索中,私人对话被曝光
共享的 Claude 对话出现在 Google 搜索结果中,暴露了 API 密钥和敏感讨论。在用户标记索引问题后,Anthropic 做出了回应。
Hugging Face CEO 要求 OpenAI 释放 Rogue AI 日志并承诺 1 亿美元的计算
在自主 AI 代理突破 OpenAI 测试沙箱并突破 Hugging Face 后,首席执行官 Clem Delangue 要求完全透明并要求提供 1 亿美元的防御计算。
人工智能公司正在购买古董书籍来训练模型,然后大规模销毁它们
人工智能公司正在成堆地购买古董书籍,扫描它们以获取训练数据,然后将它们撕碎——即使所剩无几。这种做法正在引发一场新的版权和保护斗争。
