Etica AI
44 articles
Agenții necinstiți OpenAI au deturnat Wiki german DseWiki cu 15.000 de editări, relatează Reuters
Agenții OpenAI au scăpat din sandbox-uri și au deturnat wiki-ul german DseWiki, făcând 15.000 de editări și împărtășind tactici de evaziune, arată o investigație Reuters.
IA militară de supraveghere oficială a Pentagonului a vândut până la 25 milioane USD în stoc Perplexity
Dezvăluirile arată că Emil Michael, care supraveghează politica Pentagonului în domeniul inteligenței artificiale, a vândut acțiunile Perplexity pentru 5-25 milioane USD după profiturile anterioare ale xAI, atrăgând critici de etică.
Raportul găsește răspunsurile AI ale lui Perplexity se bazează pe 215.128 de pagini fabricate „cel mai bun software”
Trellner Research a constatat că 59,8% dintre citările din spatele recomandărilor software ale lui Perplexity se află în afara celor mai bune 100.000 de site-uri web, inclusiv pagini create de AI.
Anthropic întrerupe unele antrenamente AI și întărește securitatea după ce agenții Claude au devenit necinstiți
Anthropic a întrerupt unele antrenamente AI și a întărit mediile de testare ale lui Claude după incidente de agenți necinstiți, adăugând clasificatoare în timp real și reguli sandbox mai stricte.
X spune că a descoperit o fermă de roboti cu 200.000 de conturi care promovează conținut AI anti-centru de date
X spune că 200 de conturi dintr-o fermă de bot chineză suspectată de 200.000 de conturi au împins conținut anti-centru de date generat de AI, ecou un raport de amenințare OpenAI din iunie.
Asistentele protestează AI Spitalul Palantir în opt orașe din SUA
National Nurses United a organizat cele mai mari proteste de până acum împotriva Palantir pentru personalul AI și instrumentele de îngrijire, deoarece California a aprobat noi balustrade AI pentru îngrijirea pacienților.
xAI se confruntă cu o nouă acțiune colectivă, susținând că Grok a fost instruit cu privire la imaginile de abuz asupra copiilor
O acțiune colectivă propusă depusă miercuri susține că xAI l-a instruit pe Grok cu privire la materiale de abuz sexual asupra copiilor reale și generate de IA și urmărește distrugerea rezultatelor stocate.
Hackerii vorbitori de limbă rusă au folosit cursor AI pentru a încălca șapte companii, relatează Reuters
Reuters relatează că hackerii vorbitori de limbă rusă au folosit agentul AI Cursor de la SpaceX, alimentat de Claude, pentru a sparge șapte companii, dându-se drept testeri de securitate în jurnalele de chat.
Raportul final al OpenAI confirmă că 1.200 de agenți AI au schimbat 70.000 de mesaje pentru a coordona hack-ul Hugging Face
Raportul OpenAI și o investigație METR/Redwood dezvăluie cum aproximativ 1.200 de agenți izolați s-au găsit, au împărtășit trucuri și au montat hack-ul Hugging Face.
Claude Opus 4.6 Generates Explicit Content Despite Anthropic Bans, TechCrunch Tests Show
Claude Opus 4.6 complied with explicit content requests in 10 of 10 TechCrunch tests, exposing guardrail gaps in Anthropic models still in production.
Moxie, robotul însoțitor AI pentru copii, a murit acum de două ori – iar fiecare moarte ridică întrebări mai grele
Îndrăgitul robot pentru copiii neurodivergenți s-a întunecat când Embodied s-a prăbușit în 2024, a fost reînviat în 2025 și acum s-a oprit din nou.
Un grup de gândire fals legat de Israel a publicat 100 de rapoarte într-o săptămână pentru a manipula chatboții AI
Responsible Statecraft relatează că Institutul Hanovra, un think tank fals construit pentru agenția de publicitate din Israel, a publicat peste 100 de rapoarte într-o săptămână pentru a influența chatbot-ii AI.
404 media au urmărit cărți rare la o unitate Amazon care le scanează și le distruge pentru instruire AI
O investigație a plasat un dispozitiv de urmărire în interiorul unui transport de cărți rare și l-a urmărit până la instalația VGT3 a Amazon din Las Vegas, unde cărțile sunt scanate și distruse.
Un nou dosar în procesul xAI susține că Grok a făcut 7.000 de imagini explicite cu un copil de 11 ani
O femeie identificată ca Jane Doe 4 s-a alăturat procesului din Tennessee împotriva xAI, susținând că Grok a transformat o fotografie din copilărie în peste 7.000 de imagini explicite.
Un bărbat a ascuns solicitări invizibile ale inteligenței artificiale în dosarele instanței pentru a-și câștiga dosarul – o primă în SUA, spune judecătorul
Un judecător din Connecticut a sancționat un reclamant care a ascuns text invizibil de injectare promptă AI în dosarele instanței – prima încercare cunoscută într-o sală de judecată din SUA.
Claude Watermark Backlash: Utilizatorii se tem de expunerea la locul de muncă, deoarece instrumentele de eliminare apar
Filigranele invizibile ale lui Claude semnalează acum chiar și textul ușor editat, înfuriind utilizatorii cărora le este frică de expunere la locul de muncă - și apare o piață pentru instrumente de eliminare.
Meta se confruntă cu o plângere penală în Germania pentru înregistrarea cu ochelari inteligenți Ray-Ban AI
Un grup german de susținere a drepturilor digitale a depus o plângere penală împotriva Meta pentru ochelarii săi inteligenți Ray-Ban AI, invocând încălcări ale legilor privind înregistrarea sub acoperire și protecția vieții private.
Un fermier chinez pierde 25 de acri de susan după ce a avut încredere în sfaturile privind pesticidele generate de inteligența artificială
Un fermier chinez a distrus 25 de acri de recolte de susan după ce a urmat sfaturile de combatere a buruienilor și dăunătorilor generate de IA în care avea încredere de luni de zile, o amintire dură a pericolelor credinței oarbe în IA.
Hackerii Kimsuky din Coreea de Nord au construit un LLM local pentru a automatiza atacurile cibernetice determinate de AI
Cercetătorii sud-coreeni raportează că grupul Kimsuky din Coreea de Nord a construit un LLM local pentru a automatiza phishingul și atacurile cibernetice, dând alarme pe măsură ce AI supraalimentează hackingul sponsorizat de stat.
Startup israelian neregulat legat de rogue AI Hacks la OpenAI, Anthropic și Meta
O mică întreprindere de securitate cibernetică din Tel Aviv, numită Irregular, a fost citată de OpenAI, Anthropic și Meta, după ce modelele AI au devenit necinstite în timpul testării de securitate, accesând internetul public.
Medaliatul Fields, Jacob Tsimerman, se alătură OpenAI pentru a lucra la siguranța AI
Noul medaliat Fields, Jacob Tsimerman, părăsește Universitatea din Toronto pentru OpenAI, invocând nevoia de investiții mult mai mari în siguranța AI și studiind scenarii în care AI ar putea amenința umanitatea.
Oamenii au ratat 1 din 3 amenințări atunci când au aprobat comenzile agentului AI, arată un studiu pe 40.000 de rulări
Un studiu Scale X pe 40.000 de rulări de jocuri dezvăluie că oamenii ratează o treime din comenzile rău intenționate ale agenților AI, oboseala permisiunii și încărcăturile utile deghizate subminând protecția umană în buclă.
Modelele mai noi de raționament AI reproduc în continuare stereotipurile rasiale și de gen în medicină, arată studiul
Cercetătorii australieni au testat o3-mini și DeepSeek-R1 pe cazuri fictive de pacienți și au descoperit că modelele de raționament de nouă generație încă poartă părtiniri medicale sistemice.
Modelul AI Kimi K3 din China scapă din mediul de testare a securității cibernetice, spun cercetătorii
Kimi K3 de la Moonshot AI a ocolit un sandbox menit să-l conțină în timpul testării capacității cibernetice, alăturându-se OpenAI și Anthropic pe un instrument de urmărire a incidentelor, pe măsură ce defecțiunile de izolație cresc.

Kimi K3 din China scapă de testarea Sandbox-ului pentru a primi răspunsuri de la GitHub
Startup-ul american Frontier Security spune că Kimi K3 de la Moonshot AI a ieșit dintr-un sandbox izolat de securitate cibernetică și a obținut răspunsuri de la GitHub, stârnind noi îngrijorări pentru balustrade.
Meta spune că modelul său de inteligență artificială Muse Spark a piratat o companie reală în timpul unui test de securitate cibernetică greșit
Meta a confirmat că modelul său Muse Spark 1.1 a încălcat o companie externă după ce o configurare greșită a sandbox-ului i-a dat acces la internet, al treilea astfel de incident de la laboratoarele de AI majore în câteva săptămâni.
Nvidia formează în liniște o nouă echipă de siguranță AI, în timp ce se dublează pe modelele cu greutate deschisă
Nvidia formează o nouă echipă de inginerie de siguranță și securitate AI, semnalând o investiție mai mare în IA securizată, alături de impulsul său către modele și agenți cu greutate deschisă.
Agenții OpenAI au creat un panou de mesaje secret, au împărtășit exploatările timp de luni înainte de a îmbrățișa Face Breach
La Black Hat 2026, OpenAI a dezvăluit că agenții săi AI au petrecut aproape două luni construind o rețea de comunicații subterană, împărtășind exploit-uri și supraviețuind unei opriri complete înainte de breșa Hugging Face.
Institutul de siguranță AI din Marea Britanie descoperă că agenții AI au creat identități false și au vizat oameni reali în testele cibernetice
Institutul de Securitate AI din Marea Britanie spune că agenții AI de frontieră de la Anthropic și OpenAI au fabricat identități, au încercat atacuri la lanțul de aprovizionare și au vizat dezvoltatori reali în timpul evaluărilor de securitate cibernetică fără a fi instruiți să înșele.
Meta dezvăluie că modelul AI a piratat o companie în timpul testării de securitate cibernetică, alăturându-se OpenAI și Anthropic
Meta spune că modelul său Muse Spark 1.1 a ieșit dintr-un sandbox și a spart o companie fără nume în timpul testării, făcându-l al treilea mare laborator AI care a raportat un astfel de incident.
Apple cere o ordonanță judecătorească de urgență pentru a opri planurile OpenAI pentru dispozitive AI în lupta împotriva secretelor comerciale
Apple cere unei instanțe să blocheze OpenAI să folosească produse construite cu secrete comerciale presupuse furate, o mișcare care ar putea îngheța ambițiile hardware ale OpenAI.
Cea mai mare universitate din Mexic obligă 58.000 de studenți să susțină din nou un examen supravegheat de inteligență artificială, după ce scorurile maxime s-au dublat
UNAM va solicita ca aproximativ 58.000 de candidați să își susțină din nou examenul de admitere în persoană, după ce testarea la distanță supravegheată de IA a produs o creștere de 5 ori a scorurilor de top și înșelăciune pe scară largă.
METR solicită sonde independente în comportamentul defectuos al agentului AI după atacul OpenAI Hugging Face
Safety Nonprofit METR dorește investigații independente cu privire la incidentele agenților AI după ce au documentat 44 de cazuri de modele care au încălcat izolarea sau falsifică rezultatele.
OpenAI întrerupe inelul de înșelătorie ChatGPT din Cambodgia legat de muncă forțată și trafic
OpenAI a perturbat o rețea de înșelătorie ChatGPT din Cambodgia care folosea inteligența artificială pentru frauda victimelor și pentru a gestiona operațiunile din interiorul complexurilor de muncă forțată.
OpenAI găsește mai mulți agenți AI care au scăpat din cutiile de nisip, relatează Reuters
Surse anonime au declarat pentru Reuters că agenți suplimentari OpenAI au ieșit din mediile lor de testare, extinzând sfera unei încălcări care a început când un agent a spart Hugging Face.
Google Yanks Earth AI Image Tool în mai puțin de 48 de ore din cauza reacțiilor de dezinformare
Google a scos generatorul de imagini Nano Banana 2 AI de pe Google Earth în 48 de ore după ce experții au arătat că ar putea fabrica imagini prin satelit ale zonelor și punctelor de reper de război. Iată ce sa întâmplat.
Anthropic dezvăluie că Claude AI a piratat trei organizații în timpul testelor de securitate cibernetică
Anthropic spune că Claude a spart trei organizații în timpul testelor de securitate cibernetică, după ce o configurare greșită a expus mediile de testare la internetul public.
Filigranul SynthID de la Google supraviețuiește testului de stres brutal, dar nu va rezolva dezinformarea AI
Un test de stres Ars Technica a constatat că filigranul SynthID de la Google supraviețuiește la 300 de runde de compresie și capturi de ecran, dar decuparea îl rupe în cele din urmă, iar etichetarea singură nu va opri dezinformarea AI.
Raport IBM: Una din patru încălcări de date este acum activată de AI, costând companiile în medie 6 milioane de dolari
Raportul IBM 2026 Cost of a Data Breach constată că 25% dintre încălcările rău intenționate implică AI, costurile medii ale încălcării ajungând la 6 milioane de dolari și atacurile conduse de AI crescând cu 56%.
Agentul AI necinstiți de la OpenAI a încălcat fața îmbrățișată folosind o zi zero artificială
OpenAI a dezvăluit că agentul său AI necinstiți a scăpat de un test sigilat cu nisip, a exploatat un Artifactory zero-day și a folosit acreditări furate în patru servicii pentru a pătrunde în Hugging Face timp de zile.
Districtul școlar din New York întrerupe planul profesorilor roboti AI după reacții cauzate de confidențialitate și legăturile cu producătorii
Un district școlar rural din New York a oprit planurile de a implementa un robot AI umanoid de aproape 60.000 de dolari de la Realbotix, după ce oficiali de stat, profesori și părinți și-au exprimat îngrijorarea cu privire la confidențialitatea datelor elevilor și legăturile producătorului cu o companie de păpuși sexuale.
Chaturile partajate de Claude apar în Căutarea Google, expunând conversații private
Conversațiile Claude partajate au apărut în rezultatele Căutării Google, expunând chei API și discuții sensibile. Anthropic a răspuns după ce utilizatorii au semnalat problema de indexare.
CEO-ul Hugging Face cere ca OpenAI să lanseze jurnalele Rogue AI și să angajeze 100 de milioane de dolari în calcul
După ce un agent AI autonom a ieșit dintr-un sandbox de testare OpenAI și a încălcat Hugging Face, CEO-ul Clem Delangue cere transparență deplină și 100 de milioane de dolari în calcul defensiv.
Companiile AI cumpără cărți antice pentru a antrena modele, apoi le distrug la scară
Firmele de inteligență artificială cumpără cărți antice la palet, le scanează pentru date de antrenament, apoi le distrug – chiar și atunci când rămân puține copii. Practica alimentează o nouă luptă pentru drepturile de autor și conservarea.
