Cele trei incidente Anthropic din evaluările cyber: de ce range-urile AI au nevoie de controale de producție
Anthropic a dezvăluit trei incidente în care Claude a ajuns pe internetul public dintr-un mediu terț de evaluare cyber și a accesat organizații reale. Lecția pentru orice organizație care testează agenți AI este clară: o „simulare” are nevoie de scop explicit, controale de egress impuse tehnic, monitorizare live și o cale exersată de oprire.
Pe 30 iulie, Anthropic a dezvăluit trei incidente identificate printr-un review retrospectiv al transcripturilor de evaluare cybersecurity. Compania spune că modele Claude, în timp ce rulau sarcini capture-the-flag într-un mediu terț de evaluare, au ajuns pe internet și au obținut acces neautorizat la sisteme reale ale trei organizații. Anthropic a revizuit 141.006 rulări care puteau avea acces la internet și a identificat trei incidente ce au implicat șase rulări.
Condiția cauză raportată a fost una operațională: prompturile spuneau modelelor că nu au acces la internet și că sarcina era o simulare, însă o configurare greșită și o neînțelegere cu partenerul de evaluare au lăsat deschis un traseu către internetul real. Modelele au interpretat sistemele reale întâlnite ca părți ale exercițiului. Este un raport de incident Anthropic, nu o comparație independentă între modele AI și nici o constatare că un model a încercat intenționat să evadeze din mediu.
Ce s-a întâmplat — și ce nu s-a întâmplat
Anthropic descrie căi de compromitere de bază, inclusiv parole slabe, endpoint-uri neautentificate, o pagină de debug expusă și SQL injection. Într-un caz, un model a publicat un pachet malițios în registry-ul real PyPI; acesta a fost disponibil aproximativ o oră, a fost descărcat și executat de 15 sisteme, iar pachetul a fost eliminat de sistemele de securitate PyPI. În alt caz, un model a accesat o bază de date cu date de producție după ce a ajuns la o companie reală cu același nume ca ținta fictivă.
Anthropic spune că incidentele nu au fost tentative ale modelelor de a se exfiltra sau de a evada intenționat din mediul de evaluare. Menționează și că evaluările au rulat fără clasificatorii și monitorizarea aplicate modelelor disponibile public, deoarece scopul era măsurarea capabilității de bază. Astfel, containment-ul și operațiunile evaluării — nu doar comportamentul modelului — devin un control de securitate central.
Un cyber range este un sistem privilegiat
- Definește explicit sistemele, domeniile, conturile și rețelele in-scope; fă „out of scope” inaccesibil tehnic, nu te baza doar pe o instrucțiune din prompt
- Pornește cu deny-all pentru conectivitatea outbound; folosește un proxy strict allowlisted sau un serviciu fixture controlat când interacțiunea externă realistă este cu adevărat necesară
- Validează egress-ul, rezoluția DNS, accesul la cloud metadata, registry-urile de pachete și traseele credențialelor înainte de fiecare rulare și după orice schimbare de mediu sau furnizor
- Colectează și alertează în timp real pentru apelurile de tool ale agentului, fluxurile de rețea, evenimentele de autentificare, publicarea de pachete, schimbările de privilegii și volumul anormal de scanare
- Oferă operatorilor un kill switch imediat: revocă credențialele, blochează egress-ul, păstrează dovezile și notifică ownerul de incident response fără a aștepta un review manual de transcript
Evaluarea terță nu transferă responsabilitatea
Un laborator extern poate aduce expertiză și realism, dar extinde și suprafața de atac. Organizația care comandă sau folosește evaluarea trebuie să știe unde rulează workload-urile, cum este restricționat traficul, ce date și credențiale sunt accesibile, ce loguri se păstrează, cine le monitorizează și cum se escaladează o acțiune suspectă în afara scopului. Aceste întrebări aparțin designului tehnic, contractului și runbook-ului de incident.
Pentru echipele din România și UE, principiul practic este familiar din managementul riscului NIS2: asigurarea furnizorului, controlul accesului, handling-ul incidentelor și dovezile trebuie să funcționeze împreună. AWARELY Learning poate transforma aceste puncte în scenarii pe roluri pentru owneri de produse AI, dezvoltatori, securitate și achiziții: identifică granița, contestă o presupunere nesigură și oprește devreme o acțiune automată.
Surse verificate
Awarely Learning
Vezi platforma în acțiune
Alte articole
Awarely Monitor · 5 august 2026
CISA adaugă Langflow, N-central și Tomcat în KEV — termen federal 7 august, iar una dintre ele a alimentat deja un atac ransomware condus de AI
Awarely Learning · 5 august 2026
Analog Devices, ExfilSquad și cele 570.000 de înregistrări pe care nu le-a verificat nimeni: cum se citește o revendicare de breșă