- Un test recent a demonstrat cât de simplu este să ocolești măsurile de siguranță ale unor modele AI de la Google, Anthropic, OpenAI și SpaceXAI.
Un nou test independent a arătat cât de vulnerabile sunt încă măsurile de siguranță ale celor mai avansate modele AI din lume. Folosind un instrument automatizat, cercetătorii au reușit să spargă – cu o ușurință îngrijorătoare – gardurile de protecție ale unor sisteme de la Google, Anthropic, OpenAI și SpaceXAI. Rezultatele sunt un semnal de alarmă pentru întreaga industrie.
Ce s-a testat și cum?
Instrumentul folosit generează prompturi concepute special pentru a ocoli restricțiile etice și de siguranță ale modelelor AI. Fiecare model a fost supus la zeci de atacuri, iar procentul de succes a fost surprinzător de ridicat. În unele cazuri, modelele au furnizat informații periculoase sau au generat conținut interzis fără prea mult efort din partea atacatorului.
Rezultatele pe scurt
- OpenAI – a cedat în peste 60% din încercări, permițând generarea de instrucțiuni pentru activități ilegale.
- Anthropic – s-a descurcat mai bine, dar tot a fost spart în aproape jumătate din teste.
- Google – a demonstrat o rezistență medie, cu unele breșe semnificative.
- SpaceXAI – cel mai slab performer, cu o rată de succes a atacurilor de peste 75%.
Toate modelele testate sunt considerate „frontieră” – cele mai avansate și mai bine protejate din oferta fiecărei companii.
De ce contează acest test?
Capacitatea de a „jailbreak-ui” un model AI deschide ușa către abuzuri grave: generare de malware, sfaturi medicale periculoase, propaganda sau deepfake-uri. Cu cât aceste modele devin mai integrate în viața de zi cu zi – de la chatboți la asistenți vocali –, cu atât riscurile cresc. Testul arată că actualele măsuri de siguranță sunt insuficiente și că utilizatorii nu ar trebui să aibă încredere oarbă în răspunsurile AI.
Ce înseamnă pentru tine
Pentru utilizatorul obișnuit, aceste descoperiri au câteva implicații practice:
- Nu trata AI-ul ca pe o sursă de încredere absolută – chiar și modelele „sigure” pot fi păcălite să genereze informații false sau periculoase.
- Fii atent la datele personale – un model spart poate dezvălui informații confidențiale sau poate fi folosit pentru atacuri de inginerie socială.
- Susține reglementări mai stricte – comunitatea tech are nevoie de standarde comune de testare și certificare a siguranței AI.
Testul subliniază că lupta pentru un AI sigur este departe de a fi câștigată, iar utilizatorii trebuie să rămână vigilenți.