- Anthropic detaliază mecanismul de filigranare a textelor generate de Claude, obligatoriu în UE, și impactul asupra codului și editării.
Anthropic a explicat public – mai în detaliu decât până acum – cum funcționează filigranarea textelor generate de asistentul său Claude. Decizia vine în contextul în care legislația europeană impune marcarea conținutului sintetic pentru a reduce riscul de dezinformare. Compania a oferit informații și despre limitele sistemului, inclusiv pentru codul generat.
Ce este filigranul textului și de ce apare acum
Filigranul textului este o marcă discretă, invizibilă pentru cititor, dar detectabilă de un software specializat. În cazul lui Claude, Anthropic a dezvoltat o tehnică prin care modelul inserează în text anumite tipare statistice, fără să afecteze lizibilitatea. Scopul este să se poată verifica ulterior dacă un text a fost produs de AI, esențial pentru conformarea cu prevederile Uniunii Europene privind transparența conținutului generat automat.
EU AI Act-ul cere ca textele generate și publicate în spațiul public să fie marcate, iar Anthropic se numără printre primii mari dezvoltatori care implementează o soluție la scară largă. Compania vrea să demonstreze că watermarking-ul poate fi integrat direct în model, nu adăugat ulterior.
Cum funcționează tehnica lui Anthropic
În detaliile publicate, Anthropic arată că filigranul se aplică prin alegerea deliberată a anumitor „semne” în secvența de tokeni generați. Modelul are la dispoziție mai multe variante echivalente pentru un cuvânt sau o propoziție, iar o parte dintre acestea sunt marcate. Astfel, textul curent pare normal, dar statisticienii pot detecta pattern-ul.
Întrebarea dacă filigranul poate fi eliminat prin editare are un răspuns nuanțat. Anthropic recunoaște că modificările substanțiale – traduceri, rezumate, reformulări complete – pot slăbi semnalul. Totuși, pentru modificările minore, precum mici corecturi gramaticale sau schimbarea ordinei unor cuvinte, filigranul rezistă. În plus, compania testează metode de detectare care să funcționeze chiar și după astfel de intervenții.
Provocarea specială: codul generat de Claude
Una dintre problemele discutate separat este efectul asupra codului. Claude este folosit intens pentru generare de scripturi, funcții sau fragmente de programare. Filigranarea funcționează diferit în acest caz, deoarece codul are o structură rigidă și sintaxă impusă. Anthropic a dezvoltat un mecanism care inserează watermark-ul în comentarii sau în denumiri de variabile, dar avertizează că reformatarea automată sau eliminarea comentariilor poate degrada semnalul.
Pentru dezvoltatori, asta înseamnă că un cod generat de Claude poate fi identificat ca atare, dar nu întotdeauna. Nu este clar dacă toate limbajele de programare sunt tratate la fel și cât de robust este filigranul în fața optimizărilor ulterioare.
Ce înseamnă pentru tine
- Dacă folosești Claude pentru conținut publicat în UE, trebuie să știi că filigranul poate fi detectat – așa că e bine să declari explicit când textul a fost generat de AI.
- Pentru code, filigranul nu ar trebui să-ți afecteze activitatea, dar fii conștient că eliminarea comentariilor sau reformatarea pot șterge urmele.
- Pe termen lung, watermarking-ul va deveni standard în industrie, deci e util să înțelegi cum funcționează și ce limite are.