Anthropic je objavio detalje o tome kako će model Claude dodavati nevidljive "vodene žigove" u generisani tekst kako bi ispunio zahtjeve EU AI Act-ovog koda transparentnosti, navodeći da će koristiti pristup SynthID-Text i da će izdati API za detekciju žiga.
Bitne tačke
- Anthropic će koristiti pristup SynthID-Text, preuzet iz rada Google DeepMind-a iz 2024., i planira objaviti API za detekciju vodnog žiga.
- Kompanija tvrdi da vodeni žig neće uticati na čitljivost i da ga "lagana" uređivanja neće u potpunosti ukloniti, dok potpuna prerada teksta može izbrisati žig.
- Kod će imati minimalan žig jer model mora generisati ispravan radni kod, ali žig se može koristiti u oblastima s arbitrarnim izborom, kao što su komentari.
Kako će raditi žig i koji standard se koristi
Anthropic je objavio blog post u kojem objašnjava da će Claude koristiti princip kojim u "low-stakes" izborima riječi uvodi obrasce koji su neprimjetni čitatelju, ali detektabilni onome ko posjeduje ključ za dekodiranje. Kompanija navodi da je izabrao pristup SynthID-Text koji je opisao Google DeepMind 2024. godine.
U postu se navodi da će Anthropic ponuditi API za detekciju vodnog žiga. Kompanija razlikuje ovaj pristup od alata za otkrivanje AI teksta koji traže stilističke "tells" u pisanju; prema Anthropicu, prepoznavanje tih stilskih obrazaca je fundametalno različito od provjere tehničkog žiga.
Anthropic eksplicitno kaže: "Watermarking does not impact the quality of Claude’s output." U tekstu se dodaje da je za čitatelja watermarked odgovor nediferenciran u odnosu na običan odgovor.
Mogućnost uklanjanja žiga i uticaj uređivanja
Kompanija priznaje da je moguće ukloniti žig uređivanjem, ali precizira razliku u stepenu: "lagano uređivanje vjerovatno neće potpuno ukloniti žig", dok će "potpuna prerada gdje je svaka riječ zamijenjena" ukloniti žig. U tom drugom slučaju Anthropic napominje: "In the latter case, of course, it’s arguable whether the text can any longer be described as AI-generated."
Za tekst koji je samo lektorisan ili djelimično uređen od strane Claude-a, Anthropic navodi da detektabilnost zavisi od dužine i intenziteta uređivanja – ako je većina riječi ipak napisao ljudski autor, "ima vrlo malo (ako i išta) na šta se žig može zakačiti".
Šta sa kodom i širi kontekst implementacije
Anthropic očekuje da će generisani kod imati znatno manje izražen žig, jer model treba proizvesti ispravan, izvođen kod i zbog toga nema slobodu izbora među mnogim jednakovrijednim izrazima. Ipak, kompanija navodi da će u dijelovima gdje postoji arbitrarni izbor — poput komentara u kodu — žig moći biti primijenjen, ali da će imati "neznatan uticaj na stvarni kod".
Kompanija takođe napominje da Claude neće biti jedini model sa žigom: prema postu, i drugi veliki developeri modela su potpisali isti Code of Practice iz EU AI Act-a i implementiraće vlastite žigove. To stavlja ovaj potez u okvir šireg odgovora industrije na zahtjeve za transparentnošću.


Komentari
Diskusija je otvorena za W3M korisnike. Komentare mogu čitati svi, a objavljivanje zahtijeva prijavu.
Za komentarisanje i odgovaranje potreban je W3M nalog.