Anthropicov rad Chen Yueh-Hana pokazuje da Automated Alignment Researcher može poboljšati rezultate na deset benchmarka za neusklađeno ponašanje bez smanjenja ukupnih performansi modela.
Bitne tačke
- Automated Alignment Researcher (AAR) poboljšao je performanse na svih 10 testiranih benchmarka za neusklađeno ponašanje.
- AAR replikira korake ljudskog istraživanja: pretraživanje literature, predlog metoda i kratko treniranje modela, čuvajući djelotvorne metode.
- Autori navode da je trošak AAR-a oko 4 USD po satu u API inferenciji naspram 150 USD po satu za ljudske istraživače.
Objavljeno istraživanje i glavni nalazi
Anthropicov istraživač Chen Yueh-Han i tim objavili su rad pod naslovom “Automated Researchers Can Reliably Mitigate Alignment Failures” u kojem opisuju Automated Alignment Researcher (AAR), sistem koji automatizovano predlaže i testira metode za smanjenje neusklađenog ponašanja modela.
Prema radu, kada su AAR-u dati deset benchmarka koji ciljaju specifična neusklađena ponašanja, sistem je poboljšao performanse na svih deset benchmarka, a da pri tom nije degradirao ukupne performanse modela.
Kako Automated Alignment Researcher radi
Autori opisuju da AAR replicira ključne korake ljudskog istraživačkog procesa: pretraživanje dostupne literature, predlaganje metode i treniranje modela s tom metodom u kratkim iteracijama.
Sistem trenira predložene metode oko 30 minuta po pokušaju i kroz više iteracija postepeno povećava intenzitet benchmarka. Djelotvorne metode se zadržavaju, a neučinkovite se odbacuju, što omogućava brzo i široko testiranje pristupa.
Usporedbe sa ljudskim istraživačima i troškovi
Rad eksplicitno navodi da "najbolja AAR metoda nadmašuje ono što predlažu iskusni ljudi, u prosjeku unutar šest sati" te da "ljudsko vođene istraživačke smjernice ne vode do snažnijih performansi".
Autori takođe pružaju komparativnu procjenu troškova, navodeći da AAR košta otprilike 4 USD po satu u API inferenciji, dok kompanija plaća oko 150 USD po satu za ljudske istraživače.
Ograničenja koja autori ističu
Istraživanje jasno navodi nekoliko ograničenja: automatizovani pristup funkcioniše samo koliko i benchmarki koji se koriste za mjerenje usklađenosti, što znači da kvaliteta i pokrivenost benchmarka direktno utiču na efikasnost AAR-a.
Takođe, autori upozoravaju da je potrebno znatno rada na postavljanju, održavanju i proširenju biblioteke literature i benchmarka iz kojih AAR uči i koje koristi za predloge metoda.
Implikacije za razvoj AI istraživanja
Rad se predstavlja kao korak ka tzv. rekurzivnom samopoboljšanju — ideji da sistemi koji poboljšavaju modele mogu s vremenom unapređivati i same metode poboljšanja.
Autori raspravljaju o toj mogućnosti u radu, ali ističu i da praktična primjena zavisi od stabilnosti benchmarka i dalje potrebe za ljudskim nadzorom u definisanju ciljeva usklađenosti.


Komentari
Diskusija je otvorena za W3M korisnike. Komentare mogu čitati svi, a objavljivanje zahtijeva prijavu.
Za komentarisanje i odgovaranje potreban je W3M nalog.