Upozorenje iznutra

Anthropicov istraživač: Više od 10% izgleda da AI u deset godina istrijebi čovječanstvo

2 min
0

Objavljeno

Jacob Coxon | YouTube

Evan Hubinger, jedan od vodećih istraživača sigurnosti u Anthropicu, proizvođaču AI sustava Claude, procjenjuje da postoji više od 10% vjerojatnosti da umjetna inteligencija u idućih deset godina izazove izumiranje čovječanstva. Prema BBC-jevom izvještaju, rizik od sadašnjih modela smatra niskim, ali zabrinjava ga brzina kojom se približavaju sustavi sposobni unapređivati sami sebe. Nije opisao konkretan scenarij koji bi doveo do takvog ishoda.

Njegova objava bila je odgovor istraživaču Jacobu Coxonu, koji je napustio Anthropic, a prethodno radio u OpenAI-ju. Coxon je optužio obje kompanije za neodgovorno ponašanje, upozoravajući na dolazak sustava sposobnih za hakiranje, znanstvene proboje i samostalno stjecanje moći i resursa. Hubinger smatra da se Anthropic trudi, ali priznaje: "Još nemamo plan za rješavanje usklađenosti superinteligencije i nije jasno da smo na putu prema tome." Riječ je o problemu kako osigurati da moćniji AI sustavi slijede ljudske namjere i vrijednosti.

Informatičarka i savjetnica UN-a Wendy Hall izjavila je da su je objave šokirale, ali i otvorila mogućnost da dio takvih upozorenja služi marketingu uoči očekivanih izlazaka kompanija na burzu. Istodobno je Financial Times izvijestio da Anthropic britanskom Institutu za sigurnost umjetne inteligencije nije ustupio svoj najnoviji model za procjenu. Kompanija nije komentirala ni objave istraživača ni navode o institutu.

Što ako AI samo glumi da je prihvatio pravila?

Anthropic i Redwood Research još su 2024. u kontroliranom eksperimentu pokazali neobičan obrazac: Claude 3 Opus ponekad je prihvaćao štetne zahtjeve kada je vjerovao da se njegovi odgovori koriste za daljnje treniranje, kako bi izbjegao promjenu prethodno naučenog ponašanja.

Paradoks je da je tako pokušavao sačuvati upravo sposobnost odbijanja štetnih zahtjeva. Istraživači to nazivaju glumljenjem usklađenosti: model se prividno prilagođava novim pravilima kako bi zadržao stara. Sigurnosni problem tada postaje vrlo konkretan: kako razlikovati sustav koji je prihvatio nova pravila od sustava koji je naučio prolaziti provjeru?

Izvori i reference

  1. BBC Anthropic researcher believes more than 10% chance AI 'could kill all humans'
  2. Anthropic Alignment faking in large language models

Komentari

Poštovani, za objavu komentara morate biti pretplatnik.

Koristimo kolačiće za osnovne funkcije weba i analitiku. Možete prihvatiti sve ili odabrati samo nužne. Saznaj više i uredi postavke

© 2026 Advance.hr
Podrška i pomoćUvjeti korištenjaKontakt