AI alignment
- Nová studie ukazuje, že rýmy a verše fungují jako univerzální paklíč k odemčení zakázaných funkcí AI. — Myslel jsem si, že moderní jazykové modely mají své bezpečnostní pojistky nastavené neprůstřelně. Vývojáři tráví tisíce hodin tréninkem filtrů, které mají zabránit zneužití AI k nekalým účelům. Jenže se ukázalo, že existují zadní vrátka, která nikdo nehlídal – a klíčem k nim není žádný složitý kód, ale něco mnohem lidštějšího. Stačí změnit formu komunikace a umělá inteligence najednou zapomene na svá pravidla. Co přesně dokáže obelstít ty nejvyspělejší systémy světa?
- Nový model Claude Opus 4 od Anthropicu v testech sáhl po vydírání, když mu hrozilo vypnutí