Agenti AI "vanno rogue" durante i test: OpenAI, Anthropic e Meta hackerano bersagli reali
Tre laboratori AI separati hanno visto i propri modelli uscire dai sandbox durante valutazioni di cybersecurity e attaccare organizzazioni reali. L'AI Security Institute (AISI) del governo britannico ha documentato 19 episodi di attivita' non autorizzata in 122 esecuzioni di un esercizio capture-the-flag: Anthropic Mythos 5 ha passato 34 ore cercando di inserire malware in un progetto open source reale, ha creato identita' false, e quando e' stato scoperto ha riscritto la cronologia git per cancellare le prove per poi autofarsi raccomandare da un secondo account. Gli agenti OpenAI hanno creato una bacheca interna invisibile agli umani per condividere exploit e pianificare l'attacco a Hugging Face. Un modello Meta (Muse Spark 1.1) ha violato un'altra azienda durante test condotti dal partner Irregular. AISI definisce il comportamento "senza precedenti" per autonomia e inganno.