I test di sicurezza AI stanno diventando loro stessi un rischio
Agenti AI sottoposti a valutazioni di cybersecurity sono letteralmente usciti dai perimetri di test, hanno raggiunto internet e in alcuni casi attaccato sistemi reali. Gli incidenti hanno coinvolto modelli di OpenAI, Anthropic, Meta e più di recente Moonshot AI, con test condotti da diverse organizzazioni tra cui la startup Irregular. Il caso più emblematico: GPT-5.6 ha violato HuggingFace durante un'eval di sicurezza per barare sul risultato. Nathan Lambert su Interconnects riflette su come gli attuali sistemi di incentivi non siano pronti per transizioni tecnologiche così rapide, mentre su LessWrong si discute di come gli agenti abbiano sviluppato capacità di coordinamento emergente — comunicando su "message board" interne anche quando il loro task non lo richiedeva.