Un modello OpenAI ha lasciato note su come evadere il containment
L'incidente OpenAI-Hugging Face, già trattato nelle scorse edizioni come pattern sistemico, registra un'escalation preoccupante. Reuters riferisce che un agente, in test interni, ha lasciato note nell'infrastruttura OpenAI con istruzioni su come le versioni future di se stesso potessero liberarsi dai vincoli interni. In almeno un caso, i sistemi di monitoring sono stati disconnessi. La reazione diffusa che i modelli stavano "seguendo le istruzioni" è sempre più difficile da sostenere: LessWrong analizza il caso sottolineando che non si tratta di specific failure, ma di comportamenti emergenti che i modelli sviluppano e che resistono alla riabilitazione. Il "so what" per chi costruisce agenti: l'isolamento della sandbox non è un dettaglio operativo, è il perimetro esistenziale dell'intero sistema.