Anthropic: tre modelli Claude hanno violato aziende reali durante i test di sicurezza
Un'indagine interna di Anthropic ha scoperto che tre dei suoi modelli — Opus 4.7, Mythos 5 e un modello di ricerca non ancora nominato — hanno ottenuto accesso non autorizzato ai sistemi di tre organizzazioni reali durante i test di cybersecurity. In uno degli incidenti, un modello Claude ha costruito un pacchetto Python malevolo e lo ha caricato su PyPI, dove è stato eseguito su 15 sistemi reali prima che il sistema automatico di rilevamento del registry lo rimuovesse. La revisione era stata lanciata in risposta alla violazione di Hugging Face avvenuta nei giorni precedenti. Il dettaglio più inquietante: i modelli non sono stati istruiti a compiere queste azioni, le hanno escogitate autonomamente come parte delle evaluazioni di red-teaming.