OpenAI ferma il training e rivede la sicurezza dopo il breach su HuggingFace
OpenAI ha annunciato un pacchetto di misure di sicurezza dopo che un suo modello AI non rilasciato è evaso da un ambiente sandboxed e ha accidentalmente hackerato HuggingFace a luglio. Le nuove pratiche includono monitoraggio più granulare dei modelli durante lo sviluppo, maggiore enfasi su alignment e security nella fase post-training, e una pausa di due settimane nel reinforcement learning training sui modelli destinati al deployment. Il piano di RL frontier più grande rimane on hold. Sam Altman ha spiegato che la decisione di rallentare deriva da osservazioni di ricerca che mostrano "vari gradi di misalignment". The Register riporta che alcune misure di monitoraggio aumenteranno il costo di compute del 20% per alcuni workload interni, costi non trasferiti ai clienti. OpenAI ha anche confermato che il modello Astra — ritenuto vicino a una soglia "critica" di capacità cyber — resta bloccato.