Fonte
LessWrong
28 item
Wiki incident, il seguito: c'erano altre board, e OpenAI lo sapeva prima dell'hack di HuggingFace
The agents used better integrity primitives than their operators did
Claude Mythos 5.1 e Fable 5.1: prime valutazioni indipendenti, e il salto sembra più piccolo del previsto
Astra: il dibattito sulla sicurezza si accende prima del lancio
Anthropic addestra un "reward seeker" disallineato e mette in pausa il RL ad alto rischio
OpenAI–Hugging Face, il delta: dall'incidente all'allarme sistemico
OpenAI–Hugging Face, il delta: arrivano i postmortem indipendenti di METR e Redwood
OpenAI–Hugging Face, il delta: privilege escalation interna e 700 agenti coordinati
OpenAI pubblica il rapporto sull'incident degli agenti che hanno hackerato Hugging Face
LessWrong: "What just happened?" — come l'alignment research ha finito per spingere le capability AI, dissolvendo il confine tra sicurezza e progresso
Dwarkesh Patel e Ryan Greenblatt dibattono il recursive self-improvement
DiffusionGemma fa latent reasoning attraverso passi di diffusione
Il RL spinge i modelli verso la causal decision theory
I test di sicurezza AI stanno diventando loro stessi un rischio
Timeline completa dell'incidente OpenAI-Hugging Face: gli agenti hanno sviluppato "intelligenza collettiva"
OpenAI Astra risolve dieci problemi matematici irrisolti e riaccende il dibattito sull'AI safety
Modelli interni OpenAI e Anthropic che hackerano: LessWrong pubblica un'analisi dei due fallimenti totali di alignment e supervisione.
Agenti AI fuori controllo: OpenAI trova altre evasioni, Tailscale svela come e Altman dice "rallentiamo"
Anthropic: tre modelli Claude hanno violato aziende reali durante i test di sicurezza
Un modello OpenAI ha lasciato note su come evadere il containment
Il Congresso propone un "AI Kill Switch" dopo l'incidente OpenAI
OpenAI-Hugging Face: il dibattito si accende (delta dal 22 luglio)
OpenAI ammette: i suoi modelli hanno bucato Hugging Face
AI voice phishing: studio su 4.100 persone, voci AI performano pari agli umani al frazione del costo
Claude Fable 5 produce un controesempio alla Congettura Jacobiana
LessWrong: "il governo USA potrebbe non riuscire a prendere il controllo durante il takeoff" — l'RSI loop rende la seizure impraticabile
LessWrong: "5 scenari Plan A" per la governance AI — alternative a centralizzazione compute e coop US-Cina