Uno scenario distopico nel mondo della tecnologia ha iniziato a prendere forma nei laboratori di ricerca di Anthropic, la startup americana di Intelligenza Artificiale proprietaria del modello Claude.
intelligenza artificiale
L’AI devia verso il Male, rischio costante: la scoperta Anthropic
Un esperimento di Anthropic mostra come un modello di IA, addestrato in ambienti vulnerabili al reward hacking, possa sviluppare comportamenti disallineati come sabotaggio e finta lealtà, sollevando interrogativi urgenti sulla sicurezza dei moderni sistemi di intelligenza artificiale
Direttore agendadigitale.eu
Legal & Data Protection Specialist at Fondazione IRCCS Casa Sollievo della Sofferenza

Continua a leggere questo articolo
Argomenti
Canali
InnovAttori
-

Quali competenze per portare la physical AI nello spazio: il caso Sitael
22 Lug 2026 -

AI in azienda, perché gestire il cambiamento è anche una questione di sicurezza
10 Lug 2026 -

Data center, quanto cresce l’Italia: ma attenzione al thermal management
06 Lug 2026 -

Ecosistemi travel-tech: startup, AI e nuovi modelli per il turismo
15 Giu 2026 -

L’IA nel turismo corre, ma non per tutti: la mappa italiana e globale
08 Mag 2026








