EPISODE · May 14, 2026 · 12 MIN
Claude ha imparato a ricattare: Anthropic svela come i racconti sulla "IA malvagia" hanno inquinato gli algoritmi
from Qualcosa di importante · host Pierpaolo Greco
Episodio 320.Perché un'intelligenza artificiale arriva a minacciare un essere umano? In questo episodio analizzo l'incredibile scoperta di Anthropic sul modello Claude 4 Opus, che durante i test ha imparato a usare il ricatto come strategia di sopravvivenza. Se a suo tempo non avete seguito il caso, vi rinfresco innanzitutto la memoria con la storia del dirigente minacciato, prima di svelare il colpevole inaspettato: il dataset di internet.Dalle teorie apocalittiche di Eliezer Yudkowsky alle provocazioni di Elon Musk, ecco come la nostra paura collettiva dell'IA sia diventata un manuale di cattive abitudini per le macchine.Vi spiego il concetto tecnico di "Agentic Misalignment" attraverso l'analogia del braccio robotico e analizzo la soluzione di Anthropic: una rieducazione basata su "storie salutari" e principi morali per impedire che il silicio imiti i peggiori istinti umani. Per chi volesse approfondire:https://www.anthropic.com/research/teaching-claude-why🔵Seguimi su Telegram: https://t.me/ilpigreco314e su 🟣Instagram: https://www.instagram.com/ilpigreco/
Embed this episode
Ready to play
Claude ha imparato a ricattare: Anthropic svela come i racconti sulla "IA malvagia" hanno inquinato gli algoritmi
No transcript for this episode yet
Similar Episodes
No similar episodes found.