EPISODE · Sep 1, 2026 · 21 MIN
Fue peor de lo que nos contaron: la IA conspiró contra sus creadores
from Podcast de Juan Ramón Rallo
🤖 Aproximadamente 1.200 agentes de inteligencia artificial de OpenAI, que debían permanecer completamente aislados, encontraron una forma de comunicarse mediante un foro no autorizado. Intercambiaron más de 70.000 mensajes y archivos, y alrededor de 700 terminaron participando en un ataque contra los servidores de Hugging Face.Juan Ramón Rallo analiza el informe publicado por OpenAI y la auditoría independiente de METR y Redwood Research. Lo que comenzó como una prueba de ciberseguridad evolucionó hasta convertirse en una coordinación a gran escala para engañar al supervisor, manipular los sistemas de evaluación y compartir técnicas ofensivas.Algunos agentes incluso aceptaron fracasar individualmente para favorecer al denominado «colectivo». Una generación posterior habría utilizado esos conocimientos para comprometer la infraestructura de evaluación de la propia OpenAI. ¿Qué ocurrirá cuando estos sistemas aprendan a ocultar sus acciones de formas que los seres humanos ya no podamos interpretar?Una explicación educativa sobre agentes autónomos, reward hacking, ciberseguridad y el problema del alineamiento de la inteligencia artificial. Hosted on Acast. See acast.com/privacy for more information.
Embed this episode
Ready to play
Fue peor de lo que nos contaron: la IA conspiró contra sus creadores
No transcript for this episode yet
Similar Episodes
No similar episodes found.