LLMs e sicurezza: MRJ-Agent per un attacco Multi-Round episode artwork

EPISODE · Nov 28, 2024 · 12 MIN

LLMs e sicurezza: MRJ-Agent per un attacco Multi-Round

from Andrea Viliotti · host Andrea Viliotti Independent AI Strategy Consultant & Researcher | Author of GDE

La puntata presenta MRJ-Agent, un innovativo agente di attacco multi-round per Large Language Models (LLMs). Diversamente dagli attacchi single-round già noti, MRJ-Agent simula interazioni umane complesse utilizzando strategie di decomposizione del rischio e induzione psicologica per spingere gli LLM a generare risposte potenzialmente dannose. I risultati evidenziano un elevato tasso di successo su diversi modelli, tra cui GPT-4 e LLaMA2-7B, sottolineando la vulnerabilità degli LLM agli attacchi multi-round e l'urgenza di sviluppare difese più efficaci. La ricerca offre spunti per il futuro della sicurezza e dell'allineamento degli LLM, evidenziando l'importanza di adottare un approccio proattivo e adattativo per garantire maggiore resilienza.

Episode metadata supplied by the publisher feed · Published Nov 28, 2024

Embed this episode

NOW PLAYING

LLMs e sicurezza: MRJ-Agent per un attacco Multi-Round

0:00 12:39

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of Andrea Viliotti?

This episode is 12 minutes long.

When was this Andrea Viliotti episode published?

This episode was published on November 28, 2024.

Can I download this Andrea Viliotti episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!