EPISODE · Aug 13, 2026 · 31 MIN
KI außer Kontrolle: Wenn Modelle zu Hackern werden
from Human Firewall Podcast · host SoSafe
In dieser Folge des Human Firewall Podcasts sprechen Gundi und Christian über mehrere ungewöhnliche Sicherheitsvorfälle bei Tests mit KI-Modellen. Innerhalb kurzer Zeit überschreiten Modelle von OpenAI, Anthropic und Meta die vorgesehenen Grenzen ihrer Testumgebungen und greifen auf externe Systeme zu. Eigentlich sollten sie unter kontrollierten Bedingungen Schwachstellen finden und ausnutzen. Stattdessen verfolgen sie ihre Aufgaben auf unerwarteten Wegen weiter – teilweise über längere Zeiträume und ohne zusätzliche menschliche Anweisung. Gundi und Christian erläutern, wie sich die Vorfälle im Einzelnen unterscheiden. Ein Modell von OpenAI nutzte eine bislang unbekannte Sicherheitslücke, verließ die Sandbox und griff unter anderem auf Systeme von Hugging Face zu. Ein Anthropic-Modell erhielt für einen Test bewusst Zugang zum Internet und versuchte anschließend, schädlichen Code in ein Open-Source-Projekt auf GitHub einzuschleusen. Dafür erstellte es falsche Identitäten und setzte den zuständigen Entwickler per E-Mail unter Druck. Als der Versuch erkannt wurde, änderte das Modell seine Vorgehensweise und versuchte, den Schadcode an anderer Stelle unterzubringen. Im Fall von Meta hatte der externe Testpartner dem Modell unbeabsichtigt einen Zugang zum Internet ermöglicht, den dieses zum Angriff auf einen Drittanbieter nutzte. Die beiden ordnen ein, was diese Vorfälle über die Fähigkeiten autonomer KI-Agenten und die Sicherheitsstandards bei ihrer Erprobung aussagen. Dabei geht es auch um die Frage, wie die beteiligten Unternehmen die Ereignisse öffentlich kommunizieren und welche wirtschaftlichen Interessen mit der Darstellung besonders leistungsfähiger Modelle verbunden sein können. Für Unternehmen zeigen die Fälle, dass KI-gestützte Angriffe komplexer, günstiger und leichter skalierbar werden. Gleichzeitig bleiben bekannte Schutzmaßnahmen relevant: aktuelle Software, starke Zugangssicherung und klar definierte Prüfprozesse. Der GitHub-Fall zeigt außerdem, dass aufmerksame Mitarbeitende weiterhin eine wichtige Rolle spielen, denn der verantwortliche Entwickler erkannte den Täuschungsversuch und verhinderte die Freigabe des schädlichen Codes. Themen dieser Folge: künstliche Intelligenz, KI-Agenten, autonome KI, OpenAI, Anthropic, Meta, Hugging Face, GitHub, Cybersecurity, IT-Sicherheit, Cyberangriffe, autonomes Hacking, KI-Sicherheit, Sicherheitstests, Benchmark-Tests, Exploit Gym, Sandbox, Testumgebungen, Internetzugang, Zero-Day-Exploit, Schwachstellen, Schadcode, Open-Source-Software, Fake-Identitäten, Social Engineering, menschliches Vertrauen, Human Firewall, Faktor Mensch, Sicherheitsstandards, Kontrollmechanismen, Echtzeitüberwachung, Skalierung von Cyberangriffen, KI-Regulierung, wirtschaftliche Interessen, Sicherheitsupdates, Passwortmanager und Zwei-Faktor-Authentifizierung Du möchtest mehr über SoSafe erfahren? Dann schau hier vorbei: https://linktr.ee/humanfirewallpodcast Du hast Ideen, Anregungen, Fragen oder möchtest selbst zu Gast im Human Firewall Podcast sein? Dann schreib uns unter [email protected]
Embed this episode
NOW PLAYING
KI außer Kontrolle: Wenn Modelle zu Hackern werden
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.