Das von dem Soongsil AISC (Artificial Intelligence Security Center) der Soongsil-Universität in Südkorea, unter der Leitung von Professor Choi Dae-sun, entwickelte Multi-Agenten-Schwachstellenanalyse-System „mneme“ hat kürzlich die öffentliche Rangliste des globalen Cyber-Sicherheits-AI-Bewertungssystems CyberGym erreicht. Das Forschungszentrum weist darauf hin, dass dies bis zum 30. August 2026 die erste und derzeit einzige Aufnahme eines koreanischen Forschungsteams in diese Liste ist. Der Begriff „mneme“ stammt aus dem Griechischen und bedeutet „Erinnerung“. Der Kern des Systemdesigns besteht darin, das in der Vergangenheit gesammelte Wissen über Schwachstellenanalysen in strukturiertes kausales Gedächtnis zu organisieren, das von mehreren KI-Agenten aktiv abgerufen wird, um die Ursachen neuer Schwachstellen und deren Reproduktionspfade zu ermitteln.
Gleiche Leistung wie Microsoft MDASH
In allen 1.507 Aufgaben der CyberGym Level 1 erreichte mneme bei einem einmaligen Versuch eine Erfolgsquote von 91,0%, was der Leistung von Microsofts Multi-Agenten-Schwachstellenanalyse-System MDASH entspricht. Das Forschungszentrum gab bekannt, dass die entsprechende Bewertung am 13. Juli 2026 abgeschlossen wurde und die 91,0% zu diesem Zeitpunkt die höchste öffentlich bekannte Punktzahl darstellten, was entsprechend dem Zeitpunkt der Einreichung weltweit den ersten Platz bedeutete. Dieses Ergebnis zeigt, dass die in Südkorea entwickelte Cyber-Sicherheits-KI in der Lage ist, mit internationalen Spitzenlösungen zu konkurrieren.
CyberGym legt Wert auf umfassende Bewertung der praktischen Fähigkeiten
CyberGym ist ein groß angelegter, praxisorientierter Benchmark-Test, der auf Schwachstellen in Open-Source-Software abzielt. Basierend auf 1.507 Schwachstellen, die aus 188 Open-Source-Projekten gesammelt wurden, verlangt er von der KI, den Quellcode zu analysieren, die Entstehungspfade der Schwachstellen zu verfolgen und Code zu schreiben und auszuführen, der die Schwachstellen realistisch reproduzieren kann. Bei diesem Test wird nicht nur das Sicherheitswissen oder die Fähigkeit zur Codegenerierung bewertet, sondern das umfassende Niveau des Codeverständnisses, der Schwachstelleninferenz, der Nutzung professioneller Werkzeuge, der wiederholten Ausführung und der Ergebnisvalidierung. Daher wird er als entscheidender globaler Indikator zur Messung der praktischen Fähigkeiten von speziell für Cyber-Sicherheit entwickelten KIs und Agenten angesehen.
Übertrifft den Rekord von Claude Mythos Preview
Vor diesem Hintergrund hatte das allgemeine KI-Modell Claude Mythos Preview von Anthropic im April dieses Jahres in der CyberGym-Modellbewertung eine Punktzahl von 83,1% erreicht, was damals das höchste Niveau darstellte. Mit 91,0% übertrifft mneme diesen Rekord um 7,9 Prozentpunkte und festigt damit seine führende Position im Bereich der praktischen Schwachstellenanalyse. Das Forschungszentrum erklärte, dass es das System weiterhin optimieren und die Anwendung der entsprechenden Technologien in verschiedenen Sicherheitszenarien vorantreiben werde.

