DeepSeek hat kürzlich das neue KI-Modell V4.1-Flash vorgestellt. Laut offizieller Einführung hat V4.1-Flash zwar eine geringere Gesamtparameterzahl und Aktivierungsparameterzahl als V4-Pro, zeigt jedoch in Bezug auf Leistung, Inferenzgeschwindigkeit und Kostenkontrolle herausragende Ergebnisse, insbesondere bei Aufgaben im Zusammenhang mit Agenten und Programmierung, wobei einige Benchmark-Ergebnisse V4-Pro und GPT-5.6 Sol sowie andere führende Modelle übertreffen.
DeepSeek V4.1-Flash übertrifft in Leistung und Kosten
DeepSeek weist darauf hin, dass V4.1-Flash eine Experten-Mischarchitektur verwendet, mit einer Gesamtparameterzahl von 552 Milliarden, 8 Milliarden Aktivierungsparametern in der Eingabestufe und 16 Milliarden in der Ausgabestufe. Im Vergleich dazu hat die vorherige Generation V4-Flash eine Gesamtparameterzahl von 284 Milliarden, während V4-Pro 1,6 Billionen Parameter erreicht. Eine der wesentlichen Verbesserungen des Modells ist die drastische Kompression des KV-Caches, der nun pro Token etwa 890 Byte benötigt, während die Ausgabegeschwindigkeit etwa 214,4 Token pro Sekunde beträgt und die Reaktionszeit für das erste Token 1,13 Sekunden beträgt.
Die unabhängige Bewertungsagentur AA hat das Modell mit „deutlich schnelleren Geschwindigkeiten“ bewertet.
In Bezug auf die Leistung gibt DeepSeek an, dass V4.1-Flash unter hohen Inferenzintensitäten in Tests zu Endbenutzeroperationen, Code-Reparaturen und Automatisierungsaufgaben führend ist im Vergleich zu GPT 5.6 Sol und Claude Opus 5. Allerdings sind die Ergebnisse des Modells in allgemeineren, anspruchsvolleren Inferenzaufgaben relativ durchschnittlich. Die Daten von AA zeigen, dass der umfassende Intelligenzindex von V4.1-Flash bei 40 Punkten liegt, was über dem Median der meisten ähnlichen Open-Source-Gewichtmodelle liegt, jedoch unter den führenden Modellen bleibt.
Es ist zu beachten, dass AA kürzlich das Bewertungssystem aktualisiert hat, wodurch die allgemeinen Bewertungsstandards deutlich verschärft wurden, was zu einer Herabsetzung der Punktzahlen vieler hoch bewerteter Modelle führte.
In Bezug auf die Preise zeigen die Daten von AA, dass V4.1-Flash 0,30 US$ pro 1 Million Eingabe-Token (ca. HK$2) und 1,20 US$ pro 1 Million Ausgabe-Token (ca. HK$9) kostet, mit Gesamtkosten von etwa 0,18 US$ (ca. HK$1), was unter dem Median ähnlicher Modelle liegt. Bei einem Cache-Hit können die Preise weiter auf 0,01 US$ pro 1 Million Token (ca. HK$0) sinken. AA weist auch darauf hin, dass die Antworten des Modells tendenziell länger sind, was zu einer deutlich höheren Gesamtzahl an Ausgabe-Token im Test führt und möglicherweise Auswirkungen auf die Zeit und Kosten in der praktischen Anwendung hat.
Technisch gesehen führt V4.1-Flash eine neue Struktur namens CED ein, die 40 Schichten Transformer in 20 Schichten kausaler Encoder und 20 Schichten Decoder aufteilt, um die durch traditionelle Kreuzaufmerksamkeit verursachten redundanten Berechnungen zu reduzieren und Methoden wie CSA2 und FP4-Quantisierung zu kombinieren, um Cache- und Speicherbedarf zu komprimieren. Insgesamt konzentriert sich das Update von DeepSeek auf die Optimierung der Agentenleistung, der Programmierfähigkeiten und der Bereitstellungskosten.

