Alibaba Qwen3-Max-Flash Modell mit neuem hybriden Attention-Framework vorgestellt

Die AI-Plattform Qianwen von Alibaba hat am 27. August offiziell das Modell Qwen3-Max-Flash vorgestellt, das als multimodales Mischexperten (MoE) Architektur positioniert ist und ein hervorragendes Preis-Leistungs-Verhältnis bietet. Die offiziellen Preisangaben lauten: Eingabe pro Million Tokens kostet RMB¥0.80 (ca. HK$0), Ausgabe pro Million Tokens kostet RMB¥2.70 (ca. HK$2), und Cache-Hit pro Million Tokens kostet RMB¥0.10 (ca. HK$0).

Qwen3-Max-Flash verwendet eine neuartige Mischaufmerksamkeitsarchitektur

Qwen3-Max-Flash basiert auf einer völlig neuen Next-Generation-Architektur, die sich grundlegend von früheren großen Modellen von Qianwen unterscheidet, mit einer Gesamtanzahl von Milliarden von Parametern, wobei jedoch bei jeder Inferenz nur 6 Milliarden (6B) Parameter aktiviert werden, was als Maßstab für die Effizienz globaler Modelle gilt. Im Hinblick auf den Aufmerksamkeitsmechanismus führt das Modell den einzigartigen QSA (Qwen Sparse Attention) sparsamen Aufmerksamkeitsmechanismus ein, der eine effiziente Fusion mit GDN bildet und in Szenarien mit hoher Cache-Hit-Rate und 1M Tokens langen Kontexten die Rechenleistung im Vergleich zu traditionellen Lösungen um mehr als das Achtfache steigert, während gleichzeitig die Genauigkeit gewahrt bleibt.

Im Bereich der internen Schichtkommunikation verwendet das Modell die selbstentwickelte Gated Residual-Methode, um den traditionellen Transformer-Einzelinformationshauptkanal in vier unabhängige Kanäle aufzuteilen, sodass das Modell dynamisch den Lese- und Schreibpfad je nach Bedarf bestimmen kann, was die Informationsübertragung effizienter macht und gleichzeitig die Trainingsstabilität erhöht. Dieses Design beseitigt die Engpässe, die durch den einzelnen Kanal verursacht werden, und ermöglicht einen reibungsloseren Gradientenfluss während des großangelegten Trainings.

51B N-gram Embedding verbessert die Effizienz der Parametererweiterung

Auf der Ebene der Parametererweiterung führt das Modell zusätzlich 51B N-gram Embedding-Parameter ein, die dem Transformer-Hauptstrang eine effiziente Lookup-Funktion bieten. Diese Parameter müssen bei jeder Token-Berechnung nicht sofort aktiviert werden, sondern werden lediglich mit extrem geringem Ressourcenverbrauch als eine Art umfangreiches Gedächtnishandbuch „angeschlossen“, was die Effizienz der Parametererweiterung des Modells erheblich steigert und die Trainingskosten senkt. Durch dieses entkoppelte Design kann das Modell bei gleichbleibender Inferenzgeschwindigkeit mehr Weltwissen in statischen Parametern vorladen.

In Bezug auf die Parameteranpassung verfolgt Qwen3-Max-Flash eine Strategie, die die Modellstruktur und die nachträgliche Optimierung synergistisch vorantreibt, was sowohl die Konvergenzeffizienz als auch die Trainingsdurchsatzrate erheblich verbessert. Zusammenfassend lässt sich sagen, dass das neue Modell in realen Anwendungsszenarien wie Programmierung und Agenten kostengünstige und effiziente Inferenzdienste zu einem niedrigeren Preis anbieten kann, was eine kosteneffizientere Option für Unternehmensanwendungen darstellt.

Artikel Spezifikationen
Architekturtyp Multimodaler Mischexperte (MoE)
Gesamtanzahl der Parameter Milliardenbereich
Aktivierte Parameter 6 Milliarden (6B)
N-gram Embedding-Parameter 51B
Aufmerksamkeitsmechanismus QSA sparsamer Aufmerksamkeitsmechanismus + GDN Mischarchitektur
Geschwindigkeitserhöhung bei langem Kontext Über 8-fache Steigerung in Szenarien mit hoher Cache-Hit-Rate bei 1M Tokens
Eingabepreis RMB¥0.80 (ca. HK$0)
Ausgabepreis RMB¥2.70 (ca. HK$2)
Cache-Hit-Preis RMB¥0.10 (ca. HK$0)
Originalinhalt
Dieser Artikel ist die deutsche Fassung eines Originalbeitrags von TechRitual.
Stein Yep
Stein Yep