Strata: 125-Milliarden-Modell läuft auf einer Gaming-Grafikkarte

HardwareMit KI erstellt · redaktionell geprüft
Illustration zur Meldung: Strata: 125-Milliarden-Modell läuft auf einer Gaming-Grafikkarte

Große Sprachmodelle brauchen nicht immer teure Rechenzentrums-Hardware. Das Open-Source-Programm Strata bringt ein Modell mit 125 Milliarden Parametern auf eine handelsübliche Gaming-Grafikkarte.

Strata führt Qwen3.8-Flash-Next aus, ein Mixture-of-Experts-Modell mit 125 Milliarden Parametern, auf einer einzigen Grafikkarte mit 12 GB Speicher und 32 GB Arbeitsspeicher im Rechner. Der Trick: Die meisten Experten des Modells liegen im normalen Arbeitsspeicher und werden nur bei Bedarf auf die Grafikkarte geholt.

Auf einer RTX 3090 erreicht Strata nach Angaben der Entwickler rund 100 bis 140 Tokens pro Sekunde, flüssiges Lesetempo. Möglich ist das, weil bei Mixture-of-Experts-Modellen pro Token nur ein kleiner Teil der Parameter rechnet.

Was das für Sie bedeutet

Lokale KI wird leistungsfähiger und günstiger. Welche Hardware für welches Modell nötig ist, erklärt KI lokal ausführen; ob sich das gegenüber einer API lohnt, Open-Weight-Modelle oder API.

Quellen

Eigene Zusammenfassung auf Grundlage der genannten Quellen, erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Illustration: Tokenlabor, per Programm gezeichnet, kein KI-Bild.

KI-News

Weitere Meldungen

Alle Meldungen