30. September 2026 · 9 Min. Lesezeit · Dirk Winiecki
DGX Spark vs. Mac Studio vs. RTX 5090 für lokale KI
Warum eine RTX 5090 mit 32 GB mehr als dreimal so schnell antwortet wie ein DGX Spark mit 128 GB. Mit Tabelle für über 50 Grafikkarten und Modell je Karte.
Ein DGX Spark hat 128 GB Speicher, eine RTX 5090 nur 32 GB. Trotzdem antwortet die 5090 mehr als dreimal so schnell. Und ein Mac Studio mit M3 Ultra antwortet schneller als der Spark, liest lange Texte allerdings nicht mal halb so schnell. Dahinter stecken zwei Zahlen, die kaum jemand auf dem Datenblatt liest: Speicherbandbreite und Rechenleistung.
Das Ganze gibt es auch als Video, 17 Minuten, mit allen Grafiken:
In aller Kürze
- Beim Antworten zählt die Speicherbandbreite, beim Lesen die Rechenleistung.
- Antworttempo mit gpt-oss-20b: RTX 5090 rund 300 Token pro Sekunde, Mac Studio M3 Ultra 116, DGX Spark 86.
- 30.000 Token lesen: RTX 5090 2,5 Sekunden, DGX Spark etwa 10, Mac Studio M3 Ultra gut 20.
- Mein Urteil: Der DGX Spark ist für die meisten ein Fehlkauf. Aber: Wer genau weiß, was er darauf betreiben will, dem kann er reichen.
- Tempo für deine Karte: Zeile in der llama.cpp-Tabelle suchen, durch die Modellgröße teilen.
- Strom: Die 5090 kostet bei 4 Stunden Antworten am Tag rund 14 € im Monat.
Zwei Zahlen: Bandbreite und Rechenleistung
Der Grafikspeicher bestimmt, wie groß das Modell sein darf. Die Speicherbandbreite bestimmt, wie schnell es antwortet. Zwei verschiedene Dinge, die ständig verwechselt werden.
Beim Schreiben muss für jedes einzelne Token das komplette Modell einmal aus dem Speicher gelesen werden, jedenfalls bei einem normalen Dense-Modell. Die Rechenkerne warten dabei die meiste Zeit. Der Engpass ist die Bandbreite.
Vor dem Schreiben liest das Modell deinen kompletten Text. Das heißt Prefill. Hier verarbeitet die Karte Hunderte Token auf einmal, das Modell muss nur einmal pro Block aus dem Speicher. Jetzt warten die Daten auf die Rechenkerne. So beschreibt es sogar Apple: Das erste Token hängt an der Rechenleistung, jedes weitere an der Bandbreite.
DGX Spark vs. Mac Studio vs. RTX 5090
Verglichen mit einem Modell, das auf allen drei Geräten läuft: gpt-oss mit 20 Milliarden Parametern. Gemessen hat die llama.cpp-Community, mit demselben Kommando.
| Gerät | Bandbreite | Antworten | 30.000 Token lesen |
|---|---|---|---|
| RTX 5090 | 1.792 GB/s | 299 Token/s | 2,5 s |
| Mac Studio M3 Ultra | 819 GB/s | 116 Token/s | 22 s |
| DGX Spark | 273 GB/s | 86 Token/s | 10 s |
gpt-oss-20b, llama-bench, Community-Messungen aus #15396 und #16578, Software-Stände August bis November 2025. Lesezeit gerechnet aus dem Durchschnittstempo über 32.768 Token.
Beim Antworten ist das genau die Reihenfolge der Bandbreite. Die Abstände sind kleiner als die Bandbreiten-Verhältnisse, weil gpt-oss ein Mixture-of-Experts-Modell ist und pro Token nur einen Teil liest.
Auf meiner eigenen 5090 habe ich mit aktueller Software nachgemessen (llama.cpp b10853, Power-Limit 430 W, 28.09.2026): 368 Token pro Sekunde beim Antworten, 1,7 Sekunden für 30.000 Token. Die Community-Werte sind älter, deshalb rechne ich die beiden nicht gegeneinander.
Warum liest der Mac so langsam?
An der Taktrate liegt es nicht. 5090 und Spark laufen beide mit knapp 2,5 GHz. Die 5090 hat aber 21.760 Rechenkerne, der Spark 6.144. Faktor 3,5. Dem M3 Ultra fehlen die Spezial-Rechenkerne für genau diese Rechnung, bei Nvidia heißen sie Tensor-Kerne. Apple baut sie erst seit dem M5 ein.
Und der neue Mac Studio mit M5 Ultra?
Den gibt es seit dem 22. September 2026. Im Test von MacStories kam bei einem Text mit 65.000 Token das erste Token nach 24 statt nach 59 Sekunden. Laut Tom's Hardware liest er bis etwa 32.000 Token schneller als der Spark. Die Bandbreite steigt auf 1,2 TB/s. An die 5090 kommt er beim Lesen allerdings nicht heran. Selbst getestet habe ich den M5 Ultra nicht.
Mein Urteil zum DGX Spark
Für die meisten ist der DGX Spark ein Fehlkauf. Er antwortet langsamer als der Mac Studio und liest fast viermal langsamer als die 5090. Bis eine Antwort kommt, dauert es einfach zu lange. In der großen llama.cpp-Tabelle landet er bei 57 Token pro Sekunde, etwa auf dem Niveau einer GTX 1080 Ti. Seine Bandbreite liegt ungefähr bei einer GTX 1070 Ti von 2017.
Aber: 128 GB Speicher haben ihren Wert. Wer genau weiß, welches große Modell er darauf betreiben will, und mit dem Tempo leben kann, für den kann er reichen.
Warum das Lesetempo für Agenten zählt
Ein Agent schickt bei jedem Schritt den ganzen bisherigen Verlauf an das Modell. Gute Programme wie llama-server merken sich, was schon gelesen ist, und rechnen nur den neuen Teil. Aber: Jede Datei und jedes Werkzeug-Ergebnis ist neuer Text. Und wird der Verlauf zusammengefasst, liest das Modell alles neu. Dann zählt wieder das Lesetempo.
Auch das Schreiben wird mit langem Verlauf langsamer. Auf meiner 5090 fällt gpt-oss-20b von 376 auf 302 Token pro Sekunde, wenn schon 32.000 Token im Kontext stehen. Minus 20 Prozent.
Und Riesenmodelle direkt von der SSD?
Kimi K3 hat 2,8 Billionen Parameter, die Gewichte sind offen. Von der SSD gestreamt haben andere 0,3 bis 0,5 Token pro Sekunde gemessen. Dazu kommt das Lesen deiner Frage, ebenfalls über die SSD. Bei einem langen Text sind das rechnerisch Stunden. Geht also. Praktikabel ist es nicht.
Die Software macht Faktor 1,7
Dieselbe Karte, dasselbe Modell (Qwen 3.6 35B-A3B auf meiner 5090), drei Setups: zwei llama.cpp-Varianten mit 189 und 204 Token pro Sekunde, Ninfer mit 314. Ninfer nutzt eine andere Quantisierung derselben Gewichte. Die Karte allein sagt also wenig.
Die Tabelle: über 50 Nvidia-Karten
Die llama.cpp-Community hat über 50 Nvidia-Karten mit demselben Test gemessen: Llama 2 7B in Q4, Antworttempo in Token pro Sekunde. Für AMD gibt es eine eigene Tabelle. Ein Auszug:
| Karte | Token/s | Preis, Stand 29.09.2026 |
|---|---|---|
| RTX 5090 | 300 | neu ab 5.849 € |
| RTX 4090 | 189 | gebraucht rund 2.800 € |
| RTX 5080 | 185 | |
| RTX 5070 Ti | 182 | neu ab 1.150 € |
| RTX 3090 | 162 | gebraucht rund 1.300 € |
| RTX 4080 Super | 147 | |
| RTX 4080 | 143 | |
| RTX 3080 | 140 | |
| RTX 4070 Ti Super | 133 | |
| RTX 5070 | 128 | |
| RTX 5060 Ti | 93 | 16 GB neu ab 680 € |
| RTX 2070 Super | 88 | |
| RTX 3060 | 77 | 12 GB neu ab 380 € |
| RTX 4060 Ti | 64 | 8 GB neu ab 540 € |
| GTX 1080 Ti | 61 | |
| DGX Spark | 57 | |
| Tesla P40 | 54 | |
| GTX 1060 | 28 | |
| Tesla K80 | 14 |
Llama 2 7B Q4_0, Flash Attention an, llama.cpp Discussion #15013, abgerufen 28.09.2026. Preise: Geizhals und Kleinanzeigen.
Drei Dinge fallen auf. Die 4090 hat nur 8 Prozent mehr Bandbreite als die 3090, ist aber 17 Prozent schneller. Die 5070 Ti kommt mit 16 GB fast auf 4090-Tempo. Und die 4060 Ti ist langsamer als die fünf Jahre alte 3060, weil ihr Speicherbus schmaler ist: 128 statt 192 Bit, 20 Prozent weniger Bandbreite. Das steht auf keinem Preisschild.
Meine Schwelle: Ab etwa 50 Token pro Sekunde macht das Arbeiten wirklich Spaß. Darunter wartest du auf jedes Wort.
Die Tabelle hat eine zweite Spalte, das Lesetempo. 3090: 5.600 Token pro Sekunde, 3060: 2.400. Ein PDF mit 20 Seiten hat rund 10.000 Token. Auf der 3060 sind das rechnerisch gut 4 Sekunden, in der Praxis etwas mehr.
So rechnest du das Tempo für dein Modell
Das Testmodell hat 3,6 GB. Dein Modell ist größer, also teilst du.
- Zeile deiner Karte in der Tabelle suchen.
- Dateigröße deines Modells durch 3,6 GB teilen.
- Tabellenwert durch dieses Verhältnis teilen.
RTX 5090 mit einem 27B-Modell in Q4: 15,6 GB geteilt durch 3,6 ergibt 4,4. 300 geteilt durch 4,4 ergibt rund 68 Token pro Sekunde. Gemessen habe ich tatsächlich 64.
RTX 3060 mit Gemma 4 E4B: 4,6 GB, also knapp ein Drittel größer als das Testmodell. Aus 77 werden rund 60 Token pro Sekunde. Flüssig. Auf meiner 5090 geht dieselbe Rechnung auf: gerechnet 230, gemessen 237.
Für deine Karte bleibt das eine Schätzung. Allerdings eine, die du selbst nachrechnen kannst. Für Mixture-of-Experts-Modelle gilt sie nicht, dazu unten mehr.
Wenn das Modell nicht in den Grafikspeicher passt
Dann hilft die Rechnung nicht mehr. Ein Teil läuft über den Arbeitsspeicher, und das Tempo bricht ein. Gemessen mit einem 27B-Modell, schrittweise aus der Karte geschoben: 69, 15, 8, 5, 3 Token pro Sekunde. Mehr Arbeitsspeicher ändert daran nichts. Faustregel: Dateigröße plus 2 bis 3 GB für Kontext, Puffer und Desktop muss unter deinen Grafikspeicher passen.
Welches Modell für deine Karte?
Dafür mein eigener Test: 57 Modelle, 100 Fragen in zehn Kategorien, jede zehnmal gestellt, bewertet von zwei unabhängigen KI-Judges. Tempo gemessen auf meiner 5090.
| Grafikspeicher | Modell | Punkte | Tempo auf der 5090 |
|---|---|---|---|
| bis 8 GB | Gemma 4 E4B | 84 | 237 Token/s |
| bis 16 GB | Gemma 4 12B-QAT | 86 | 150 Token/s |
| 24 GB | Qwen 3.8 27B (Q4) | 90 | 69 Token/s |
| 24 GB, schnell | Qwen 3.6 35B-A3B (MoE) | 88 | 190 bis 200 Token/s |
| bis 8 GB, Thinking | Qwen 3.5 9B Thinking | 91 | 18 s pro Antwort |
| 24 GB, Thinking | Qwen 3.5 27B Thinking | 93 | 36 s pro Antwort |
Die kleinen Gemma-Modelle sind stark bei Extraktion und Anweisungen, aber schwach bei Halluzinationen. Sie erfinden lieber, als „weiß ich nicht" zu sagen. Thinking lohnt sich, wenn du auf die Antwort warten kannst. Für schnelle Rückfragen wahrscheinlich eher nicht.
Aber: Mein Test ist fast immer eine Frage, eine Antwort. Über Agenten sagt er wenig. Alle 57 Modelle, filterbar nach deinem Grafikspeicher, stehen im Benchmark.
Für Agenten: Qwen 3.8 27B
Artificial Analysis hat Qwen 3.8 27B im Terminal-Bench 2.1 gemessen, 89 Aufgaben am Computer. Es löst rund 8 von 10, das nächstbeste Modell bis 24 GB rund 6. Allerdings nur mit langem Nachdenken. Ohne Thinking sind es 49 Prozent. Mein eigener Agent läuft seit Wochen auf Qwen 3.8, ohne Thinking. Gemessen habe ich das nicht. Gefühlt ist es das beste Modell, das ich auf einer Karte laufen lassen kann.
Drei Fallen
1. Mixture-of-Experts bricht die Rechnung
Mein 35B-MoE macht rund 200 Token pro Sekunde statt 64, weil pro Token nur ein Teil des Modells aus dem Speicher gelesen wird.
2. Langer Kontext
Mit jedem Token wächst der Kontextspeicher. Die Antworten werden langsamer, auf jeder Karte. Meine Benchmark-Prompts lagen zu 99,7 Prozent (von 56.944) unter 4.000 Token. Für lange Dokumente gelten meine Tempo-Zahlen also eher nicht.
3. Die 24-GB-Grenze
Qwen 3.5 27B in Q4 belegt mit 32.000 Token Kontext rund 19 GB. Auf 24 GB passen rechnerisch gut 80.000 Token, ohne Optimierung. Hängt dein Monitor an derselben Karte, nimmt der sich bis zu 2 GB. Dann eher 50.000.
Mit komprimiertem Kontextspeicher passt Qwen 3.8 27B in Q4 rechnerisch sogar mit vollem Kontext auf 24 GB, gut 260.000 Token. Das ist ungetestet, und bei langen Texten wird es ungenauer.
Zum Chatten reichen 32.000 Token. Mein Agenten-Setup will zum Start schon mehr, rund läuft es erst ab 100.000. Deshalb bleibe ich bei meiner Empfehlung: Zwei gebrauchte 3090 sind für die meisten besser als eine 4090. 48 GB, Platz für Kontext. Die 4090 ist leicht schneller, allerdings nicht im Verhältnis zum Preis.
Was kostet der Strom?
Tester haben direkt an der Karte gemessen: Leerlauf 5090 30 W, 3060 11 W. Volllast im Spiel 587 und 183 W. Beim KI-Antworten liegt es darunter, in einem Server-Test zog die 5090 rund 310 W.
| Karte | 4 h Antworten am Tag | plus 20 h Leerlauf |
|---|---|---|
| RTX 5090 | rund 14 € im Monat | knapp 7 € im Monat |
| RTX 3060 | rund 8 € im Monat |
37 Cent pro kWh (BDEW-Durchschnitt 2026). 3060 mit Spiele-Last gerechnet, beim Antworten wahrscheinlich eher weniger. Watt-Werte: TechPowerUp, Server-Test arXiv 2601.09527.
Wer das Power-Limit senkt, verliert beim Schreiben kaum Tempo. In der Community gemessen: 5090 von 600 auf 400 W, gut 1 Prozent langsamer beim Schreiben, rund 14 Prozent beim Lesen. Meine läuft auf 430 statt 575 W und schafft im Tabellentest trotzdem 306 Token pro Sekunde. Eine eigene Strommessung habe ich noch nicht gemacht, die kommt in einem eigenen Video.
Mehr dazu
- Die Grundlagen: Welche Hardware du für lokale KI wirklich brauchst (YouTube)
- Mein Modelltest mit allen Ergebnissen: Lokale KI im Test
- Die Rohdaten der Karten: llama.cpp-Tabelle Nvidia und AMD
Such deine Karte in der Tabelle, teil durch deine Modellgröße und schau im Benchmark nach, welches Modell in deine Klasse passt. Welche Karte hast du, und welche Modelle laufen darauf? Schreib es mir unter das Video.
Lokale KI für dein Unternehmen prüfen
Ehrliche Einschätzung, ob und wie lokale KI in deinem Setup Sinn ergibt. 30 Minuten, kostenlos, unverbindlich.
Potenzialcheck buchen