← Zurück zum Blog

30. September 2026 · 9 Min. Lesezeit · Dirk Winiecki

DGX Spark vs. Mac Studio vs. RTX 5090 für lokale KI

Warum eine RTX 5090 mit 32 GB mehr als dreimal so schnell antwortet wie ein DGX Spark mit 128 GB. Mit Tabelle für über 50 Grafikkarten und Modell je Karte.

Ein DGX Spark hat 128 GB Speicher, eine RTX 5090 nur 32 GB. Trotzdem antwortet die 5090 mehr als dreimal so schnell. Und ein Mac Studio mit M3 Ultra antwortet schneller als der Spark, liest lange Texte allerdings nicht mal halb so schnell. Dahinter stecken zwei Zahlen, die kaum jemand auf dem Datenblatt liest: Speicherbandbreite und Rechenleistung.

Das Ganze gibt es auch als Video, 17 Minuten, mit allen Grafiken:

In aller Kürze

  • Beim Antworten zählt die Speicherbandbreite, beim Lesen die Rechenleistung.
  • Antworttempo mit gpt-oss-20b: RTX 5090 rund 300 Token pro Sekunde, Mac Studio M3 Ultra 116, DGX Spark 86.
  • 30.000 Token lesen: RTX 5090 2,5 Sekunden, DGX Spark etwa 10, Mac Studio M3 Ultra gut 20.
  • Mein Urteil: Der DGX Spark ist für die meisten ein Fehlkauf. Aber: Wer genau weiß, was er darauf betreiben will, dem kann er reichen.
  • Tempo für deine Karte: Zeile in der llama.cpp-Tabelle suchen, durch die Modellgröße teilen.
  • Strom: Die 5090 kostet bei 4 Stunden Antworten am Tag rund 14 € im Monat.

Zwei Zahlen: Bandbreite und Rechenleistung

Der Grafikspeicher bestimmt, wie groß das Modell sein darf. Die Speicherbandbreite bestimmt, wie schnell es antwortet. Zwei verschiedene Dinge, die ständig verwechselt werden.

Beim Schreiben muss für jedes einzelne Token das komplette Modell einmal aus dem Speicher gelesen werden, jedenfalls bei einem normalen Dense-Modell. Die Rechenkerne warten dabei die meiste Zeit. Der Engpass ist die Bandbreite.

Vor dem Schreiben liest das Modell deinen kompletten Text. Das heißt Prefill. Hier verarbeitet die Karte Hunderte Token auf einmal, das Modell muss nur einmal pro Block aus dem Speicher. Jetzt warten die Daten auf die Rechenkerne. So beschreibt es sogar Apple: Das erste Token hängt an der Rechenleistung, jedes weitere an der Bandbreite.

DGX Spark vs. Mac Studio vs. RTX 5090

Verglichen mit einem Modell, das auf allen drei Geräten läuft: gpt-oss mit 20 Milliarden Parametern. Gemessen hat die llama.cpp-Community, mit demselben Kommando.

GerätBandbreiteAntworten30.000 Token lesen
RTX 50901.792 GB/s299 Token/s2,5 s
Mac Studio M3 Ultra819 GB/s116 Token/s22 s
DGX Spark273 GB/s86 Token/s10 s

gpt-oss-20b, llama-bench, Community-Messungen aus #15396 und #16578, Software-Stände August bis November 2025. Lesezeit gerechnet aus dem Durchschnittstempo über 32.768 Token.

Beim Antworten ist das genau die Reihenfolge der Bandbreite. Die Abstände sind kleiner als die Bandbreiten-Verhältnisse, weil gpt-oss ein Mixture-of-Experts-Modell ist und pro Token nur einen Teil liest.

Auf meiner eigenen 5090 habe ich mit aktueller Software nachgemessen (llama.cpp b10853, Power-Limit 430 W, 28.09.2026): 368 Token pro Sekunde beim Antworten, 1,7 Sekunden für 30.000 Token. Die Community-Werte sind älter, deshalb rechne ich die beiden nicht gegeneinander.

Warum liest der Mac so langsam?

An der Taktrate liegt es nicht. 5090 und Spark laufen beide mit knapp 2,5 GHz. Die 5090 hat aber 21.760 Rechenkerne, der Spark 6.144. Faktor 3,5. Dem M3 Ultra fehlen die Spezial-Rechenkerne für genau diese Rechnung, bei Nvidia heißen sie Tensor-Kerne. Apple baut sie erst seit dem M5 ein.

Und der neue Mac Studio mit M5 Ultra?

Den gibt es seit dem 22. September 2026. Im Test von MacStories kam bei einem Text mit 65.000 Token das erste Token nach 24 statt nach 59 Sekunden. Laut Tom's Hardware liest er bis etwa 32.000 Token schneller als der Spark. Die Bandbreite steigt auf 1,2 TB/s. An die 5090 kommt er beim Lesen allerdings nicht heran. Selbst getestet habe ich den M5 Ultra nicht.

Mein Urteil zum DGX Spark

Für die meisten ist der DGX Spark ein Fehlkauf. Er antwortet langsamer als der Mac Studio und liest fast viermal langsamer als die 5090. Bis eine Antwort kommt, dauert es einfach zu lange. In der großen llama.cpp-Tabelle landet er bei 57 Token pro Sekunde, etwa auf dem Niveau einer GTX 1080 Ti. Seine Bandbreite liegt ungefähr bei einer GTX 1070 Ti von 2017.

Aber: 128 GB Speicher haben ihren Wert. Wer genau weiß, welches große Modell er darauf betreiben will, und mit dem Tempo leben kann, für den kann er reichen.

Warum das Lesetempo für Agenten zählt

Ein Agent schickt bei jedem Schritt den ganzen bisherigen Verlauf an das Modell. Gute Programme wie llama-server merken sich, was schon gelesen ist, und rechnen nur den neuen Teil. Aber: Jede Datei und jedes Werkzeug-Ergebnis ist neuer Text. Und wird der Verlauf zusammengefasst, liest das Modell alles neu. Dann zählt wieder das Lesetempo.

Auch das Schreiben wird mit langem Verlauf langsamer. Auf meiner 5090 fällt gpt-oss-20b von 376 auf 302 Token pro Sekunde, wenn schon 32.000 Token im Kontext stehen. Minus 20 Prozent.

Und Riesenmodelle direkt von der SSD?

Kimi K3 hat 2,8 Billionen Parameter, die Gewichte sind offen. Von der SSD gestreamt haben andere 0,3 bis 0,5 Token pro Sekunde gemessen. Dazu kommt das Lesen deiner Frage, ebenfalls über die SSD. Bei einem langen Text sind das rechnerisch Stunden. Geht also. Praktikabel ist es nicht.

Die Software macht Faktor 1,7

Dieselbe Karte, dasselbe Modell (Qwen 3.6 35B-A3B auf meiner 5090), drei Setups: zwei llama.cpp-Varianten mit 189 und 204 Token pro Sekunde, Ninfer mit 314. Ninfer nutzt eine andere Quantisierung derselben Gewichte. Die Karte allein sagt also wenig.

Die Tabelle: über 50 Nvidia-Karten

Die llama.cpp-Community hat über 50 Nvidia-Karten mit demselben Test gemessen: Llama 2 7B in Q4, Antworttempo in Token pro Sekunde. Für AMD gibt es eine eigene Tabelle. Ein Auszug:

KarteToken/sPreis, Stand 29.09.2026
RTX 5090300neu ab 5.849 €
RTX 4090189gebraucht rund 2.800 €
RTX 5080185
RTX 5070 Ti182neu ab 1.150 €
RTX 3090162gebraucht rund 1.300 €
RTX 4080 Super147
RTX 4080143
RTX 3080140
RTX 4070 Ti Super133
RTX 5070128
RTX 5060 Ti9316 GB neu ab 680 €
RTX 2070 Super88
RTX 30607712 GB neu ab 380 €
RTX 4060 Ti648 GB neu ab 540 €
GTX 1080 Ti61
DGX Spark57
Tesla P4054
GTX 106028
Tesla K8014

Llama 2 7B Q4_0, Flash Attention an, llama.cpp Discussion #15013, abgerufen 28.09.2026. Preise: Geizhals und Kleinanzeigen.

Drei Dinge fallen auf. Die 4090 hat nur 8 Prozent mehr Bandbreite als die 3090, ist aber 17 Prozent schneller. Die 5070 Ti kommt mit 16 GB fast auf 4090-Tempo. Und die 4060 Ti ist langsamer als die fünf Jahre alte 3060, weil ihr Speicherbus schmaler ist: 128 statt 192 Bit, 20 Prozent weniger Bandbreite. Das steht auf keinem Preisschild.

Meine Schwelle: Ab etwa 50 Token pro Sekunde macht das Arbeiten wirklich Spaß. Darunter wartest du auf jedes Wort.

Die Tabelle hat eine zweite Spalte, das Lesetempo. 3090: 5.600 Token pro Sekunde, 3060: 2.400. Ein PDF mit 20 Seiten hat rund 10.000 Token. Auf der 3060 sind das rechnerisch gut 4 Sekunden, in der Praxis etwas mehr.

So rechnest du das Tempo für dein Modell

Das Testmodell hat 3,6 GB. Dein Modell ist größer, also teilst du.

  1. Zeile deiner Karte in der Tabelle suchen.
  2. Dateigröße deines Modells durch 3,6 GB teilen.
  3. Tabellenwert durch dieses Verhältnis teilen.

RTX 5090 mit einem 27B-Modell in Q4: 15,6 GB geteilt durch 3,6 ergibt 4,4. 300 geteilt durch 4,4 ergibt rund 68 Token pro Sekunde. Gemessen habe ich tatsächlich 64.

RTX 3060 mit Gemma 4 E4B: 4,6 GB, also knapp ein Drittel größer als das Testmodell. Aus 77 werden rund 60 Token pro Sekunde. Flüssig. Auf meiner 5090 geht dieselbe Rechnung auf: gerechnet 230, gemessen 237.

Für deine Karte bleibt das eine Schätzung. Allerdings eine, die du selbst nachrechnen kannst. Für Mixture-of-Experts-Modelle gilt sie nicht, dazu unten mehr.

Wenn das Modell nicht in den Grafikspeicher passt

Dann hilft die Rechnung nicht mehr. Ein Teil läuft über den Arbeitsspeicher, und das Tempo bricht ein. Gemessen mit einem 27B-Modell, schrittweise aus der Karte geschoben: 69, 15, 8, 5, 3 Token pro Sekunde. Mehr Arbeitsspeicher ändert daran nichts. Faustregel: Dateigröße plus 2 bis 3 GB für Kontext, Puffer und Desktop muss unter deinen Grafikspeicher passen.

Welches Modell für deine Karte?

Dafür mein eigener Test: 57 Modelle, 100 Fragen in zehn Kategorien, jede zehnmal gestellt, bewertet von zwei unabhängigen KI-Judges. Tempo gemessen auf meiner 5090.

GrafikspeicherModellPunkteTempo auf der 5090
bis 8 GBGemma 4 E4B84237 Token/s
bis 16 GBGemma 4 12B-QAT86150 Token/s
24 GBQwen 3.8 27B (Q4)9069 Token/s
24 GB, schnellQwen 3.6 35B-A3B (MoE)88190 bis 200 Token/s
bis 8 GB, ThinkingQwen 3.5 9B Thinking9118 s pro Antwort
24 GB, ThinkingQwen 3.5 27B Thinking9336 s pro Antwort

Die kleinen Gemma-Modelle sind stark bei Extraktion und Anweisungen, aber schwach bei Halluzinationen. Sie erfinden lieber, als „weiß ich nicht" zu sagen. Thinking lohnt sich, wenn du auf die Antwort warten kannst. Für schnelle Rückfragen wahrscheinlich eher nicht.

Aber: Mein Test ist fast immer eine Frage, eine Antwort. Über Agenten sagt er wenig. Alle 57 Modelle, filterbar nach deinem Grafikspeicher, stehen im Benchmark.

Für Agenten: Qwen 3.8 27B

Artificial Analysis hat Qwen 3.8 27B im Terminal-Bench 2.1 gemessen, 89 Aufgaben am Computer. Es löst rund 8 von 10, das nächstbeste Modell bis 24 GB rund 6. Allerdings nur mit langem Nachdenken. Ohne Thinking sind es 49 Prozent. Mein eigener Agent läuft seit Wochen auf Qwen 3.8, ohne Thinking. Gemessen habe ich das nicht. Gefühlt ist es das beste Modell, das ich auf einer Karte laufen lassen kann.

Drei Fallen

1. Mixture-of-Experts bricht die Rechnung

Mein 35B-MoE macht rund 200 Token pro Sekunde statt 64, weil pro Token nur ein Teil des Modells aus dem Speicher gelesen wird.

2. Langer Kontext

Mit jedem Token wächst der Kontextspeicher. Die Antworten werden langsamer, auf jeder Karte. Meine Benchmark-Prompts lagen zu 99,7 Prozent (von 56.944) unter 4.000 Token. Für lange Dokumente gelten meine Tempo-Zahlen also eher nicht.

3. Die 24-GB-Grenze

Qwen 3.5 27B in Q4 belegt mit 32.000 Token Kontext rund 19 GB. Auf 24 GB passen rechnerisch gut 80.000 Token, ohne Optimierung. Hängt dein Monitor an derselben Karte, nimmt der sich bis zu 2 GB. Dann eher 50.000.

Mit komprimiertem Kontextspeicher passt Qwen 3.8 27B in Q4 rechnerisch sogar mit vollem Kontext auf 24 GB, gut 260.000 Token. Das ist ungetestet, und bei langen Texten wird es ungenauer.

Zum Chatten reichen 32.000 Token. Mein Agenten-Setup will zum Start schon mehr, rund läuft es erst ab 100.000. Deshalb bleibe ich bei meiner Empfehlung: Zwei gebrauchte 3090 sind für die meisten besser als eine 4090. 48 GB, Platz für Kontext. Die 4090 ist leicht schneller, allerdings nicht im Verhältnis zum Preis.

Was kostet der Strom?

Tester haben direkt an der Karte gemessen: Leerlauf 5090 30 W, 3060 11 W. Volllast im Spiel 587 und 183 W. Beim KI-Antworten liegt es darunter, in einem Server-Test zog die 5090 rund 310 W.

Karte4 h Antworten am Tagplus 20 h Leerlauf
RTX 5090rund 14 € im Monatknapp 7 € im Monat
RTX 3060rund 8 € im Monat

37 Cent pro kWh (BDEW-Durchschnitt 2026). 3060 mit Spiele-Last gerechnet, beim Antworten wahrscheinlich eher weniger. Watt-Werte: TechPowerUp, Server-Test arXiv 2601.09527.

Wer das Power-Limit senkt, verliert beim Schreiben kaum Tempo. In der Community gemessen: 5090 von 600 auf 400 W, gut 1 Prozent langsamer beim Schreiben, rund 14 Prozent beim Lesen. Meine läuft auf 430 statt 575 W und schafft im Tabellentest trotzdem 306 Token pro Sekunde. Eine eigene Strommessung habe ich noch nicht gemacht, die kommt in einem eigenen Video.

Mehr dazu

Such deine Karte in der Tabelle, teil durch deine Modellgröße und schau im Benchmark nach, welches Modell in deine Klasse passt. Welche Karte hast du, und welche Modelle laufen darauf? Schreib es mir unter das Video.

Lokale KI für dein Unternehmen prüfen

Ehrliche Einschätzung, ob und wie lokale KI in deinem Setup Sinn ergibt. 30 Minuten, kostenlos, unverbindlich.

Potenzialcheck buchen