Bleib up-to-date mit unserem Newsletter!

Erhalte regelmäßig praktische Tipps, Anleitungen und wertvolles Wissen rund um Künstliche Intelligenz — direkt von KI-Wissen.org.
Newsletter KI-Experte

 Ihre Daten werden nur für den Versand des Newsletters genutzt. Infos zum Datenschutz hier.

Auf einen Blick

Die bekanntesten Small Language Models im Überblick

NameBeschreibungLink
Gemma 3n E2B Google, 5 Mrd. Parameter (effektiv 2 Mrd.) – läuft laut Google mit rund 2 GB Speicher. Offizielle Dokumentation
Qwen3-1.7B Alibaba, 1,7 Mrd. Parameter – kompakt, mit Umschaltung zwischen schnellem und tiefem Denkmodus, u. a. gut zum Auslesen hochgeladener Dokumente. Bei Hugging Face ansehen
LFM2 Liquid AI, 350 Mio. – 2,6 Mrd. Parameter – Hybrid-Architektur eigens für On-Device-Einsatz; benötigt bereits in 4-Bit-Quantisierung unter 2 GB Arbeitsspeicher. Bei Hugging Face ansehen
RWKV RWKV-Projekt (Open Source), Parameterzahl je nach Version – alternative Architektur ohne klassische Transformer-Attention, sehr sparsam im Speicherbedarf. Offizielle Projektseite

So läuft KI auch auf deinem alten Rechner – lokal, privat, kostenlos

Lokale KI muss nicht am teuren High-End-PC scheitern. Mit Small Language Models – kompakten KI-Modellen, die gezielt für schwächere Rechner entwickelt wurden – läuft KI auch auf einem 5 oder 7 Jahre alten Computer, komplett lokal, privat und kostenlos.

In diesem Beitrag zeige ich dir, woran du ein Small Language Model erkennst, was GGUF, MLX und Quantisierung bedeuten, welche Modelle sich für welche Hardware eignen – und wie gut sie sich im Praxistest auf einem alten MacBook und einem alten iMac wirklich schlagen.

Von Harald Frey, KI-Trainer & Berater · Zuletzt aktualisiert: 28. August 2026

Was sind Small Language Models?

Small Language Models, kurz SLMs, sind KI-Sprachmodelle mit typischerweise unter 10 Milliarden Parametern, die gezielt für schwächere Rechner optimiert wurden. Anders als große Sprachmodelle mit 30, 70 oder mehr Milliarden Parametern laufen sie auch auf älteren Laptops und Desktop-Rechnern mit wenig Arbeitsspeicher – lokal, kostenlos und ganz ohne Internetverbindung.

< 10 Mrd.
Parameter gelten als Small Language Model
ab 2 GB RAM
reichen für ein kleines On-Device-Modell
0 €
Kosten – läuft komplett lokal, ohne Abo

Dabei gibt es zwei unterschiedliche Wege zu einem Small Language Model: verkleinerte Varianten bekannter Modelle wie Gemma von Google oder Qwen von Alibaba, und neuartige Hybrid-Architekturen wie LFM von Liquid AI oder RWKV, die von Grund auf für maximale Effizienz auf schwacher Hardware entwickelt wurden.

Eine offizielle Einstufung für Small Language Models gibt es nicht. In der Praxis gilt bei führenden Anbietern aber einheitlich: Alles unter 10 Milliarden Parametern zählt als Small Language Model.

Woran erkennst du ein Small Language Model in LM Studio?

Die einfachste Möglichkeit, Small Language Models zu finden und zu testen, ist die kostenlose Software LM Studio. Sie liest deine Hardware aus und zeigt dir im Modell-Browser vor allem Modelle an, die auch wirklich auf deinen Rechner passen.

Wichtig vor dem ersten Download: Prüfe in den Einstellungen unter „Runtime", ob alle Engines und Frameworks aktuell sind – sonst funktionieren neuere Modelle mitunter nicht optimal.

Am Modellnamen selbst erkennst du schon viel: Die Zahl vor dem „B" steht für die Anzahl der Parameter in Milliarden – bei „2B" also zwei Milliarden, verglichen mit 12, 30 oder über 70 Milliarden bei großen KI-Modellen. Steht zusätzlich ein „E" im Namen, wie bei Googles Gemma 3n E2B, bedeutet das „Effective": Das Modell wurde gezielt so gebaut, dass es mit deutlich weniger Speicher auskommt, als seine tatsächliche Parameterzahl vermuten lässt.

GGUF, MLX und Quantisierung: was die Modell-Varianten bedeuten

Zu jedem Modell zeigt LM Studio mehrere Varianten an. Die MLX-Variante ist speziell für neuere Macs mit Apple Silicon optimiert, während sich Modelle im GGUF-Format auf allen Betriebssystemen und auch auf älteren Intel-Macs nutzen lassen.

Angaben wie 4-Bit (Q4) oder 8-Bit (Q8) beschreiben die sogenannte Quantisierung – wie stark ein Modell komprimiert wurde. Je stärker die Komprimierung, desto kleiner der RAM-Bedarf und desto schneller läuft das Modell auf deiner CPU, allerdings auf Kosten der Präzision.

Q4 – 4-Bit

Kleinster Speicherbedarf

Jedes Gewicht wird vom 16-Bit-Original auf 4 Bit reduziert – das Modell wird etwa um den Faktor 4 kleiner, RAM- und VRAM-Bedarf sinken drastisch.

Q8 – 8-Bit

Nahezu verlustfrei

Jeder Parameter belegt 8 Bit Speicher – eine Halbierung gegenüber dem 16-Bit-Original, bei kaum spürbarem Qualitätsverlust.

Praxistest: Small Language Models auf altem MacBook und iMac

Wie gut schlagen sich Small Language Models wirklich auf alter Hardware? Ich habe es auf zwei Geräten getestet:

Gerät 1

5 Jahre altes MacBook

8 GB RAM insgesamt, davon nur gut 5 GB als VRAM für lokale Sprachmodelle nutzbar – getestet mit LM Studio.

Gerät 2

7 Jahre alter iMac (Intel)

16 GB RAM, zu alt für LM Studio – getestet mit der Alternative Ollama.

Auf beiden Geräten habe ich dasselbe On-Device-Modell geladen und eine PDF-Datei hochladen und auslesen lassen – unbearbeitet und live. Das Ergebnis: Selbst mit nur rund 5 GB nutzbarem Speicher antwortet das Modell auf dem alten MacBook flüssig und zuverlässig. Auf dem iMac übernimmt Ollama die Rolle von LM Studio, da die Software auf dieser älteren Intel-Hardware nicht läuft – auch hier liest das Modell die hochgeladene PDF-Datei zuverlässig aus.

Wie genau sich das im Detail anfühlt und wie schnell die Antworten wirklich kommen, zeige ich dir Schritt für Schritt im Video oben.

KI-Training & Beratung

Du willst lokale KI und Automatisierungen in deinem Unternehmen einsetzen?

Ich zeige dir und deinem Team, wie ihr KI lokal, sicher und ohne laufende Cloud-Kosten einsetzt – praxisnah und auf euren Workflow zugeschnitten.

Häufige Fragen

Was ist ein Small Language Model (SLM)?

Ein Small Language Model ist ein KI-Sprachmodell mit typischerweise unter 10 Milliarden Parametern, das speziell für schwächere Rechner optimiert wurde und lokal läuft.

Wie viel RAM brauche ich für ein Small Language Model?

Das hängt vom Modell und der Quantisierung ab: Ultrakompakte On-Device-Modelle mit 1 bis 3 Milliarden Parametern laufen in 4-Bit-Quantisierung oft schon mit unter 2 GB Arbeitsspeicher, größere Small Language Models benötigen meist 8 bis 16 GB RAM.

Was ist der Unterschied zwischen GGUF und MLX?

GGUF ist ein universelles Format, das auf allen Betriebssystemen läuft, auch auf älteren Intel-Macs. MLX ist speziell für neuere Macs mit Apple Silicon optimiert und dort meist schneller.

Was bedeutet Quantisierung bei KI-Modellen?

Quantisierung reduziert die Genauigkeit, mit der die Gewichte eines Modells gespeichert werden, zum Beispiel von 16-Bit auf 4-Bit, und verkleinert dadurch Speicherbedarf und Rechenaufwand – meist bei nur geringem Qualitätsverlust.

Läuft lokale KI auch auf einem Computer ohne dedizierte Grafikkarte?

Ja. Small Language Models sind gezielt für CPU-lastige, leistungsschwache Rechner optimiert und laufen auch ohne dedizierte Grafikkarte – wie im Praxistest auf einem 5 und einem 7 Jahre alten Rechner gezeigt.

Stell Harald deine persönliche Frage

Ich nehme mir für jede Anfrage persönlich Zeit und antworte in der Regel innerhalb von 24 Stunden. Kostenlos und unverbindlich.
Direkt Google Meeting vereinbaren: Terminkalender
E-Mail senden:
Deine Daten werden ausschließlich für die Beantwortung der Fragen genutzt. Mehr zum Datenschutz erfährst du hier.