Welches lokale KI-Modell läuft auf deinem Rechner?
Standardansicht für eine 12-GB-Grafikkarte — wähle dein Gerät für passgenaue Empfehlungen.
Für Coding-Agenten
Modelle, die einen lokalen Coding-Agenten antreiben — Code verstehen, Dateien ändern, Werkzeuge bedienen.
DeepSeek R1 14B
Denkt vor der Antwort nach und ist dadurch stark bei kniffligen Aufgaben.
ollama run deepseek-r1:14blmstudio-community/DeepSeek-R1-Distill-Qwen-14B-GGUF- Qwen 2.5 Coder 14B9,0 GB
ollama run qwen2.5-coder:14blmstudio-community/Qwen2.5-Coder-14B-Instruct-GGUF - Code Llama 13B7,4 GB
ollama run codellama:13bCode Llama 13B
Für Dokumente & Wissensfragen (RAG)
Modelle, die deine PDFs und Notizen durchsuchen und Fragen dazu beantworten.
Llama 3.1 8B
Bewährtes Allround-Modell mit großer Community — läuft auch auf schwächerer Hardware flüssig.
ollama run llama3.1:8bLlama 3.1 8B- Llama 3.2 3B2,0 GB
ollama run llama3.2:3bLlama 3.2 3B - Gemma 3 12B8,1 GB
ollama run gemma3:12bGemma 3 12B - Qwen 2.5 14B9,0 GB
ollama run qwen2.5:14blmstudio-community/Qwen2.5-14B-Instruct-GGUF - Qwen 3 14B9,3 GB
ollama run qwen3:14blmstudio-community/Qwen3-14B-GGUF
Für Chat & allgemeine Aufgaben
Modelle zum Schreiben, Zusammenfassen und Nachdenken im Alltag.
Llama 3.1 8B
Bewährtes Allround-Modell mit großer Community — läuft auch auf schwächerer Hardware flüssig.
ollama run llama3.1:8bLlama 3.1 8B- DeepSeek R1 14B9,0 GB
ollama run deepseek-r1:14blmstudio-community/DeepSeek-R1-Distill-Qwen-14B-GGUF - Llama 3.2 3B2,0 GB
ollama run llama3.2:3bLlama 3.2 3B - Gemma 3 12B8,1 GB
ollama run gemma3:12bGemma 3 12B - Qwen 2.5 14B9,0 GB
ollama run qwen2.5:14blmstudio-community/Qwen2.5-14B-Instruct-GGUF
In LM Studio oben ins Suchfeld einfügen und das GGUF-Modell laden.
Alle Größenangaben beziehen sich auf die Standardquantisierung Q4_K_M bzw. das jeweilige Ollama-Standard-Tag.
Häufige Fragen
Wie viel VRAM brauche ich für ein 7B-Modell?
Ein 7B-Modell belegt bei der Standardquantisierung Q4_K_M rund 4 bis 5 GB. Mit Reserve für den Kontext bist du mit einer 8-GB-Grafikkarte gut dabei.
Was bedeutet Q4_K_M?
Q4_K_M ist eine Quantisierung: Das Modell wird auf etwa 4 Bit pro Gewicht komprimiert. Es wird deutlich kleiner und schneller, verliert dabei aber nur wenig Qualität. Bei Ollama ist das der übliche Standard.
Läuft ein lokales Modell auch ohne dedizierte Grafikkarte?
Ja. Kleine Modelle bis etwa 4 Milliarden Parameter laufen auch auf dem Prozessor oder integrierter Grafik — spürbar langsamer, aber für erste Schritte völlig brauchbar.
Warum bekomme ich andere Empfehlungen als mein Kollege?
Die Empfehlungen richten sich nach deiner erkannten Hardware. Andere Grafikkarte oder anderer Arbeitsspeicher bedeutet andere passende Modelle.
