Buzzmatic

Lokale LLMs & Open-Source-Modelle nutzen

Ein Sprachmodell auf dem eigenen Rechner statt in der Cloud: Dieser Guide zeigt, welche Werkzeuge du brauchst, welches Modell zu deiner Hardware passt und wo die Grenzen liegen.

Experte9 Min. LesezeitZuletzt aktualisiert: 20. August 2026

Das lernst du hier

  • Was ein lokales LLM ist und wodurch es sich von Cloud-Assistenten unterscheidet
  • Welche Werkzeuge – Ollama, LM Studio und Alternativen – den Einstieg ermöglichen
  • Wie du anhand deiner Hardware das passende Modell und die richtige Quantisierung wählst
  • Welche Einsatzszenarien im Unternehmen sich für lokale Modelle wirklich rechnen
  • Wo die Grenzen gegenüber Cloud-Modellen verlaufen und was Datenschutz lokal bedeutet

Lokale LLMs in einem Satz

Ein lokales LLM ist ein großes Sprachmodell, dessen Gewichte du herunterlädst und auf eigener Hardware ausführst – auf dem Laptop, einer Workstation oder einem Server im Haus –, sodass keine Anfrage und kein Dokument den eigenen Rechner oder das eigene Netz verlässt.

Der Unterschied zu einem Cloud-Assistenten ist grundsätzlich: Du mietest keinen Dienst, du betreibst eine Software. Damit verschiebt sich alles – Kosten von laufender Gebühr zu Hardware, Verantwortung vom Anbieter zu dir, Datenschutz von der Vertragsfrage zur technischen Tatsache.

Warum überhaupt lokal?

Vier Gründe tragen den Aufwand:

  • Datenschutz als Architektur. Was den Rechner nie verlässt, kann nicht abfließen, nicht mitgelesen und nicht für Training verwendet werden. Für Mandantendaten, Patientenakten, Verträge oder unveröffentlichte Produktdaten ist das ein struktureller Vorteil, kein Vertragsversprechen.
  • Kalkulierbare Kosten. Nach der Anschaffung kostet die einzelne Anfrage nichts. Bei hohen Volumina – Massenklassifizierung, Textaufbereitung über Zehntausende Datensätze – kippt die Rechnung schnell zugunsten des Eigenbetriebs.
  • Unabhängigkeit. Kein Anbieter kann dir dein Modell abschalten, verteuern oder im Verhalten ändern. Was heute funktioniert, funktioniert in einem Jahr identisch.
  • Offline-Fähigkeit. Kein Netz, kein Problem. Relevant für Außeneinsätze, abgeschottete Netze und Produktionsumgebungen.

Wie ein lokales Modell technisch läuft

Ein Sprachmodell besteht aus Gewichten – Milliarden von Zahlenwerten, die beim Training entstanden sind. Um Text zu erzeugen, müssen diese Gewichte in den Arbeitsspeicher, idealerweise in den Grafikspeicher. Genau daran entscheidet sich, was auf deiner Hardware läuft.

Zwei Größen musst du kennen. Die Parameterzahl – angegeben in Milliarden, etwa 8B oder 70B – beschreibt die Größe des Modells und grob seine Fähigkeit. Die Quantisierung beschreibt, mit wie viel Präzision jeder einzelne Gewichtswert gespeichert wird. In voller Präzision braucht ein Modell etwa zwei Gigabyte Speicher pro Milliarde Parameter; auf vier Bit reduziert sind es grob 0,5 bis 0,7 Gigabyte. Der Qualitätsverlust ist bei moderater Quantisierung erstaunlich gering, der Speichergewinn dramatisch.

Praktische Faustregel: Ein stärkeres Modell in starker Quantisierung schlägt fast immer ein schwächeres Modell in voller Präzision. Wer die Wahl hat, nimmt lieber das größere Modell mit weniger Bits. Wie Sprachmodelle grundsätzlich arbeiten, erklärt der Artikel Wie funktioniert KI?.

Die Werkzeuge für den Einstieg

Ollama ist der schnellste Weg in den Betrieb. Ein Installationspaket, ein Befehl im Terminal, und das Modell läuft – inklusive automatischem Download, Speicherverwaltung und einer lokalen Schnittstelle, über die eigene Anwendungen den Assistenten ansprechen können. Diese Schnittstelle ist der eigentliche Grund, warum Ollama in Entwicklungsteams Standard geworden ist: Bestehende Software, die für Cloud-Modelle geschrieben wurde, lässt sich oft mit einer geänderten Adresse auf das lokale Modell umbiegen.

LM Studio verfolgt denselben Zweck mit grafischer Oberfläche. Modelle werden in einem Katalog durchsucht, per Klick geladen und in einem Chatfenster genutzt; Parameter wie Kontextlänge und Ausgabelänge sind über Regler zugänglich. Für alle, die kein Terminal öffnen wollen, ist das der bequemere Einstieg – und die eingebaute Verträglichkeitsanzeige verhindert, dass man ein Modell lädt, das der eigene Rechner gar nicht stemmt.

Daneben lohnt ein Blick auf schlanke Chat-Oberflächen, die sich vor Ollama setzen lassen und eine ChatGPT-ähnliche Bedienung im Browser bieten, sowie auf serverseitige Laufzeitumgebungen für den Mehrbenutzerbetrieb im Unternehmen. Der Einstieg beginnt aber sinnvollerweise auf einem einzelnen Rechner.

Welches Modell passt zu welcher Hardware?

Die entscheidende Größe ist der verfügbare Grafikspeicher – bei Apple-Rechnern der gemeinsame Arbeitsspeicher. Diese Orientierung hat sich in der Praxis bewährt:

Verfügbarer Speicher

Realistische Modellgröße

Wofür es reicht

**8 GB**

Kleine Modelle bis etwa 4B, quantisiert

Zusammenfassen, Klassifizieren, einfache Umformulierungen

**16 GB**

Mittlere Modelle um 7B bis 14B, quantisiert

Solide Alltagsaufgaben, Textarbeit, einfacher Code

**24–32 GB**

Modelle um 24B bis 32B, quantisiert

Anspruchsvolle Textarbeit, brauchbare Programmierhilfe

**64 GB und mehr**

Große Modelle ab 70B, quantisiert

Nahe an der Qualität mittlerer Cloud-Modelle

Zwei Ergänzungen: Reine Prozessorausführung ohne Grafikkarte funktioniert, ist aber so langsam, dass sie nur für Stapelverarbeitung im Hintergrund taugt. Und Apple-Rechner mit gemeinsamem Speicher sind für diesen Zweck ungewöhnlich wirtschaftlich, weil dem Modell der gesamte Arbeitsspeicher zur Verfügung steht.

Bei den Modellfamilien selbst gibt es eine lebendige Auswahl frei verfügbarer Gewichte – von europäischen Anbietern über große US-Konzerne bis zu asiatischen Laboren, dazu spezialisierte Varianten für Code, Mehrsprachigkeit oder besonders kompakte Größen. Wie sich diese Familien insgesamt einordnen, zeigt der Artikel KI-Modelle im Vergleich.

Welches lokale Modell zu welchem Speicherausbau passt QUANTISIERT 8 GB 16 GB 24–32 GB 64 GB+ bis 4B 7B–14B 24B–32B ab 70B Zusammenfassen & Klassifizieren Alltagsaufgaben Textarbeit & Code nahe an Cloud-Qualität

Der verfügbare Speicher setzt die Obergrenze – schon 16 GB reichen für Modelle, die den Arbeitsalltag zuverlässig abdecken.

In vier Schritten zum laufenden Modell

  1. Speicher prüfen. Grafikspeicher beziehungsweise gemeinsamen Arbeitsspeicher feststellen und die Modellgröße nach der Tabelle oben wählen.
  2. Werkzeug installieren. Ollama für den Betrieb im Hintergrund und für eigene Anwendungen, LM Studio für die grafische Bedienung.
  3. Modell laden und testen. Mit einer mittelgroßen quantisierten Variante beginnen und mit drei echten Aufgaben aus dem Alltag testen – nicht mit Spielereien.
  4. Kontext und Ausgabe einstellen. Die Kontextlänge bestimmt, wie viel Text das Modell gleichzeitig sieht, und kostet Speicher. Hier liegt der häufigste Grund für unerwartet langsame oder abbrechende Antworten.

Wofür sich lokale Modelle im Unternehmen rechnen

Vorverarbeitung sensibler Dokumente. Verträge, Bewerbungen oder Berichte lokal zusammenfassen, anonymisieren und strukturieren – und erst das bereinigte Ergebnis, falls nötig, an ein stärkeres Cloud-Modell geben. Dieses zweistufige Vorgehen kombiniert Datenschutz mit Qualität.

Massenverarbeitung. Produktdaten kategorisieren, Support-Tickets vorsortieren, Freitextfelder auswerten. Wo Hunderttausende Datensätze anfallen, schlägt der Eigenbetrieb die Nutzungsgebühr deutlich.

Interne Wissenssuche. Ein lokales Modell in Kombination mit einer Suchschicht über eure eigenen Dokumente – die Antwort entsteht aus euren Inhalten, ohne dass diese das Haus verlassen.

Entwicklung und Test. Anwendungen gegen ein lokales Modell entwickeln, ohne bei jedem Testlauf Gebühren zu erzeugen.

Rohdaten lokal bereinigen, nur das Ergebnis überquert die Grenzlinie zur Cloud EIGENES NETZ CLOUD LOKALES MODELL CLOUD- MODELL ANTWORT

Rohdaten bleiben im Haus, nur das bereinigte Ergebnis geht nach draußen – so lassen sich Datenschutz und Spitzenqualität kombinieren.

Grenzen gegenüber Cloud-Modellen

Qualitätsabstand bei komplexen Aufgaben. Bei mehrstufigem Denken, sehr langen Kontexten und anspruchsvollem Code liegen die stärksten Cloud-Modelle weiterhin vorn. Der Abstand ist über die Jahre geschrumpft, aber er ist real.

Geschwindigkeit. Auf einem Laptop antwortet ein großes Modell spürbar langsamer als ein Cloud-Dienst. Für Dialogarbeit stört das, für Stapelverarbeitung kaum.

Fehlende Zusatzfunktionen. Websuche, Dateiverarbeitung, Bildgenerierung und Agentenfähigkeiten musst du selbst dazubauen. Ein Cloud-Assistent wie ChatGPT liefert das fertig mit.

Betriebsaufwand. Modelle aktualisieren, Speicher verwalten, bei mehreren Nutzern Kapazität planen – das ist eine Aufgabe, die jemand übernehmen muss. Wer den Vergleich zu gehosteten Optionen sucht, findet ihn im Artikel ChatGPT-Alternativen.

Was „lokal“ beim Datenschutz wirklich heißt

Ein lokal ausgeführtes Modell verarbeitet Daten ohne Übertragung an Dritte – das ist der stärkste denkbare technische Schutz und erspart die Diskussion über Drittlandtransfers. Drei Punkte bleiben trotzdem in deiner Verantwortung.

Erstens: Die eingesetzte Oberfläche muss ebenfalls lokal arbeiten. Manche Chat-Anwendungen senden Telemetrie oder greifen für Zusatzfunktionen doch auf Onlinedienste zu. Zweitens: Der Rechner selbst braucht Zugriffsschutz und Verschlüsselung, sonst verlagerst du das Risiko nur. Drittens: Auch ein lokales Modell erzeugt Ausgaben, die falsch sein können – die Datenschutzfrage ist gelöst, die Qualitätsfrage nicht.

Für die Dokumentation gilt: Der Eigenbetrieb vereinfacht das Verzeichnis der Verarbeitungstätigkeiten erheblich, ersetzt es aber nicht.

Fazit

Lokale Sprachmodelle sind kein Ersatz für Cloud-Assistenten, sondern deren Ergänzung an genau der Stelle, an der Daten das Haus nicht verlassen dürfen oder das Volumen die Gebühren sprengt. Der Einstieg ist mit Ollama oder LM Studio eine Sache von Minuten; die eigentliche Arbeit liegt in der ehrlichen Zuordnung, welche Aufgabe lokal gut genug erledigt wird und welche ein starkes Cloud-Modell braucht. Wer diese Trennung sauber zieht, bekommt beides: Kontrolle über die sensiblen Daten und Spitzenqualität dort, wo sie zählt.

FAQ

Häufige Fragen

Ein lokales LLM ist ein großes Sprachmodell, dessen Gewichte du herunterlädst und auf eigener Hardware ausführst. Anfragen und Dokumente bleiben dabei auf deinem Rechner oder im eigenen Netz, es besteht keine Verbindung zu einem Anbieter. Der Betrieb erfolgt über Werkzeuge wie Ollama oder LM Studio.

Entscheidend ist der verfügbare Grafikspeicher, bei Apple-Rechnern der gemeinsame Arbeitsspeicher. Mit 8 GB laufen kleine Modelle für einfache Aufgaben, mit 16 GB mittlere Modelle für den Alltag, ab 24 bis 32 GB wird anspruchsvolle Textarbeit möglich, und ab 64 GB kommen große Modelle in die Nähe mittlerer Cloud-Qualität.

Ollama läuft im Hintergrund und wird über das Terminal bedient; es stellt zusätzlich eine lokale Schnittstelle bereit, über die eigene Anwendungen das Modell nutzen können. LM Studio bietet dieselbe Grundfunktion mit grafischer Oberfläche, Modellkatalog und Verträglichkeitsanzeige. Für Entwicklung eignet sich Ollama, für den bequemen Einstieg LM Studio.

Bei alltäglichen Aufgaben wie Zusammenfassen, Umformulieren und Klassifizieren kommen gute lokale Modelle sehr nah heran. Bei mehrstufigem Denken, sehr langen Kontexten und anspruchsvollem Code liegen die stärksten Cloud-Modelle weiterhin vorn. Außerdem fehlen lokal die Zusatzfunktionen wie Websuche oder Bildgenerierung, sofern du sie nicht selbst ergänzt.

Quantisierung reduziert die Präzision, mit der die Gewichte eines Modells gespeichert werden – etwa von 16 auf 4 Bit. Dadurch sinkt der Speicherbedarf drastisch, während die Antwortqualität bei moderater Quantisierung nur leicht nachlässt. In der Praxis liefert ein größeres, stark quantisiertes Modell meist bessere Ergebnisse als ein kleineres in voller Präzision.

Quiz

Teste dein Wissen

Fünf Fragen zu Werkzeugen, Hardware und Grenzen lokaler Sprachmodelle.

Frage 1 von 5

Was zeichnet ein lokales LLM aus?