Kann ein kleines oder mittleres Unternehmen KI selbst betreiben – ohne Rechenzentrum und ohne seine Dokumente an einen Cloud-Anbieter zu geben? Die kurze Antwort lautet 2026: ja. Die längere Antwort hängt davon ab, was das Modell leisten soll. Dieser Leitfaden sortiert die Überlegungen in der Reihenfolge, in der wir sie auch in Projekten angehen: erst die Aufgabe, dann die Modellgröße, dann die Hardware, dann Betrieb und Anbindung.

Konkrete Preise nennen wir bewusst kaum. Der Markt für Grafikkarten und Arbeitsspeicher schwankt 2026 so stark, dass jede Preistabelle nach wenigen Wochen veraltet wäre. Die Größenordnungen und Zusammenhänge bleiben dagegen stabil.

Erst die Aufgabe, dann die Hardware

Lokale Sprachmodelle sind nicht in allem gleich gut. Die wichtigste Abgrenzung für Unternehmen:

Wer das zuerst klärt, kauft keine Hardware, die er nicht braucht.

Der wichtigste Wert: Grafikspeicher

Ein Sprachmodell besteht aus Milliarden von Gewichten, die beim Erzeugen jedes einzelnen Wortes gelesen werden. Idealerweise liegen sie vollständig im schnellen Speicher der Grafikkarte (VRAM). Deshalb gilt für lokale KI:

  1. Wie viel Grafikspeicher bestimmt, welche Modellgröße überhaupt läuft.
  2. Wie schnell dieser Speicher angebunden ist bestimmt maßgeblich, wie schnell das Modell antwortet.
  3. Der Prozessor ist weniger wichtig, als viele annehmen, solange das Modell vollständig auf der Grafikkarte liegt.

Quantisierung macht große Modelle erst möglich

In voller Genauigkeit belegt ein Modell mit 70 Milliarden Parametern rund 140 GB. Bei der Quantisierung werden die Gewichte mit geringerer Genauigkeit gespeichert, typischerweise mit etwa 4 bis 5 Bit pro Gewicht. Der Speicherbedarf sinkt dadurch auf rund ein Drittel, bei einem überschaubaren Qualitätsverlust.

Modellgröße Speicherbedarf bei ~4 Bit (grob) Komfortabler Grafikspeicher
8 Mrd. Parameter 5 GB 8–12 GB
14 Mrd. 9 GB 12–16 GB
30–35 Mrd. 18–22 GB 24–32 GB
70 Mrd. 40–45 GB 48–64 GB
100–120 Mrd. 60–75 GB 80–128 GB

Zum Modell selbst kommen der Kontext (also der bereits gelesene Text) und die Laufzeitumgebung hinzu. Eine 45-GB-Modelldatei auf einer Karte mit 48 GB ist deshalb keine entspannte Konfiguration. Eine Wissensdatenbank, die viele Textstellen gleichzeitig in die Antwort einbezieht, braucht spürbar Reserve.

Vier Hardwareklassen

1. Der vorhandene Rechner. Kleine Modelle mit 3 bis 8 Milliarden Parametern laufen auf jedem halbwegs aktuellen PC, zur Not nur auf dem Prozessor. Das ist langsam, reicht aber, um herauszufinden, ob lokale KI für den eigenen Anwendungsfall überhaupt taugt. Zusätzliche Kosten: praktisch keine.

2. Die Workstation mit einer Grafikkarte. Mit 16 bis 24 GB Grafikspeicher laufen Modelle bis etwa 30 Milliarden Parameter flüssig – für eine Wissensdatenbank mit wenigen Nutzern oft schon genug. Mit 48 GB rücken Modelle um 70 Milliarden Parameter in Reichweite. Auf dem Gebrauchtmarkt ist die RTX 3090 mit 24 GB so beliebt geworden, dass ihre Preise seit 2025 deutlich gestiegen sind.

3. Das Kompaktgerät mit 128 GB gemeinsamem Speicher. Seit Ende 2025 gibt es eine neue Geräteklasse, in der Prozessor und Grafikeinheit sich 128 GB Speicher teilen: den NVIDIA DGX Spark und baugleiche Geräte wie die HP ZGX Nano AI Station mit dem GB10-Chip sowie die HP Z2 Mini G1a mit AMD Ryzen AI Max+. Sie sind klein, leise, sparsam und neu mit Herstellergarantie erhältlich. Große Modelle laufen darauf – die Z2 Mini G1a betreibt zum Beispiel das offene Modell GPT-OSS 120B ganz ohne separate Grafikkarte. Der Haken ist die geringere Speicherbandbreite: Beim DGX Spark liegt sie bei 273 GB/s. Für GPT-OSS 120B werden rund 39 Token pro Sekunde gemessen, auf einem System mit drei RTX 3090 dagegen rund 124. Für eine Wissensdatenbank mit wenigen Nutzern ist das völlig ausreichend, für viele gleichzeitige Anfragen eher nicht.

4. Der Server mit mehreren Grafikkarten. Wer viele Nutzer bedienen oder sehr große Modelle schnell betreiben will, landet beim Server mit mehreren Grafikkarten – etwa einem HP-ProLiant-System mit passender Stromversorgung und Kühlung. Moderne Laufzeitumgebungen verteilen ein Modell auf mehrere Karten, der Grafikspeicher lässt sich also praktisch addieren. Dafür sind solche Systeme laut, schwer und brauchen einen Serverraum. Vorsicht bei gebrauchten Rechenzentrumskarten: Viele haben keinen eigenen Lüfter und überhitzen außerhalb eines Servers, und besonders günstige Angebote sind manchmal umgebaute Module statt echter PCIe-Karten.

Für die meisten kleinen und mittleren Unternehmen ist Klasse 2 oder 3 der sinnvolle Einstieg.

Arbeitsspeicher, Strom und Datenträger

Arbeitsspeicher: 64 GB sind für eine Workstation ein guter Ausgangspunkt, für Server mit mehreren Grafikkarten eher 128 GB. Anders als noch vor einem Jahr ist Arbeitsspeicher 2026 ein echter Kostenfaktor: Weil KI-Rechenzentren große Mengen abnehmen, haben sich die Preise für DDR4 und DDR5 zeitweise mehr als verdoppelt. Das gehört in jede Kalkulation.

Strom: Eine Workstation, die nur während der Arbeitszeit läuft, fällt kaum ins Gewicht. Im Dauerbetrieb sieht das anders aus: Schon 200 Watt rund um die Uhr ergeben gut 1.750 kWh im Jahr. Ein Server mit vier Grafikkarten kann unter Last weit über ein Kilowatt aufnehmen. Kompaktgeräte sind hier klar im Vorteil, der DGX Spark ist etwa mit einem 240-Watt-Netzteil spezifiziert.

Datenträger: Modelle sind groß, und wer mehrere ausprobiert, belegt schnell einige hundert Gigabyte. 1 TB ist der Einstieg, 2 TB sind sinnvoll. Eine schnelle NVMe-SSD verkürzt vor allem die Ladezeit.

Wie schnell muss es sein?

Die Geschwindigkeit wird in Token pro Sekunde gemessen, ein Token ist grob ein Wortteil. Als Orientierung: Unter 5 Token pro Sekunde wirkt eine Antwort zäh, ab 10 ordentlich, ab 20 angenehm. Für eine Wissensdatenbank zählt außerdem, wie schnell das System die gefundenen Textstellen einliest, bevor es antwortet. Bei langen Dokumenten kann dieser erste Schritt länger dauern als die eigentliche Antwort.

Software: vom ersten Test zum Betrieb

Für den Einstieg reichen frei verfügbare Werkzeuge wie llama.cpp oder Ollama, die quantisierte Modelle laden und über eine Programmierschnittstelle bereitstellen. Für den Betrieb mit vielen gleichzeitigen Nutzern gibt es spezialisierte Inferenz-Server.

Für Unternehmen entscheidend ist die Anbindung an die eigene Software. In der .NET-Welt bieten Microsoft.Extensions.AI und das Microsoft Agent Framework eine einheitliche Schnittstelle, die neben Cloud-Anbietern auch lokal betriebene Modelle über Ollama unterstützt. Für die Wissensdatenbank kommen die ebenfalls allgemein verfügbaren Vector-Data-Erweiterungen hinzu. Der praktische Vorteil: Ob ein Modell lokal oder in der Cloud läuft, ist in der Anwendung eine Frage der Konfiguration, kein Umbau.

NVIDIA oder AMD?

NVIDIA ist für lokale KI weiterhin der Weg des geringsten Widerstands, weniger wegen der Hardware als wegen des CUDA-Ökosystems, für das die meisten Werkzeuge zuerst entwickelt werden. AMD ist bei Preis und Speichermenge interessant, und die Unterstützung hat sich deutlich verbessert – die Z2 Mini G1a zeigt, was mit AMD inzwischen möglich ist. Vor dem Kauf sollte man trotzdem prüfen, ob die gewünschte Software und das gewünschte Modell auf der konkreten Hardware problemlos laufen.

Sicher betreiben

Ein lokales Modell ist nur so sicher wie sein Betrieb. Drei Punkte sind uns besonders wichtig:

Und ehrlich dazu: Lokal betrieben heißt nicht automatisch DSGVO-konform. Die Übermittlung an einen externen Anbieter entfällt, eine Rechtsgrundlage und ein Rechtekonzept braucht die Verarbeitung trotzdem.

Lokal, Cloud oder beides?

Ein lokales System ersetzt die großen Cloud-Modelle nicht vollständig. Der sinnvollste Ansatz ist meist hybrid: lokal für Wissen und sensible Daten, die Cloud gezielt für schwierige Aufgaben ohne vertrauliche Inhalte. So bleiben die wertvollsten Daten im Haus, und für die Aufgaben, bei denen lokale Modelle an ihre Grenzen stoßen, steht trotzdem die volle Leistung zur Verfügung.

So würden wir vorgehen

  1. Aufgabe festlegen: Wissensdatenbank, Zusammenfassungen, Auswertung? Und welche Daten sind betroffen?
  2. Klein testen: Ein kleines Modell auf vorhandener Hardware zeigt schnell, ob der Ansatz funktioniert.
  3. Modellgröße bestimmen: Welche Qualität braucht die Aufgabe wirklich?
  4. Passende Hardware kaufen: nach dem nötigen Grafikspeicher, nicht nach dem größten Datenblatt.
  5. Betrieb und Anbindung planen: Netz, Rechte, Protokollierung, Updates und die Integration in die eigene Software.

Wie wir Unternehmen dabei begleiten – von der Hardware über den sicheren Betrieb bis zur Anbindung an bestehende Anwendungen –, beschreiben wir unter Lokale KI für Unternehmen. Für die Auswahl und Beschaffung der Geräte gibt es unsere IT-Planung und Einkauf, für die Anbindung an Ihre Software die KI-Entwicklung mit .NET.


Quellen: IntuitionLabs – NVIDIA DGX Spark: Preis und Benchmarks · HP – ZGX Nano AI Station · StorageReview – HP Z2 Mini G1a: GPT-OSS 120B ohne separate Grafikkarte · Microsoft Learn – Microsoft Agent Framework · .NET Blog – AI- und Vector-Data-Erweiterungen allgemein verfügbar · Tom's Hardware – Speicherpreise 2026 · borncity – RTX 3090 auf dem Gebrauchtmarkt