Sprachmodelle müssen nicht in der Cloud laufen. Wir planen KI auf Ihrer eigenen Hardware, betreiben sie sicher in Ihrem Netz und binden sie an Ihre Software an – von der Hardware bis zur fertigen Anwendung, mit einem Partner aus Hannover. Für Unternehmen, bei denen Dokumente, Kundendaten oder Betriebsgeheimnisse das Haus nicht verlassen sollen.
Lokale KI besprechen
Cloud-KI ist bequem, aber jede Anfrage verlässt Ihr Unternehmen. Für viele Aufgaben ist das unkritisch. Für Verträge, Kundendaten, Konstruktionsunterlagen oder interne Richtlinien oft nicht. Ein lokal betriebenes Sprachmodell verarbeitet diese Daten dort, wo sie ohnehin liegen:
Ehrlich dazu: Lokal heißt nicht automatisch DSGVO-konform. Auch im eigenen Haus braucht die Verarbeitung personenbezogener Daten eine Rechtsgrundlage und klare Regeln. Der Unterschied ist, dass Sie jeden Schritt selbst in der Hand haben.
| Aufgabe | Lokal | Cloud |
|---|---|---|
| Wissensdatenbank: interne Dokumente durchsuchen und mit Quellenangabe beantworten | ✔ sehr gut geeignet | möglich, aber Ihre Dokumente verlassen das Haus |
| Texte zusammenfassen, E-Mails und Berichte vorformulieren | ✔ gut geeignet | ✔ |
| Klassifizieren und Auswerten von Dokumenten und Anfragen | ✔ gut geeignet | ✔ |
| Anspruchsvolles Programmieren und lange Agenten-Abläufe | eingeschränkt | ✔ deutlich stärker |
| Schwierige Schlussfolgerungen und Spezialwissen | eingeschränkt | ✔ deutlich stärker |
Das stärkste Argument für lokale KI ist die Wissensdatenbank: Handbücher, Verträge, Protokolle, Angebote und Richtlinien werden erschlossen, und Mitarbeitende fragen in normaler Sprache – „Welche Wartungsintervalle gelten für Anlage X?", „Was haben wir mit Kunde Y zur Gewährleistung vereinbart?". Die Antwort kommt mit Verweis auf das Quelldokument, damit sie nachprüfbar bleibt. Technisch heißt das Verfahren RAG (Retrieval-Augmented Generation): Das System sucht zuerst die passenden Textstellen und formuliert erst dann die Antwort. Dafür reichen mittelgroße Modelle – und gerade hier liegen die sensibelsten Daten.
Für anspruchsvolles Programmieren oder schwierige Schlussfolgerungen sind die großen Cloud-Modelle dagegen weiterhin klar überlegen. Deshalb planen wir meist hybrid: lokal für Wissen und sensible Daten, die Cloud gezielt für Aufgaben ohne vertrauliche Inhalte.
Lokale KI setzt 2026 kein Rechenzentrum mehr voraus. Entscheidend ist, was das Modell leisten soll:
| Einsatz | Modellgröße (grob) | Typische Hardware |
|---|---|---|
| Ausprobieren, einfache Texte | klein (3–8 Mrd. Parameter) | vorhandener Rechner |
| Wissensdatenbank, Zusammenfassen, Auswerten | mittel (bis etwa 30 Mrd.) | Workstation mit einer Grafikkarte |
| Viele Nutzer, große Modelle | groß (70 Mrd. und mehr) | Kompaktgerät mit 128 GB Speicher oder Server mit mehreren Grafikkarten |
Seit Ende 2025 gibt es leise Kompaktgeräte mit 128 GB gemeinsamem Speicher, etwa die HP ZGX Nano AI Station mit NVIDIA-GB10-Chip oder die HP Z2 Mini G1a mit AMD Ryzen AI Max+. Sie passen ins Büro statt in den Serverraum. Für viele gleichzeitige Nutzer bleibt der klassische Server mit mehreren Grafikkarten die schnellere Wahl.

Wir ermitteln, welche Modellgröße Ihre Aufgaben brauchen, und wählen die passende Hardware – von der Workstation über das Kompaktgerät bis zum Server. Als HP-Partner beschaffen wir auf Wunsch Geräte wie die HP ZGX Nano, HP-Z-Workstations oder HP-ProLiant-Server und nehmen sie in Betrieb.
Planung & Einkauf →
Das Modell läuft in Ihrem Netz, ohne Zugang zum Internet, erreichbar nur über definierte Schnittstellen. Die Wissensdatenbank beachtet die Zugriffsrechte Ihrer Dokumente. Dazu kommen Protokollierung, Überwachung und die Pflege von Modellen und Laufzeitumgebung.
IT-Sicherheit →
Ihren Nutzen entfaltet lokale KI erst in Ihren Anwendungen. Mit .NET, Microsoft.Extensions.AI und dem Microsoft Agent Framework binden wir das Modell an bestehende Software an – und können später jederzeit auf ein Cloud-Modell wechseln oder beides kombinieren.
KI-Entwicklung mit .NET →Der häufigste Fehler bei internen Wissensdatenbanken: Alle Dokumente landen in einem gemeinsamen Index, und plötzlich kann jeder auch Personalakten, Gehaltslisten oder vertrauliche Verträge abfragen. Deshalb gilt bei uns: Die KI sieht nur, was die fragende Person auch sehen darf. Die Zugriffsrechte der Quelldokumente werden bei jeder Suche beachtet, und jede Abfrage wird protokolliert.
Genauso wichtig ist die Grenze nach außen. Ein Sprachmodell, das mit Werkzeugen arbeiten darf, braucht klare Regeln – auch lokal. Was passieren kann, wenn Agenten zu viel dürfen, zeigt der Vorfall bei Hugging Face. Bei uns arbeiten Modelle und Agenten deshalb nie direkt auf Produktivsystemen, sondern über definierte Schnittstellen mit Freigaben und Protokollierung. Mehr dazu in Warum KI-Agenten im Unternehmen echte Sandboxes brauchen.
Reicht ein lokales Modell für unser Unternehmen? Für viele Alltagsaufgaben ja, allen voran für eine Wissensdatenbank über Ihre internen Dokumente, für Zusammenfassungen und für das Auswerten von Anfragen. Für anspruchsvolles Programmieren oder schwierige Schlussfolgerungen ergänzen wir gezielt ein Cloud-Modell.
Brauchen wir dafür einen Serverraum? Nicht unbedingt. Kompaktgeräte mit 128 GB Speicher sind leise, sparsam und passen ins Büro. Erst bei vielen gleichzeitigen Nutzern oder sehr großen Modellen lohnt sich ein Server im Rack.
Ist lokale KI automatisch DSGVO-konform? Nein. Sie vermeidet die Übermittlung an externe Anbieter, aber die Verarbeitung braucht weiterhin eine Rechtsgrundlage, ein Rechtekonzept und dokumentierte Abläufe. Die technischen Maßnahmen dafür planen wir mit Ihnen.
Was kostet das? Das hängt von der Modellgröße, der Zahl der Nutzer und dem Betrieb ab. Oft genügt zum Start eine einzelne Workstation oder ein Kompaktgerät. Hardwarepreise schwanken 2026 wegen knapper Speicherchips spürbar, deshalb kalkulieren wir konkret zum Zeitpunkt Ihrer Anfrage.
Können wir klein anfangen? Ja, und das empfehlen wir: ein Anwendungsfall, ein Gerät, ein Pilot. Danach wissen Sie, was lokal funktioniert, bevor Sie größer investieren.
Quellen: HP – ZGX Nano AI Station · StorageReview – HP Z2 Mini G1a: GPT-OSS 120B ohne separate Grafikkarte · Microsoft Learn – Microsoft Agent Framework (u. a. Ollama für lokale Modelle) · .NET Blog – AI- und Vector-Data-Erweiterungen allgemein verfügbar · Tom's Hardware – Speicherpreise 2026