
Lokale LLMs für Entscheider: Was funktioniert im echten Betrieb?
aus IT for Business Podcast · 04.08.2026 · 26 Min.
Beschreibung
Lokale Large Language Models gelten oft als einfache Antwort auf Datenschutz- und Sicherheitsfragen: Modell herunterladen, auf einem eigenen Server starten und sensible Daten bleiben im Haus. In der Praxis beginnt die eigentliche Arbeit jedoch erst dann. Sobald Mitarbeitende auf Verträge, Tickets, Richtlinien oder technische Dokumentationen zugreifen sollen, werden Berechtigungen, Datenflüsse, Antwortzeiten, Backups, Updates und klare Betriebsverantwortung entscheidend. In dieser Episode zeigt Mirko Peters, wann lokale KI wirklich sinnvoll ist – und wann Cloud- oder Hybridansätze die bessere Wahl sein können. WO LOKALE KI HEUTE KONKRET NUTZEN SCHAFFT Der größte Nutzen lokaler LLMs entsteht nicht durch einen allgemeinen Unternehmenschatbot, sondern durch klar begrenzte, wiederkehrende Aufgaben. Dazu gehören das Zusammenfassen langer Ticketverläufe, das Strukturieren technischer Dokumentation, das Erstellen von Antwortentwürfen oder das Extrahieren von Informationen aus Dokumenten. Entscheidend ist: Ein Fachmensch muss das Ergebnis schnell prüfen und korrigieren können. Die KI unterstützt bei Such-, Lese- und Vorbereitungsarbeit – Verantwortung und Entscheidung bleiben beim Menschen. RAG: UNTERNEHMENSWISSEN FINDEN STATT MODELLE TEUER TRAINIEREN Viele Unternehmen müssen ein Modell nicht mit ihren eigenen Daten trainieren. Praktischer ist häufig RAG, also Retrieval Augmented Generation. Dabei durchsucht das System freigegebene Dokumente, findet passende Textstellen und formuliert daraus eine Antwort mit nachvollziehbaren Quellen. So werden Richtlinien, Handbücher, Verträge, alte Tickets und Legacy-Dokumentation besser auffindbar. Ein guter Wissensassistent beantwortet nicht einfach alles, sondern zeigt idealerweise Dokument, Abschnitt, Version und Link zur ursprünglichen Quelle. DIE DREI STÄRKSTEN EINSATZFELDER FÜR LOKALE LLMS Ein internes Wissenssystem kann Mitarbeitende schneller zu den richtigen Richtlinien, Betriebsanweisungen und technischen Informationen führen – vorausgesetzt, bestehende Berechtigungen werden konsequent übernommen. In der Dokumentenverarbeitung hilft KI bei OCR, Klassifizierung und der Extraktion von Rechnungsnummern, Beträgen, Fristen oder Ansprechpartnern. Und in IT- und Fachbereichen kann sie Ticketverläufe verdichten, Change-Protokolle strukturieren, Code erklären oder Testfälle vorschlagen. Besonders wertvoll wird das dort, wo Wissen über viele Jahre, Systeme und Personen verteilt ist. DSGVO UND SECURITY: LOKAL IST KEIN FREIFAHRSCHEIN Ein Modell im eigenen Netzwerk verhindert nicht automatisch Datenlecks oder DSGVO-Risiken. Auch lokal gespeicherte Chatverläufe, Vektordatenbanken, Logs, Backups, OCR-Komponenten und Supportzugänge können vertrauliche Inhalte enthalten. Deshalb braucht jedes Vorhaben eine Datenklassifizierung, ein durchgängiges Berechtigungskonzept, Löschfristen und klare Regeln für Monitoring und Sicherungen. Nutzer dürfen über die KI nur auf Inhalte zugreifen, die sie auch ohne KI sehen dürften. Sonst wird der Chat zur Abkürzung um das bestehende Sicherheitsmodell herum. HARDWARE RICHTIG EINORDNEN: SPEICHER IST NICHT GESCHWINDIGKEIT Die wichtigste Hardwarefrage lautet nicht, welches Modell gerade populär ist, sondern ob es für den konkreten Arbeitsablauf schnell und zuverlässig genug arbeitet. Speicher entscheidet, ob ein Modell überhaupt sinnvoll geladen werden kann; Speicherbandbreite und GPU-Leistung bestimmen, wie schnell Antworten entstehen und wie viele Mitarbeitende gleichzeitig arbeiten können. Für einen begrenzten Pilot reichen vorhandene Rechner, kleinere quantisierte Modelle oder leistungsfähige Notebooks oft aus. GPU-Server werden vor allem bei mehreren parallelen Nutzern, längeren Kontexten und interaktiven Anwendungen relevant. Kosten für Strom, Kühlung, Ersatzteile, Wartung und Betrieb gehören immer in die Rechnung. PRODUKTIVER BETRIEB BRAUCHT ARCHITEKTUR UND VERANTWORTUNG Ein funktionierender Test ist noch kein produktiver Service. Eine tragfähige Architektur trennt Nutzeroberfläche, Modellserver, Dokumenten-Pipeline, Vektordatenbank, Identity Provider, Monitoring und Backup. Tools wie LM Studio oder Ollama können für erste Tests sinnvoll sein, ersetzen aber nicht automatisch eine produktionsreife Plattform. Modellversionen, Quantisierung, System Prompts und Testszenarien müssen dokumentiert werden. Außerdem muss klar sein, wer den Dienst betreibt, wer auffällige Antworten prüft, wer Dokumente aktuell hält und was bei Ausfällen passiert. LOKAL, CLOUD ODER HYBRID: DIE RICHTIGE ENTSCHEIDUNG TREFFEN Lokale LLMs passen besonders gut zu vertraulichen Daten, wiederkehrenden Aufgaben und planbarer Last – wenn das Unternehmen den Betrieb auch leisten kann. Cloud-Dienste sind oft sinnvoller für seltene, komplexe Aufgaben, aktuelles Weltwissen oder höchste Modellqualität. Häufig ist ein Hybridmodell der pragmatische Weg: sensible interne Suche und Assistenz lokal, allgemeine Textarbeit oder externe Recherche über kontrollierte Cloud-Dienste. Wichtig ist, dass für jeden Prozess dokumentiert ist, welche Daten wohin fließen, warum sie dort verarbeitet werden und welche Freigaben gelten. SO STARTET EIN SINNVOLLER PILOT Der beste Einstieg ist kein unternehmensweiter Chatbot, sondern ein einzelner, messbarer Use Case mit einer kleinen Nutzergruppe und einem begrenzten Dokumentenbestand. Zum Beispiel: Supporttickets zusammenfassen, Betriebsanweisungen durchsuchen oder Rechnungsdaten vorbereiten. Vor dem Modellvergleich sollten Datenfluss, Zugriffsrechte, Logs, Backups und Löschkonzept auf Papier stehen. Danach reichen zwei oder drei Modellkandidaten, getestet mit echten Dokumenten und realistischen Fragen. Gemessen werden sollten Antwortqualität, Korrekturaufwand, Geschwindigkeit, Fehlerbilder, Betriebskosten und offene Risiken. So wird aus einer KI-Demo ein belastbares Werkzeug für den echten Betrieb. Sie möchten wissen, wie IT Ihr Business voranbringen kann? Dann vernetzen Sie sich mit mir auf LinkedIn und bleiben Sie bei den neuesten Trends und Best Practices immer auf dem Laufenden.