Auspacken, einstecken, loslegen.
Du sparst dir Wochen an Setup. Was bei dir ankommt, ist nicht „ein PC, auf dem du KI installieren könntest" – sondern ein fertig konfigurierter KI-Server, ab der ersten Sekunde produktiv. Hier siehst du Punkt für Punkt, was bereits läuft – bei der Workstation (1.999 €), der Workstation Pro (ab 3.999 €) und auch bei der reinen Installation auf deiner eigenen Hardware (349 €).
4
KI-Modelle vorinstalliert
Sprache, Code, Vision – per Klick wechselbar
0 €
Cloud-Kosten pro Monat
Einmal kaufen, dauerhaft nutzen
100 %
lokal verarbeitet
Keine Daten Richtung US-Cloud
< 10 Min
bis zum ersten Chat
Anschließen, anmelden, fertig
1 · Hardware & Betriebssystem
Anschließen, einstecken, fertig. 24/7 stabil.
Wir liefern den Mac mini einsatzbereit. macOS ist bereits so eingerichtet, dass die Workstation 24/7 als zuverlässiger KI-Server läuft – nicht als normaler Schreibtisch-Rechner.
- Auto-Sleep deaktiviert, damit die KI auch nachts erreichbar bleibt
- Auto-Login + Auto-Start aller KI-Dienste nach Stromausfall
- macOS-Updates auf manuell – kein Reboot zur Unzeit
- Login-Hardening: kein Gast-Zugang, FileVault-Verschlüsselung an
- Bonjour/mDNS aktiviert, damit du im Netz `ki.local` aufrufen kannst

Apple Mac mini · M4
Drei Wege zur fertigen Workstation
- Workstation: Apple Mac mini M4 · 32 GB Unified Memory · 512 GB SSD
- Workstation Pro: individuell konfiguriert – meist M4 Pro mit 48 GB / 1 TB SSD für höhere Last und größere Modelle
- Deine eigene Hardware: hast du schon einen passenden Mac mini, Mini-PC oder Server, machen wir das komplette Setup für 349 €
2 · KI-Modelle vorinstalliert
Vier Modelle. Pro Aufgabe das richtige.
Über Ollama als Modell-Server laufen vier spezialisierte LLMs parallel auf der Workstation. Du wechselst zwischen ihnen mit einem Klick im Chat – jedes Modell hat seine eigenen Stärken. Llama-Modelle sind die mit Abstand verbreitetsten Open-Weight-LLMs (Meta, Apache-Lizenz), Mistral kommt aus Frankreich und ist besonders stark im Deutschen, Qwen stammt von Alibaba mit Fokus auf Coding und Reasoning. Die Workstation Pro bringt zusätzlich zwei deutlich größere Modelle für höhere Antwortqualität mit.
Llama 3.3 (8B)
Alltags-Allrounder
Meta · Open-Weight · USA
6,1 GB · ~50 Tokens/s
Schnellstes Modell im Setup. Gut für E-Mails, Briefe, Protokolle, Zusammenfassungen, einfache Fragen. Antwortet innerhalb von Sekunden – das ist deine erste Wahl für 80 % der Aufgaben.
Llama 3.3 70B
Hohe Antwortqualität
Meta · Open-Weight · USA
40 GB · ~10 Tokens/s
Deutlich tieferes Reasoning, längere zusammenhängende Argumentation, präzisere Formulierungen. Spürbar langsamer, aber im Niveau nahe an GPT-4o-mini. Für anspruchsvolle Schriftsätze, Befundberichte, längere Analysen.
Mistral 7B Instruct
Deutsche Sprache
Mistral AI · Open-Weight · Frankreich
4,4 GB · ~55 Tokens/s
Modell aus Paris, im Deutschen oft natürlicher und idiomatischer als Llama. Wenn du Briefe oder Mails generieren willst, die wirklich „nach Mensch" klingen, ist Mistral die erste Wahl.
Qwen 2.5 Coder (7B)
Technik & Code
Alibaba · Open-Weight · China
4,2 GB · ~50 Tokens/s
Spezialisiertes Coding-Modell. Code-Reviews, Skripte erklären, Excel-Formeln, SQL, Regex – hier punkteit Qwen Coder gegen alle generalistischen Modelle. Für Praxen relevant für Excel-/Daten-Aufgaben.
Qwen 2.5 (32B)
Reasoning & lange Texte
Alibaba · Open-Weight · China
19 GB · ~15 Tokens/s
Stark im logischen Denken und bei langen Kontexten (z.B. 50-Seiten-PDF zusammenfassen). Kommt der Qualität von Claude 3.5 Sonnet in vielen Benchmarks erstaunlich nahe.
Llama 3.2 Vision (11B)
Bilder & gescannte PDFs
Meta · Open-Weight · USA
8 GB · ~30 Tokens/s
Versteht Bilder, Diagramme, gescannte Dokumente. Beispiele: handschriftliche Anamnese-Notiz transkribieren, Tabelle aus PDF-Foto extrahieren, Röntgen-Beschreibung erfassen.
Andere Open-Weight-Modelle (DeepSeek, Gemma, Phi, …) können jederzeit nachträglich installiert werden – das Modell-Set bleibt erweiterbar. Geschwindigkeiten sind grobe Richtwerte auf einem Mac mini M4 32 GB; reale Werte hängen von Prompt-Länge ab.
3 · Chat-Oberfläche & Sprache
ChatGPT-Bedienung – ohne dass jemand neu lernen muss.
Llama 3.3
8B · lokal
Drei Punkte fallen auf:
- §4 Haftung – sehr weit gefasst
- §7 Laufzeit – 36 Monate
- Anhang B – SLA fehlt
Eure Mitarbeiter öffnen einfach den Browser und chatten wie bei ChatGPT. Open WebUI ist die zentrale Oberfläche.
- Vertraute Chat-UX – kein Neulernen für niemanden im Team
- Datei-Upload: PDFs, Word, Bilder direkt in den Chat ziehen
- Chat-Historie pro Nutzer, durchsuchbar
- Markdown- und Code-Highlighting
- Modell-Wechsel mid-conversation per Dropdown
- Erreichbar unter eigenem Hostname wie
https://ki.localoderhttps://ki.eure-praxis.de
Sprich, statt zu tippen.
Diktier deine Notiz oder Frage einfach – das offline laufende Whisper übersetzt deutsche Sprache zuverlässig in sauberen Text. Auch medizinisches und juristisches Fachvokabular.
4 · Eigene Dokumente einbinden
Eure Unterlagen machen die KI zum echten Mitdenker.
KI-Antwort
„§ 4 Haftung ist sehr weit gefasst …" (Quelle: S. 3)
Mit Anything LLM bekommst du eine Dokumenten-Wissensbasis: PDFs, Word-Dateien, Tabellen hochladen, die KI nutzt sie als Quelle für ihre Antworten. Jeder Mitarbeiter kann eigene Workspaces anlegen.
- Upload aller gängigen Formate (PDF, Word, Excel, Markdown, TXT)
- Workspace pro Mitarbeiter oder pro Mandant / Fall
- Volltextsuche + semantische Suche über lokale Embeddings
- Quellenangaben in jeder Antwort – nachvollziehbar
- Alles lokal – auch sensible Dokumente bleiben im Haus
5 · Mehrere Mitarbeiter parallel
Das ganze Team chattet gleichzeitig – jeder mit eigenem Verlauf.
Open WebUI und Anything LLM sind Multi-User-fähig. Jede Person im Team bekommt einen eigenen Account – mit eigenem Chat-Verlauf, eigener Wissensbasis und individuellen Einstellungen.
- Eigene Logins pro Mitarbeiter (LDAP-/E-Mail-basiert)
- Chat-Verläufe sind privat – niemand sieht die der Kollegen
- Rollen: Admin / Standardnutzer / Read-only
- Im Praxis-/Kanzleinetz parallel nutzbar (mehrere gleichzeitige Sessions)
6 · Web-Recherche
Aktuelles Wissen aus dem Web – ohne Google zu füttern.
Wenn die KI selbst im Internet recherchieren soll (z.B. aktuelle Studienlage, juristische Urteile, Produktvergleiche), greift sie auf SearXNG zurück – eine Meta-Suchmaschine, die mehrere Quellen aggregiert.
- Aggregiert Bing, DuckDuckGo, Wikipedia & viele Spezial-Suchen
- Keine Cookies, kein Tracking, keine Profile
- Komplett lokal gehostet – kein Such-Verhalten Richtung Google
- Die KI kombiniert Web-Treffer mit deiner Wissensbasis
7 · Mobil & sicher von unterwegs
Wo immer du bist – deine KI ist nur einen Tap entfernt.
Zuhause
ki.praxis-mueller.ts.net
„Liebe Frau Becker, der Termin am Donnerstag passt …"
Unterwegs
Über Tailscale (WireGuard-basiert) erreichst du deine Workstation von überall: Smartphone, Laptop, Hotel-WLAN. Komplett verschlüsselt, ohne Port-Forwarding, ohne öffentliche IP.
- Apps für iOS, Android, macOS, Windows, Linux – per Account-Code installiert
- Verbindung baut sich peer-to-peer auf – nichts läuft über Drittserver
- Eigene Hostnames im Tailnet (z. B. ki.praxis-mueller.ts.net)
- Magic DNS – bequem aufrufbar, keine IPs merken
- Optional: Zugriff auf bestimmte Mitarbeiter beschränken
8 · Sichere lokale Adresse
Eine saubere URL. Kein roter Warnbalken im Browser.
Statt unschöner IP-Adressen mit Ports erreichst du eure KI unter einer sauberen URL wie https://ki.local oder https://ki.eure-praxis.de. Wir konfigurieren einen Reverse Proxy mit lokalem TLS-Zertifikat, damit der Browser kein Sicherheitsschloss-Warnsymbol zeigt.
- Eine zentrale URL für Chat, Wissensbasis und Status-Dashboard
- Vertrauenswürdiges Zertifikat (lokal signiert oder via Tailscale-TLS)
- Saubere Routen für alle Dienste auf der gleichen Adresse
9 · Status & Konfigurationstest
Du siehst auf einen Blick, ob alles läuft.
Eine eigene Statusanzeige auf der Workstation zeigt dir CPU-, RAM- und Speicher-Auslastung, welche Modelle gerade geladen sind und wer aktuell verbunden ist. Ein Konfigurationstest läuft automatisch jede Nacht und prüft alle Dienste auf Funktion.
- Live-Auslastung: CPU, RAM, SSD
- Liste der geladenen Modelle mit Speicherverbrauch
- Aktuell verbundene Nutzer
- Selbst-Test aller Dienste (Ollama, WebUI, Anything LLM, SearXNG, Tailscale, Reverse Proxy)
- Selbstheilung: wenn ein Dienst abschmiert, wird er automatisch neu gestartet
KI-Workstation · Status
aktualisiert vor 4 Sek
34 %
18,2 / 32 GB
Geladene Modelle
- Llama 3.3 8B6,1 GB
- Mistral 7B4,4 GB
- Qwen 2.5 Coder4,2 GB
- Llama 3.2 Vision8,0 GB
Konfigurations-Test
- Ollama API
- Open WebUI
- SearXNG
- Anything LLM
- Tailscale VPN
- Reverse Proxy (TLS)
Letzter Test: heute 06:00 · Selbstheilung aktiv
10 · Anleitung
Damit alle im Team sofort starten können.
Mit der Workstation kommt eine einfache Anleitung in Klartext – ohne IT-Jargon und ohne 80-seitiges PDF. Für IT-Affine zusätzlich eine technische Dokumentation der Systemarchitektur.
- Einfache Schritt-für-Schritt-Anleitung: Anmelden, Chatten, Datei hochladen
- Tailscale-Setup für Handys – Schritt für Schritt
- Branchen-spezifische Beispielprompts als Kopiervorlage
Tiefer angepasste System-Prompts und maßgeschneiderte Workflows sind Teil der separat buchbaren Beratungsleistung.
11 · Garantie & Support
Wir übernehmen Einrichtung, Apple übernimmt die Hardware.
Die Apple-Herstellergarantie (1 Jahr Standard, optional erweiterbar auf 3 Jahre via AppleCare+ für Mac mini) gilt in vollem Umfang. Im Garantiefall hilft entweder Apple direkt oder wir vermitteln – je nachdem, was schneller ist.
- 1 Jahr Herstellergarantie auf den Mac mini (Apple)
- Optional 3 Jahre AppleCare+ verfügbar (gegen Aufpreis)
- Software-Setup ist unsere Verantwortung – wenn etwas an unserer Konfiguration nicht stimmt, beheben wir es
- Reguläre Updates, Modell-Wechsel oder System-Anpassungen über separaten Wartungsvertrag buchbar
Klingt das gut? Lass uns reden.
Im Erstgespräch klären wir, welches der beiden Workstation-Pakete zu eurer Team-Größe und Last passt – und ob eine Beratungsstunde für individuelle Anpassung Sinn ergibt.