Eigene KI
Unter CachyOS Linux auf Gaming-PC¶
Hier lade ich das Paket ollama-cuda herunter. KI nutzt stark die GPU und deren VRAM zur Berechnung.,
Hardware-Kontext¶
- System: CachyOS (Arch Linux)
- CPU: Intel i7-10700K
- RAM: 32 GB DDR4
- GPU: NVIDIA RTX 4080 (16 GB VRAM)
- Ziel: Lokale KI mit Internet-Recherche, dauerhaftem Gedächtnis und Offline-Betrieb.
Phase 1: Installation & Basis-Konfiguration (Ollama)¶
Ollama dient als Backend, um KI-Modelle direkt auf der NVIDIA GPU (via CUDA) auszuführen.
-
Installation:
sudo pacman -S ollama-cuda -
Dienst aktivieren:
sudo systemctl enable --now ollama -
Test:
Das Modellqwen2.5:14bwurde via CLI getestet. Es ist ideal für die 16 GB VRAM, da es exzellent in Logik, Coding und deutscher Sprache ist.
ollama run qwen2.5:14b
Ollama für Netzwerk-Zugriffe freigeben¶
Systemd-Override-Datei erstellen:
sudo systemctl edit ollama
Folgenden Inhalt im oberen Teil einfügen und speichern:
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
Dienst neustarten:
sudo systemctl daemon-reload
sudo systemctl restart ollama
Phase 2: Container-Umgebung (Docker)¶
Docker wird benötigt, um die Web-Oberfläche (Open WebUI) isoliert zu betreiben.
-
Installation:
sudo pacman -S docker docker-compose -
Konfiguration:
* Dienst aktivieren:sudo systemctl enable --now docker
* Berechtigungen setzen (Benutzer derdocker-Gruppe hinzufügen, erfordert Neustart/Logout):
sudo usermod -aG docker $USER
Phase 3: Open WebUI Deployment¶
Open WebUI fungiert als Benutzeroberfläche und "Gehirn" für die Websuche und das Gedächtnis-Management.
- Befehl zum Starten des Containers:
docker run -d --network=host -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
Prüfen, ob alles läuft:
docker ps
Auszug:
❯ docker ps
CONTAINER ID IMAGE COMMAND CREATED STATUS PORTS NAMES
16c2ffcf1e9b ghcr.io/open-webui/open-webui:main "bash start.sh" 7 minutes ago Up 7 minutes (healthy) open-webui
Phase 4: Mit WebUI verbinden¶
Öffne jetzt deinen Browser und gehe auf:
http://localhost:8080
Dort wirst du beim ersten Aufruf aufgefordert, deinen lokalen Admin-Account anzulegen. Danach bist du direkt in der Benutzeroberfläche und kannst oben im Chat-Dropdown dein installiertes qwen2.5:14b Modell auswählen.
Verbindung verifizieren:
In den Einstellungen unter Verbindungen sicherstellen, dass die Ollama API auf http://127.0.0.1:11434 zeigt.
Zusammenfassung der Entscheidungsgründe¶
- Warum Qwen2.5 14b? Optimale Ausnutzung des VRAMs für flüssige Inferenz bei gleichzeitig hoher "Intelligenz" für technische Aufgaben (Bash, Python, C, Linux-Konfiguration).
- Warum WebUI? Notwendig, um die Anforderungen an "permanentes Gedächtnis" (Memory/RAG) und "Internet-Suche" (via SearXNG oder Web-Search-Integration) komfortabel zu lösen, ohne komplexe Terminal-Skripte für jede Anfrage schreiben zu müssen.
- Privatsphäre: Alle Daten (Modelle, Chats, User-Profil) bleiben lokal auf dem Gaming-PC.
Nächster Schritt: Nachdem du dich in http://localhost:8080 eingeloggt hast, werden wir als Nächstes die Websuche-Anbindung konfigurieren und das "Memory"-Feature aktivieren, damit die KI sich an dein Setup (Name, Hardware, Vorlieben) erinnern kann.
Phase 5: WebUI verwenden¶
Puh, also Websuche is seeeehr knifflig... DDGS -> Auto bzw. ausgewählte Suchmaschine nutzen geht bisher wenigstens SCHEINBAR...
Funktionsaufruf veraltet scheint angeblich bei kleinen Modellen, wie ich sie verwende jedenfalls, auch ganz nützlich bzw. hilfreich zu sein, dass es überhaupt mal eine Websuche gibt.
Unter Arch Linux auf NAS¶
Hier lade ich das Paket ollama herunter. Reine CPU KI.