KI-Server: RTX 3090 mit llama.cpp + Qwen3.6 35B aktivieren #99
Labels
No labels
flugscanner
fuenfvoracht
infrastruktur
jarvis
ki-tower
nice-to-have
prio-1
wartung
wordpress
No milestone
No project
No assignees
1 participant
Notifications
Due date
No due date set.
Dependencies
No dependencies set.
Reference: orbitalo/homelab-brain#99
Loading…
Add table
Reference in a new issue
No description provided.
Delete branch "%!s()"
Deleting a branch is permanent. Although the deleted branch may continue to exist for a short time before it actually gets removed, it CANNOT be undone in most cases. Continue?
Ziel
RTX 3090 als primären lokalen LLM-Server aktivieren. Verzeichnisse
C:\llm\modelsundC:\llm\binsind bereits angelegt.Finale Konfiguration
UD-Q4_K_XL(22,4 GB) — Unsloth Dynamic 2.0 Kalibrierung, bei MoE-Modellen qualitativ relevantunsloth/Qwen3.6-35B-A3B-GGUFauf Hugging Face (nicht HauhauCS)Plan
Schritt 1 — llama.cpp Binary laden
Schritt 2 — Modell laden (22,4 GB)
⚠️ Repo-Name beim Pullen prüfen:
unsloth/Qwen3.6-35B-A3B-GGUF— nicht die HauhauCS-Variante.Schritt 3 — Erster Teststart OHNE KV-Quant, kleiner Kontext
Ziel: sauberen Build bestätigen, noch keine KV-Quant.
Schritt 4 — Kohärenztest
Diagnose:
Schritt 5 — Vollstart mit KV-Quant und großem Kontext ⚠️ Kritischer Schritt
nvidia-smiparallel laufen lassen — VRAM muss unter ~23,5 GB bleiben.Falls OOM oder VRAM > 23,5 GB:
→ Erst
--ctx-size 131072versuchen, NICHT am Quant drehen.128K ist immer noch weit über dem Cursor-Bedarf. 256K beim ersten Versuch ist nicht garantiert.
Schritt 6 — Cline anbinden
http://127.0.0.1:8080/v1Checkliste
C:\llm\bin\entpacktUD-Q4_K_XLvonunsloth/Qwen3.6-35B-A3B-GGUFgeladenStolpersteine
unsloth/nichtHauhauCS/Quelle: Tipp von Claude Opus 4.8, Korrekturen eingearbeitet 10.06.2026
Erledigt – 11.06.2026
Abweichungen vom ursprünglichen Plan
UD-Q4_K_XL→ HauhauCSIQ4_XS(uncensored, 17.4 GB)Stabiler Startbefehl
Learnings
-np 1ist Pflicht – 4 Slots à 131K = OOM-Crash--reasoning offnötig, sonst verbrennt das Modell alle Tokens im Thinking-Blockq3_Kgibt es in b9561 nicht →iq4_nlfür V-CacheCheckliste
C:\llm\bin\entpacktIQ4_XSvonHauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-AggressivegeladenBerlin, München, Hamburg– saubere Antwort)Abgeschlossen 11.06.2026 — Ziel erreicht, aber anderer Weg
Das Kernziel dieser Issue (RTX 3090 als lokaler LLM-Server für Cline) ist erreicht. Der hier geplante llama.cpp-Weg wurde NICHT genommen — stattdessen Ollama, weil es auf dem KI-Server längst lief und die gleichen GGUF-Modelle bedient, ohne den ganzen Binary-/Argument-/Persistenz-Aufwand von llama.cpp.
Was anders lief als im Plan
contentbei Thinking-Modellen leerLearnings (Details in #100)
think:falseabschalten, nicht per Modelfile.Offen → verschoben nach #100
Schließe diese Issue. Weiterarbeit läuft über #100.