[Plan] Cursor → Cline Migration: Kosteneinsparung + bessere MCP-Unterstützung #97

Open
opened 2026-06-10 09:48:57 +00:00 by orbitalo · 3 comments
Owner

Ziel

Cursor durch Cline (VS Code Extension) ersetzen um hunderte Euro/Monat an Kosten zu sparen und gleichzeitig bessere MCP-Kompatibilität zu erreichen.

Ausgangslage

  • Cursor Ultra kostet mehrere hundert Euro/Monat
  • Cursor BYOK/OpenRouter funktioniert nicht zuverlässig (offiziell nicht unterstützt, stundenlanges Basteln ohne Ergebnis)
  • Remote MCP (SSE/Streamable HTTP) ist in Cursor seit ~12 Monaten kaputt → Cloudflare MCP nicht nutzbar
  • Cursor MCP-Limit: 40 Tools

Warum Cline

  • Kostenlos (nur API-Kosten via OpenRouter, ~15-40€/Monat mit günstigen Modellen)
  • Voller IDE-Kontext in VS Code (offene Dateien, Linter, Git) — kein Blind-Modus
  • Remote MCP nativ unterstützt → Cloudflare MCP funktioniert sofort
  • Kein Tool-Limit bei MCPs
  • BYOK nativ: OpenRouter, Anthropic, Ollama, BeeLlama, lokale Modelle
  • Apache 2.0 Open Source, 5M+ Nutzer
  • Agentischer Workflow identisch zu Cursor (Chat → Agent liest/schreibt Dateien/Commands)

Migrations-Plan

Phase 1: Setup (ca. 30 Min)

  • VS Code für Windows 11 installieren (code.visualstudio.com)
  • Cline Extension installieren (Extensions-Tab → "Cline" suchen)
  • OpenRouter-Key + x-ai/grok-4.1-fast als Default-Modell eintragen
  • MCP-Server konfigurieren (siehe unten)

Phase 2: Cursor Rules übertragen

  • Cursor Rules nicht 1:1 kopieren, sondern für qwen optimieren (expliziter, klarer)
  • homelab.mdc.clinerules / Custom Instructions
  • debug-workflow.mdc übertragen
  • openmemory.mdc übertragen (Memory-Aufrufe expliziter formulieren)
  • deploy-workflow.mdc übertragen
  • session-summary.mdc übertragen
  • System Prompt für qwen tunen (präzisere Anweisungen als bei Claude)

Phase 3: MCPs einrichten

MCP Priorität Verbindung Status
OpenMemory (CT 122) Muss http://100.92.71.93:8765 bereit
Forgejo (CT 111) Muss http://100.89.246.60:3000 + Token bereit
Cloudflare Muss Remote: mcp.cloudflare.com in Cursor kaputt, in Cline nativ
Playwright Muss npx @playwright/mcp@latest (lokal) ein Befehl
Web-Fetch 🔶 Sinnvoll HTTP-Requests, URL-Checks
Proxmox (CT 888) 🔶 Sinnvoll Bereits installiert auf pve-ka-1 bereit
Grafana (CT 143) 💡 Nice-to-have http://100.66.78.56
Telegram 💡 Nice-to-have Chatlogger-API CT 116

Phase 4: Paralleltest (1 Woche)

  • Cline parallel zu Cursor nutzen
  • Typische Aufgaben testen (Homelab-Ops, Code-Entwicklung, Repo-Klonen)
  • Entscheidung: Cursor kündigen oder behalten

Technische Voraussetzungen

  • Windows 11
  • Tailscale läuft lokal → MCPs über Tailscale direkt erreichbar
  • OpenRouter Account vorhanden
  • Alle MCP-Server laufen bereits (OpenMemory, Forgejo, Proxmox)
  • Zugangsdaten bekannt

Modell-Konfiguration für Cline

Mehrere Profile können in Cline parallel angelegt und per Klick gewechselt werden:

Profil Provider Base URL Modell Kosten Wann
Standard OpenRouter https://openrouter.ai/api/v1 x-ai/grok-4.1-fast ~€0.001/Session Homelab-Ops, Standard
Lokal (BeeLlama) OpenAI Compatible http://100.84.255.83:8090/v1 qwen36-bee €0 KI-Server online
Lokal (Ollama) OpenAI Compatible http://100.84.255.83:11434/v1 qwen3.6:35b-a3b-fast €0 Fallback
Komplex OpenRouter https://openrouter.ai/api/v1 anthropic/claude-sonnet-4-6 ~€0.05/Session Architektur, Debugging

BeeLlama — warum deutlich schneller als Ollama

BeeLlama ist ein optimierter llama.cpp-Build (llama-server v0.2.0) speziell für die RTX 3090.

Installiert unter: C:\Users\wutti\beellama-v0.2.0\
Start: Scheduled Task BeeLlamaSrvrun-long.bat
Port: 8090 (0.0.0.0, via Tailscale erreichbar)

--spec-type dflash              # Speculative Decoding → massiv schneller
--cache-type-k turbo3_tcq       # NVIDIA RTX-optimierter KV-Cache
--flash-attn on                 # Flash Attention
-m Qwen3.6-27B-Q4_K_M.gguf     # Q4_K_M Quantisierung
--ctx-size 65536                # 64k Kontext
--reasoning off                 # kein Chain-of-Thought

Modell-Alias: qwen36-bee

Qualitätsvergleich qwen36-bee vs. Claude

Agentische Fähigkeiten

Fähigkeit Claude Sonnet qwen36-bee Auswirkung
Sequentielle Tool-Calls kein Unterschied
Parallele Tool-Calls ⚠️ qwen läuft sequentiell
Lange Sessions ohne Drift ⚠️ qwen braucht explizitere Rules
Selbstkorrektur ⚠️ qwen braucht öfter Hinweis
Memory-Tools proaktiv nutzen mit guten Rules durch präzise .clinerules lösbar

Aufgabenverteilung

~70% — qwen kann das ohne spürbare Einbußen:

  • Homelab-Ops (SSH, Container, Configs, Services)
  • Standard-Coding (Scripts, einfache Features, bekannte Patterns)
  • Repo klonen, Dateien lesen/schreiben, MCP-Aufgaben
  • Forgejo Issues, OpenMemory, Cloudflare DNS

~30% — Claude ist klar besser:

  • Neues Projekt von Grund auf planen (Architektur, Datenmodell)
  • Komplexe Bugs mit unklarer Ursache (mehrere Dateien, Race Conditions)
  • Unbekannte Technologien zum ersten Mal aufbauen
  • Lange Kausalketten debuggen

Session-Memory: qwen gleichwertig

OpenMemory ist ein externes MCP-Tool — qwen nutzt exakt dieselbe Memory-Infrastruktur wie Claude. Mit präzisen .clinerules (wann suchen, wann speichern) ist der Unterschied nicht spürbar. Das externe Gedächtnis gleicht qwens kürzeren effektiven Kontext aus.

Erwartete Qualität nach Setup

Bereich Erwartung
Homelab-Ops gleichwertig oder besser (Cloudflare MCP funktioniert!)
Standard-Coding gleichwertig
Komplexe Aufgaben ein Klick auf Claude → gleichwertig
MCP-Stabilität besser (Remote MCP nativ, kein Tool-Limit)

Monetäre Kosten des Umbaus

Einmalig: €0 — keine neue Software, keine neuen Server.

Cursor (aktuell) Cline (Ziel)
Software ~200€/Monat 0€
API-Kosten im Abo inkl. ~15-40€/Monat (OpenRouter)
Gesamt 200€+/Monat ~15-40€/Monat

Geschätzte Ersparnis: ~160-185€/Monat

Risiken

  • Kein Tab-Autocomplete (wird nicht genutzt → kein Problem)
  • Codebase-Indexing etwas weniger tief als Cursor (testbar in der Probe-Woche)
  • Keine Background Cloud-Agents (Cursor Ultra Feature — Bedarf unklar)
  • BeeLlama benötigt KI-Server online (Fallback: Ollama oder OpenRouter)
  • qwen braucht präzisere Rules als Claude (wird beim Setup berücksichtigt)

Status

Warte auf Startsignal — alle Vorbereitungen abgeschlossen, Agent bereit zum Einrichten sobald VS Code + Cline installiert sind.

Referenzen

  • Cline GitHub — Apache 2.0, 58k Stars
  • Playwright MCP — offiziell von Microsoft
  • Cursor Remote-MCP Bug: seit März 2025 offen, kein Fix in Sicht
  • BeeLlama: C:\Users\wutti\beellama-v0.2.0\ auf KI-Server (100.84.255.83)
## Ziel Cursor durch **Cline** (VS Code Extension) ersetzen um hunderte Euro/Monat an Kosten zu sparen und gleichzeitig bessere MCP-Kompatibilität zu erreichen. ## Ausgangslage - Cursor Ultra kostet mehrere hundert Euro/Monat - Cursor BYOK/OpenRouter funktioniert nicht zuverlässig (offiziell nicht unterstützt, stundenlanges Basteln ohne Ergebnis) - Remote MCP (SSE/Streamable HTTP) ist in Cursor seit ~12 Monaten kaputt → Cloudflare MCP nicht nutzbar - Cursor MCP-Limit: 40 Tools ## Warum Cline - **Kostenlos** (nur API-Kosten via OpenRouter, ~15-40€/Monat mit günstigen Modellen) - **Voller IDE-Kontext** in VS Code (offene Dateien, Linter, Git) — kein Blind-Modus - **Remote MCP nativ unterstützt** → Cloudflare MCP funktioniert sofort - **Kein Tool-Limit** bei MCPs - **BYOK nativ**: OpenRouter, Anthropic, Ollama, BeeLlama, lokale Modelle - Apache 2.0 Open Source, 5M+ Nutzer - Agentischer Workflow identisch zu Cursor (Chat → Agent liest/schreibt Dateien/Commands) ## Migrations-Plan ### Phase 1: Setup (ca. 30 Min) - [ ] VS Code für Windows 11 installieren (code.visualstudio.com) - [ ] Cline Extension installieren (Extensions-Tab → "Cline" suchen) - [ ] OpenRouter-Key + `x-ai/grok-4.1-fast` als Default-Modell eintragen - [ ] MCP-Server konfigurieren (siehe unten) ### Phase 2: Cursor Rules übertragen - [ ] Cursor Rules **nicht 1:1 kopieren**, sondern für qwen optimieren (expliziter, klarer) - [ ] `homelab.mdc` → `.clinerules` / Custom Instructions - [ ] `debug-workflow.mdc` übertragen - [ ] `openmemory.mdc` übertragen (Memory-Aufrufe expliziter formulieren) - [ ] `deploy-workflow.mdc` übertragen - [ ] `session-summary.mdc` übertragen - [ ] System Prompt für qwen tunen (präzisere Anweisungen als bei Claude) ### Phase 3: MCPs einrichten | MCP | Priorität | Verbindung | Status | |---|---|---|---| | OpenMemory (CT 122) | ⭐ Muss | `http://100.92.71.93:8765` | bereit | | Forgejo (CT 111) | ⭐ Muss | `http://100.89.246.60:3000` + Token | bereit | | Cloudflare | ⭐ Muss | Remote: `mcp.cloudflare.com` | in Cursor kaputt, in Cline nativ | | Playwright | ⭐ Muss | `npx @playwright/mcp@latest` (lokal) | ein Befehl | | Web-Fetch | 🔶 Sinnvoll | HTTP-Requests, URL-Checks | — | | Proxmox (CT 888) | 🔶 Sinnvoll | Bereits installiert auf pve-ka-1 | bereit | | Grafana (CT 143) | 💡 Nice-to-have | `http://100.66.78.56` | — | | Telegram | 💡 Nice-to-have | Chatlogger-API CT 116 | — | ### Phase 4: Paralleltest (1 Woche) - [ ] Cline parallel zu Cursor nutzen - [ ] Typische Aufgaben testen (Homelab-Ops, Code-Entwicklung, Repo-Klonen) - [ ] Entscheidung: Cursor kündigen oder behalten ## Technische Voraussetzungen ✅ - Windows 11 ✅ - Tailscale läuft lokal → MCPs über Tailscale direkt erreichbar ✅ - OpenRouter Account vorhanden ✅ - Alle MCP-Server laufen bereits (OpenMemory, Forgejo, Proxmox) ✅ - Zugangsdaten bekannt ✅ ## Modell-Konfiguration für Cline Mehrere Profile können in Cline parallel angelegt und per Klick gewechselt werden: | Profil | Provider | Base URL | Modell | Kosten | Wann | |---|---|---|---|---|---| | Standard | OpenRouter | `https://openrouter.ai/api/v1` | `x-ai/grok-4.1-fast` | ~€0.001/Session | Homelab-Ops, Standard | | Lokal (BeeLlama) | OpenAI Compatible | `http://100.84.255.83:8090/v1` | `qwen36-bee` | €0 | KI-Server online | | Lokal (Ollama) | OpenAI Compatible | `http://100.84.255.83:11434/v1` | `qwen3.6:35b-a3b-fast` | €0 | Fallback | | Komplex | OpenRouter | `https://openrouter.ai/api/v1` | `anthropic/claude-sonnet-4-6` | ~€0.05/Session | Architektur, Debugging | ### BeeLlama — warum deutlich schneller als Ollama BeeLlama ist ein optimierter llama.cpp-Build (`llama-server v0.2.0`) speziell für die RTX 3090. **Installiert unter:** `C:\Users\wutti\beellama-v0.2.0\` **Start:** Scheduled Task `BeeLlamaSrv` → `run-long.bat` **Port:** `8090` (0.0.0.0, via Tailscale erreichbar) ``` --spec-type dflash # Speculative Decoding → massiv schneller --cache-type-k turbo3_tcq # NVIDIA RTX-optimierter KV-Cache --flash-attn on # Flash Attention -m Qwen3.6-27B-Q4_K_M.gguf # Q4_K_M Quantisierung --ctx-size 65536 # 64k Kontext --reasoning off # kein Chain-of-Thought ``` **Modell-Alias:** `qwen36-bee` ## Qualitätsvergleich qwen36-bee vs. Claude ### Agentische Fähigkeiten | Fähigkeit | Claude Sonnet | qwen36-bee | Auswirkung | |---|:---:|:---:|---| | Sequentielle Tool-Calls | ✅ | ✅ | kein Unterschied | | Parallele Tool-Calls | ✅ | ⚠️ | qwen läuft sequentiell | | Lange Sessions ohne Drift | ✅ | ⚠️ | qwen braucht explizitere Rules | | Selbstkorrektur | ✅ | ⚠️ | qwen braucht öfter Hinweis | | Memory-Tools proaktiv nutzen | ✅ | mit guten Rules ✅ | durch präzise `.clinerules` lösbar | ### Aufgabenverteilung **~70% — qwen kann das ohne spürbare Einbußen:** - Homelab-Ops (SSH, Container, Configs, Services) - Standard-Coding (Scripts, einfache Features, bekannte Patterns) - Repo klonen, Dateien lesen/schreiben, MCP-Aufgaben - Forgejo Issues, OpenMemory, Cloudflare DNS **~30% — Claude ist klar besser:** - Neues Projekt von Grund auf planen (Architektur, Datenmodell) - Komplexe Bugs mit unklarer Ursache (mehrere Dateien, Race Conditions) - Unbekannte Technologien zum ersten Mal aufbauen - Lange Kausalketten debuggen ### Session-Memory: qwen gleichwertig OpenMemory ist ein **externes MCP-Tool** — qwen nutzt exakt dieselbe Memory-Infrastruktur wie Claude. Mit präzisen `.clinerules` (wann suchen, wann speichern) ist der Unterschied nicht spürbar. Das externe Gedächtnis gleicht qwens kürzeren effektiven Kontext aus. ### Erwartete Qualität nach Setup | Bereich | Erwartung | |---|---| | Homelab-Ops | gleichwertig oder besser (Cloudflare MCP funktioniert!) | | Standard-Coding | gleichwertig | | Komplexe Aufgaben | ein Klick auf Claude → gleichwertig | | MCP-Stabilität | besser (Remote MCP nativ, kein Tool-Limit) | ## Monetäre Kosten des Umbaus **Einmalig: €0** — keine neue Software, keine neuen Server. | | Cursor (aktuell) | Cline (Ziel) | |---|---|---| | Software | ~200€/Monat | 0€ | | API-Kosten | im Abo inkl. | ~15-40€/Monat (OpenRouter) | | **Gesamt** | **200€+/Monat** | **~15-40€/Monat** | **Geschätzte Ersparnis: ~160-185€/Monat** ## Risiken - Kein Tab-Autocomplete (wird nicht genutzt → kein Problem) - Codebase-Indexing etwas weniger tief als Cursor (testbar in der Probe-Woche) - Keine Background Cloud-Agents (Cursor Ultra Feature — Bedarf unklar) - BeeLlama benötigt KI-Server online (Fallback: Ollama oder OpenRouter) - qwen braucht präzisere Rules als Claude (wird beim Setup berücksichtigt) ## Status ⏳ Warte auf Startsignal — alle Vorbereitungen abgeschlossen, Agent bereit zum Einrichten sobald VS Code + Cline installiert sind. ## Referenzen - [Cline GitHub](https://github.com/cline/cline) — Apache 2.0, 58k Stars - [Playwright MCP](https://github.com/microsoft/playwright-mcp) — offiziell von Microsoft - Cursor Remote-MCP Bug: seit März 2025 offen, kein Fix in Sicht - BeeLlama: `C:\Users\wutti\beellama-v0.2.0\` auf KI-Server (100.84.255.83)
Author
Owner

Test-Auswertung Cline + Qwen 3.6 (Stand 12.06.2026)

Nach dem ersten echten Testtag (Cline 3.89.2, qwen3.6-hauhau via Ollama, MCPs OpenMemory + Forgejo) eine ehrliche Einordnung — teils im Widerspruch zu den optimistischen Annahmen oben.

Kurzfazit

Kein vollwertiger Cursor-Ersatz — aber nicht wegen Cline, sondern wegen Qwen 3.6 als Gehirn. Diese Trennung ist entscheidend.

  • Cline (Harness): gut. MCP-Anbindung lief sauber (OpenMemory, Forgejo je ein Aufruf), Rules/Auto-Approve/Terminal/Checkpoints vorhanden. Die Hülle ist NICHT der Flaschenhals.
  • Qwen 3.6 (Gehirn): der Flaschenhals. 35B-MoE, ~3B aktive Params, uncensored, IQ4_XS = schnell + billig, aber schwach.

Was die Tests gezeigt haben

Aufgabentyp Ergebnis
Fertiges Tool aufrufen (OpenMemory, Forgejo) OK, ein Aufruf
Eigenstaendiges Skript schreiben (dedupe.py) OK, gute Qualitaet
Diagnose an echten Daten (Service-Status) OK
Freie Exploration ohne Tool (Filmliste) FAIL: 117 Befehle, Doom-Loop
Freies Wissen (Film-Fakten) FAIL: halluziniert Eigennamen/Orte
Regeln halten bei vollem Kontext (>70%) FAIL: bricht zusammen

Roter Faden: gegroundet + klein abgegrenzt = gut. Frei explorieren / grosser Kontext / reines Wissen = scheitert.

Konkrete Befunde

  1. Doom-Loop bei freier Suche: "Liste der Save.TV-Filme" => 117 execute_command-Versuche / 30 Completion-Versuche, Kontext auf 72%. Mit dem bereits existierenden get_savetv_archive_filme-Tool waere das EIN Aufruf gewesen.
  2. Faktenhalluzination: Film-Empfehlung (Jesse Stone) war als Geschmacks-/Musteranalyse stark, aber Fakten frei erfunden ('Charlie Pitts Romane' statt Jesse-Stone-Romane von R. B. Parker; 'New Bedford' statt der fiktiven Stadt Paradise, MA). Ursache: schwaches Faktengedaechtnis (wenig aktive Params + aggressiver Quant).
  3. SSH-Quoting-Haenger: bash -c "... | grep ..." ueber cmd.exe => Quotes zerlegt => remote crontab ohne -l liest stdin => Endlos-Haenger. .clinerules (REGEL 1) gehaertet, half aber nur begrenzt.
  4. Regel-Kollaps bei langem Kontext: Ab ~70% Kontext ignoriert das Modell die Rules am Prompt-Anfang => der Spiral verschlimmert sich selbst (Doom-Loop).
  5. Auto-Approve fuer Commands ist riskant: Ein Haenger ist kein Fehler => REGEL 2 (stoppen) greift nicht => ohne Mensch am Bremshebel steht alles.

Gegenueberstellung zur Plan-Annahme

Der Plan oben sagt "~70% kann qwen ohne spuerbare Einbussen". Das stimmt nur mit Einschraenkung: 70% gilt fuer gegroundete, klar abgegrenzte Aufgaben mit fertigen Tools. Sobald qwen selbst explorieren muss (fremder Code, unbekannte Datenlage, lange Ketten), faellt es deutlich ab — nicht durch Drift, sondern durch Verzetteln + Halluzination.

Auch Coding differenziert: eigenstaendige Skripte aus klarer Vorgabe = gut. Aenderungen in grossem, fremdem Code (erst 20 Dateien verstehen) = scheitert am selben Muster.

Empfehlung: Hybrid, nicht Ersatz

  • Qwen/Cline fuer: haeufige, kleine, klar umrissene Aufgaben mit fertigen Tools (Ops-Diagnosen, kleine Skripte, gegroundete Abfragen). Kostet lokal ~0.
  • Cursor/Claude fuer: grosse Umbauten, Exploration in fremdem Code, kniffliges Debugging.
  • Voraussetzung, damit Qwen taugt: wichtige Homelab-Funktionen als MCP-Tools bereitstellen (z. B. savetv-MCP), statt nacktem SSH-Zugang. Da steht und faellt alles.
  • Wenn wirklich weg von Cursor: dann eher Cline mit staerkerem Modell (Claude/groesseres lokales), nicht Cline mit Qwen 3.6.

Fairer Vergleich waere Cline+Claude vs. Cursor+Claude (Harness-Duell). Cline+Qwen vs. Cursor ist Kleinwagen-Motor gegen Sportwagen.

Erledigt an diesem Testtag

  • .clinerules gehaertet (REGEL 1: keine Pipes/bash -c/Filter im SSH-Befehl, crontab nur mit -l, keine stdin-Haenger; REGEL 2: nicht verrennen)
  • Learnings in OpenMemory abgelegt
  • Haengende ssh.exe-Prozesse + wartender crontab in CT 116 beseitigt

Naechste Schritte (Vorschlag)

  • savetv als MCP-Tool fuer Cline bereitstellen (statt freier SSH-Exploration)
  • Optional: Cline+Claude-Profil testen, um Harness sauber von Modell zu trennen
  • Auto-Approve fuer Commands aus lassen (nur Read/MCP auto)
## Test-Auswertung Cline + Qwen 3.6 (Stand 12.06.2026) Nach dem ersten echten Testtag (Cline 3.89.2, **qwen3.6-hauhau via Ollama**, MCPs OpenMemory + Forgejo) eine ehrliche Einordnung — teils im Widerspruch zu den optimistischen Annahmen oben. ### Kurzfazit **Kein vollwertiger Cursor-Ersatz — aber nicht wegen Cline, sondern wegen Qwen 3.6 als Gehirn.** Diese Trennung ist entscheidend. - **Cline (Harness):** gut. MCP-Anbindung lief sauber (OpenMemory, Forgejo je ein Aufruf), Rules/Auto-Approve/Terminal/Checkpoints vorhanden. Die Hülle ist NICHT der Flaschenhals. - **Qwen 3.6 (Gehirn):** der Flaschenhals. 35B-MoE, ~3B aktive Params, uncensored, IQ4_XS = schnell + billig, aber schwach. ### Was die Tests gezeigt haben | Aufgabentyp | Ergebnis | |---|---| | Fertiges Tool aufrufen (OpenMemory, Forgejo) | OK, ein Aufruf | | Eigenstaendiges Skript schreiben (dedupe.py) | OK, gute Qualitaet | | Diagnose an echten Daten (Service-Status) | OK | | Freie Exploration ohne Tool (Filmliste) | FAIL: 117 Befehle, Doom-Loop | | Freies Wissen (Film-Fakten) | FAIL: halluziniert Eigennamen/Orte | | Regeln halten bei vollem Kontext (>70%) | FAIL: bricht zusammen | Roter Faden: **gegroundet + klein abgegrenzt = gut. Frei explorieren / grosser Kontext / reines Wissen = scheitert.** ### Konkrete Befunde 1. **Doom-Loop bei freier Suche:** "Liste der Save.TV-Filme" => 117 execute_command-Versuche / 30 Completion-Versuche, Kontext auf 72%. Mit dem bereits existierenden `get_savetv_archive_filme`-Tool waere das EIN Aufruf gewesen. 2. **Faktenhalluzination:** Film-Empfehlung (Jesse Stone) war als Geschmacks-/Musteranalyse stark, aber Fakten frei erfunden ('Charlie Pitts Romane' statt Jesse-Stone-Romane von R. B. Parker; 'New Bedford' statt der fiktiven Stadt Paradise, MA). Ursache: schwaches Faktengedaechtnis (wenig aktive Params + aggressiver Quant). 3. **SSH-Quoting-Haenger:** `bash -c "... | grep ..."` ueber cmd.exe => Quotes zerlegt => remote `crontab` ohne `-l` liest stdin => Endlos-Haenger. .clinerules (REGEL 1) gehaertet, half aber nur begrenzt. 4. **Regel-Kollaps bei langem Kontext:** Ab ~70% Kontext ignoriert das Modell die Rules am Prompt-Anfang => der Spiral verschlimmert sich selbst (Doom-Loop). 5. **Auto-Approve fuer Commands ist riskant:** Ein *Haenger* ist kein *Fehler* => REGEL 2 (stoppen) greift nicht => ohne Mensch am Bremshebel steht alles. ### Gegenueberstellung zur Plan-Annahme Der Plan oben sagt "~70% kann qwen ohne spuerbare Einbussen". Das stimmt nur mit Einschraenkung: **70% gilt fuer gegroundete, klar abgegrenzte Aufgaben mit fertigen Tools.** Sobald qwen selbst explorieren muss (fremder Code, unbekannte Datenlage, lange Ketten), faellt es deutlich ab — nicht durch Drift, sondern durch Verzetteln + Halluzination. Auch Coding differenziert: eigenstaendige Skripte aus klarer Vorgabe = gut. Aenderungen in grossem, fremdem Code (erst 20 Dateien verstehen) = scheitert am selben Muster. ### Empfehlung: Hybrid, nicht Ersatz - **Qwen/Cline fuer:** haeufige, kleine, klar umrissene Aufgaben mit fertigen Tools (Ops-Diagnosen, kleine Skripte, gegroundete Abfragen). Kostet lokal ~0. - **Cursor/Claude fuer:** grosse Umbauten, Exploration in fremdem Code, kniffliges Debugging. - **Voraussetzung, damit Qwen taugt:** wichtige Homelab-Funktionen als MCP-Tools bereitstellen (z. B. savetv-MCP), statt nacktem SSH-Zugang. Da steht und faellt alles. - **Wenn wirklich weg von Cursor:** dann eher **Cline mit staerkerem Modell** (Claude/groesseres lokales), nicht Cline mit Qwen 3.6. Fairer Vergleich waere Cline+Claude vs. Cursor+Claude (Harness-Duell). Cline+Qwen vs. Cursor ist Kleinwagen-Motor gegen Sportwagen. ### Erledigt an diesem Testtag - .clinerules gehaertet (REGEL 1: keine Pipes/bash -c/Filter im SSH-Befehl, crontab nur mit -l, keine stdin-Haenger; REGEL 2: nicht verrennen) - Learnings in OpenMemory abgelegt - Haengende ssh.exe-Prozesse + wartender crontab in CT 116 beseitigt ### Naechste Schritte (Vorschlag) - savetv als MCP-Tool fuer Cline bereitstellen (statt freier SSH-Exploration) - Optional: Cline+Claude-Profil testen, um Harness sauber von Modell zu trennen - Auto-Approve fuer Commands aus lassen (nur Read/MCP auto)
Author
Owner

Gegentest: Cline + DeepSeek V4 Pro (Stand 13.06.2026)

Nachtrag zum Test von gestern. Kernfrage war: liegt es an Cline (Harness) oder am Gehirn (Qwen 3.6)? Heute mit einem klugen, billig-gehosteten Modell gegengetestet — Antwort eindeutig: es lag am Gehirn.

Setup

  • Cline in VS Code (KI-Server) von lokalem Qwen 3.6 auf DeepSeek V4 Pro umgestellt (OpenRouter, vorhandener Key aus credentials.md).
  • Slug: deepseek/deepseek-v4-pro ($0.43/M in, $0.87/M out, 1M Kontext, MIT open weights, ~80,6% SWE-bench).
  • Thinking aktiviert (Budget ~3-4k), Provider-Routing auf "Price".
  • Identische Aufgabe wie gestern: "gib mir ne liste der filme die in save tv zum download stehen".

Ergebnis: DeepSeek V4 Pro vs. Qwen 3.6 (gleiche Aufgabe)

Metrik Qwen 3.6 (12.06.) DeepSeek V4 Pro (13.06.)
execute_command 117 12
Vorgehen blind explorieren, Doom-Loop erst planen (Reasoning), dann gezielt
Regel-Treue (REGEL 1) verletzt eingehalten + selbst korrigiert
Halluzination ja (Film-Fakten) nein, gegroundet + transparent
Status abgebrochen sauber abgeschlossen
Kosten "gratis" + Totalausfall ~$0,05

Qualitative Beobachtungen

  • Plant zuerst: 0 Befehle in der ersten Phase, nur sichtbares Reasoning — statt Qwens sofortigem Blind-Feuern.
  • Selbstkorrektur: verschachtelter python -c "..."-Einzeiler mit Quoting-Problem erkannt => auf eigenes Skript list_savetv.py umgestiegen (genau die REGEL 1, die Qwen ignorierte).
  • Gegroundet + ehrlich: nutzte vorhandene Datendatei, legte offen dass der geratene Live-Endpunkt /api/downloads 404 gab (korrekt waere /api/films auf :8765/:9443). Kein Erfinden.
  • Korrekte Ausgabe: strukturierte Filmliste (373 aktiv von 585, 106 dringend), nach Dringlichkeit sortiert, Kino-Filme markiert.

Fazit / Entscheidung

Cline + DeepSeek V4 Pro ist eine echte, bezahlbare Cursor-Alternative. Nicht Cline+Qwen (zu schwach = Spielzeug), sondern Cline mit einem klugen, gehosteten Gehirn fuer Cent-Betraege statt ~200 EUR/Monat, bei Qualitaet nahe Claude. Die These von gestern ("Harness gut, Gehirn der Flaschenhals") ist damit empirisch bestaetigt.

Nebenbei verifiziert: Claude Opus 4.8 existiert auf OpenRouter (anthropic/claude-opus-4.8), ebenso moonshotai/kimi-k2.7-code — fuer Eskalation/agentische Tasks als Profile vorgesehen.

Naechste Schritte

  • savetv als MCP-Tool bauen => eliminiert das letzte API-Raten (kein 404, keine Stale-Daten).
  • Benannte Cline-Profile: DeepSeek V4 Pro (Default) / Kimi K2.7 Code (agentisch) / Claude Opus 4.8 (hart).
  • Optional: Plan/Act-Split (starkes Modell plant, billiges fuehrt aus).
## Gegentest: Cline + DeepSeek V4 Pro (Stand 13.06.2026) Nachtrag zum Test von gestern. Kernfrage war: liegt es an Cline (Harness) oder am Gehirn (Qwen 3.6)? Heute mit einem klugen, billig-gehosteten Modell gegengetestet — Antwort eindeutig: **es lag am Gehirn.** ### Setup - Cline in VS Code (KI-Server) von lokalem Qwen 3.6 auf **DeepSeek V4 Pro** umgestellt (OpenRouter, vorhandener Key aus credentials.md). - Slug: `deepseek/deepseek-v4-pro` ($0.43/M in, $0.87/M out, 1M Kontext, MIT open weights, ~80,6% SWE-bench). - Thinking aktiviert (Budget ~3-4k), Provider-Routing auf "Price". - **Identische Aufgabe wie gestern:** "gib mir ne liste der filme die in save tv zum download stehen". ### Ergebnis: DeepSeek V4 Pro vs. Qwen 3.6 (gleiche Aufgabe) | Metrik | Qwen 3.6 (12.06.) | DeepSeek V4 Pro (13.06.) | |---|---|---| | execute_command | 117 | **12** | | Vorgehen | blind explorieren, Doom-Loop | erst planen (Reasoning), dann gezielt | | Regel-Treue (REGEL 1) | verletzt | eingehalten + selbst korrigiert | | Halluzination | ja (Film-Fakten) | nein, gegroundet + transparent | | Status | abgebrochen | sauber abgeschlossen | | Kosten | "gratis" + Totalausfall | ~$0,05 | ### Qualitative Beobachtungen - **Plant zuerst:** 0 Befehle in der ersten Phase, nur sichtbares Reasoning — statt Qwens sofortigem Blind-Feuern. - **Selbstkorrektur:** verschachtelter `python -c "..."`-Einzeiler mit Quoting-Problem erkannt => auf eigenes Skript `list_savetv.py` umgestiegen (genau die REGEL 1, die Qwen ignorierte). - **Gegroundet + ehrlich:** nutzte vorhandene Datendatei, legte offen dass der geratene Live-Endpunkt `/api/downloads` 404 gab (korrekt waere `/api/films` auf :8765/:9443). Kein Erfinden. - **Korrekte Ausgabe:** strukturierte Filmliste (373 aktiv von 585, 106 dringend), nach Dringlichkeit sortiert, Kino-Filme markiert. ### Fazit / Entscheidung **Cline + DeepSeek V4 Pro ist eine echte, bezahlbare Cursor-Alternative.** Nicht Cline+Qwen (zu schwach = Spielzeug), sondern Cline mit einem klugen, gehosteten Gehirn fuer Cent-Betraege statt ~200 EUR/Monat, bei Qualitaet nahe Claude. Die These von gestern ("Harness gut, Gehirn der Flaschenhals") ist damit empirisch bestaetigt. Nebenbei verifiziert: **Claude Opus 4.8 existiert** auf OpenRouter (`anthropic/claude-opus-4.8`), ebenso `moonshotai/kimi-k2.7-code` — fuer Eskalation/agentische Tasks als Profile vorgesehen. ### Naechste Schritte - `savetv` als MCP-Tool bauen => eliminiert das letzte API-Raten (kein 404, keine Stale-Daten). - Benannte Cline-Profile: DeepSeek V4 Pro (Default) / Kimi K2.7 Code (agentisch) / Claude Opus 4.8 (hart). - Optional: Plan/Act-Split (starkes Modell plant, billiges fuehrt aus).
Author
Owner

Folge-Test: Cline + DeepSeek baut sich sein eigenes MCP-Tool (13.06.2026)

Letzter Schritt der Beweiskette: Kann das kluge Gehirn nicht nur Aufgaben loesen, sondern sich die fehlenden gegroundeten Tools selbst bauen? Ja.

Aufgabe

DeepSeek V4 Pro (in Cline) bekam den Auftrag, ein savetv-MCP-Tool zu bauen, das die Save.TV-Download-Liste liefert (statt per SSH danach zu suchen). Ich habe vorab die Fakten geliefert (verifizierter Endpunkt + JSON-Shape), damit es nicht raten muss.

Was DeepSeek autonom gemacht hat

  1. Endpunkt-Erreichbarkeit verifiziert (http://138.201.84.95:9443/api/films)
  2. Sauberen Python-MCP-Server geschrieben: C:\dev\homelab\savetv_mcp\server.py (fastmcp + requests, stdio)
  3. Dependencies installiert, venv-Frage korrekt geklaert (global, weil MCP-Config command: python nutzt)
  4. In cline_mcp_settings.json registriert OHNE die bestehenden Server (openmemory/forgejo/cloudflare/playwright) zu beschaedigen
  5. Getestet

Code-Qualitaet (server.py, 71 Zeilen)

  • Tool list_savetv_downloads(urgent_only=False, limit=0)
  • Saubere Fehlerbehandlung (Timeout / ConnectionError / HTTP / ungueltiges JSON) mit Klartext-Meldungen statt Crash
  • Sortierung nach days_left, Filter, formatierte Ausgabe mit KINO-Marker
  • Type-Hints, Docstrings

Verifikation (Task-State)

In einem Folge-Lauf nutzte DeepSeek das Tool von selbst (kein SSH):

<use_mcp_tool><server_name>savetv</server_name><tool_name>list_savetv_downloads</tool_name>...
=> Result: Save.TV Download-Liste: 22 Filme (total=571, urgent=101, kino=13)
  • Ein einziger Tool-Aufruf statt 117 SSH-Befehle (Qwen gestern)
  • Live-Daten (total=571 jetzt vs. 585 im gestrigen Snapshot) => kein Stale, kein 404, kein Raten mehr

Fazit

Doom-Loop fuer diese Aufgabe strukturell beseitigt. Die Beweiskette ist komplett: schwaches Gehirn (Qwen, Spielzeug) -> kluges Gehirn (DeepSeek, Cursor-nah) -> kluges Gehirn baut sich seine eigenen gegroundeten Tools und nutzt sie korrekt. Cline + DeepSeek V4 Pro ist als bezahlbare Cursor-Alternative bestaetigt.

Naechster moeglicher Ausbau: weitere Homelab-Funktionen analog als MCP-Tools (Proxmox-Status, Container-Health, etc.).

## Folge-Test: Cline + DeepSeek baut sich sein eigenes MCP-Tool (13.06.2026) Letzter Schritt der Beweiskette: Kann das kluge Gehirn nicht nur Aufgaben loesen, sondern sich die fehlenden gegroundeten Tools selbst bauen? Ja. ### Aufgabe DeepSeek V4 Pro (in Cline) bekam den Auftrag, ein `savetv`-MCP-Tool zu bauen, das die Save.TV-Download-Liste liefert (statt per SSH danach zu suchen). Ich habe vorab die Fakten geliefert (verifizierter Endpunkt + JSON-Shape), damit es nicht raten muss. ### Was DeepSeek autonom gemacht hat 1. Endpunkt-Erreichbarkeit verifiziert (`http://138.201.84.95:9443/api/films`) 2. Sauberen Python-MCP-Server geschrieben: `C:\dev\homelab\savetv_mcp\server.py` (fastmcp + requests, stdio) 3. Dependencies installiert, venv-Frage korrekt geklaert (global, weil MCP-Config `command: python` nutzt) 4. In `cline_mcp_settings.json` registriert OHNE die bestehenden Server (openmemory/forgejo/cloudflare/playwright) zu beschaedigen 5. Getestet ### Code-Qualitaet (server.py, 71 Zeilen) - Tool `list_savetv_downloads(urgent_only=False, limit=0)` - Saubere Fehlerbehandlung (Timeout / ConnectionError / HTTP / ungueltiges JSON) mit Klartext-Meldungen statt Crash - Sortierung nach `days_left`, Filter, formatierte Ausgabe mit KINO-Marker - Type-Hints, Docstrings ### Verifikation (Task-State) In einem Folge-Lauf nutzte DeepSeek das Tool **von selbst** (kein SSH): ``` <use_mcp_tool><server_name>savetv</server_name><tool_name>list_savetv_downloads</tool_name>... => Result: Save.TV Download-Liste: 22 Filme (total=571, urgent=101, kino=13) ``` - **Ein einziger Tool-Aufruf** statt 117 SSH-Befehle (Qwen gestern) - **Live-Daten** (total=571 jetzt vs. 585 im gestrigen Snapshot) => kein Stale, kein 404, kein Raten mehr ### Fazit Doom-Loop fuer diese Aufgabe **strukturell beseitigt**. Die Beweiskette ist komplett: schwaches Gehirn (Qwen, Spielzeug) -> kluges Gehirn (DeepSeek, Cursor-nah) -> kluges Gehirn baut sich seine eigenen gegroundeten Tools und nutzt sie korrekt. Cline + DeepSeek V4 Pro ist als bezahlbare Cursor-Alternative bestaetigt. Naechster moeglicher Ausbau: weitere Homelab-Funktionen analog als MCP-Tools (Proxmox-Status, Container-Health, etc.).
Sign in to join this conversation.
No milestone
No project
No assignees
1 participant
Notifications
Due date
The due date is invalid or out of range. Please use the format "yyyy-mm-dd".

No due date set.

Dependencies

No dependencies set.

Reference: orbitalo/homelab-brain#97
No description provided.