hermes-erkenntnisse/externe-tools-katalog-routingkarte-2026-07-24.md

241 lines
16 KiB
Markdown
Raw Permalink Blame History

This file contains invisible Unicode characters

This file contains invisible Unicode characters that are indistinguishable to humans but may be processed differently by a computer. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Externe-Tools-Katalog (#94) + Routingkarte (#61) + #95-Nachtrag
Stand: 2026-07-24. Quellen: `anleitung.md` (docs.consoro.it, X-API-Key sk-registry-…), VM201
`gpu1-status/app.py` (`#53`-Manifest, live abgefragt), `barby/hermes-erkenntnisse` (Forgejo,
VRAM-Fix + Routingkarte-Vorarbeit vom 2026-07-24), `barby/fleet-shared` (model-routing +
ask-agy Skills), Live-Web-Check (MiniMax Hailuo Pricing). Prinzip laut Bär-Kurskorrektur
2026-07-24: **„LOKAL mit POWER von EXTERN"** — lokal zuerst, extern ist jetzt immer erlaubt
(#95, kein Toggle/Bär-GO mehr), aber je Kategorie zwingend güns­tig-vor-teuer mit
Flatrate-Bevorzugung (Mammouth, Hermes, Antigravity ganz vorne).
---
## Teil 1 — Werkzeug-Katalog (was kann was, wie erreichbar, was kostet es)
### Text / Chat / Planung / Prompt-Aufbereitung
| Tool | Zugriffsweg | Modelle/Umfang | Kosten | Aktiv? |
|---|---|---|---|---|
| **Hermes / Hub-LiteLLM** | Hub-MCP (`ask_go_ki_hermes`), `keys.consoro.it:4000` | Default-Chain MiniMax-M2 → Ionos-Llama-405B → Cloudflare-Llama-70B, dynamisches Routing nach Task-Typ | quasi 0 (Flat/Hub-eigen) | ✅ |
| **Mammouth (Chat)** | PWA (gpu-pc, CDP-Bridge), NIE API | 40+ Modelle: Claude, GPT, Gemini, DeepSeek, Qwen, GLM, MiniMax, Perplexity | ~10€/Monat Flat (alles inkl.) | ✅ REAKTIVIERT |
| **Antigravity / ask-agy** | Hub-MCP bzw. `ask-agy`-Wrapper (Go-Binary, `~/.local/bin/agy`) | Google Gemini Code Assist Pro/Personal — lange Kontexte bis 1M Token, Google-Search-grounded, Multi-Tool-Agent-Loops | 0 (Google-Sub-Flat, kein Pay-per-Token) | ✅ (jump, Fleet-Sync verteilt Skill nicht Binary) |
| **Qolaba (Text/Chat)** | PWA (gpu-pc) oder `keys.consoro.it/services/qolaba/*` | 60+ Modelle inkl. Sonar/Perplexity | Credits-Reserve (Fair-Use) | ✅ LIVE |
| **DeepSeek** | API (`deepseek:chat`/`deepseek:reasoner`) über Hub-LiteLLM | Chat + Reasoning | teuerstes laufendes Abo = quasi-Flat | ✅ |
| **IONOS LLM** | offizielle API (`openai.inference.de-txl.ionos.com`) über LiteLLM-Gateway | llama-3.1-8b/405b, mistral, qwen3-coder-next | günstig, Guthaben-basiert | ✅ |
| **Gemini (Chat/Lyrics)** | PWA (Chrome-CDP-Bridge, `:4003/gemini/chat`), NIE API | Gemini 3.x Pro/Flash, Ultra-Abo (Google One) | 0 extra (Workspace/Ultra-Sub) | ✅ REAKTIVIERT |
| **OpenRouter** | API über Hub-LiteLLM | claude-sonnet-4, claude-opus-4.6 | teuer, Pay-per-Token | ✅ (nur letzter Ausweg) |
| **Perplexity** | API/Bridge | sonar, sonar-pro, sonar-reasoning-pro, sonar-deep-research | Abo-gedeckt | ✅ |
### Bild
| Tool | Zugriffsweg | Modelle | Kosten | Aktiv? |
|---|---|---|---|---|
| **SDXL/FLUX lokal** | ComfyUI (A40, VM302 :8188) | eigene Checkpoints/LoRAs | 0 | ✅ |
| **Mammouth (Bild)** | PWA, `Mammouth-PWA/image` | FLUX Pro/Dev, DALL·E 3, Grok-Imagine, Recraft, SD, Leonardo Phoenix | im Flat-Abo inkl. | ✅ |
| **Gemini Nano-Banana** | PWA-Bridge | schnell, ~2s, low-quality | 0 extra | ✅ |
| **IONOS FLUX.1-schnell** | offizielle API | `black-forest-labs/FLUX.1-schnell`, 1024x1024 | ~0,010,015€/Bild | ✅ |
| **Qolaba (Bild)** | PWA | FLUX u.a. | ~10 Credits/Bild (~$0,10) | ✅ |
### Video
| Tool | Zugriffsweg | Modelle | Kosten | Aktiv? |
|---|---|---|---|---|
| **Wan2.2 lokal (A40)** | ComfyUI, GGUF Q5_K_M + Lightning-4step-LoRA | I2V/T2V, primäres Werkzeug | 0 | ✅ Primär |
| **Shadow / Monster** | Burst-Nodes (siehe Hardware-Docs) | gleiche Wan2.2-Pipeline, entlastet A40 | 0 (eigene HW) | ✅ als Overflow-Ziel |
| **Mammouth (Video)** | PWA, `Mammouth-PWA/video` | Veo 3.1 Lite/Full, Sora 2/1, Kling 2.5/2.0, Runway Gen-3 | im Flat-Abo inkl. (~10€/Mo) | ✅ |
| **MiniMax Hailuo (Video)** | **offizielle API** (kein PWA-Zwang) | Text/Image-to-Video, 768p/512p | ~$0,0170,045/s (API pay-as-you-go); Abo-Stufen $9,99$199,99/Mo | ⚠️ **geprüft, NICHT verdrahtet** — siehe Hybrid-Empfehlung unten |
| **Qolaba (Video)** | PWA | Veo 3.1 (~156 Cr/60s≈$1,56), Kling 3.0 (~100 Cr≈$1,00), Sora | Credits-Reserve | ✅ LIVE |
| **Poyo.ai** | offizielle API (Aggregator) | Veo, Sora, Kling, MiniMax | pay-as-you-go, $0,100,80/Szene | ⚠️ teils "Down"/seasonal laut Anleitung |
| **Fal.ai** | offizielle API | Kling 3.0 (beste Konsistenz laut Doku) | pay-per-use | ✅ vorhanden |
**MiniMax-Video-Check (Nachtrag-Auftrag):** MiniMax bietet über **Hailuo AI** echte Text-/Image-to-Video-Generierung
an, offizielle API (nicht PWA-pflichtig wie Gemini/Mammouth), Pay-as-you-go ab ca. $0,017/s (512p) bzw.
$0,045/s (768p) laut aktueller Recherche (2026). Für die Content-Pipeline als **Hybrid-Überlauf** geeignet:
extern per API rendern lassen, danach lokal auf VM302/A40 nachbearbeiten (Restore/Mux/Interpolate/Lipsync
bleiben lokal — nur das Rohrendering wandert extern). Aktuell **nicht in `routing_tiers.json` scharf
geschaltet**, sondern als Video-Tier-5 (nach Mammouth-Flat, vor Qolaba-Guthaben) dokumentiert — Aktivierung
wäre ein separater, kleiner API-Anbindungsschritt (Key aus `credentials.json[minimax_api_key]`, dieselbe
Route wie MiniMax-TTS `t2a_v2`, nur anderer Endpoint).
### Lipsync / Upscale / Restore
| Tool | Zugriffsweg | Kosten | Aktiv? |
|---|---|---|---|
| **MuseTalk / GFPGAN / RealESRGAN lokal** | A40 (VM302), eigene venv | 0 | ✅ (#17-Pipeline) |
| **Shadow** | Burst-Node, gleiche Pipeline | 0 | ✅ als Overflow |
| Externer Ersatz | — | — | ❌ aktuell keiner etabliert (Folgeschritt) |
### TTS (deutsche Stimme)
| Tool | Zugriffsweg | Stimmen | Kosten | Aktiv? |
|---|---|---|---|---|
| **Azure Speech Neural (HD)** | offizielle API, `credentials.json[azure_speech_key]`, Region eastus2 | 10 dt. Stimmen: Katja, Conrad, Amala, Killian, Seraphina(Multi), Florian(Multi) | **0 — $2600 Sponsorship-Guthaben (bis 2027), TRACKEN** | ✅ Primär (Akzentfreiheit) |
| **MiniMax speech-02-hd** | offizielle API, `t2a_v2` | voice_id `female-shaonv` u.a. | Guthaben pay-per-use | ✅ |
| **Mammouth (Audio/TTS)** | PWA-Bridge | Azure TTS/OpenAI TTS/Google TTS/Play.ht — alle über PWA erreichbar | im Flat-Abo inkl. | ✅ Fallback wenn Direkt-Azure down |
| **edge-tts** | kostenlos, gleiche Neural-Stimmen ohne Sponsorship-Konto | Seraphina, Conrad, Katja, Amala | 0 | ✅ Notfall-Fallback |
| **XTTS v2 lokal** | CPU (VM302) | eigene Stimme-Clones | 0 | ✅ nur Offline-Fallback |
| **Piper lokal** | CPU | Basis-Stimmen | 0 | ✅ letzter Fallback |
### Musik
| Tool | Zugriffsweg | Kosten | Aktiv? |
|---|---|---|---|
| **ACE-Step lokal** | Shadow, `M:\ACE-Step` | 0 | ✅ |
| **Mammouth → Suno v5.5/v4.5** | PWA-Bridge, `Mammouth-PWA/music` | im Flat-Abo inkl. | ✅ |
| **Suno direkt** | PWA (gpu-pc) | eigenes Abo | ✅ Fallback |
### Websuche
| Tool | Zugriffsweg | Kosten | Aktiv? |
|---|---|---|---|
| **Antigravity/ask-agy** | Google-Search-grounded, Flat | 0 | ✅ |
| **SearXNG** | selbst gehostet, nas2 `:8888` | 0 | ✅ |
| **Perplexity sonar/sonar-pro** | Abo/Bridge | Abo-gedeckt | ✅ |
| **web_search (Claude-nativ)** | Tool-eigen | 0 | ✅ |
---
## Teil 2 — Routingkarte (#61), lokal+extern, lauffähige Config
Die vollständige, maschinenlesbare Fassung liegt in
**`B:\barby\orchestrator\routing_tiers.json`** und ist **live über den Orchestrator abrufbar**:
`GET http://127.0.0.1:8197/routing-map` (verifiziert, HTTP 200, 2026-07-24 08:31).
Grundregel je Kategorie: **lokal-first → Mammouth-Flat/Hermes/Antigravity (günstig/Flat) →
Guthaben-Dienste (Azure-Sponsorship/MiniMax/IONOS, tracken) → teure Einzel-APIs (OpenRouter,
nur letzter Ausweg)**. Overflow automatisch bei Überlast-Signal (A40-Guard, `VM201:9090`),
kein Bär-GO nötig (#95). Ausnahme TTS: dort ist die Reihenfolge umgekehrt (extern zuerst,
wegen Akzentfreiheit — Bär-Kurskorrektur 2026-07-24).
| Kategorie | Tier 1 (lokal/quasi-frei) | Tier 2 (Flatrate) | Tier 3 (Guthaben) | Tier 4 (teuer/letzter Ausweg) |
|---|---|---|---|---|
| Video | A40 → Shadow → Monster | Mammouth-PWA/veo\|kling | MiniMax Hailuo (Hybrid, ungeprüft aktiviert) → Qolaba | Poyo/Fal (Einzelfall) |
| Bildgen | SDXL/FLUX A40/Shadow | Mammouth-PWA/image, Gemini Nano-Banana | IONOS FLUX.1-schnell, Qolaba | — |
| Lipsync/Upscale | A40/Shadow (MuseTalk/GFPGAN/RealESRGAN) | — | — | kein externer Ersatz etabliert |
| TTS-Deutsch | *(nur Offline-Fallback: XTTS/Piper)* | Mammouth-PWA/audio | **Azure Speech (primär, Sponsorship)**, MiniMax t2a_v2 | edge-tts (kostenlos, Notfall) |
| Musik | ACE-Step (Shadow) | Mammouth-PWA/music → Suno | — | — |
| Text/Prompt | Hermes/Hub-LiteLLM | Mammouth-Chat, Antigravity/ask-agy | Qolaba-Text, DeepSeek(Abo), IONOS-LLM | OpenRouter (nur letzter Ausweg) |
| Websuche | SearXNG | Antigravity/ask-agy | Perplexity | web_search-Tool |
---
## Teil 3 — #95: Extern-Toggle abgeschafft (Beleg)
**Vorher:** `GET http://100.114.24.89:9090/api/external-tools``{"enabled":false,...}`
(Stand 2026-07-23 21:40, portal-admin).
**Aktion 1 (Live-Flip, sofort wirksam):** `POST /api/external-tools/toggle`
`{"enabled":true,"changed_by":"portal-admin","changed_at":"2026-07-24T08:12:52"}` — verifiziert
per erneutem GET.
**Aktion 2 (Code-Fix, dauerhaft, additiv/reversibel):** `B:\barby\orchestrator\main.py`,
Funktion `external_pool_enabled()` gibt jetzt hart `True` zurück — die alte
Live-Toggle-Abfrage bleibt als Kommentarblock im Code stehen (Rückweg ohne Recherche möglich).
Backup: `main.py.bak-toggleremoved-20260724-081307`. `py_compile` grün. Orchestrator
(Scheduled Task `BarbyOrchestrator`, Port 8197) sauber neu gestartet — verifiziert: der
einzige wartende Queue-Eintrag (`bc825ebe8d`) war bereits vor dem Neustart verwaist (Timestamp
2026-07-24 00:23, älter als der zuvor laufende Prozess seit 02:21) — **kein aktiver Job
unterbrochen**. `GET /pool-status` zeigt jetzt `"toggle_status": "ABGESCHAFFT seit #95"`.
**Portal-Toggle-UI (cp.go-ki.eu):** UI-Schalter selbst nicht entfernt (bewusst, um das Risiko
eines Portal-Deploys laut `portal-cp-go-ki`-Skill klein zu halten) — zeigt jetzt aber
dauerhaft "AN", weil die zugrundeliegende `external_tools.json` auf VM201 auf `enabled:true`
gepinnt ist UND der Orchestrator sie seit dem Code-Fix ohnehin nicht mehr auswertet. Empfehlung
Folgeschritt: Toggle-Element im Portal-HTML in einem eigenen, separat getesteten Schritt durch
einen reinen Status-Chip ersetzen.
---
## Teil 4 — Neue Tools gefunden (Nachtrag-Auftrag, GitLab/Obsidian/Web-Suche)
- **Antigravity/ask-agy** (Google Gemini CLI, Go-Binary v1.0.14) — in `barby/fleet-shared`
(`hermes-skills/devops/ask-agy/SKILL.md`) gefunden, **jetzt in Katalog+Routingkarte
aufgenommen** (Text/Prompt Tier 2, Websuche Tier 2).
- **MiniMax Hailuo Video** — per Web-Recherche verifiziert (echte API, kein PWA-Zwang),
**als Video-Hybrid-Tier dokumentiert**, nicht aktiv verdrahtet (ehrlich markiert).
- **DeepSeek** — bereits in `model-routing`-Skill (`barby/fleet-shared`) als Coding/Reasoning-
Fallback gelistet, hier zusätzlich als "teuerstes-Abo=quasi-Flat" in Text-Tier 3 aufgenommen.
- **SearXNG** (`nas2:8888`) — aus Anleitung + Fleet-Shared-Skill bestätigt, als
Websuche-Tier-1-Ergänzung neben Antigravity aufgenommen.
- Obsidian-Vault dieser Session **nicht erreichbar** (kein REST-API-Port lokal offen, kein
Netzwerkpfad zu `nc.consoro.it` von diesem Host aus) — ehrlich markiert, keine Recherche
dort möglich in diesem Schritt. Forgejo (`barby/hermes-erkenntnisse`, `barby/fleet-shared`,
`barby/aufgaben`) war die tragfähige Quelle für die Tool-Recherche.
---
## Teil 5 — Offene Punkte (ehrlich)
1. **Shadow/Monster-Feindetails für Video-Routing**: Rollen als Burst-Nodes bestätigt
(`barby/hermes-erkenntnisse/hardware/monster-gpu-spec-2026-07-23.md`,
`burst-nodes-65-2026-07-23.md`), aber die exakte Schritt→Knoten-Zuordnung für die
#17-Pipeline (welches pipe_0x-Skript auf welchem Knoten) wurde in dieser Session nicht
bis ins letzte Detail verifiziert — Empfehlung: Folgeschritt mit Shadow/Monster-SSH-Zugriff.
2. **MiniMax-Video-Anbindung**: dokumentiert, nicht implementiert (kein ungetesteter
Produktiv-Eingriff ohne eigenen Beleg-Schritt).
3. **Portal-Toggle-UI**: bewusst nicht angefasst (Risiko-Minimierung), nur Backend/Orchestrator
umgestellt.
---
## Teil 6 — Worker #97 (2026-07-24): Cloudflare Workers AI + Kling + AI6-Korrektur
**1) Cloudflare Workers AI additiv als GRATIS-Tier eingebaut.** Key gefunden in Vaultwarden
"KI API Keys" -> `CLOUDFLARE-WORKERS-AI` (Account `9776ea02d0dd34d6e1c81d96b75f478f`,
Endpoint `https://api.cloudflare.com/client/v4/accounts/<ACCOUNT_ID>/ai/run/<model>`).
10.000 Neurons/Tag gratis (danach $0.011/1k Neurons), 47+ Modelle (Text/SDXL-Bild/Whisper/
Embeddings). **Echter Test-Beleg:**
- Text (`@cf/meta/llama-3.1-8b-instruct`): HTTP 200, deutsche Antwort erhalten
("Der komplexe Softwaresystem hat alle Funktionen erfolgreich getestet...").
- Bild (`@cf/stabilityai/stable-diffusion-xl-base-1.0`): HTTP 200, 1.6 MB PNG erhalten
(roter Bauernhof/Feld-Motiv, verifiziert als valides Bild).
In `B:\barby\orchestrator\routing_tiers.json` eingebaut als:
- `text_prompt_planung` Tier 2 (direkt nach Hermes, vor Mammouth-Flat) — Text/Bulk-Aufgaben.
- `bildgenerierung` Tier 3 (nach lokal+Shadow, vor Mammouth-Flat) — kleine/schnelle Bilder,
NICHT Ersatz fuer lokale SDXL/FLUX-Qualitaet (Neurons-Budget ist knapp: SDXL-Bild kostet
mehrere Hundert Neurons/Bild).
Backup vor Aenderung: `routing_tiers.json.bak-worker97-20260724-085220`. Deploy erfolgte per
sauberem Forgejo-Transfer (Chunk-basiertes WinRM-Copy-Paste hat Zeichen korrumpiert -- verworfen,
stattdessen Datei über `barby/hermes-erkenntnisse/_transfer/` gepusht und von VM302 per
`Invoke-WebRequest` heruntergeladen, danach `python -m json.load` validiert). Live-Endpoint
`GET http://100.104.5.57:8197/routing-map` liefert die neue Struktur (verifiziert, `worker97_nachtrag`
Feld vorhanden, Video-Kategorie hat jetzt 7 statt 6 Tiers) — Orchestrator liest die Datei live,
kein Scheduled-Task-Neustart noetig (Restart-Versuch scheiterte an 502-Gateway-Fehlern des
WinRM-Aggregators, war aber nicht erforderlich, da Live-Reload bereits bestaetigt ist).
**2) Kling AI als Video-Failover-Option dokumentiert, NICHT verdrahtet.** Vaultwarden-Suche
nach "kling" ergab keinen Treffer — kein API-Key vorhanden. In `routing_tiers.json` als neue
Stufe 6 (zwischen MiniMax #96 und Qolaba) additiv eingetragen, analog zum MiniMax-Muster:
Default AUS, `[BAER-SIGNUP]`-Hinweis mit konkreten Schritten (Account bei klingai.com bzw.
EvoLink-Reseller, API-Key erzeugen, in Vaultwarden "KI API Keys" als `KLING-AI` eintragen,
`KLING_API_KEY` in main.py-Umgebung hinterlegen). Kein Signup selbst durchgefuehrt.
**3) AI6-Regel als ueberholt markiert.** `barby/memory/keys-consoro-it/TOOL-STORE-KATALOG.md`
markierte Cloud-Video (MiniMax/Kling/Runway/Luma/Mammouth-Video/Qolaba-Video) durchgehend als
"AI6-gesperrt / nicht nutzen". Per Baer-Kurskorrektur 2026-07-24 ist das ueberholt: Cloud-Video
ist jetzt als Failover erlaubt (kein Default, aber technisch freigegeben), externe Tools
generell immer erlaubt (#95, kein Toggle/Baer-GO mehr). Nur Gemini+Mammouth bleiben PWA-only
(REZEPT AI5 bleibt in Kraft). Katalog-Datei um einen Korrektur-Abschnitt ergaenzt (additiv, alte
Zeilen nicht geloescht, damit die Historie nachvollziehbar bleibt).
**4) [BAER-SIGNUP]-Empfehlungen (nicht selbst angelegt):**
- **Cerebras Free-Tier** — 1.000.000 Tokens/Tag GRATIS (Llama/Qwen-Modelle, sehr schnelle
Inferenz). Baer muesste: Account auf `cloud.cerebras.ai` anlegen, API-Key erzeugen, Key in
Vaultwarden "KI API Keys" als `CEREBRAS` eintragen (Format wie bestehende Eintraege: KEY +
URL `https://api.cerebras.ai/v1`), danach kann ein Worker es additiv als weiteren Gratis-Tier
in `text_prompt_planung` einbauen (vermutlich zwischen Hermes und Cloudflare Workers AI, je
nach Rate-Limit-Vergleich).
- **Featherless.ai** — $25/Monat Flatrate, tausende Open-Weight-Modelle (Llama/Qwen/Mistral/
Mixtral-Varianten, auch grosse 70B+/100B+ Modelle ohne eigene Infrastruktur). Baer muesste:
Account auf `featherless.ai` anlegen, Zahlungsmethode hinterlegen (kostenpflichtig, daher
zwingend Baer-Entscheidung), API-Key erzeugen, Key in Vaultwarden als `FEATHERLESS` eintragen
(Format: KEY + URL `https://api.featherless.ai/v1`). Waere danach als Guthaben/Flatrate-Tier
fuer Modelle einsetzbar, die weder Hermes noch Cloudflare Workers AI abdecken (z.B. sehr
grosse Open-Weight-Modelle fuer Spezialfaelle).
Beide NICHT selbst angelegt (kostenpflichtig bzw. Account-Erstellung = Baer-Entscheidung laut
Rollen-Regel).