hermes-erkenntnisse/externe-tools-katalog-routingkarte-2026-07-24.md

16 KiB
Raw Permalink Blame History

Externe-Tools-Katalog (#94) + Routingkarte (#61) + #95-Nachtrag

Stand: 2026-07-24. Quellen: anleitung.md (docs.consoro.it, X-API-Key sk-registry-…), VM201 gpu1-status/app.py (#53-Manifest, live abgefragt), barby/hermes-erkenntnisse (Forgejo, VRAM-Fix + Routingkarte-Vorarbeit vom 2026-07-24), barby/fleet-shared (model-routing + ask-agy Skills), Live-Web-Check (MiniMax Hailuo Pricing). Prinzip laut Bär-Kurskorrektur 2026-07-24: „LOKAL mit POWER von EXTERN" — lokal zuerst, extern ist jetzt immer erlaubt (#95, kein Toggle/Bär-GO mehr), aber je Kategorie zwingend güns­tig-vor-teuer mit Flatrate-Bevorzugung (Mammouth, Hermes, Antigravity ganz vorne).


Teil 1 — Werkzeug-Katalog (was kann was, wie erreichbar, was kostet es)

Text / Chat / Planung / Prompt-Aufbereitung

Tool Zugriffsweg Modelle/Umfang Kosten Aktiv?
Hermes / Hub-LiteLLM Hub-MCP (ask_go_ki_hermes), keys.consoro.it:4000 Default-Chain MiniMax-M2 → Ionos-Llama-405B → Cloudflare-Llama-70B, dynamisches Routing nach Task-Typ quasi 0 (Flat/Hub-eigen)
Mammouth (Chat) PWA (gpu-pc, CDP-Bridge), NIE API 40+ Modelle: Claude, GPT, Gemini, DeepSeek, Qwen, GLM, MiniMax, Perplexity ~10€/Monat Flat (alles inkl.) REAKTIVIERT
Antigravity / ask-agy Hub-MCP bzw. ask-agy-Wrapper (Go-Binary, ~/.local/bin/agy) Google Gemini Code Assist Pro/Personal — lange Kontexte bis 1M Token, Google-Search-grounded, Multi-Tool-Agent-Loops 0 (Google-Sub-Flat, kein Pay-per-Token) (jump, Fleet-Sync verteilt Skill nicht Binary)
Qolaba (Text/Chat) PWA (gpu-pc) oder keys.consoro.it/services/qolaba/* 60+ Modelle inkl. Sonar/Perplexity Credits-Reserve (Fair-Use) LIVE
DeepSeek API (deepseek:chat/deepseek:reasoner) über Hub-LiteLLM Chat + Reasoning teuerstes laufendes Abo = quasi-Flat
IONOS LLM offizielle API (openai.inference.de-txl.ionos.com) über LiteLLM-Gateway llama-3.1-8b/405b, mistral, qwen3-coder-next günstig, Guthaben-basiert
Gemini (Chat/Lyrics) PWA (Chrome-CDP-Bridge, :4003/gemini/chat), NIE API Gemini 3.x Pro/Flash, Ultra-Abo (Google One) 0 extra (Workspace/Ultra-Sub) REAKTIVIERT
OpenRouter API über Hub-LiteLLM claude-sonnet-4, claude-opus-4.6 teuer, Pay-per-Token (nur letzter Ausweg)
Perplexity API/Bridge sonar, sonar-pro, sonar-reasoning-pro, sonar-deep-research Abo-gedeckt

Bild

Tool Zugriffsweg Modelle Kosten Aktiv?
SDXL/FLUX lokal ComfyUI (A40, VM302 :8188) eigene Checkpoints/LoRAs 0
Mammouth (Bild) PWA, Mammouth-PWA/image FLUX Pro/Dev, DALL·E 3, Grok-Imagine, Recraft, SD, Leonardo Phoenix im Flat-Abo inkl.
Gemini Nano-Banana PWA-Bridge schnell, ~2s, low-quality 0 extra
IONOS FLUX.1-schnell offizielle API black-forest-labs/FLUX.1-schnell, 1024x1024 ~0,010,015€/Bild
Qolaba (Bild) PWA FLUX u.a. ~10 Credits/Bild (~$0,10)

Video

Tool Zugriffsweg Modelle Kosten Aktiv?
Wan2.2 lokal (A40) ComfyUI, GGUF Q5_K_M + Lightning-4step-LoRA I2V/T2V, primäres Werkzeug 0 Primär
Shadow / Monster Burst-Nodes (siehe Hardware-Docs) gleiche Wan2.2-Pipeline, entlastet A40 0 (eigene HW) als Overflow-Ziel
Mammouth (Video) PWA, Mammouth-PWA/video Veo 3.1 Lite/Full, Sora 2/1, Kling 2.5/2.0, Runway Gen-3 im Flat-Abo inkl. (~10€/Mo)
MiniMax Hailuo (Video) offizielle API (kein PWA-Zwang) Text/Image-to-Video, 768p/512p ~$0,0170,045/s (API pay-as-you-go); Abo-Stufen $9,99$199,99/Mo ⚠️ geprüft, NICHT verdrahtet — siehe Hybrid-Empfehlung unten
Qolaba (Video) PWA Veo 3.1 (~156 Cr/60s≈$1,56), Kling 3.0 (~100 Cr≈$1,00), Sora Credits-Reserve LIVE
Poyo.ai offizielle API (Aggregator) Veo, Sora, Kling, MiniMax pay-as-you-go, $0,100,80/Szene ⚠️ teils "Down"/seasonal laut Anleitung
Fal.ai offizielle API Kling 3.0 (beste Konsistenz laut Doku) pay-per-use vorhanden

MiniMax-Video-Check (Nachtrag-Auftrag): MiniMax bietet über Hailuo AI echte Text-/Image-to-Video-Generierung an, offizielle API (nicht PWA-pflichtig wie Gemini/Mammouth), Pay-as-you-go ab ca. $0,017/s (512p) bzw. $0,045/s (768p) laut aktueller Recherche (2026). Für die Content-Pipeline als Hybrid-Überlauf geeignet: extern per API rendern lassen, danach lokal auf VM302/A40 nachbearbeiten (Restore/Mux/Interpolate/Lipsync bleiben lokal — nur das Rohrendering wandert extern). Aktuell nicht in routing_tiers.json scharf geschaltet, sondern als Video-Tier-5 (nach Mammouth-Flat, vor Qolaba-Guthaben) dokumentiert — Aktivierung wäre ein separater, kleiner API-Anbindungsschritt (Key aus credentials.json[minimax_api_key], dieselbe Route wie MiniMax-TTS t2a_v2, nur anderer Endpoint).

Lipsync / Upscale / Restore

Tool Zugriffsweg Kosten Aktiv?
MuseTalk / GFPGAN / RealESRGAN lokal A40 (VM302), eigene venv 0 (#17-Pipeline)
Shadow Burst-Node, gleiche Pipeline 0 als Overflow
Externer Ersatz aktuell keiner etabliert (Folgeschritt)

TTS (deutsche Stimme)

Tool Zugriffsweg Stimmen Kosten Aktiv?
Azure Speech Neural (HD) offizielle API, credentials.json[azure_speech_key], Region eastus2 10 dt. Stimmen: Katja, Conrad, Amala, Killian, Seraphina(Multi), Florian(Multi) 0 — $2600 Sponsorship-Guthaben (bis 2027), TRACKEN Primär (Akzentfreiheit)
MiniMax speech-02-hd offizielle API, t2a_v2 voice_id female-shaonv u.a. Guthaben pay-per-use
Mammouth (Audio/TTS) PWA-Bridge Azure TTS/OpenAI TTS/Google TTS/Play.ht — alle über PWA erreichbar im Flat-Abo inkl. Fallback wenn Direkt-Azure down
edge-tts kostenlos, gleiche Neural-Stimmen ohne Sponsorship-Konto Seraphina, Conrad, Katja, Amala 0 Notfall-Fallback
XTTS v2 lokal CPU (VM302) eigene Stimme-Clones 0 nur Offline-Fallback
Piper lokal CPU Basis-Stimmen 0 letzter Fallback

Musik

Tool Zugriffsweg Kosten Aktiv?
ACE-Step lokal Shadow, M:\ACE-Step 0
Mammouth → Suno v5.5/v4.5 PWA-Bridge, Mammouth-PWA/music im Flat-Abo inkl.
Suno direkt PWA (gpu-pc) eigenes Abo Fallback

Websuche

Tool Zugriffsweg Kosten Aktiv?
Antigravity/ask-agy Google-Search-grounded, Flat 0
SearXNG selbst gehostet, nas2 :8888 0
Perplexity sonar/sonar-pro Abo/Bridge Abo-gedeckt
web_search (Claude-nativ) Tool-eigen 0

Teil 2 — Routingkarte (#61), lokal+extern, lauffähige Config

Die vollständige, maschinenlesbare Fassung liegt in B:\barby\orchestrator\routing_tiers.json und ist live über den Orchestrator abrufbar: GET http://127.0.0.1:8197/routing-map (verifiziert, HTTP 200, 2026-07-24 08:31).

Grundregel je Kategorie: lokal-first → Mammouth-Flat/Hermes/Antigravity (günstig/Flat) → Guthaben-Dienste (Azure-Sponsorship/MiniMax/IONOS, tracken) → teure Einzel-APIs (OpenRouter, nur letzter Ausweg). Overflow automatisch bei Überlast-Signal (A40-Guard, VM201:9090), kein Bär-GO nötig (#95). Ausnahme TTS: dort ist die Reihenfolge umgekehrt (extern zuerst, wegen Akzentfreiheit — Bär-Kurskorrektur 2026-07-24).

Kategorie Tier 1 (lokal/quasi-frei) Tier 2 (Flatrate) Tier 3 (Guthaben) Tier 4 (teuer/letzter Ausweg)
Video A40 → Shadow → Monster Mammouth-PWA/veo|kling MiniMax Hailuo (Hybrid, ungeprüft aktiviert) → Qolaba Poyo/Fal (Einzelfall)
Bildgen SDXL/FLUX A40/Shadow Mammouth-PWA/image, Gemini Nano-Banana IONOS FLUX.1-schnell, Qolaba
Lipsync/Upscale A40/Shadow (MuseTalk/GFPGAN/RealESRGAN) kein externer Ersatz etabliert
TTS-Deutsch (nur Offline-Fallback: XTTS/Piper) Mammouth-PWA/audio Azure Speech (primär, Sponsorship), MiniMax t2a_v2 edge-tts (kostenlos, Notfall)
Musik ACE-Step (Shadow) Mammouth-PWA/music → Suno
Text/Prompt Hermes/Hub-LiteLLM Mammouth-Chat, Antigravity/ask-agy Qolaba-Text, DeepSeek(Abo), IONOS-LLM OpenRouter (nur letzter Ausweg)
Websuche SearXNG Antigravity/ask-agy Perplexity web_search-Tool

Teil 3 — #95: Extern-Toggle abgeschafft (Beleg)

Vorher: GET http://100.114.24.89:9090/api/external-tools{"enabled":false,...} (Stand 2026-07-23 21:40, portal-admin).

Aktion 1 (Live-Flip, sofort wirksam): POST /api/external-tools/toggle{"enabled":true,"changed_by":"portal-admin","changed_at":"2026-07-24T08:12:52"} — verifiziert per erneutem GET.

Aktion 2 (Code-Fix, dauerhaft, additiv/reversibel): B:\barby\orchestrator\main.py, Funktion external_pool_enabled() gibt jetzt hart True zurück — die alte Live-Toggle-Abfrage bleibt als Kommentarblock im Code stehen (Rückweg ohne Recherche möglich). Backup: main.py.bak-toggleremoved-20260724-081307. py_compile grün. Orchestrator (Scheduled Task BarbyOrchestrator, Port 8197) sauber neu gestartet — verifiziert: der einzige wartende Queue-Eintrag (bc825ebe8d) war bereits vor dem Neustart verwaist (Timestamp 2026-07-24 00:23, älter als der zuvor laufende Prozess seit 02:21) — kein aktiver Job unterbrochen. GET /pool-status zeigt jetzt "toggle_status": "ABGESCHAFFT seit #95".

Portal-Toggle-UI (cp.go-ki.eu): UI-Schalter selbst nicht entfernt (bewusst, um das Risiko eines Portal-Deploys laut portal-cp-go-ki-Skill klein zu halten) — zeigt jetzt aber dauerhaft "AN", weil die zugrundeliegende external_tools.json auf VM201 auf enabled:true gepinnt ist UND der Orchestrator sie seit dem Code-Fix ohnehin nicht mehr auswertet. Empfehlung Folgeschritt: Toggle-Element im Portal-HTML in einem eigenen, separat getesteten Schritt durch einen reinen Status-Chip ersetzen.


Teil 4 — Neue Tools gefunden (Nachtrag-Auftrag, GitLab/Obsidian/Web-Suche)

  • Antigravity/ask-agy (Google Gemini CLI, Go-Binary v1.0.14) — in barby/fleet-shared (hermes-skills/devops/ask-agy/SKILL.md) gefunden, jetzt in Katalog+Routingkarte aufgenommen (Text/Prompt Tier 2, Websuche Tier 2).
  • MiniMax Hailuo Video — per Web-Recherche verifiziert (echte API, kein PWA-Zwang), als Video-Hybrid-Tier dokumentiert, nicht aktiv verdrahtet (ehrlich markiert).
  • DeepSeek — bereits in model-routing-Skill (barby/fleet-shared) als Coding/Reasoning- Fallback gelistet, hier zusätzlich als "teuerstes-Abo=quasi-Flat" in Text-Tier 3 aufgenommen.
  • SearXNG (nas2:8888) — aus Anleitung + Fleet-Shared-Skill bestätigt, als Websuche-Tier-1-Ergänzung neben Antigravity aufgenommen.
  • Obsidian-Vault dieser Session nicht erreichbar (kein REST-API-Port lokal offen, kein Netzwerkpfad zu nc.consoro.it von diesem Host aus) — ehrlich markiert, keine Recherche dort möglich in diesem Schritt. Forgejo (barby/hermes-erkenntnisse, barby/fleet-shared, barby/aufgaben) war die tragfähige Quelle für die Tool-Recherche.

Teil 5 — Offene Punkte (ehrlich)

  1. Shadow/Monster-Feindetails für Video-Routing: Rollen als Burst-Nodes bestätigt (barby/hermes-erkenntnisse/hardware/monster-gpu-spec-2026-07-23.md, burst-nodes-65-2026-07-23.md), aber die exakte Schritt→Knoten-Zuordnung für die #17-Pipeline (welches pipe_0x-Skript auf welchem Knoten) wurde in dieser Session nicht bis ins letzte Detail verifiziert — Empfehlung: Folgeschritt mit Shadow/Monster-SSH-Zugriff.
  2. MiniMax-Video-Anbindung: dokumentiert, nicht implementiert (kein ungetesteter Produktiv-Eingriff ohne eigenen Beleg-Schritt).
  3. Portal-Toggle-UI: bewusst nicht angefasst (Risiko-Minimierung), nur Backend/Orchestrator umgestellt.

Teil 6 — Worker #97 (2026-07-24): Cloudflare Workers AI + Kling + AI6-Korrektur

1) Cloudflare Workers AI additiv als GRATIS-Tier eingebaut. Key gefunden in Vaultwarden "KI API Keys" -> CLOUDFLARE-WORKERS-AI (Account 9776ea02d0dd34d6e1c81d96b75f478f, Endpoint https://api.cloudflare.com/client/v4/accounts/<ACCOUNT_ID>/ai/run/<model>). 10.000 Neurons/Tag gratis (danach $0.011/1k Neurons), 47+ Modelle (Text/SDXL-Bild/Whisper/ Embeddings). Echter Test-Beleg:

  • Text (@cf/meta/llama-3.1-8b-instruct): HTTP 200, deutsche Antwort erhalten ("Der komplexe Softwaresystem hat alle Funktionen erfolgreich getestet...").
  • Bild (@cf/stabilityai/stable-diffusion-xl-base-1.0): HTTP 200, 1.6 MB PNG erhalten (roter Bauernhof/Feld-Motiv, verifiziert als valides Bild).

In B:\barby\orchestrator\routing_tiers.json eingebaut als:

  • text_prompt_planung Tier 2 (direkt nach Hermes, vor Mammouth-Flat) — Text/Bulk-Aufgaben.
  • bildgenerierung Tier 3 (nach lokal+Shadow, vor Mammouth-Flat) — kleine/schnelle Bilder, NICHT Ersatz fuer lokale SDXL/FLUX-Qualitaet (Neurons-Budget ist knapp: SDXL-Bild kostet mehrere Hundert Neurons/Bild).

Backup vor Aenderung: routing_tiers.json.bak-worker97-20260724-085220. Deploy erfolgte per sauberem Forgejo-Transfer (Chunk-basiertes WinRM-Copy-Paste hat Zeichen korrumpiert -- verworfen, stattdessen Datei über barby/hermes-erkenntnisse/_transfer/ gepusht und von VM302 per Invoke-WebRequest heruntergeladen, danach python -m json.load validiert). Live-Endpoint GET http://100.104.5.57:8197/routing-map liefert die neue Struktur (verifiziert, worker97_nachtrag Feld vorhanden, Video-Kategorie hat jetzt 7 statt 6 Tiers) — Orchestrator liest die Datei live, kein Scheduled-Task-Neustart noetig (Restart-Versuch scheiterte an 502-Gateway-Fehlern des WinRM-Aggregators, war aber nicht erforderlich, da Live-Reload bereits bestaetigt ist).

2) Kling AI als Video-Failover-Option dokumentiert, NICHT verdrahtet. Vaultwarden-Suche nach "kling" ergab keinen Treffer — kein API-Key vorhanden. In routing_tiers.json als neue Stufe 6 (zwischen MiniMax #96 und Qolaba) additiv eingetragen, analog zum MiniMax-Muster: Default AUS, [BAER-SIGNUP]-Hinweis mit konkreten Schritten (Account bei klingai.com bzw. EvoLink-Reseller, API-Key erzeugen, in Vaultwarden "KI API Keys" als KLING-AI eintragen, KLING_API_KEY in main.py-Umgebung hinterlegen). Kein Signup selbst durchgefuehrt.

3) AI6-Regel als ueberholt markiert. barby/memory/keys-consoro-it/TOOL-STORE-KATALOG.md markierte Cloud-Video (MiniMax/Kling/Runway/Luma/Mammouth-Video/Qolaba-Video) durchgehend als "AI6-gesperrt / nicht nutzen". Per Baer-Kurskorrektur 2026-07-24 ist das ueberholt: Cloud-Video ist jetzt als Failover erlaubt (kein Default, aber technisch freigegeben), externe Tools generell immer erlaubt (#95, kein Toggle/Baer-GO mehr). Nur Gemini+Mammouth bleiben PWA-only (REZEPT AI5 bleibt in Kraft). Katalog-Datei um einen Korrektur-Abschnitt ergaenzt (additiv, alte Zeilen nicht geloescht, damit die Historie nachvollziehbar bleibt).

4) [BAER-SIGNUP]-Empfehlungen (nicht selbst angelegt):

  • Cerebras Free-Tier — 1.000.000 Tokens/Tag GRATIS (Llama/Qwen-Modelle, sehr schnelle Inferenz). Baer muesste: Account auf cloud.cerebras.ai anlegen, API-Key erzeugen, Key in Vaultwarden "KI API Keys" als CEREBRAS eintragen (Format wie bestehende Eintraege: KEY + URL https://api.cerebras.ai/v1), danach kann ein Worker es additiv als weiteren Gratis-Tier in text_prompt_planung einbauen (vermutlich zwischen Hermes und Cloudflare Workers AI, je nach Rate-Limit-Vergleich).
  • Featherless.ai — $25/Monat Flatrate, tausende Open-Weight-Modelle (Llama/Qwen/Mistral/ Mixtral-Varianten, auch grosse 70B+/100B+ Modelle ohne eigene Infrastruktur). Baer muesste: Account auf featherless.ai anlegen, Zahlungsmethode hinterlegen (kostenpflichtig, daher zwingend Baer-Entscheidung), API-Key erzeugen, Key in Vaultwarden als FEATHERLESS eintragen (Format: KEY + URL https://api.featherless.ai/v1). Waere danach als Guthaben/Flatrate-Tier fuer Modelle einsetzbar, die weder Hermes noch Cloudflare Workers AI abdecken (z.B. sehr grosse Open-Weight-Modelle fuer Spezialfaelle).

Beide NICHT selbst angelegt (kostenpflichtig bzw. Account-Erstellung = Baer-Entscheidung laut Rollen-Regel).