16 KiB
Externe-Tools-Katalog (#94) + Routingkarte (#61) + #95-Nachtrag
Stand: 2026-07-24. Quellen: anleitung.md (docs.consoro.it, X-API-Key sk-registry-…), VM201
gpu1-status/app.py (#53-Manifest, live abgefragt), barby/hermes-erkenntnisse (Forgejo,
VRAM-Fix + Routingkarte-Vorarbeit vom 2026-07-24), barby/fleet-shared (model-routing +
ask-agy Skills), Live-Web-Check (MiniMax Hailuo Pricing). Prinzip laut Bär-Kurskorrektur
2026-07-24: „LOKAL mit POWER von EXTERN" — lokal zuerst, extern ist jetzt immer erlaubt
(#95, kein Toggle/Bär-GO mehr), aber je Kategorie zwingend günstig-vor-teuer mit
Flatrate-Bevorzugung (Mammouth, Hermes, Antigravity ganz vorne).
Teil 1 — Werkzeug-Katalog (was kann was, wie erreichbar, was kostet es)
Text / Chat / Planung / Prompt-Aufbereitung
| Tool | Zugriffsweg | Modelle/Umfang | Kosten | Aktiv? |
|---|---|---|---|---|
| Hermes / Hub-LiteLLM | Hub-MCP (ask_go_ki_hermes), keys.consoro.it:4000 |
Default-Chain MiniMax-M2 → Ionos-Llama-405B → Cloudflare-Llama-70B, dynamisches Routing nach Task-Typ | quasi 0 (Flat/Hub-eigen) | ✅ |
| Mammouth (Chat) | PWA (gpu-pc, CDP-Bridge), NIE API | 40+ Modelle: Claude, GPT, Gemini, DeepSeek, Qwen, GLM, MiniMax, Perplexity | ~10€/Monat Flat (alles inkl.) | ✅ REAKTIVIERT |
| Antigravity / ask-agy | Hub-MCP bzw. ask-agy-Wrapper (Go-Binary, ~/.local/bin/agy) |
Google Gemini Code Assist Pro/Personal — lange Kontexte bis 1M Token, Google-Search-grounded, Multi-Tool-Agent-Loops | 0 (Google-Sub-Flat, kein Pay-per-Token) | ✅ (jump, Fleet-Sync verteilt Skill nicht Binary) |
| Qolaba (Text/Chat) | PWA (gpu-pc) oder keys.consoro.it/services/qolaba/* |
60+ Modelle inkl. Sonar/Perplexity | Credits-Reserve (Fair-Use) | ✅ LIVE |
| DeepSeek | API (deepseek:chat/deepseek:reasoner) über Hub-LiteLLM |
Chat + Reasoning | teuerstes laufendes Abo = quasi-Flat | ✅ |
| IONOS LLM | offizielle API (openai.inference.de-txl.ionos.com) über LiteLLM-Gateway |
llama-3.1-8b/405b, mistral, qwen3-coder-next | günstig, Guthaben-basiert | ✅ |
| Gemini (Chat/Lyrics) | PWA (Chrome-CDP-Bridge, :4003/gemini/chat), NIE API |
Gemini 3.x Pro/Flash, Ultra-Abo (Google One) | 0 extra (Workspace/Ultra-Sub) | ✅ REAKTIVIERT |
| OpenRouter | API über Hub-LiteLLM | claude-sonnet-4, claude-opus-4.6 | teuer, Pay-per-Token | ✅ (nur letzter Ausweg) |
| Perplexity | API/Bridge | sonar, sonar-pro, sonar-reasoning-pro, sonar-deep-research | Abo-gedeckt | ✅ |
Bild
| Tool | Zugriffsweg | Modelle | Kosten | Aktiv? |
|---|---|---|---|---|
| SDXL/FLUX lokal | ComfyUI (A40, VM302 :8188) | eigene Checkpoints/LoRAs | 0 | ✅ |
| Mammouth (Bild) | PWA, Mammouth-PWA/image |
FLUX Pro/Dev, DALL·E 3, Grok-Imagine, Recraft, SD, Leonardo Phoenix | im Flat-Abo inkl. | ✅ |
| Gemini Nano-Banana | PWA-Bridge | schnell, ~2s, low-quality | 0 extra | ✅ |
| IONOS FLUX.1-schnell | offizielle API | black-forest-labs/FLUX.1-schnell, 1024x1024 |
~0,01–0,015€/Bild | ✅ |
| Qolaba (Bild) | PWA | FLUX u.a. | ~10 Credits/Bild (~$0,10) | ✅ |
Video
| Tool | Zugriffsweg | Modelle | Kosten | Aktiv? |
|---|---|---|---|---|
| Wan2.2 lokal (A40) | ComfyUI, GGUF Q5_K_M + Lightning-4step-LoRA | I2V/T2V, primäres Werkzeug | 0 | ✅ Primär |
| Shadow / Monster | Burst-Nodes (siehe Hardware-Docs) | gleiche Wan2.2-Pipeline, entlastet A40 | 0 (eigene HW) | ✅ als Overflow-Ziel |
| Mammouth (Video) | PWA, Mammouth-PWA/video |
Veo 3.1 Lite/Full, Sora 2/1, Kling 2.5/2.0, Runway Gen-3 | im Flat-Abo inkl. (~10€/Mo) | ✅ |
| MiniMax Hailuo (Video) | offizielle API (kein PWA-Zwang) | Text/Image-to-Video, 768p/512p | ~$0,017–0,045/s (API pay-as-you-go); Abo-Stufen $9,99–$199,99/Mo | ⚠️ geprüft, NICHT verdrahtet — siehe Hybrid-Empfehlung unten |
| Qolaba (Video) | PWA | Veo 3.1 (~156 Cr/60s≈$1,56), Kling 3.0 (~100 Cr≈$1,00), Sora | Credits-Reserve | ✅ LIVE |
| Poyo.ai | offizielle API (Aggregator) | Veo, Sora, Kling, MiniMax | pay-as-you-go, $0,10–0,80/Szene | ⚠️ teils "Down"/seasonal laut Anleitung |
| Fal.ai | offizielle API | Kling 3.0 (beste Konsistenz laut Doku) | pay-per-use | ✅ vorhanden |
MiniMax-Video-Check (Nachtrag-Auftrag): MiniMax bietet über Hailuo AI echte Text-/Image-to-Video-Generierung
an, offizielle API (nicht PWA-pflichtig wie Gemini/Mammouth), Pay-as-you-go ab ca. $0,017/s (512p) bzw.
$0,045/s (768p) laut aktueller Recherche (2026). Für die Content-Pipeline als Hybrid-Überlauf geeignet:
extern per API rendern lassen, danach lokal auf VM302/A40 nachbearbeiten (Restore/Mux/Interpolate/Lipsync
bleiben lokal — nur das Rohrendering wandert extern). Aktuell nicht in routing_tiers.json scharf
geschaltet, sondern als Video-Tier-5 (nach Mammouth-Flat, vor Qolaba-Guthaben) dokumentiert — Aktivierung
wäre ein separater, kleiner API-Anbindungsschritt (Key aus credentials.json[minimax_api_key], dieselbe
Route wie MiniMax-TTS t2a_v2, nur anderer Endpoint).
Lipsync / Upscale / Restore
| Tool | Zugriffsweg | Kosten | Aktiv? |
|---|---|---|---|
| MuseTalk / GFPGAN / RealESRGAN lokal | A40 (VM302), eigene venv | 0 | ✅ (#17-Pipeline) |
| Shadow | Burst-Node, gleiche Pipeline | 0 | ✅ als Overflow |
| Externer Ersatz | — | — | ❌ aktuell keiner etabliert (Folgeschritt) |
TTS (deutsche Stimme)
| Tool | Zugriffsweg | Stimmen | Kosten | Aktiv? |
|---|---|---|---|---|
| Azure Speech Neural (HD) | offizielle API, credentials.json[azure_speech_key], Region eastus2 |
10 dt. Stimmen: Katja, Conrad, Amala, Killian, Seraphina(Multi), Florian(Multi) | 0 — $2600 Sponsorship-Guthaben (bis 2027), TRACKEN | ✅ Primär (Akzentfreiheit) |
| MiniMax speech-02-hd | offizielle API, t2a_v2 |
voice_id female-shaonv u.a. |
Guthaben pay-per-use | ✅ |
| Mammouth (Audio/TTS) | PWA-Bridge | Azure TTS/OpenAI TTS/Google TTS/Play.ht — alle über PWA erreichbar | im Flat-Abo inkl. | ✅ Fallback wenn Direkt-Azure down |
| edge-tts | kostenlos, gleiche Neural-Stimmen ohne Sponsorship-Konto | Seraphina, Conrad, Katja, Amala | 0 | ✅ Notfall-Fallback |
| XTTS v2 lokal | CPU (VM302) | eigene Stimme-Clones | 0 | ✅ nur Offline-Fallback |
| Piper lokal | CPU | Basis-Stimmen | 0 | ✅ letzter Fallback |
Musik
| Tool | Zugriffsweg | Kosten | Aktiv? |
|---|---|---|---|
| ACE-Step lokal | Shadow, M:\ACE-Step |
0 | ✅ |
| Mammouth → Suno v5.5/v4.5 | PWA-Bridge, Mammouth-PWA/music |
im Flat-Abo inkl. | ✅ |
| Suno direkt | PWA (gpu-pc) | eigenes Abo | ✅ Fallback |
Websuche
| Tool | Zugriffsweg | Kosten | Aktiv? |
|---|---|---|---|
| Antigravity/ask-agy | Google-Search-grounded, Flat | 0 | ✅ |
| SearXNG | selbst gehostet, nas2 :8888 |
0 | ✅ |
| Perplexity sonar/sonar-pro | Abo/Bridge | Abo-gedeckt | ✅ |
| web_search (Claude-nativ) | Tool-eigen | 0 | ✅ |
Teil 2 — Routingkarte (#61), lokal+extern, lauffähige Config
Die vollständige, maschinenlesbare Fassung liegt in
B:\barby\orchestrator\routing_tiers.json und ist live über den Orchestrator abrufbar:
GET http://127.0.0.1:8197/routing-map (verifiziert, HTTP 200, 2026-07-24 08:31).
Grundregel je Kategorie: lokal-first → Mammouth-Flat/Hermes/Antigravity (günstig/Flat) →
Guthaben-Dienste (Azure-Sponsorship/MiniMax/IONOS, tracken) → teure Einzel-APIs (OpenRouter,
nur letzter Ausweg). Overflow automatisch bei Überlast-Signal (A40-Guard, VM201:9090),
kein Bär-GO nötig (#95). Ausnahme TTS: dort ist die Reihenfolge umgekehrt (extern zuerst,
wegen Akzentfreiheit — Bär-Kurskorrektur 2026-07-24).
| Kategorie | Tier 1 (lokal/quasi-frei) | Tier 2 (Flatrate) | Tier 3 (Guthaben) | Tier 4 (teuer/letzter Ausweg) |
|---|---|---|---|---|
| Video | A40 → Shadow → Monster | Mammouth-PWA/veo|kling | MiniMax Hailuo (Hybrid, ungeprüft aktiviert) → Qolaba | Poyo/Fal (Einzelfall) |
| Bildgen | SDXL/FLUX A40/Shadow | Mammouth-PWA/image, Gemini Nano-Banana | IONOS FLUX.1-schnell, Qolaba | — |
| Lipsync/Upscale | A40/Shadow (MuseTalk/GFPGAN/RealESRGAN) | — | — | kein externer Ersatz etabliert |
| TTS-Deutsch | (nur Offline-Fallback: XTTS/Piper) | Mammouth-PWA/audio | Azure Speech (primär, Sponsorship), MiniMax t2a_v2 | edge-tts (kostenlos, Notfall) |
| Musik | ACE-Step (Shadow) | Mammouth-PWA/music → Suno | — | — |
| Text/Prompt | Hermes/Hub-LiteLLM | Mammouth-Chat, Antigravity/ask-agy | Qolaba-Text, DeepSeek(Abo), IONOS-LLM | OpenRouter (nur letzter Ausweg) |
| Websuche | SearXNG | Antigravity/ask-agy | Perplexity | web_search-Tool |
Teil 3 — #95: Extern-Toggle abgeschafft (Beleg)
Vorher: GET http://100.114.24.89:9090/api/external-tools → {"enabled":false,...}
(Stand 2026-07-23 21:40, portal-admin).
Aktion 1 (Live-Flip, sofort wirksam): POST /api/external-tools/toggle →
{"enabled":true,"changed_by":"portal-admin","changed_at":"2026-07-24T08:12:52"} — verifiziert
per erneutem GET.
Aktion 2 (Code-Fix, dauerhaft, additiv/reversibel): B:\barby\orchestrator\main.py,
Funktion external_pool_enabled() gibt jetzt hart True zurück — die alte
Live-Toggle-Abfrage bleibt als Kommentarblock im Code stehen (Rückweg ohne Recherche möglich).
Backup: main.py.bak-toggleremoved-20260724-081307. py_compile grün. Orchestrator
(Scheduled Task BarbyOrchestrator, Port 8197) sauber neu gestartet — verifiziert: der
einzige wartende Queue-Eintrag (bc825ebe8d) war bereits vor dem Neustart verwaist (Timestamp
2026-07-24 00:23, älter als der zuvor laufende Prozess seit 02:21) — kein aktiver Job
unterbrochen. GET /pool-status zeigt jetzt "toggle_status": "ABGESCHAFFT seit #95".
Portal-Toggle-UI (cp.go-ki.eu): UI-Schalter selbst nicht entfernt (bewusst, um das Risiko
eines Portal-Deploys laut portal-cp-go-ki-Skill klein zu halten) — zeigt jetzt aber
dauerhaft "AN", weil die zugrundeliegende external_tools.json auf VM201 auf enabled:true
gepinnt ist UND der Orchestrator sie seit dem Code-Fix ohnehin nicht mehr auswertet. Empfehlung
Folgeschritt: Toggle-Element im Portal-HTML in einem eigenen, separat getesteten Schritt durch
einen reinen Status-Chip ersetzen.
Teil 4 — Neue Tools gefunden (Nachtrag-Auftrag, GitLab/Obsidian/Web-Suche)
- Antigravity/ask-agy (Google Gemini CLI, Go-Binary v1.0.14) — in
barby/fleet-shared(hermes-skills/devops/ask-agy/SKILL.md) gefunden, jetzt in Katalog+Routingkarte aufgenommen (Text/Prompt Tier 2, Websuche Tier 2). - MiniMax Hailuo Video — per Web-Recherche verifiziert (echte API, kein PWA-Zwang), als Video-Hybrid-Tier dokumentiert, nicht aktiv verdrahtet (ehrlich markiert).
- DeepSeek — bereits in
model-routing-Skill (barby/fleet-shared) als Coding/Reasoning- Fallback gelistet, hier zusätzlich als "teuerstes-Abo=quasi-Flat" in Text-Tier 3 aufgenommen. - SearXNG (
nas2:8888) — aus Anleitung + Fleet-Shared-Skill bestätigt, als Websuche-Tier-1-Ergänzung neben Antigravity aufgenommen. - Obsidian-Vault dieser Session nicht erreichbar (kein REST-API-Port lokal offen, kein
Netzwerkpfad zu
nc.consoro.itvon diesem Host aus) — ehrlich markiert, keine Recherche dort möglich in diesem Schritt. Forgejo (barby/hermes-erkenntnisse,barby/fleet-shared,barby/aufgaben) war die tragfähige Quelle für die Tool-Recherche.
Teil 5 — Offene Punkte (ehrlich)
- Shadow/Monster-Feindetails für Video-Routing: Rollen als Burst-Nodes bestätigt
(
barby/hermes-erkenntnisse/hardware/monster-gpu-spec-2026-07-23.md,burst-nodes-65-2026-07-23.md), aber die exakte Schritt→Knoten-Zuordnung für die #17-Pipeline (welches pipe_0x-Skript auf welchem Knoten) wurde in dieser Session nicht bis ins letzte Detail verifiziert — Empfehlung: Folgeschritt mit Shadow/Monster-SSH-Zugriff. - MiniMax-Video-Anbindung: dokumentiert, nicht implementiert (kein ungetesteter Produktiv-Eingriff ohne eigenen Beleg-Schritt).
- Portal-Toggle-UI: bewusst nicht angefasst (Risiko-Minimierung), nur Backend/Orchestrator umgestellt.
Teil 6 — Worker #97 (2026-07-24): Cloudflare Workers AI + Kling + AI6-Korrektur
1) Cloudflare Workers AI additiv als GRATIS-Tier eingebaut. Key gefunden in Vaultwarden
"KI API Keys" -> CLOUDFLARE-WORKERS-AI (Account 9776ea02d0dd34d6e1c81d96b75f478f,
Endpoint https://api.cloudflare.com/client/v4/accounts/<ACCOUNT_ID>/ai/run/<model>).
10.000 Neurons/Tag gratis (danach $0.011/1k Neurons), 47+ Modelle (Text/SDXL-Bild/Whisper/
Embeddings). Echter Test-Beleg:
- Text (
@cf/meta/llama-3.1-8b-instruct): HTTP 200, deutsche Antwort erhalten ("Der komplexe Softwaresystem hat alle Funktionen erfolgreich getestet..."). - Bild (
@cf/stabilityai/stable-diffusion-xl-base-1.0): HTTP 200, 1.6 MB PNG erhalten (roter Bauernhof/Feld-Motiv, verifiziert als valides Bild).
In B:\barby\orchestrator\routing_tiers.json eingebaut als:
text_prompt_planungTier 2 (direkt nach Hermes, vor Mammouth-Flat) — Text/Bulk-Aufgaben.bildgenerierungTier 3 (nach lokal+Shadow, vor Mammouth-Flat) — kleine/schnelle Bilder, NICHT Ersatz fuer lokale SDXL/FLUX-Qualitaet (Neurons-Budget ist knapp: SDXL-Bild kostet mehrere Hundert Neurons/Bild).
Backup vor Aenderung: routing_tiers.json.bak-worker97-20260724-085220. Deploy erfolgte per
sauberem Forgejo-Transfer (Chunk-basiertes WinRM-Copy-Paste hat Zeichen korrumpiert -- verworfen,
stattdessen Datei über barby/hermes-erkenntnisse/_transfer/ gepusht und von VM302 per
Invoke-WebRequest heruntergeladen, danach python -m json.load validiert). Live-Endpoint
GET http://100.104.5.57:8197/routing-map liefert die neue Struktur (verifiziert, worker97_nachtrag
Feld vorhanden, Video-Kategorie hat jetzt 7 statt 6 Tiers) — Orchestrator liest die Datei live,
kein Scheduled-Task-Neustart noetig (Restart-Versuch scheiterte an 502-Gateway-Fehlern des
WinRM-Aggregators, war aber nicht erforderlich, da Live-Reload bereits bestaetigt ist).
2) Kling AI als Video-Failover-Option dokumentiert, NICHT verdrahtet. Vaultwarden-Suche
nach "kling" ergab keinen Treffer — kein API-Key vorhanden. In routing_tiers.json als neue
Stufe 6 (zwischen MiniMax #96 und Qolaba) additiv eingetragen, analog zum MiniMax-Muster:
Default AUS, [BAER-SIGNUP]-Hinweis mit konkreten Schritten (Account bei klingai.com bzw.
EvoLink-Reseller, API-Key erzeugen, in Vaultwarden "KI API Keys" als KLING-AI eintragen,
KLING_API_KEY in main.py-Umgebung hinterlegen). Kein Signup selbst durchgefuehrt.
3) AI6-Regel als ueberholt markiert. barby/memory/keys-consoro-it/TOOL-STORE-KATALOG.md
markierte Cloud-Video (MiniMax/Kling/Runway/Luma/Mammouth-Video/Qolaba-Video) durchgehend als
"AI6-gesperrt / nicht nutzen". Per Baer-Kurskorrektur 2026-07-24 ist das ueberholt: Cloud-Video
ist jetzt als Failover erlaubt (kein Default, aber technisch freigegeben), externe Tools
generell immer erlaubt (#95, kein Toggle/Baer-GO mehr). Nur Gemini+Mammouth bleiben PWA-only
(REZEPT AI5 bleibt in Kraft). Katalog-Datei um einen Korrektur-Abschnitt ergaenzt (additiv, alte
Zeilen nicht geloescht, damit die Historie nachvollziehbar bleibt).
4) [BAER-SIGNUP]-Empfehlungen (nicht selbst angelegt):
- Cerebras Free-Tier — 1.000.000 Tokens/Tag GRATIS (Llama/Qwen-Modelle, sehr schnelle
Inferenz). Baer muesste: Account auf
cloud.cerebras.aianlegen, API-Key erzeugen, Key in Vaultwarden "KI API Keys" alsCEREBRASeintragen (Format wie bestehende Eintraege: KEY + URLhttps://api.cerebras.ai/v1), danach kann ein Worker es additiv als weiteren Gratis-Tier intext_prompt_planungeinbauen (vermutlich zwischen Hermes und Cloudflare Workers AI, je nach Rate-Limit-Vergleich). - Featherless.ai — $25/Monat Flatrate, tausende Open-Weight-Modelle (Llama/Qwen/Mistral/
Mixtral-Varianten, auch grosse 70B+/100B+ Modelle ohne eigene Infrastruktur). Baer muesste:
Account auf
featherless.aianlegen, Zahlungsmethode hinterlegen (kostenpflichtig, daher zwingend Baer-Entscheidung), API-Key erzeugen, Key in Vaultwarden alsFEATHERLESSeintragen (Format: KEY + URLhttps://api.featherless.ai/v1). Waere danach als Guthaben/Flatrate-Tier fuer Modelle einsetzbar, die weder Hermes noch Cloudflare Workers AI abdecken (z.B. sehr grosse Open-Weight-Modelle fuer Spezialfaelle).
Beide NICHT selbst angelegt (kostenpflichtig bzw. Account-Erstellung = Baer-Entscheidung laut Rollen-Regel).