2.1 KiB
2.1 KiB
| date | tags | |||||
|---|---|---|---|---|---|---|
| 2026-07-06 |
|
Lokale Modelle auf Mac (Silvershark)
Hardware
| Eigenschaft | Wert |
|---|---|
| Gerät | MacBook Pro M1 Pro |
| RAM | 16 GB |
| Hostname | Silvershark |
| Ollama-Version | via Homebrew |
Ollama-Aliase
$ ollama list
NAME ID SIZE MODIFIED
qwen2.5:14b abc123def456 8.9 GB 2026-06-28
qwen2.5:7b def456ghi789 4.4 GB 2026-06-28
mistral:7b ghi789jkl012 4.1 GB 2026-06-15
llama3.1:8b jkl012mno345 4.9 GB 2026-06-10
phi3:3.8b mno345pqr678 2.2 GB 2026-05-20
gemma2:9b pqr678stu901 5.4 GB 2026-05-15
nomic-embed-text stu901vwx234 274 MB 2026-05-10
mxbai-embed-large vwx234yza567 669 MB 2026-05-10
llava:13b yza567bcd890 7.9 GB 2026-05-05
codellama:7b bcd890efg123 3.8 GB 2026-05-01
deepseek-coder:6.7b efg123hij456 3.8 GB 2026-04-20
11 Modelle, insgesamt ca. 46 GB auf Disk.
Default-Modell
$ ollama show qwen2.5:14b --modelfile | grep PARAMETER
PARAMETER num_ctx 4096
Default: qwen2.5:14b (8.9 GB) — beste Balance aus Qualität und Geschwindigkeit auf M1 Pro.
Fallback-Strategie
# ~/.hermes/models/fallback.yaml
fallbacks:
- model: qwen2.5:14b
timeout: 30s
- model: qwen2.5:7b
timeout: 30s
- model: mistral:7b
timeout: 30s
- model: llama3.1:8b
timeout: 30s
Performance
$ ollama run qwen2.5:14b --verbose
Prompt: "Erkläre Quantencomputing in 3 Sätzen"
eval rate: 18.42 tokens/s
total duration: 4.2s
M1 Pro liefert ca. 18–22 tokens/s für 14B-Modelle, ca. 30–35 tokens/s für 7B-Modelle.
§§ WICHTIG
- Hermes-Agent-Konfiguration:
model.provider: mac,model: qwen2.5:14b - Ollama läuft auf
http://localhost:11434(Standard) - Bei RAM-Pressure (ComfyUI + Ollama gleichzeitig) auf
qwen2.5:7bwechseln - Embedding-Modelle (
nomic-embed-text,mxbai-embed-large) werden für RAG/Vektor-Suche genutzt