Auf einen Blick#
| Frage | Antwort |
|---|---|
| Worum geht’s? | Eigene KI-Infrastruktur statt teurem KI-Abo |
| Für wen? | Entwickler, Homelab-Enthusiasten, kleine Teams, DIY-Gurus |
| Was brauche ich? | Entweder Hetzner-GPU-Server ODER IONOS API (AI Model Hub) |
| Zeitaufwand | 2–4 Stunden für das Setup(je nach vorerfahrung) |
| Schwierigkeit | Leicht (Docker-Grundkenntnisse hilfreich) |
Inhalt: So ist dieser Artikel aufgebaut#
- Das Fundament: Was ist Hugging Face und warum OpenSource KI-Modelle?
- Das Problem: Warum KI-Abos nicht die einzige Lösung sind
- Die Lösung: Zwei Wege zur eigenen KI-Infrastruktur
- Die Modelle: Qwen3.5(397B-A17B) vs. Llama 3.3(80B) im direkten Vergleich
- Die Umsetzung: So bauen Sie das System Schritt für Schritt
- Die Kosten: Was kostet das Ganze wirklich? (Eine Beispiel Kalkulation)
- Das Fazit: Welche Variante für wen sinnvoll ist
1. Das Fundament: Was ist Hugging Face?#
Stellen Sie sich Hugging Face als “GitHub für KI-Modelle” vor. Es ist DAS Repository für OpenSource KI-Modelle.
Die Analogie#
| GitHub | Hugging Face |
|---|---|
| Entwickler laden Code hoch | Forscher laden KI-Modelle hoch |
| Open-Source-Projekte | Open-Source-KI-Modelle |
| Issues, Pull Requests | Discussions, Papers |
| Stars, Forks | Likes, Downloads |
Warum ist Hugging Face wichtig?#
Mit Hugging Face haben wir:
- ✅ Offene Modelle: Jeder kann Modelle herunterladen, testen, verbessern
- ✅ Transparenz: Model Cards zeigen Training, Limitationen, Bias
- ✅ Vergleichbarkeit: Leaderboards ranken Modelle nach Performance
- ✅ Innovation: Kleine Teams können mit großen Konzernen konkurrieren
Was ist Hugging Face?#
Gegründet 2016 als Chatbot-Startup, hat sich Hugging Face zu einer kompletten Infrastruktur für Machine Learning entwickelt. Man kann die Plattform als “GitHub für KI” beschreiben – mit entscheidenden Unterschieden:
| Feature | GitHub | Hugging Face |
|---|---|---|
| Primärer Inhalt | Quellcode | KI-Modelle & Datasets |
| Dateitypen | Text-Dateien | Binäre Modell-Weights (GB groß) |
| Versionierung | Git | Git + Git LFS (Large File Storage) |
| Community | Entwickler aller Sprachen | ML-Forscher & Data Scientists |
Die Top-Modelle auf Hugging Face (Stand Juli 2026)#
| Modell | Anbieter | HumanEval (Coding) | Lizenz |
|---|---|---|---|
| Qwen3.5-397B-A17B | Alibaba | 89,7% | Apache 2.0 |
| Qwen3.5-235B-A22B | Alibaba | 86,2% | Apache 2.0 |
| Llama 3.3 70B Instruct | Meta | ~80% | Llama 3.3 License |
| DeepSeek-V2.5 | DeepSeek | ~82% | MIT |
Wichtig für diesen Artikel: Die Modelle auf Hugging Face sind kostenlos herunterladbar. Sie können sie:
- Lokal betreiben (auf eigener Hardware wie Hetzner)
- Via API nutzen (bei Anbietern wie IONOS)
- Selbst fine-tunen (auf Ihre Daten anpassen)
Hugging Face vs. IONOS AI Hub#
Für Ihre Infrastruktur interessant: Während Hugging Face die Modelle bereitstellt, bietet der IONOS AI Hub die Inferenz-Infrastruktur:
| ASPEKT | HUGGING FACE | IONOS AI HUB |
|---|---|---|
| Zweck | Modell-Repository & Community | API-basierte Inferenz |
| Preismodell | Kostenlos + Enterprise | Pay-per-Token |
| Infrastruktur | Self-Hosted oder Inference API | Managed Infrastructure |
| Verfügbare Modelle | 500.000+ | Ausgewählte (Llama, Qwen, etc.) |
Kombinierter Workflow:
- Modell auf Hugging Face entdecken & testen
- Lokal oder auf IONOS API heraussuchen (wenn verfügbar)
- In eigene Anwendungen integrieren
2. Das Problem: Warum nicht einfach ein beliebiges KI-Abo?#
Die meisten Nutzer starten mit ChatGPT Plus oder Claude Pro um nur zwei Beispiele zu nennen. Das ist bequem, hat aber drei große Nachteile:
Problem 1: Kosten bei intensiver Nutzung#
| Nutzung | ChatGPT Plus | Eigene Infrastruktur |
|---|---|---|
| Gelegenheitsnutzer | €20/Monat | €10–20/Monat (IONOS) |
| Power-User (täglich) | €20/Monat + Limits | €10–50/Monat (nach Tokens) |
| API-Automatisierung | ❌ Nicht erlaubt | ✅ Voll unterstützt |
| 10M+ Tokens/Monat | ❌ Nicht möglich | ✅ ~€200/Monat |
Fazit: Ab ~500.000 Tokens/Monat wird die eigene Infrastruktur günstiger.
Problem 2: Datenfluss und Datenschutz#
- ChatGPT: Daten fließen durch US-Server (OpenAI)
- Claude: Daten fließen durch US-Server (Anthropic)
- Eigene Infrastruktur: Daten bleiben in DE (Hetzner/IONOS)
Für Unternehmen mit DSGVO-Anforderungen ist das ein K.O.-Kriterium.
Problem 3: Keine Automatisierung#
ist für manuelle Nutzung gedacht:
- ❌ Keine API für Skripte
- ❌ Keine Integration in VS Code
- ❌ Keine Automatisierung von Workflows
Die eigene Infrastruktur bietet volle API-Kontrolle.
3. Die Lösung: Zwei Wege zur eigenen KI#
Es gibt zwei Beispielwege, die Modelle von Hugging Face zu nutzen:
┌─────────────────┐
│ Hugging Face │
│ (Modell-Quelle)│
└────────┬────────┘
│
┌────────────────┼────────────────┐
│ │ │
▼ ▼ ▼
┌──────────────┐ ┌──────────────┐ ┌──────────────┐
│ Hetzner │ │ IONOS │ │ Sonstige │
│ (Managed) │ │ (Hybrid) │ │ (z.B. Lokal) │
└──────────────┘ └──────────────┘ └──────────────┘Weg A: Hetzner Dedicated GPU-Server#
Prinzip: Sie mieten einen physischen Server mit GPU und installieren die Modelle selbst.
Analogie: Wie ein eigenes Auto kaufen vs. Taxi fahren.
| Vorteil | Nachteil |
|---|---|
| Volle Kontrolle | Fixkosten (auch bei Nichtnutzung) |
| Keine Token-Limits | Wartung selbst verantwortlich |
| Einmalige Einrichtung | Hardware-Upgrade = Server-Tausch |
| Fine-Tuning möglich | VRAM-Limit pro GPU |
Preise (Stand Juli 2026):
| Modell | GPU | VRAM | Preis/Monat |
|---|---|---|---|
| GEX24 | RTX A4000 | 16 GB | ~€184 |
| GEX34 | RTX A5000 | 24 GB | ~€289 |
| GEX131 | RTX 6000 Blackwell | 96 GB | ~€899 |
Weg B: IONOS AI Model Hub#
Prinzip: IONOS hostet die Modelle, Sie zahlen nur pro genutztem Token.
Analogie: Wie Taxi fahren vs. eigenes Auto.
| Vorteil | Nachteil |
|---|---|
| Keine Wartung | Höhere Kosten bei sehr hoher Nutzung |
| Sofort startklar | Keine eigenen Modelle |
| Skalierbar | Rate-Limits möglich |
| DSGVO-konform (DE-Server) | Modell-Auswahl begrenzt |
Verfügbare Modelle (Stand Juli 2026):
| Modell | Input (pro 1M) | Output (pro 1M) |
|---|---|---|
| Qwen3.5-397B-A17B | 0,60 € | 3,60 € |
| Qwen3.5-9B | 0,10 € | 0,15 € |
| Llama 3.3 70B Instruct | 0,65 € | 0,65 € |
| Llama 3.1 8B Instruct | 0,15 € | 0,15 € |
| Mistral-Nemo 12B | 0,15 € | 0,15 € |
4. Die Modelle: Qwen3.5-397B vs. Llama 3.3 70B#
Jetzt wird’s technisch. Welches Modell sollten Sie nutzen?
HumanEval Benchmark (Python Code Generation)#
Der HumanEval-Benchmark testet, wie gut ein Modell Python-Code aus Beschreibungen generieren kann.
| Modell | HumanEval | MBPP | Kontext-Fenster |
|---|---|---|---|
| Qwen3.5-397B-A17B | 89,7% | 85,4% | 256k Token |
| Qwen3.5-235B-A22B | 86,2% | 82,1% | 256k Token |
| GPT-4o | 84,5% | 80,2% | 128k Token |
| Llama 3.3 70B Instruct | ~80% | ~77% | 128k Token |
| Llama 3.1 70B Instruct | ~76% | ~74% | 128k Token |
Was bedeutet das in der Praxis?#
| Aufgabe | Qwen3.5-397B | Llama 3.3 70B |
|---|---|---|
| Code vervollständigen | ✅ Exzellent | ✅ Gut |
| Komplexe Refactorings | ✅ Sehr gut | ✅ Okay |
| Mehrsprachiger Chat | ✅ Gut | ✅ Exzellent |
| Dokumentation schreiben | ✅ Gut | ✅ Exzellent |
| Lange Kontexte (>100k) | ✅ 256k möglich | ❌ Max 128k |
Die MoE-Architektur von Qwen3.5-397B-A17B#
MoE = Mixture of Experts
- 397B Gesamtparameter (das gesamte “Wissen”)
- Nur 17B aktive Parameter pro Anfrage (die “genutzten” Neuronen)
- Vorteil: Die Performance eines 397B-Modells mit der Geschwindigkeit eines 17B-Modells
Analogie: Ein Unternehmen mit 397 Mitarbeitern, aber nur 17 arbeiten gleichzeitig an Ihrem Projekt.
5. Die Umsetzung: Schritt für Schritt#
Jetzt bauen wir das System. Hier ist die Architektur:
┌─────────────────────────────────────────────────────────────┐
│ Client-Anwendungen │
│ (OpenWebUI, VS Code, Python-Skripte, Custom Apps) │
└──────────────────────┬──────────────────────────────────────┘
│
▼
┌─────────────────────────────────────────────────────────────┐
│ LiteLLM Proxy Server │
│ (Läuft auf Hetzner Server oder lokal im Homelab) │
│ - Einheitliche API (OpenAI-kompatibel) │
│ - Load Balancing zwischen Hetzner & IONOS │
│ - Fallback-Logik, Rate-Limiting, Caching │
└──────────┬───────────────────────────────────┬──────────────┘
│ │
▼ ▼
┌──────────────────────┐ ┌──────────────────────────┐
│ Hetzner GPU-Server │ │ IONOS AI Model Hub │
│ - Ollama / vLLM │ │ - Managed API │
│ - Qwen2.5-32B (Q4) │ │ - Qwen3.5-397B-A17B │
│ - Keine Token-Kosten│ │ - Llama 3.3 70B │
│ │ │ - Pay-per-Token │
└──────────────────────┘ └──────────────────────────┘Schritt 1: LiteLLM Proxy einrichten#
LiteLLM ist der “Verkehrspolizist” – es leitet Anfragen an die richtigen Modelle weiter.
Installation (Docker):
docker run -d \
-p 4000:4000 \
-v ./litellm-config.yaml:/app/config.yaml \
ghcr.io/berriai/litellm:main-latest \
--config /app/config.yamlKonfiguration (litellm-config.yaml):
model_list:
# Lokales Modell auf Hetzner-Server (Ollama)
- model_name: "qwen-local"
litellm_params:
model: "ollama/qwen2.5-32b"
api_base: "http://hetzner-server:11434"
# IONOS Modell als Fallback
- model_name: "qwen-ionos"
litellm_params:
model: "openai/qwen3.5-397b-a17b"
api_base: "https://api.ionos.ai/v1"
api_key: "ionos-api-key-xxx"
# Fallback-Logik: Erst lokal, bei Fehler zu IONOS
router_settings:
fallbacks: [{"qwen-local": ["qwen-ionos"]}]
timeout: 30Schritt 2: OpenWebUI als Frontend#
OpenWebUI ist die “ChatGPT-Oberfläche” für Ihre eigene Infrastruktur.
Installation:
docker run -d \
-p 3000:8080 \
-e OPENAI_API_BASE="http://localhost:4000" \
-e OPENAI_API_KEY="sk-123456" \
ghcr.io/open-webui/open-webui:mainFunktionen:
- Multi-User mit eigenen Quotas
- RAG (Dokumente hochladen, KI fragt Kontext ab)
- Plugins (Websuche, Code-Interpreter, Bild-Generierung)
Schritt 3: Integration in Visual Studio Code#
Für die Entwicklung im IDE bietet sich die Continue-Extension an.
Setup in VS Code (settings.json):
{
"continue.apiBase": "http://localhost:4000",
"continue.apiKey": "sk-123456",
"continue.model": "qwen-local"
}Anwendungsfälle:
- Code-Completion während des Tippens
- Chat im Editor (“Erkläre diese Funktion”)
- Debug-Hilfe (KI analysiert Stack-Traces)
- Refactoring-Vorschläge
6. Die Kosten: Was kostet das wirklich?#
Jetzt die Frage, die alle interessiert: Was kostet der Spaß?
Szenario 1: Gelegenheitsnutzer (~100k Tokens/Tag)#
| Anbieter | Kosten/Monat |
|---|---|
| Hetzner GEX24 | €184 |
| IONOS (Qwen3.5-397B) | ~€4,50 |
| IONOS (Llama 3.3 70B) | ~€2,00 |
| Sieger | 🏆 IONOS |
Szenario 2: Power-User (~500k Tokens/Tag)#
| Anbieter | Kosten/Monat |
|---|---|
| Hetzner GEX24 | €184 |
| IONOS (Qwen3.5-397B) | ~€23 |
| IONOS (Llama 3.3 70B) | ~€10 |
| Sieger | 🏆 IONOS |
Szenario 3: Extrem-Nutzer (~10M Tokens/Tag)#
| Anbieter | Kosten/Monat |
|---|---|
| Hetzner GEX24 | €184 |
| IONOS (Qwen3.5-397B) | ~€450 |
| IONOS (Llama 3.3 70B) | ~€200 |
| Sieger | 🏆 Hetzner |
Die Faustformel#
Bis ~5M Tokens/Monat → IONOS günstiger
Ab ~5M Tokens/Monat → Hetzner günstiger
Fine-Tuning benötigt → Hetzner (IONOS kann das nicht)
Qwen3.5-397B benötigt → Beides möglich!7. Das Fazit: Welche Variante für wen?#
Für Einsteiger: IONOS AI Model Hub#
Warum:
- Keine Wartung
- Sofort startklar
- Qwen3.5-397B verfügbar (bestes Coding-Modell)
- Kosten: ~€10–23/Monat bei normaler Nutzung
Setup-Zeit: 30 Minuten
Für Fortgeschrittene: Hetzner GEX24 + Ollama#
Warum:
- Volle Kontrolle
- Keine Token-Limits
- Fine-Tuning möglich
- Kosten: ~€184/Monat (fix)
Setup-Zeit: 2–4 Stunden
Für Profis: Hybrid-Lösung#
Warum:
- Basis-Last lokal (Hetzner)
- Spitzen-Last via API (IONOS)
- Bestes Modell (Qwen3.5-397B) auf beiden Wegen
- LiteLLM als intelligente Schaltstelle
Setup-Zeit: 4–6 Stunden
Zusammenfassung: Der komplette Weg#
1. Hugging Face
└── Modell auswählen (z.B. Qwen3.5-397B-A17B)
2. Infrastruktur wählen
├── Hetzner (selbst hosten)
└── IONOS (managed API)
3. LiteLLM Proxy
└── Einheitliche API für beide Wege
4. Frontend
├── OpenWebUI (Chat-Oberfläche)
└── VS Code Continue (Development)
5. Loslegen!Weiterführende Links#
| Ressource | Link |
|---|---|
| Hugging Face | https://huggingface.co |
| Hetzner GPU-Server | https://www.hetzner.com/dedicated-rootserver/matrix-gpu/ |
| IONOS AI Model Hub | https://cloud.ionos.de/managed/ai-model-hub |
| LiteLLM Doku | https://docs.litellm.ai/ |
| OpenWebUI | https://github.com/open-webui/open-webui |
| Qwen3.5 Benchmarks | https://qwen-image-2512.com/blog/qwen3.5-397b-a17b-complete-guide-en |
| HumanEval Leaderboard | https://pricepertoken.com/leaderboards/benchmark/humaneval |
Rechtlicher Hinweis#
Dieser Artikel stellt eine technische Analyse dar und ersetzt keine Rechts- oder Kaufberatung. Alle Markennamen sind Eigentum ihrer Inhaber. Preise und Verfügbarkeit ohne Gewähr. Kontakt: blog@bit-wolke.de
Hinweis: Preise, Modellverfügbarkeit und Benchmark-Scores Stand Juli 2026. Bitte prüfen Sie die aktuellen Konditionen direkt bei den Anbietern.