Zum Hauptinhalt springen
  1. Posts/

KI-Infrastruktur jenseits von Abos: Hetzner GPU-Server vs. IONOS AI Model Hub

·1566 Wörter·8 min
Inhaltsverzeichnis

Auf einen Blick
#

FrageAntwort
Worum geht’s?Eigene KI-Infrastruktur statt teurem KI-Abo
Für wen?Entwickler, Homelab-Enthusiasten, kleine Teams, DIY-Gurus
Was brauche ich?Entweder Hetzner-GPU-Server ODER IONOS API (AI Model Hub)
Zeitaufwand2–4 Stunden für das Setup(je nach vorerfahrung)
SchwierigkeitLeicht (Docker-Grundkenntnisse hilfreich)

Inhalt: So ist dieser Artikel aufgebaut
#

  1. Das Fundament: Was ist Hugging Face und warum OpenSource KI-Modelle?
  2. Das Problem: Warum KI-Abos nicht die einzige Lösung sind
  3. Die Lösung: Zwei Wege zur eigenen KI-Infrastruktur
  4. Die Modelle: Qwen3.5(397B-A17B) vs. Llama 3.3(80B) im direkten Vergleich
  5. Die Umsetzung: So bauen Sie das System Schritt für Schritt
  6. Die Kosten: Was kostet das Ganze wirklich? (Eine Beispiel Kalkulation)
  7. Das Fazit: Welche Variante für wen sinnvoll ist

1. Das Fundament: Was ist Hugging Face?
#

Stellen Sie sich Hugging Face als “GitHub für KI-Modelle” vor. Es ist DAS Repository für OpenSource KI-Modelle.

Die Analogie
#

GitHubHugging Face
Entwickler laden Code hochForscher laden KI-Modelle hoch
Open-Source-ProjekteOpen-Source-KI-Modelle
Issues, Pull RequestsDiscussions, Papers
Stars, ForksLikes, Downloads

Warum ist Hugging Face wichtig?
#

Mit Hugging Face haben wir:

  • Offene Modelle: Jeder kann Modelle herunterladen, testen, verbessern
  • Transparenz: Model Cards zeigen Training, Limitationen, Bias
  • Vergleichbarkeit: Leaderboards ranken Modelle nach Performance
  • Innovation: Kleine Teams können mit großen Konzernen konkurrieren

Was ist Hugging Face?
#

Gegründet 2016 als Chatbot-Startup, hat sich Hugging Face zu einer kompletten Infrastruktur für Machine Learning entwickelt. Man kann die Plattform als “GitHub für KI” beschreiben – mit entscheidenden Unterschieden:

FeatureGitHubHugging Face
Primärer InhaltQuellcodeKI-Modelle & Datasets
DateitypenText-DateienBinäre Modell-Weights (GB groß)
VersionierungGitGit + Git LFS (Large File Storage)
CommunityEntwickler aller SprachenML-Forscher & Data Scientists

Die Top-Modelle auf Hugging Face (Stand Juli 2026)
#

ModellAnbieterHumanEval (Coding)Lizenz
Qwen3.5-397B-A17BAlibaba89,7%Apache 2.0
Qwen3.5-235B-A22BAlibaba86,2%Apache 2.0
Llama 3.3 70B InstructMeta~80%Llama 3.3 License
DeepSeek-V2.5DeepSeek~82%MIT

Wichtig für diesen Artikel: Die Modelle auf Hugging Face sind kostenlos herunterladbar. Sie können sie:

  • Lokal betreiben (auf eigener Hardware wie Hetzner)
  • Via API nutzen (bei Anbietern wie IONOS)
  • Selbst fine-tunen (auf Ihre Daten anpassen)

Hugging Face vs. IONOS AI Hub
#

Für Ihre Infrastruktur interessant: Während Hugging Face die Modelle bereitstellt, bietet der IONOS AI Hub die Inferenz-Infrastruktur:

ASPEKTHUGGING FACEIONOS AI HUB
ZweckModell-Repository & CommunityAPI-basierte Inferenz
PreismodellKostenlos + EnterprisePay-per-Token
InfrastrukturSelf-Hosted oder Inference APIManaged Infrastructure
Verfügbare Modelle500.000+Ausgewählte (Llama, Qwen, etc.)

Kombinierter Workflow:

  1. Modell auf Hugging Face entdecken & testen
  2. Lokal oder auf IONOS API heraussuchen (wenn verfügbar)
  3. In eigene Anwendungen integrieren

2. Das Problem: Warum nicht einfach ein beliebiges KI-Abo?
#

Die meisten Nutzer starten mit ChatGPT Plus oder Claude Pro um nur zwei Beispiele zu nennen. Das ist bequem, hat aber drei große Nachteile:

Problem 1: Kosten bei intensiver Nutzung
#

NutzungChatGPT PlusEigene Infrastruktur
Gelegenheitsnutzer€20/Monat€10–20/Monat (IONOS)
Power-User (täglich)€20/Monat + Limits€10–50/Monat (nach Tokens)
API-Automatisierung❌ Nicht erlaubt✅ Voll unterstützt
10M+ Tokens/Monat❌ Nicht möglich✅ ~€200/Monat

Fazit: Ab ~500.000 Tokens/Monat wird die eigene Infrastruktur günstiger.

Problem 2: Datenfluss und Datenschutz
#

  • ChatGPT: Daten fließen durch US-Server (OpenAI)
  • Claude: Daten fließen durch US-Server (Anthropic)
  • Eigene Infrastruktur: Daten bleiben in DE (Hetzner/IONOS)

Für Unternehmen mit DSGVO-Anforderungen ist das ein K.O.-Kriterium.

Problem 3: Keine Automatisierung
#

ist für manuelle Nutzung gedacht:

  • ❌ Keine API für Skripte
  • ❌ Keine Integration in VS Code
  • ❌ Keine Automatisierung von Workflows

Die eigene Infrastruktur bietet volle API-Kontrolle.


3. Die Lösung: Zwei Wege zur eigenen KI
#

Es gibt zwei Beispielwege, die Modelle von Hugging Face zu nutzen:

                    ┌─────────────────┐
                    │  Hugging Face   │
                    │  (Modell-Quelle)│
                    └────────┬────────┘
            ┌────────────────┼────────────────┐
            │                │                │
            ▼                ▼                ▼
     ┌──────────────┐ ┌──────────────┐ ┌──────────────┐
     │   Hetzner    │ │    IONOS     │ │   Sonstige     │
     │   (Managed)   │ │   (Hybrid)  │ │   (z.B. Lokal)   │
     └──────────────┘ └──────────────┘ └──────────────┘

Weg A: Hetzner Dedicated GPU-Server
#

Prinzip: Sie mieten einen physischen Server mit GPU und installieren die Modelle selbst.

Analogie: Wie ein eigenes Auto kaufen vs. Taxi fahren.

VorteilNachteil
Volle KontrolleFixkosten (auch bei Nichtnutzung)
Keine Token-LimitsWartung selbst verantwortlich
Einmalige EinrichtungHardware-Upgrade = Server-Tausch
Fine-Tuning möglichVRAM-Limit pro GPU

Preise (Stand Juli 2026):

ModellGPUVRAMPreis/Monat
GEX24RTX A400016 GB~€184
GEX34RTX A500024 GB~€289
GEX131RTX 6000 Blackwell96 GB~€899

Weg B: IONOS AI Model Hub
#

Prinzip: IONOS hostet die Modelle, Sie zahlen nur pro genutztem Token.

Analogie: Wie Taxi fahren vs. eigenes Auto.

VorteilNachteil
Keine WartungHöhere Kosten bei sehr hoher Nutzung
Sofort startklarKeine eigenen Modelle
SkalierbarRate-Limits möglich
DSGVO-konform (DE-Server)Modell-Auswahl begrenzt

Verfügbare Modelle (Stand Juli 2026):

ModellInput (pro 1M)Output (pro 1M)
Qwen3.5-397B-A17B0,60 €3,60 €
Qwen3.5-9B0,10 €0,15 €
Llama 3.3 70B Instruct0,65 €0,65 €
Llama 3.1 8B Instruct0,15 €0,15 €
Mistral-Nemo 12B0,15 €0,15 €

4. Die Modelle: Qwen3.5-397B vs. Llama 3.3 70B
#

Jetzt wird’s technisch. Welches Modell sollten Sie nutzen?

HumanEval Benchmark (Python Code Generation)
#

Der HumanEval-Benchmark testet, wie gut ein Modell Python-Code aus Beschreibungen generieren kann.

ModellHumanEvalMBPPKontext-Fenster
Qwen3.5-397B-A17B89,7%85,4%256k Token
Qwen3.5-235B-A22B86,2%82,1%256k Token
GPT-4o84,5%80,2%128k Token
Llama 3.3 70B Instruct~80%~77%128k Token
Llama 3.1 70B Instruct~76%~74%128k Token

Was bedeutet das in der Praxis?
#

AufgabeQwen3.5-397BLlama 3.3 70B
Code vervollständigen✅ Exzellent✅ Gut
Komplexe Refactorings✅ Sehr gut✅ Okay
Mehrsprachiger Chat✅ Gut✅ Exzellent
Dokumentation schreiben✅ Gut✅ Exzellent
Lange Kontexte (>100k)✅ 256k möglich❌ Max 128k

Die MoE-Architektur von Qwen3.5-397B-A17B
#

MoE = Mixture of Experts

  • 397B Gesamtparameter (das gesamte “Wissen”)
  • Nur 17B aktive Parameter pro Anfrage (die “genutzten” Neuronen)
  • Vorteil: Die Performance eines 397B-Modells mit der Geschwindigkeit eines 17B-Modells

Analogie: Ein Unternehmen mit 397 Mitarbeitern, aber nur 17 arbeiten gleichzeitig an Ihrem Projekt.


5. Die Umsetzung: Schritt für Schritt
#

Jetzt bauen wir das System. Hier ist die Architektur:

┌─────────────────────────────────────────────────────────────┐
│                    Client-Anwendungen                       │
│  (OpenWebUI, VS Code, Python-Skripte, Custom Apps)          │
└──────────────────────┬──────────────────────────────────────┘
┌─────────────────────────────────────────────────────────────┐
│                  LiteLLM Proxy Server                       │
│  (Läuft auf Hetzner Server oder lokal im Homelab)           │
│  - Einheitliche API (OpenAI-kompatibel)                     │
│  - Load Balancing zwischen Hetzner & IONOS                  │
│  - Fallback-Logik, Rate-Limiting, Caching                   │
└──────────┬───────────────────────────────────┬──────────────┘
           │                                   │
           ▼                                   ▼
┌──────────────────────┐           ┌──────────────────────────┐
│  Hetzner GPU-Server  │           │   IONOS AI Model Hub     │
│  - Ollama / vLLM     │           │   - Managed API          │
│  - Qwen2.5-32B (Q4)  │           │   - Qwen3.5-397B-A17B    │
│  - Keine Token-Kosten│           │   - Llama 3.3 70B        │
│                      │           │   - Pay-per-Token        │
└──────────────────────┘           └──────────────────────────┘

Schritt 1: LiteLLM Proxy einrichten
#

LiteLLM ist der “Verkehrspolizist” – es leitet Anfragen an die richtigen Modelle weiter.

Installation (Docker):

docker run -d \
  -p 4000:4000 \
  -v ./litellm-config.yaml:/app/config.yaml \
  ghcr.io/berriai/litellm:main-latest \
  --config /app/config.yaml

Konfiguration (litellm-config.yaml):

model_list:
  # Lokales Modell auf Hetzner-Server (Ollama)
  - model_name: "qwen-local"
    litellm_params:
      model: "ollama/qwen2.5-32b"
      api_base: "http://hetzner-server:11434"
  
  # IONOS Modell als Fallback
  - model_name: "qwen-ionos"
    litellm_params:
      model: "openai/qwen3.5-397b-a17b"
      api_base: "https://api.ionos.ai/v1"
      api_key: "ionos-api-key-xxx"

# Fallback-Logik: Erst lokal, bei Fehler zu IONOS
router_settings:
  fallbacks: [{"qwen-local": ["qwen-ionos"]}]
  timeout: 30

Schritt 2: OpenWebUI als Frontend
#

OpenWebUI ist die “ChatGPT-Oberfläche” für Ihre eigene Infrastruktur.

Installation:

docker run -d \
  -p 3000:8080 \
  -e OPENAI_API_BASE="http://localhost:4000" \
  -e OPENAI_API_KEY="sk-123456" \
  ghcr.io/open-webui/open-webui:main

Funktionen:

  • Multi-User mit eigenen Quotas
  • RAG (Dokumente hochladen, KI fragt Kontext ab)
  • Plugins (Websuche, Code-Interpreter, Bild-Generierung)

Schritt 3: Integration in Visual Studio Code
#

Für die Entwicklung im IDE bietet sich die Continue-Extension an.

Setup in VS Code (settings.json):

{
  "continue.apiBase": "http://localhost:4000",
  "continue.apiKey": "sk-123456",
  "continue.model": "qwen-local"
}

Anwendungsfälle:

  • Code-Completion während des Tippens
  • Chat im Editor (“Erkläre diese Funktion”)
  • Debug-Hilfe (KI analysiert Stack-Traces)
  • Refactoring-Vorschläge

6. Die Kosten: Was kostet das wirklich?
#

Jetzt die Frage, die alle interessiert: Was kostet der Spaß?

Szenario 1: Gelegenheitsnutzer (~100k Tokens/Tag)
#

AnbieterKosten/Monat
Hetzner GEX24€184
IONOS (Qwen3.5-397B)~€4,50
IONOS (Llama 3.3 70B)~€2,00
Sieger🏆 IONOS

Szenario 2: Power-User (~500k Tokens/Tag)
#

AnbieterKosten/Monat
Hetzner GEX24€184
IONOS (Qwen3.5-397B)~€23
IONOS (Llama 3.3 70B)~€10
Sieger🏆 IONOS

Szenario 3: Extrem-Nutzer (~10M Tokens/Tag)
#

AnbieterKosten/Monat
Hetzner GEX24€184
IONOS (Qwen3.5-397B)~€450
IONOS (Llama 3.3 70B)~€200
Sieger🏆 Hetzner

Die Faustformel
#

Bis ~5M Tokens/Monat  →  IONOS günstiger
Ab ~5M Tokens/Monat   →  Hetzner günstiger
Fine-Tuning benötigt  →  Hetzner (IONOS kann das nicht)
Qwen3.5-397B benötigt →  Beides möglich!

7. Das Fazit: Welche Variante für wen?
#

Für Einsteiger: IONOS AI Model Hub
#

Warum:

  • Keine Wartung
  • Sofort startklar
  • Qwen3.5-397B verfügbar (bestes Coding-Modell)
  • Kosten: ~€10–23/Monat bei normaler Nutzung

Setup-Zeit: 30 Minuten


Für Fortgeschrittene: Hetzner GEX24 + Ollama
#

Warum:

  • Volle Kontrolle
  • Keine Token-Limits
  • Fine-Tuning möglich
  • Kosten: ~€184/Monat (fix)

Setup-Zeit: 2–4 Stunden


Für Profis: Hybrid-Lösung
#

Warum:

  • Basis-Last lokal (Hetzner)
  • Spitzen-Last via API (IONOS)
  • Bestes Modell (Qwen3.5-397B) auf beiden Wegen
  • LiteLLM als intelligente Schaltstelle

Setup-Zeit: 4–6 Stunden


Zusammenfassung: Der komplette Weg
#

1. Hugging Face
   └── Modell auswählen (z.B. Qwen3.5-397B-A17B)
   
2. Infrastruktur wählen
   ├── Hetzner (selbst hosten)
   └── IONOS (managed API)
   
3. LiteLLM Proxy
   └── Einheitliche API für beide Wege
   
4. Frontend
   ├── OpenWebUI (Chat-Oberfläche)
   └── VS Code Continue (Development)
   
5. Loslegen!

Weiterführende Links#

RessourceLink
Hugging Facehttps://huggingface.co
Hetzner GPU-Serverhttps://www.hetzner.com/dedicated-rootserver/matrix-gpu/
IONOS AI Model Hubhttps://cloud.ionos.de/managed/ai-model-hub
LiteLLM Dokuhttps://docs.litellm.ai/
OpenWebUIhttps://github.com/open-webui/open-webui
Qwen3.5 Benchmarkshttps://qwen-image-2512.com/blog/qwen3.5-397b-a17b-complete-guide-en
HumanEval Leaderboardhttps://pricepertoken.com/leaderboards/benchmark/humaneval

Rechtlicher Hinweis
#

Dieser Artikel stellt eine technische Analyse dar und ersetzt keine Rechts- oder Kaufberatung. Alle Markennamen sind Eigentum ihrer Inhaber. Preise und Verfügbarkeit ohne Gewähr. Kontakt: blog@bit-wolke.de

Hinweis: Preise, Modellverfügbarkeit und Benchmark-Scores Stand Juli 2026. Bitte prüfen Sie die aktuellen Konditionen direkt bei den Anbietern.