Rabatt auf Premium-Pläne, wenn du dich registrierstRabatt sichern

Blog/guides·20. Aug. 2026·4 Min.·vom eroq-Team

Selbst hosten oder unzensierte KI-API? Die echte Rechnung

GPU-Miete, Auslastung und Betriebsaufwand: eine ehrliche Break-even-Analyse – eigener unzensierter Stack gegen feste Credits pro Aufruf.


„Warum pro Aufruf zahlen, wenn eine gemietete 4090 $300 im Monat kostet?“ ist der vernünftigste Einwand gegen eine unzensierte KI-API – und manchmal stimmt er. Hier ist die echte Rechnung, inklusive der Teile, die nicht in einen Tweet passen.

Die Rechnung auf dem Preisschild

Eine gemietete Consumer-GPU (4090-Klasse) kostet ungefähr $0.35–0.50 pro Stunde – sagen wir $250–370 im Monat im Dauerbetrieb. Eine Karte der A100-Klasse für größere Modelle kostet $1.10–1.80 pro Stunde – $800–1,300 im Monat. Ein quantisiertes 13B-Rollenspielmodell auf der 4090 bedient den Chat-Traffic eines echten Produkts; ein 70B braucht die A100 oder ein Multi-GPU-Rig.

Gegen feste Credits gerechnet (eine Completion kostet 1–3 Credits ≈ 1–3¢, vollständige Tabelle), sieht der naive Break-even beim Chat so aus:

Completions pro Monat API-Kosten (RP mini) Selbst gehostet (4090)
100.000 ~$830 ~$300 + Betrieb
30.000 ~$250 ~$300 + Betrieb
10.000 ~$83 ~$300 + Betrieb

Irgendwo bei 30.000–40.000 Completions im Monat fällt die GPU-Linie unter die API-Linie. Ist die Sache damit klar – ab einer gewissen Größe selbst hosten? Nur wenn die nächsten vier Punkte nicht auf dich zutreffen.

Was die Preisschild-Rechnung verschweigt

Auslastung ist alles. Die GPU läuft 24/7 auf der Rechnung; deine Nutzer kommen in abendlichen Spitzen. Echte Produkte erreichen 15–35% Auslastung, was deine effektiven Kosten pro Aufruf verdoppelt oder verdreifacht. Der feste Preis der API ist das Batching von jemand anderem – du zahlst für Output, nicht für Silizium im Leerlauf. Fehlgeschlagene Generierungen werden sogar automatisch erstattet.

Betrieb ist ein Gehalt, keine Fußnote. Modell-Updates, CUDA-Treiber-Roulette, OOM-Abstürze mitten in deiner Samstagsspitze, Quantisierungs-Regressionen nach jedem Fine-Tune-Update. Plane für einen produktiven Inferenz-Stack echte Engineering-Stunden pro Monat ein – zu Freelancer-Sätzen ist das schon deine API-Rechnung, bevor du ein einziges Token ausgeliefert hast.

Tuning ist der unsichtbare Kostenblock. Rohe unzensierte Checkpoints wiederholen sich, driften ab und durchbrechen unter Rollenspiel-Druck die vierte Wand – die Fehlerbilder sind ganz spezifisch, und sie zu beheben (Sampling-Profile, Anti-Wiederholung, Kontrolle des Tonfalls) ist genau die Arbeit, die du dir sparen wolltest.

Chat war die einfache Modalität. Sobald dein Produkt Bilder, Video, Stimme oder Transkription braucht, vervielfacht sich das Selbsthosten: eigene Modelle, eigener VRAM, eigene Pipelines – dazu Speicher und ein CDN für die Ergebnisse. Ein API-Schlüssel, der alle zehn abdeckt, ist das Argument, das die Debatte für kleine Teams meist beendet.

Wann Selbsthosten wirklich gewinnt

Ganz ehrlich: Selbsthosten ist die richtige Entscheidung, wenn alle vier Bedingungen zutreffen:

  1. Gleichmäßiges, hohes, planbares Volumen (≥ 50.000 Completions im Monat ohne abendliche Spitzen und Einbrüche);
  2. Eine Modalität, ein Modell, das du bereits validiert hast;
  3. Jemand im Team, der die Inferenz selbst verantworten will (Anforderungen an Datenstandort oder Compliance zählen doppelt);
  4. Toleranz für ein Wochenende Ausfallzeit, während irgendetwas neu kompiliert.

Das ist ein echtes Profil – einige der besten Produkte in diesem Bereich laufen so. Es trifft nur nicht auf die meisten Produkte zu, und fast nie auf Produkte am Anfang, wenn Iterationstempo mehr wert ist als Marge.

Wenn dich der Datenschutz zur eigenen GPU treibt, lies die Aufbewahrungsbedingungen des Anbieters, bevor du GPU-Angebote vergleichst. Hier speichern die eigenen Modelle von eroq – RP+ und RP mini eingeschlossen – vorgelagert nichts, und der Privatmodus (ein Schalter im Studio oder private: true an den Bild- und Video-Endpunkten) behält keine Datei und keinen Bibliothekseintrag und ersetzt den Prompt im Nutzungsprotokoll durch Sternchen. Außerhalb des Privatmodus werden Prompts für Abrechnung und Missbrauchsbekämpfung im Nutzungsprotokoll aufbewahrt; schließen deine Compliance-Anforderungen selbst das aus, ist das Bedingung 3 von oben, und Selbsthosten ist die ehrliche Antwort.

Das Hybridmodell, das wirklich funktioniert

Das Muster, das wir erfolgreich sehen: Prototyp und Launch auf der API (ein Schlüssel, 50 kostenlose Credits, ein Quickstart in fünf Minuten), deinen echten Traffic messen und die Rechnung bei deinem tatsächlichen Volumen neu aufmachen – mit festen, öffentlichen Preisen ist die API-Seite der Tabelle in fünf Minuten erledigt. Überschreitet allein das Chat-Volumen die Linie, verschieb diese Arbeitslast auf deine eigene GPU und lass Bilder, Video und Stimme auf der API. Weil die API zustandslos ist, wird der Wechsel langweilig: eine Basis-URL pro Arbeitslast.

Häufige Fragen

Ist es günstiger, ein unzensiertes Modell selbst zu hosten, als eine API zu nutzen?

Bei Volumen, nur für Chat, irgendwann ja – der naive Schnittpunkt liegt bei etwa 30.000–40.000 Completions im Monat gegenüber RP-mini-Aufrufen zu je 1 Credits. Dann kommen die Korrekturen: 15–35% echte Auslastung verdoppeln oder verdreifachen deine effektiven Kosten pro Aufruf, und die Betriebszeit ist ein Gehaltsposten. Produkte, die diese beiden Punkte ehrlich durchrechnen, finden den Schnittpunkt meist viel weiter draußen, als die Preisschild-Rechnung vermuten lässt.

Welche GPU brauche ich für ein unzensiertes Rollenspielmodell?

Ein quantisiertes 13B auf einer Karte der 4090-Klasse bedient den Chat-Traffic eines echten Produkts für ungefähr $250–370 im Monat im Dauerbetrieb. Ein 70B braucht eine Karte der A100-Klasse oder ein Multi-GPU-Rig, im Bereich von $800–1,300. Das sind Mietpreise mit Stand September 2026 – prüf die aktuellen Preise, bevor du eine Tabelle darauf aufbaust.

Was kostet eroq bei 100.000 Completions im Monat?

100.000 Credits mit RP mini, also etwa $833 zum Paketpreis von $100 für 12.000 Credits, oder ungefähr $1,000 mit dem Einstiegspaket. Plan-Credits werden unbegrenzt übertragen, ein Abo, das in einem Monat zu viel liefert, ist also nicht verschwendet – es wird angespart.

Kann ich beides betreiben und Arbeitslasten später verschieben?

Ja, und das ist das Muster, das meistens funktioniert. Bau den Prototyp auf der API, miss deinen echten Traffic und verschieb dann nur die Arbeitslast, die die Linie überschreitet – fast immer Chat –, auf deine eigene GPU, während Bilder, Video, Stimme und Transkription auf einem Schlüssel bleiben. Die API ist zustandslos, der Wechsel ist also eine Basis-URL pro Arbeitslast statt einer Migration.

Infrastrukturentscheidungen verdienen Belege, kein Bauchgefühl – rechne beide Spalten mit deinen eigenen Zahlen durch.

Tagsself-hostingcostsinfrastructure

Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.