新規登録でプレミアムプランが割引に割引を受け取る

ブログ/guides·2026年8月20日·2分·執筆:eroqチーム

検閲なしモデルはセルフホストかAPIか:本当のコスト計算

GPUのレンタル代、稼働率、運用の手間。検閲なしの環境を自前で動かす場合と、呼び出しごとの定額クレジットの損益分岐を正直に分析します。


「レンタルの4090が月$300なのに、なぜ呼び出しごとにお金を払うのか?」。これは検閲なしのAI APIに対する、もっとも筋の通った反論です。そして、それが正しいこともあります。ここでは、ツイートには収まらない部分も含めて、実際の計算をお見せします。

表面上の計算

レンタルのコンシューマー向けGPU(4090クラス)は、1時間あたりおよそ$0.35〜0.50。常時稼働なら月$250〜370といったところです。大きなモデル向けのA100クラスのカードは1時間あたり$1.10〜1.80で、月$800〜1,300になります。量子化した13Bのロールプレイモデルなら、4090で実際のプロダクトのチャットトラフィックをさばけます。70Bになると、A100かマルチGPU構成が必要です。

定額クレジット(1回の応答は1〜3クレジット ≈ 1〜3¢、料金表)と比べると、チャットの単純な損益分岐は次のとおりです。

月間の応答数 APIのコスト(RP mini) セルフホスト(4090)
100,000 約$830 約$300 + 運用
30,000 約$250 約$300 + 運用
10,000 約$83 約$300 + 運用

月3万〜4万回の応答あたりで、GPUのコストがAPIのコストを下回ります。では、規模が大きければセルフホストで決まりでしょうか? そう言えるのは、このあとの4つのポイントがあなたに当てはまらない場合だけです。

表面上の計算が隠しているもの

すべては稼働率しだい。GPUは24時間365日課金されますが、ユーザーが来るのは夜のピークです。実際のプロダクトの稼働率は15〜35%で、呼び出し1回あたりの実質コストは2倍から3倍になります。APIの定額料金は、まさにほかの誰かがまとめて処理している結果です。あなたが払うのは出力に対してであって、遊んでいるシリコンに対してではありません。失敗した生成は自動で返金までされます。

運用は脚注ではなく人件費。モデルの更新、運任せのCUDAドライバー、土曜のピーク時のOOMクラッシュ、ファインチューニングを更新するたびに起きる量子化での劣化。本番の推論環境には、毎月それなりのエンジニアの工数を見込んでおきましょう。外部委託の単価で換算すれば、トークンを1つも返さないうちに、それだけでAPIの請求額に届きます。

チューニングは見えないコスト。素の検閲なしチェックポイントは、ロールプレイの負荷がかかると同じことを繰り返し、キャラクターがぶれ、第四の壁を破ります。失敗のパターンははっきりしていて、それを直す作業(サンプリングのプロファイル、繰り返しの抑制、口調のコントロール)こそ、あなたが省きたかった作業そのものです。

チャットはいちばん簡単なモダリティ。プロダクトが画像、動画、ボイス、文字起こしを必要とした瞬間、セルフホストの手間は何倍にもなります。モデルも、VRAMも、パイプラインも別々。さらに出力用のストレージとCDNも要ります。小さなチームにとっては、1つのAPIキーで10種類すべてをまかなえることが、たいてい議論の決め手になります。

セルフホストが本当に有利なとき

公平に言えば、次の4つすべてが当てはまるなら、セルフホストが正解です。

  1. 安定していて、多く、予測しやすい量(夜だけ極端に偏ることのない、月5万回以上の応答)
  2. モダリティが1つで、すでに検証済みのモデルが1つ
  3. 推論を自分たちで抱えることを望んでいるエンジニア(データの所在やコンプライアンスの要件があれば、その重みは2倍)
  4. 何かを再コンパイルしているあいだ、週末いっぱいダウンしても許容できること

これは実在するプロファイルで、この分野の優れたプロダクトの中にも、この形で運用しているものがあります。ただ、大半のプロダクトはそうではありませんし、立ち上げ期のプロダクトがそうであることはまずありません。その時期は、利益率よりも改善のスピードのほうが価値があるからです。

自前のGPUに傾いている理由がプライバシーなら、GPUの見積もりより先に、提供元のデータ保持の規約を読みましょう。eroqの場合、自社モデル(RP+とRP miniを含む)は上流に何も保持しません。また、プライベートモード(スタジオの切り替えスイッチ、または画像・動画エンドポイントのprivate: true)では、ファイルもライブラリのエントリーも残らず、利用明細ではプロンプトが伏せ字に置き換えられます。プライベートモード以外では、請求と不正利用への対応のために、プロンプトが利用明細に保存されます。コンプライアンスの要件でそれすら許されないなら、それは上の条件3に当たり、正直に言ってセルフホストが答えです。

実際にうまくいくハイブリッド

うまくいっているパターンはこうです。APIでプロトタイプを作ってローンチし(APIキー、無料の50クレジット、5分でできるクイックスタート)、実際のトラフィックを計測して、本当の量で計算し直します。料金は定額で公開されているので、スプレッドシートのAPI側は5分で埋まります。チャットの量だけで分岐点を超えたら、そのワークロードだけを自前のGPUに移し、画像、動画、ボイスはAPIに残しましょう。APIはステートレスなので、切り替えは拍子抜けするほど簡単です。ワークロードごとにベースURLを1つ変えるだけです。

よくある質問

検閲なしモデルのセルフホストはAPIより安いですか?

量が多く、チャットだけなら、いずれは安くなります。1回1クレジットのRP miniと比べた単純な分岐点は、月3万〜4万回の応答あたりです。ただし、そこに補正をかけてください。実際の稼働率は15〜35%なので、呼び出し1回あたりの実質コストは2倍から3倍になります。そして運用の時間は人件費です。この2つを正直に見積もったプロダクトは、たいてい分岐点が表面上の計算よりずっと先にあることに気づきます。

検閲なしのロールプレイモデルを動かすには、どのGPUが必要ですか?

4090クラスのカードで量子化した13Bを動かせば、常時稼働で月およそ$250〜370で、実際のプロダクトのチャットトラフィックをさばけます。70BにはA100クラスのカードかマルチGPU構成が必要で、$800〜1,300の範囲です。これらは2026年9月時点のレンタル価格です。スプレッドシートを組む前に、最新の料金を確認してください。

月100,000回の応答で、eroqの料金はいくらですか?

RP miniなら100,000クレジットです。12,000クレジットで$100のパックの単価なら約$833、エントリーパックならおよそ$1,000です。プランのクレジットは無期限に繰り越されるので、ある月に使い切れなかったサブスクリプションも無駄にはならず、貯まっていきます。

両方を併用して、あとからワークロードを移せますか?

はい。たいていうまくいくのが、このパターンです。APIでプロトタイプを作り、実際のトラフィックを計測したら、分岐点を超えたワークロード(ほぼ必ずチャットです)だけを自前のGPUに移し、画像、動画、ボイス、文字起こしは1つのキーのまま残します。APIはステートレスなので、切り替えは移行作業ではなく、ワークロードごとにベースURLを1つ変えるだけです。

インフラの判断に必要なのは、雰囲気ではなく裏付けです。自分の数字で、両方の列を計算してみてください。

タグself-hostingcostsinfrastructure

この記事で使ったモデルで作ってみましょう。無料の50クレジットで始めるか、全エンジンと料金をご覧ください。