# LLM APIの最安プロバイダー：同じモデルを購入先別に比較

> 同じモデルの最安は、たいてい直接契約かホスティング事業者です。DeepSeek V4 Proは公式のオフピークが最安で、ルーター経由は表示単価にチャージ手数料を足して比べます。

- URL: https://blog.laozhang.ai/ja/posts/cheapest-llm-api-provider
- Published: 2026-07-01
- Updated: 2026-09-26
- Author: LaoZhang AI Team (https://blog.laozhang.ai/ja/about)
- Category: API料金
- Tags: LLM API, API料金, DeepSeek API, OpenRouter, ホスティング事業者, APIゲートウェイ

---
使うモデルがすでに決まっているなら、いちばん安い購入先は「モデル提供元との直接契約」か「同じ重みを置くホスティング事業者」のどちらかになることがほとんどです。ルーターは下流の単価をそのまま通す代わりにチャージ手数料がかかり、中継サービスは独自の料金表と倍率で売るので、どちらも単価の下限にはなりにくく、手間を減らす対価として選ぶものです。

2026年9月26日時点の具体例では、DeepSeek V4 Proを月に入力1億トークン・出力2,000万トークン使うと、DeepSeek公式のピーク時間帯で$211.20、オフピークで$105.60、Together AIで$211.20、DeepInfraで$182.00です。オフピークに処理を寄せられるなら公式が最安、時間帯を選べないならDeepInfraが公式ピークより安い、という順位になります。ただし、安い行が同じバージョンのモデルとは限りません。

| 購入先 | 売っているもの | 単価を決めるのは | 安くなる条件 | 見落としやすい費用 |
| --- | --- | --- | --- | --- |
| モデル提供元と直接契約 | 自社モデルの推論（OpenAI、Anthropic、Google、xAI、DeepSeekなど） | 提供元 | オフピーク、Batch、キャッシュ入力を使える | APIキーと請求書が提供元ごとに増える |
| ホスティング事業者 | オープンウェイトモデルを自社GPUで動かした推論（Together AI、DeepInfra、Fireworksなど） | 事業者 | 公式にオフピークがない時間帯、事業者どうしの価格差 | 旧スナップショットや精度の違い、キャッシュ単価の差 |
| ルーター | 複数の提供元・事業者への単一窓口（OpenRouterなど） | 下流の事業者＋ルーターの手数料 | 自前のキーを持ち込み、手数料なしの範囲に収まる | クレジット購入時のチャージ手数料 |
| 中継サービス・ゲートウェイ | 自社の残高とキーで上流モデルを再販・中継 | 中継業者（倍率や回数課金を含む） | 支払い手段や接続の都合で直接契約が難しい | 独自単価、グループ倍率、運営主体とデータの扱い |

どのモデルを選ぶか自体をまだ決めていない場合は、先に[AI API 料金比較：主要5社の単価と最安モデルの選び方](https://blog.laozhang.ai/ja/posts/cheapest-llm-models)でモデル単価を比べてから、この記事で購入先を絞るほうが早く済みます。

## 4種類の購入先は、それぞれ別のものを売っている

「最安のLLM APIプロバイダー」を比べるとき、まず分けておきたいのは、どの経路もモデルの推論という同じ商品を売っているわけではない点です。

モデル提供元との直接契約では、提供元が自分のモデルに付けた定価で買います。GPT-6、Claude、Gemini、GrokのようなクローズドモデルはほかのGPU事業者が重みを持てないため、提供元の単価がそのまま下限になります。ここから安くする方法は、提供元自身が用意しているBatchやFlex、キャッシュ入力、DeepSeekのようなオフピーク割引です。直接契約はトークン単価では最も有利になりやすい反面、提供元ごとにアカウント、APIキー、支払い、請求書が分かれます。

ホスティング事業者は、DeepSeek、Kimi、Qwen、GLM、gpt-ossのように重みが公開されたモデルを自社のGPUで動かし、自分で決めた単価で売ります。同じモデル名でも事業者ごとに価格が違い、公式より安い行もあれば、公式のピーク価格と同じ行もあります。Fireworksのように新規登録で$1の無料クレジットを付け、使った分を後払いで請求する事業者もあります。

ルーターは、多数の提供元や事業者を一つのAPIキーとエンドポイントにまとめる窓口です。OpenRouterは下流の事業者の単価に上乗せせずにそのまま通すと公式FAQで説明し、その代わりクレジット購入時に手数料を取ります。単価の下限を下げる経路ではなく、キーと請求を一本化する経路です。

中継サービス・ゲートウェイは、自社のアカウント残高とキーで上流のモデルを呼べるようにする事業者です。料金は中継業者が独自に決め、トークン課金と回数課金が混在したり、キーのグループごとに倍率が付いたりします。海外のカード決済や上流への接続に困っている場合に意味がありますが、運営主体、データの扱い、実際の請求額を直接契約と同じ物差しで確かめる必要があります。

## DeepSeek V4 ProとV4.1 Flashを経路別に並べる

同じモデルで比べられる例として、DeepSeekの2モデルを並べます。単価はいずれも100万トークンあたりの米ドルで、2026年9月26日時点の各社公式料金ページの表示です。

| モデル | 購入先 | 入力 | キャッシュ入力 | 出力 |
| --- | --- | ---: | ---: | ---: |
| DeepSeek V4 Pro | DeepSeek公式・ピーク | $1.32 | $0.044 | $3.96 |
| DeepSeek V4 Pro | DeepSeek公式・オフピーク | $0.66 | $0.022 | $1.98 |
| DeepSeek V4 Pro 0813 | Together AI | $1.32 | $0.13 | $3.96 |
| DeepSeek-V4-Pro | DeepInfra | $1.30 | $0.10 | $2.60 |
| DeepSeek V4.1 Flash | DeepSeek公式・ピーク | $0.30 | $0.006 | $1.20 |
| DeepSeek V4.1 Flash | DeepSeek公式・オフピーク | $0.15 | $0.003 | $0.60 |
| DeepSeek V4.1 Flash | Together AI | $0.30 | $0.006 | $1.20 |

出典は[DeepSeek API料金](https://api-docs.deepseek.com/quick_start/pricing)、[Together AI料金](https://www.together.ai/pricing)、[DeepInfra料金](https://deepinfra.com/pricing)です。DeepSeek公式のモデルIDは、V4 Proが`deepseek-v4-pro`（V4-Pro-0813）、Flashが`deepseek-flash`（中身はV4.1-Flash）です。

DeepSeekのピーク時間帯は、UTCの月〜金01:00〜04:00と06:00〜10:00で、中国の祝日は除かれます。日本時間に直すと平日の10:00〜13:00と15:00〜19:00で、それ以外の時間帯と週末はすべての単価が半額になります。時間帯の判定方法は[DeepSeek V4のAPI料金：ピーク時間を日本時間で確認・費用計算](https://blog.laozhang.ai/ja/posts/deepseek-v4)で詳しく扱っています。

Together AIのV4 ProとV4.1 Flashは、入力・キャッシュ入力・出力のどれを見てもDeepSeek公式のピーク単価と同じで、オフピーク割引にあたる表示はありません。Togetherを選ぶ理由は、すでにTogetherで他のモデルを動かしていて請求をまとめたい、といった価格以外の事情になります。

### 月額に直すと順位はこうなる

入力1億トークン、出力2,000万トークン、キャッシュなしの月を想定すると、月額は「入力単価×100＋出力単価×20」で求められます。

| モデル | 購入先 | 計算 | 月額 |
| --- | --- | --- | ---: |
| V4 Pro | DeepSeek公式・ピーク | 1.32×100＋3.96×20 | $211.20 |
| V4 Pro | DeepSeek公式・オフピーク | 0.66×100＋1.98×20 | $105.60 |
| V4 Pro | Together AI | 1.32×100＋3.96×20 | $211.20 |
| V4 Pro | DeepInfra | 1.30×100＋2.60×20 | $182.00 |
| V4.1 Flash | DeepSeek公式・ピーク | 0.30×100＋1.20×20 | $54.00 |
| V4.1 Flash | DeepSeek公式・オフピーク | 0.15×100＋0.60×20 | $27.00 |
| V4.1 Flash | Together AI | 0.30×100＋1.20×20 | $54.00 |

キャッシュが効く使い方では差がさらに開きます。同じV4 Proで、入力1億トークンのうち8,000万トークンがキャッシュに当たり、残り2,000万トークンが通常入力、出力2,000万トークンという月を置くと、公式ピークは0.044×80＋1.32×20＋3.96×20＝$109.12、公式オフピークは$54.56、Togetherは0.13×80＋1.32×20＋3.96×20＝$116.00、DeepInfraは0.10×80＋1.30×20＋2.60×20＝$86.00です。キャッシュ入力の単価は公式がいちばん低いため、キャッシュ率が高いほどオフピークの優位が大きくなります。ただし、キャッシュが同じ条件で当たるかどうかは事業者ごとに実装が違うので、実際の請求で確かめます。

![DeepSeek V4 Proの月額をDeepSeek公式のピークとオフピーク、Together AI、DeepInfraで比べた棒グラフ。キャッシュなしとキャッシュ80%の2通り](https://blog.laozhang.ai/posts/ja/cheapest-llm-api-provider/img/monthly-cost-by-route.webp)

ここから言える判断は次のとおりです。

- 夜間バッチや翌朝までに終わればよい処理なら、DeepSeek公式のオフピークに寄せるのが最安です。
- 日本の業務時間帯にリアルタイムで返す必要があるなら、公式ピークよりDeepInfraのV4 Proが安くなります。ただし、DeepInfraの`DeepSeek-V4-Pro`がどの日付のスナップショットかは料金表に書かれていないので、エンドポイントのモデルカードで確かめてから比べます。
- Together AIのDeepSeek行は公式ピークと同額なので、価格だけを理由に選ぶ経路ではありません。

## 名前が同じでも中身が同じとは限らない

経路比較でいちばん見落としやすいのが、同じ名前で売られている別バージョンです。

DeepSeek公式APIでは、旧名の`deepseek-v4-flash`はすでに廃止され、呼び出すとV4.1-Flashが応答し、Flashの単価で課金されます。一方でホスティング事業者は、古いオープンウェイトのスナップショットを引き続き売っています。Together AIの「DeepSeek V4 Flash 0731」は入力$0.14、出力$0.28、DeepInfraの「DeepSeek-V4-Flash-0731」は入力$0.06、出力$0.18、日付のない「DeepSeek-V4-Flash」は入力$0.09、出力$0.18です。

公式のV4.1 Flashはオフピークでも入力$0.15、出力$0.60なので、これらの行は数字だけ見れば大幅に安く見えます。しかし、比べているのは7月31日版のV4 Flashと、DeepSeekが現在提供しているV4.1-Flashです。安い行が同じモデルとは限らず、品質が同等かどうかは同じプロンプトで試すまで分かりません。旧版で足りる処理なら安い旧版を選ぶのは合理的ですが、「同じモデルを安く買えた」と考えて本番に回すと、出力の質が変わったことに後から気づくことになります。

精度も同じ問題を抱えています。ホスティング事業者の中には、モデル名に「FP8」のような量子化の表記を付けて売る行があります。表記がない場合でも、どの精度で動かしているかはモデルカードやドキュメントで確認し、書かれていなければ事業者に問い合わせます。量子化で品質が落ちるかどうかは処理内容によって違うため、後述の「合格出力あたりのコスト」で判断します。

### ホスティング事業者どうしでも順位は入れ替わる

「この事業者がいつも最安」という前提も成り立ちません。同じ2026年9月26日時点で、Kimi K3はTogether AIが入力$3.00、出力$15.00、DeepInfraが入力$2.85、出力$14.25で、DeepInfraが5%安くなっています。一方でQwen3.7-MaxはTogether AIが入力$1.50、出力$4.50、DeepInfraが入力$2.50、出力$7.50で、Togetherのほうが安くなります。先ほどと同じ月（入力1億・出力2,000万トークン）に直すと、Kimi K3はTogether $600.00とDeepInfra $570.00、Qwen3.7-MaxはTogether $240.00とDeepInfra $400.00です。

購入先はモデルごとに決めるもので、事業者単位で「最安の会社」を決めることはできません。事業者が自社を1位に置いたランキングも、その事業者が最安であることの根拠にはなりません。GLM-5.3-FlashのようにTogether AIで入力$0.15、出力$0.50と表示されているモデルも、公式APIの単価や提供条件と並べてから決めます。GLM-5.3-Flashの公式APIについては[GLM-5.3-Flash導入ガイド：Ox Alphaの正体、API料金、ローカル実行](https://blog.laozhang.ai/ja/posts/glm-5-3-flash-guide)にまとめています。

## ルーターは直接契約より安いのか

結論から言うと、同じモデルを同じ事業者で動かすなら、ルーター経由が直接契約より安くなることは基本的にありません。

OpenRouterの公式FAQは、下流の事業者の単価に上乗せせず、直接契約と同じ単価で通すと説明しています。その代わり、クレジットを購入するときに手数料がかかり、料金ページの表示ではStandardプランが5.5%、Businessプランが8%です。たとえば$500分のクレジットを買うと、Standardでは手数料が$27.50になります。先ほどのV4 Proの例で、仮に下流の事業者の単価がDeepInfraと同じなら、月$182.00の利用に対して約$192.01を支払う計算です。

手数料を避ける方法もあります。自分で契約した提供元のAPIキーを持ち込む（BYOK）場合、StandardとBusinessでは、定価ベースで月$25,000分の推論までは手数料がかからず、それを超えた分に5%がかかります。すでに各社と直接契約していて、呼び出し口と利用ログだけを一本化したいなら、この範囲に収まるうちはルーターの費用はほぼ発生しません。

無料プランもありますが、使えるのは25以上の無料モデルと4つの事業者に限られ、1日50リクエストの上限があり、BYOKや予算管理機能は使えません。試作には十分でも、本番の購入先にはなりません。無料で使えるAPIを用途別に探す場合は[無料AI APIのおすすめ：上限・学習利用・カード要否で選ぶ](https://blog.laozhang.ai/ja/posts/free-ai-api-tiers-compared)を参照してください。

ルーターが実質的に得になるのは、単価ではなく次のような手間を減らせるときです。

- 複数のモデルを一つのキーで切り替えて比較したい
- 障害時に別の事業者へ自動で振り替えたい
- 事業者ごとの支払い手続きや請求書の管理を減らしたい
- 予算上限や利用ログをまとめて管理したい

この便利さに5.5%を払う価値があるかどうかで判断します。

## 中継サービス・ゲートウェイを選ぶ条件

中継サービスは、直接契約できない、または直接契約だと手間がかかりすぎる場合の選択肢です。海外のクレジットカードで各社に支払えない、上流のAPIに安定して接続できない、OpenAIとAnthropicの両方の形式を一つのキーで呼びたい、といった事情があるときに比較対象に入ります。単価は中継業者が独自に決めるので、「公式より安い」と書かれていても、実際にどのモデルのどのバージョンに、どの倍率で課金されるかを確かめるまでは判断できません。

当ブログのAPIゲートウェイであるlaozhang.aiも、この種類に入ります。[公式サイト](https://laozhang.ai/)と[ドキュメント](https://docs.laozhang.ai/en)に記載されている仕様は次のとおりです。

- 運営はシンガポールのYingTu Technology Pte. Ltd.で、上流モデルの公式運営者ではありません
- OpenAI SDKのベースURLは`https://api.laozhang.ai/v1`で、Anthropic Messages形式（`/v1/messages`）にも対応します。接続できない場合の予備ホストとして`api2.laozhang.ai`があります
- 前払い残高から引き落とされ、モデルによってトークン課金と回数課金に分かれ、キーのグループによっては価格に倍率がかかります
- モデルID、価格、グループは「Models and pricing」ページに、自分のアカウントに適用される価格はコンソールに表示されます
- プロンプトと応答の内容は既定で保存せず、運用上のメタデータは保持されます
- 登録にはGmailアドレスが必要で、利用開始は審査制です

価格はここでは挙げません。比べるときは、コンソールに表示される単価にグループの倍率を掛けた実額を、直接契約やホスティング事業者の月額と同じ計算式に入れます。そのうえで、支払いや接続の手間が減る分を上乗せ分と比べて決めます。Claudeを中心に使う場合の比較は[Claude を安定して使うにはどう選ぶべきか: Anthropic 直結、対応クラウド、それとも laozhang.ai の互換ゲートウェイ？](https://blog.laozhang.ai/ja/posts/claude-gateway-laozhang-ai)、ツールから中継先を設定する手順は[OpenClaw 完全ガイド：API中継設定・モデル選択・コスト最適化（2026年版）](https://blog.laozhang.ai/ja/posts/openclaw-api-guide)にあります。

## モデルの種類ごとに、最初に比べる購入先

ここまでの内容を、モデルの種類ごとの判断ルールにまとめます。

| 使うモデル | 最初に比べる購入先 | 判断の分かれ目 |
| --- | --- | --- |
| クローズドモデル（GPT-6、Claude、Gemini、Grok） | 提供元との直接契約 | 非同期処理ならBatchやFlexを使う。ルーター経由は手数料分高くなるので、キーを一本化したい場合だけ |
| DeepSeekのように公式APIとオフピークがあるオープンモデル | 公式のオフピークとホスティング事業者 | オフピークに寄せられるなら公式、業務時間帯のリアルタイム処理ならホスティング事業者の単価とバージョンを確認 |
| 公式APIのないオープンウェイトモデル | 複数のホスティング事業者 | モデルごとに最安の事業者が違う。精度とスナップショットの日付をそろえて比べる |
| 複数モデルを試作段階で比べたい | ルーター | 本番の購入先が決まったら、直接契約やBYOKに切り替えると手数料が消える |
| 支払い手段や接続に制約がある | 中継サービス・ゲートウェイ | コンソール上の実額と倍率、運営主体、データの扱いを直接契約と同じ基準で確認 |

クローズドモデルの例を挙げると、2026年9月26日時点でOpenAIのGPT-6 Lunaは入力$0.10、出力$0.50で、BatchとFlexではその半額です。Gemini 3.8 Flashは入力$0.75、出力$3.75ですが、2027年1月から入力$1.50、出力$7.50に上がる予定で、Batchは半額です。こうした割引や改定は提供元の料金表にしか現れないので、直接契約の単価を基準線にして他の経路を比べます。提供元ごとの詳しい比較は[ClaudeとOpenAIのAPI料金比較：同額でも差が出る条件](https://blog.laozhang.ai/ja/posts/claude-api-vs-openai-api-pricing)や[Grok API料金：grok-4.7の単価・無料枠・月額試算](https://blog.laozhang.ai/ja/posts/xai-grok-api-pricing)を参照してください。

## 最後は合格出力あたりのコストで決める

表示単価と月額試算で候補を2〜3に絞ったら、最終判断は「合格出力あたりのコスト」で行います。

合格出力あたりのコスト＝試験期間の請求総額÷品質基準を満たした出力の件数

安い経路が、旧スナップショットや量子化のせいで出力の不合格が増えたり、再試行が増えたりすると、請求額は下がっても1件あたりの費用は上がります。たとえば仮に、経路Aが月$100で合格6,000件、経路Bが月$130で合格9,000件だったとすると、Aは1件あたり約$0.0167、Bは約$0.0144で、単価の高いBのほうが実際には安くなります。

この計算に入れる要素は次のとおりです。

- 入力トークン：システムプロンプト、ツール定義、会話履歴を含めた1件あたりの実量
- 出力トークン：合格に必要な出力の長さ。モデルによって説明が長くなる
- キャッシュの当たり率：経路ごとにキャッシュ単価と当たり方が違う
- 再試行：タイムアウト、形式エラー、拒否で増えた課金回数
- 手数料：チャージ手数料、倍率、為替や決済の手数料

## 本番トラフィックを移す前の確認リスト

価格表で決めた経路にいきなり本番を移さず、次の項目を順に確認します。

1. モデルIDとバージョン：スナップショットの日付、量子化の有無、コンテキスト長が、比べている経路どうしでそろっているか
2. 単価の種類：入力、キャッシュ入力、出力のどれが対象か、オフピークやBatchが使えるか、回数課金のモデルはないか
3. 上乗せ費用：クレジット購入時の手数料、グループ倍率、決済や為替の手数料
4. 失敗時の課金：タイムアウトやエラーになったリクエストが課金されるか
5. 上限：1分あたりのリクエスト数やトークン数、日次の上限、残高が尽きたときの挙動
6. データの扱い：プロンプトの保存期間や学習への利用が業務の条件に合うか。機密データを扱うなら[LLM APIのデータ保持とZDR：稟議で使える確認手順](https://blog.laozhang.ai/ja/posts/llm-api-data-retention-vs-zero-data-retention)で経路ごとに確認します
7. 同じプロンプトでの比較：各経路で同じテストセットを流し、合格出力あたりのコストを出す
8. 段階的な切り替え：一部のトラフィックだけを移し、予算上限と元の経路に戻す手順を用意しておく

![本番トラフィックを移す前に確認する8項目と、単価が安くても避けるべき経路の条件をまとめた図](https://blog.laozhang.ai/posts/ja/cheapest-llm-api-provider/img/production-switch-checklist.webp)

失敗時の課金が説明されていない、利用ログで費用を追えない、上流の障害時に誰が対応するのか答えられない、という経路は、単価が安くても本番では高くつきます。

## よくある質問

### 格安のLLMはどこで契約できますか？

クローズドモデルなら提供元との直接契約が単価の下限で、BatchやFlexなどの割引も直接契約で使えます。オープンウェイトモデルなら、公式APIとTogether AIやDeepInfraなどのホスティング事業者を、同じバージョン同士で月額に直して比べます。キーや支払いを一本化したい場合はルーター、支払い手段に制約がある場合は中継サービスが候補ですが、どちらも手数料や倍率を足した実額で比べます。

### OpenRouterのようなルーターは直接契約より安いですか？

同じ事業者の同じモデルなら安くはなりません。単価は下流の事業者と同じで、クレジット購入時にStandardプランで5.5%、Businessプランで8%の手数料がかかります。自分のAPIキーを持ち込むBYOKなら、定価ベースで月$25,000分までは手数料がかかりません。

### 安いホスティング事業者は量子化で品質が落ちていませんか？

落ちている可能性はあり、料金表だけでは判断できません。モデル名やモデルカードに精度の表記があるかを確認し、同じプロンプトで公式APIと比べて合格率を測ります。旧スナップショットが安く売られているケースも多いので、日付の表記もあわせて確認します。

### 無料クレジットだけで本番を回せますか？

回せません。Fireworksの新規クレジットは$1、OpenRouterの無料プランは1日50リクエストまでで、試作や比較テスト向けの量です。無料枠はテストセットを流して合格出力あたりのコストを測る用途に使い、本番は有料の経路で上限と請求を確認してから始めます。

### 価格はどのくらいの頻度で見直せばよいですか？

本番を移す前、利用量が大きく増える前、そして提供元がモデル名やバージョンを切り替えたときです。DeepSeekのように旧名が新バージョンに置き換わる例や、Gemini 3.8 Flashのように改定日が決まっている例があるので、単価だけでなく提供モデルのバージョンと改定予定も一緒に見直します。
