AI API料金比較・
実効コスト試算
主要AIモデル(GPT-6 Astra, Claude Fable 5.1, Gemini 3.8 Flash, DeepSeek-V4-Pro等)のAPI料金比較・実効コスト計算シミュレーター。各社で異なるプロンプトキャッシュ仕様(Write・Read・保管料)や長文レートまで精緻に反映し、他ではできない実運用ベースの正確な月額コストを瞬時に試算できます。
データ更新日: 2026/09/08
⇅ 並べ替え▼
1
Max Out:128K
知識カットオフ:2026-04
低速
2
Max Out:128K
知識カットオフ:2026-06
低速
3
Max Out:128K
知識カットオフ:2026-01
低速
4
Max Out:128K
知識カットオフ:2026-02
標準
5
Max Out:128K
知識カットオフ:2026-05
低速
6
Max Out:128K
知識カットオフ:2025-12
低速
7
Max Out:128K
知識カットオフ:2025-08
低速
8
Max Out:128K
知識カットオフ:2026-01
低速
9
Max Out:128K
知識カットオフ:2026-01
高速
10
Max Out:128K
知識カットオフ:2026-01
低速
11
Max Out:65K
知識カットオフ:2025-01
標準
12
Max Out:128K
知識カットオフ:2026-02
高速
13
Max Out:128K
知識カットオフ:2025-12
標準
14
Max Out:128K
知識カットオフ:2025-08
低速
15
Max Out:65K
知識カットオフ:2026-03
爆速
16
Max Out:65K
知識カットオフ:2026-03
爆速
17
Max Out:128K
知識カットオフ:2025-08
低速
18
Max Out:272K
知識カットオフ:2024-09
低速
19
Max Out:65K
知識カットオフ:2026-03
爆速
20
Max Out:-
知識カットオフ:2026-02
高速
21
Max Out:128K
知識カットオフ:2025-08
標準
22
Max Out:64K
知識カットオフ:2026-01
高速
23
Max Out:128K
知識カットオフ:2025-08
高速
24
Max Out:16K
知識カットオフ:2025-08
標準
25
Max Out:65K
知識カットオフ:2025-01
爆速
26
Max Out:384K
知識カットオフ:-
標準
27
Max Out:64K
知識カットオフ:2025-08
低速
28
Max Out:16K
知識カットオフ:2025-08
高速
29
Max Out:128K
知識カットオフ:2024-09
標準
30
Max Out:-
知識カットオフ:-
標準
31
Max Out:128K
知識カットオフ:2026-02
爆速
32
Max Out:128K
知識カットオフ:2024-09
標準
33
Max Out:128K
知識カットオフ:2025-08
高速
34
Max Out:-
知識カットオフ:-
低速
35
Max Out:128K
知識カットオフ:2025-08
標準
36
Max Out:128K
知識カットオフ:2024-09
低速
37
Max Out:16K
知識カットオフ:2024-09
標準
38
Max Out:16K
知識カットオフ:2024-09
標準
39
Max Out:65K
知識カットオフ:2025-01
標準
40
Max Out:128K
知識カットオフ:2025-08
高速
41
Max Out:65K
知識カットオフ:2025-01
爆速
42
Max Out:-
知識カットオフ:-
標準
43
Max Out:-
知識カットオフ:-
低速
44
Max Out:128K
知識カットオフ:2024-09
標準
45
Max Out:128K
知識カットオフ:2024-09
標準
46
Max Out:-
知識カットオフ:-
高速
47
Max Out:64K
知識カットオフ:2025-07
高速
48
Max Out:-
知識カットオフ:-
高速
49
Max Out:-
知識カットオフ:-
高速
50
Max Out:65K
知識カットオフ:2026-03
爆速
51
Max Out:32K
知識カットオフ:2024-06
高速
52
Max Out:-
知識カットオフ:-
標準
53
Max Out:65K
知識カットオフ:2025-01
爆速
54
Max Out:100K
知識カットオフ:2024-06
微速
55
Max Out:128K
知識カットオフ:2024-05
高速
56
Max Out:-
知識カットオフ:-
標準
57
Max Out:-
知識カットオフ:-
高速
58
Max Out:128K
知識カットオフ:2025-08
爆速
59
Max Out:100K
知識カットオフ:2024-06
微速
60
Max Out:32K
知識カットオフ:2025-03
標準
61
Max Out:384K
知識カットオフ:-
高速
62
Max Out:100K
知識カットオフ:2024-06
低速
63
Max Out:100K
知識カットオフ:2024-06
微速
64
Max Out:65K
知識カットオフ:2025-01
爆速
65
Max Out:128K
知識カットオフ:2024-09
高速
66
Max Out:-
知識カットオフ:-
爆速
67
Max Out:-
知識カットオフ:-
高速
68
Max Out:100K
知識カットオフ:2023-10
微速
69
Max Out:100K
知識カットオフ:2024-06
標準
70
Max Out:65K
知識カットオフ:2025-01
爆速
71
Max Out:64K
知識カットオフ:2025-07
高速
72
Max Out:-
知識カットオフ:-
標準
73
Max Out:32K
知識カットオフ:2024-06
高速
74
Max Out:64K
知識カットオフ:2025-03
高速
75
Max Out:16K
知識カットオフ:2023-10
高速
76
Max Out:100K
知識カットオフ:2023-10
低速
77
Max Out:4K
知識カットオフ:2023-12
標準
78
Max Out:100K
知識カットオフ:2023-10
標準
79
Max Out:8K
知識カットオフ:2023-12
低速
80
Max Out:128K
知識カットオフ:2024-05
爆速
81
Max Out:32K
知識カットオフ:2024-06
爆速
82
Max Out:-
知識カットオフ:-
高速
83
Max Out:16K
知識カットオフ:2023-10
高速
84
Max Out:4K
知識カットオフ:2021-09
高速
LLM API料金の仕組みとコスト最適化のポイント
API選定で失敗しないための基本知識と、トークンコストを最小化する実践テクニック
💰
入力と出力の価格差(3〜5倍)
API料金は100万トークン(1M tokens)単位で課金されます。一般的にAIが文章を生成する「出力トークン」は「入力トークン」の3〜5倍高価です。長文生成が必要なタスクでは出力単価の安いモデルを選ぶことが重要です。
⚡
プロンプトキャッシュで最大90%削減
ClaudeやGemini、GPT、DeepSeekなどの最新モデルはプロンプトキャッシュ(Prompt Caching)に対応しています。頻繁に再利用するコンテキストや指示文をキャッシュすることで、入力単価を50〜90%大幅に削減できます。
🎯
タスクに応じたマルチLLM運用
すべての処理に最高峰モデルを使うのではなく、分類・要約などの定型処理にはFlash/mini系の超低コストモデル、高度な推論やコーディングにはフラッグシップモデルを使い分けることで月間コストを劇的に抑えられます。
よくある質問(FAQ)
LLM APIの料金計算式・キャッシュ仕様・長文レート・コスト最適化の疑問にお答えします
Q. 当シミュレーターの月額APIコスト計算式はどのようになっていますか?+
基本計算式は「(リクエスト数 × 1回入力トークン ÷ 100万 × 入力単価) + (リクエスト数 × 1回出力トークン ÷ 100万 × 出力単価)」です。さらに当ツールでは、入力トークンを「固定プロンプト(共有コンテキスト)」と「個別入力(ユニーク)」に分離し、各AIプロバイダ独自のプロンプトキャッシュ仕様や長文閾値(Long Context Tier)を忠実に反映した実効コストを算出します。各モデルカードの「計算式を確認」ボタンから、Write/Read/Storage費用の詳細な数式内訳をご確認いただけます。
Q. Anthropic、Google、OpenAI、DeepSeekのキャッシュ計算の違いは?+
AI各社でキャッシュの課金体系が大きく異なるため、当シミュレーターではプロバイダ別に専用ロジックを実装しています。
・Anthropic (Claude): 初回書き込み(Write)に通常単価の1.25倍(5分TTL)または2.0倍(1時間TTL)が発生し、2回目以降の読み取り(Read)は通常価格の10%(90%割引)で計算。
・Google (Gemini): 1回分の通常書き込み+割引読み取り単価に加え、キャッシュ保持時間に応じた「ストレージ保管料(1Mトークン/時)」を加算。
・OpenAI / DeepSeek: DeepSeekは64トークンから自動適用(Write追加費なし)、OpenAI 5.6 / 6系(GPT-6 Astraなど)は30分TTLで1.25倍Write費+大幅割引Read費で試算します。
Q. キャッシュを使ってもコストが安くならない(逆転する)ケースとは?+
リクエスト数が極めて少ない場合(1〜2回)や、Google Geminiで長時間のストレージ保管料がかかる場合、初回書き込み費用や保管料の合計が通常入力コストを上回ることがあります。当シミュレーターには「コストガード機能」が組み込まれており、キャッシュ適用後の総コストが通常料金より高くなる場合は自動的にキャッシュを無効化(通常料金表示)して過剰な試算や損する設定を防止しています。
Q. 長文コンテキスト(Long Context Tier)による料金変動とは?+
一部のモデルでは、入力トークン数が規定の閾値(Threshold)を超えると、入力・出力・キャッシュのすべての単価が上位Tier(約1.5倍〜2倍)に引き上げられます。当ツールでは入力トークン数が閾値を超えた場合に自動で長文レート(longContextPricing)に切り替えて高精度に試算します。
Q. 性能スコア(ベンチマーク 0-100)はどのように算出されていますか?+
各モデルの性能スコアは、MMLU-Pro、SWE-bench、HumanEval、MATH、GPQAなどの主要な推論・コード生成・知識ベンチマークの公表値を0〜100スケールに統合・正規化した指標です。計算結果画面で「性能スコア順」に並び替えることで、各モデルのコストと性能のバランス(費用対効果)を一目で比較できます。
Q. アプリ開発や業務導入でAPIコストを最小化する実践テクニックは?+
1. マルチLLM運用: 分類やデータ抽出などの定型タスクにはGemini Flash / GPT Mini / DeepSeek($0.1〜$0.5/1M)を割り当て、高度な推論にのみフラッグシップモデルを使用する。
2. キャッシュ最適化: システム指示や参考資料などの共通コンテキストをプロンプト先頭に配置し、各社の最小トークン数(1,024トークン等)を満たしてキャッシュヒット率を高める。
3. 出力トークン制限: 出力単価は入力の3〜5倍高価なため、max_tokensの指定や構造化JSON出力で冗長な生成を徹底的に省く。
Note: 性能スコアは参考値です。様々なベンチマークをもとに0-100で整理しています。