生成AIのAPI費用はどう見積もる?試算の手順と、予算超過を防いでコストを削減する運用方法
公開日:執筆:AI顧問マッチ編集部
生成AIのAPIを使った機能を社内ツールや自社サービスに組み込むとき、「毎月いくらかかるのか」を事前に見積もるのは意外と難しいものです。APIの多くは使った分だけ支払う従量課金で、しかも費用は利用者の数だけでなく、1回あたりに送る文章の長さや、処理の組み立て方によって大きく変わります。
この記事では、APIの費用を導入前に見積もるための手順と、運用を始めてから予算を超えないようにするための方法を解説します。費用の削減は「どこにいくらかかっているか」を把握することから始まります。見積もりと記録の仕組みを整えることは、そのままコスト削減の土台になります。なお、各社のAPIの単価は頻繁に改定されるため、本記事では具体的な金額は記載していません。単価は必ず各提供元の公式の料金ページでご確認ください。
APIの料金の基本:トークン数 × 単価
生成AIのAPIの多くは、処理した文字量を「トークン」という単位で数え、トークン数に単価を掛けて課金します。単価は100万トークンあたりの価格などで示されることが多く、入力(AIに送る文章)と出力(AIが生成する文章)で別々の単価が設定され、出力の単価のほうが高いのが一般的です。また、同じ提供元でも高性能なモデルほど単価が高く設定されています。
注意したいのは、トークン数は文字数と一致しないという点です。1文字が何トークンになるかは言語やモデルによって異なり、日本語は英語と比べて同じ内容でもトークン数が多くなりやすいと言われます。机上で文字数から換算するよりも、実際のデータでAPIを呼び出し、レスポンスに含まれる使用トークン数を確認する方法が確実です。
費用を見積もる5つの手順
手順1:処理の種類を洗い出す
まず、APIを呼び出す処理を種類ごとに書き出します。たとえば社内の問い合わせ対応ボットであれば、「質問の分類」「社内資料の検索結果を使った回答の生成」「会話の要約」のように、1つの機能の中でも複数の呼び出しがあることが少なくありません。処理ごとに使うモデルも異なる場合があるため、分けて考えます。
手順2:1回あたりの入力・出力トークン数を実測する
処理ごとに、実際の業務に近いデータで何回か試し、入力と出力のトークン数を記録します。入力には、利用者が入力した文章だけでなく、システムプロンプト(AIへの前提の指示)、会話の履歴、検索で取得した参照資料なども含まれます。この「見えない入力」が、利用者の入力よりはるかに大きくなることもあります。
手順3:月間の呼び出し回数を見積もる
利用者数、1人あたりの1日の利用回数、営業日数などから、処理ごとの月間の呼び出し回数を見積もります。1回の操作で複数回APIを呼び出す設計になっている場合は、その回数も掛け合わせます。
手順4:単価を掛けて月額を計算する
処理ごとに「月間の回数 ×(1回の入力トークン数 × 入力単価 + 1回の出力トークン数 × 出力単価)」を計算し、すべての処理分を合計したものが月額の見積もりになります。
計算の流れだけを、仮の数字で示します。1回あたり入力2,000トークン・出力500トークンの処理を、1日1,000回、30日間行うとすると、月間の入力は6,000万トークン、出力は1,500万トークンです。これに、使うモデルの入力・出力それぞれの単価を掛ければ、その処理の月額が求められます。同じトークン数でも、選ぶモデルによって金額は大きく変わります。
手順5:余裕を上乗せする
実際の運用では、エラー時の再試行、開発やテストでの利用、品質を確認するための評価、想定以上の利用者の増加など、見積もりに入っていない利用が発生します。どの程度の余裕を見込むかは用途によって異なるため一律には言えませんが、初めての見積もりでは余裕を持たせておき、運用開始後の実績で見直すのが現実的です。
見積もりの結果は、計算の前提と一緒に表にまとめて残しておくと、後から実績と比べやすくなります。残しておきたい項目は次のとおりです。
- 処理の名前と、使うモデル
- 1回あたりの入力・出力トークン数(実測した条件も含めて)
- 月間の呼び出し回数と、その根拠(利用者数・1人あたりの回数など)
- 計算に使った単価と、単価を確認した日付
- 上乗せした余裕の考え方
見積もりがずれやすい5つのポイント
- 会話履歴の積み上がり:チャット形式では、やり取りが続くほど毎回送る履歴が長くなります。1往復目だけで測ると、実際より少なく見積もってしまいます。
- 参照資料の量:RAG(社内資料を検索してAIに渡す仕組み)では、検索結果として渡す資料の量が入力トークンの大半を占めることがあります。
- AIエージェントの多段の呼び出し:エージェントは1つのタスクのために、ツールの呼び出しと判断を何度も繰り返します。タスクの難しさによって呼び出し回数がばらつく点にも注意が必要です。
- 出力の長さのばらつき:出力の長さに上限を設けていないと、同じ処理でも回によって出力が長くなり、費用がぶれます。
- 為替の変動:ドル建てで請求されるサービスでは、円換算の支払額が為替によって変わります。
RAGの運用費用についてはRAGの運用コストを見直すチェックリストで詳しく解説しています。
予算超過を防ぐ運用の方法
見積もりはあくまで出発点です。運用を始めてから予算を超えないようにするには、次のような仕組みを組み合わせます。
- 提供元の上限・通知機能を設定する:提供元によっては、管理画面で月間の利用上限や、一定額を超えたときの通知を設定できます。まずは使える機能を確認し、設定しておきます。
- アプリ側でも上限を設ける:利用者ごと・1日ごとの呼び出し回数の上限、出力トークン数の上限、エージェントの試行回数の上限などを設け、想定外の使われ方で費用が急増するのを防ぎます。
- 機能別に利用量を記録する:APIのレスポンスに含まれるトークン数を、機能・モデル・部署などの単位で記録します。請求書の合計額だけでは、どこを見直せばよいか判断できません。
- 本番と開発でAPIキーを分ける:本番環境と開発・テスト環境でキーやプロジェクトを分けると、どちらでどれだけ使っているかが明確になります。
- 月に一度は見積もりと実績を比べる:ずれが大きい処理から原因を確認し、見積もりと設計の両方を更新します。
実績が見えたら、コスト削減の打ち手へ
機能別の利用量が見えるようになると、費用のかかっている処理から優先的に見直せます。代表的な打ち手には、会話履歴や参照資料の絞り込み、処理の難しさに応じたモデルの使い分け、出力の長さの制限、同じ結果の再利用などがあります。繰り返し送る長い前置きがある場合は、プロンプトキャッシュが使えることもあります。
具体的な見直しの方法は、APIコストが膨らむ5つの原因と見直し方やプロンプトキャッシュとバッチ処理の解説記事をご覧ください。いずれの打ち手も、切り替えの前後で出力の品質を実際のデータで比べることが欠かせません。
まとめ
APIの費用は、「処理の種類 × 1回あたりのトークン数 × 回数 × 単価」に分解すると、見積もりやすくなります。そして、運用開始後に機能別の実績を記録し、見積もりと比べ続けることが、予算超過を防ぎ、削減の優先順位を決めるための一番の近道です。
すでにAPIの費用が大きくなっていて、社内だけで見直す余裕がない場合は、AIコスト削減プラン(成果報酬型)をご検討ください。実際に削減できた月額費用をもとに報酬が決まるため、削減できなければその計算による報酬は発生しません。まずは無料のAIコスト診断(約1分)で見直しの余地を確認し、専門家に相談したい場合は企業として無料登録のうえ、案件を掲載してください。