生成AIやAIエージェントの活用が本格化する一方で、思いがけずトークンコストが膨らみ、予算を大幅に超過するという問題が広がっている。AIによる恩恵と費用との間で、多くのエンドユーザーはいかに“賢く”AIエージェントを使うかを探り始めている。効率的なAI活用に向けたソリューションを展開するITベンダー各社の動きから、トークンコスト節約の取り組みを追う。
(取材・文/大畑直悠)
組織としてガバナンスを確保
「トークン」はAIモデルがテキストを処理する際の基本単位であり、AIモデルはプロンプトなどをトークンに分割して理解している。多くの生成AIサービスでトークンベースの価格モデルの採用が進んでおり、AIの普及と同時にトークン消費量が予想外に急増したことで、従量課金に伴うコストの問題が浮上している。
記憶に新しいところでは、米Uber(ウーバー)が、2026年全体のAIコーディング予算を4カ月で使い切ったと報道されている。国内でも生成AIが登場した当初は、社員によるAIの利用率を活用の指標とする動きが見られたが、単に生成AIの利用量を増やすフェーズは終わり、不要なトークンコストを生み出さない使い方が模索され始めている。
米New Relic日本法人
齊藤恒太 部長
生成AIの導入が特に進むのがソフトウェア開発の現場だ。オブザーバビリティー基盤を展開する米New Relic(ニューレリック)日本法人の齊藤恒太・技術統括コンサルティング部兼プロダクト技術部部長は、トークンが想定外に浪費される原因を、「生成AIの使い方が従業員個人に委ねられ、組織として非効率な使い方を抑止するためのガバナンスが整っていない」からと指摘する。
同社はコード生成AIを用いた開発環境を監視する製品「Preflight」を展開している。リアルタイムでのコスト把握や予算管理に加え、AIコーディングの無駄遣いを可視化する。不必要なコンテキストや、プロンプトが不十分なために進ちょくが見込めない指示の繰り返しを検出する機能も備える。齊藤部長は「プロンプトエンジニアリングのように、コストの面でも生成AIを上手に使うための工夫を組織としてできなければ、いたずらにトークンコストは膨れ上がる」と話す。その上で「生成AIの活用はまだまだ始まったばかり。具体的な指標を基に、徐々に最適なかたちにチューニングしてほしい」と呼び掛ける。
従業員への働きかけだけではなく、仕組みとしてトークンコストを節約するソリューションも現れている。米Salesforce(セールスフォース)ではiPaaSとAPI管理を担う「MuleSoft」をマルチエージェントの統合管理基盤として発展させている。アプリケーションからLLMへの問い合わせに使うAPIや、LLMが外部ツールやデータソースに接続するためのMCPサーバーなどを一元的に管理し、余計なトークン消費を抑える。
セールスフォース・ジャパン
淺井龍太 常務
具体的には、MuleSoftはLLMが動作する際のゲートウェイの役割を果たし、プロンプトの内容に応じてより安価なLLMで対応できるようにルーティングする。セールスフォース・ジャパン常務執行役員の淺井龍太・製品事業統括本部Data&Integration統括本部長は「AIが悩む時間もトークンを消費しているため、一定の時間で処理できなかった場合は別のLLMにルーティングすることもできる」と話す。
セールスフォース・ジャパン
小島賢二 統括部長
予算管理機能も有しており、「Model Wallet」では、プリペイド型で予算を超過できない仕組みを設定し、AIコストの厳格な統制を可能にする。小島賢二・ソリューション統括本部Data&Integration本部MuleSoft第一部兼プロダクトスペシャリスト部統括部長は「『気づいたら予算を超えていた』となってはだめで、トークン消費量がどう推移しているかをモニタリングできる仕組みを提供している」と強調する。
コストに見合う成果なのか見極めを
AIコストの管理において、とりわけ自律的に動作するAIエージェントを業務プロセスの中に組み込む場合には、適切な管理体制を確立しなければ、知らないうちにトークンを浪費しかねない。加えて、そもそもAIエージェントを当てはめるべき業務内容を見定めることも重要になる。例えば、同じような問い合わせが何度も発生しているとしたら、問い合わせのたびに推論させずとも、マニュアルを整備しておけば解決する場合もある。
独Celonis日本法人
村瀬将思 社長
プロセスマイニング基盤を展開する独Celonis(セロニス)日本法人の村瀬将思社長は「コストが発生したとしても、トークンの消費量に見合う成果が出ているのであれば問題ない。人間や他のシステムも含めた業務プロセスの中で、ビジネス上の価値と本当に結びついているか監視する必要がある」と指摘する。
セロニスではAIエージェントが担う業務プロセスを観測・分析し、実行ログなどを指標に継続的な改善を支援する「エージェントマイニング」をソリューションとして提供している。寺田有汰・バリューエンジニアリング統括本部本部長兼Applied AI本部本部長は「個々のAIエージェントは仕様通りに動いていても、業務オブジェクト単位で見なければ気づけない課題がある」と話す。
独Celonis日本法人
寺田有汰 本部長
その一例が「隠れた往復」だ。請求などの受付を担うAIエージェントと、内容を査定するAIエージェントとの間でルールが統一されておらず、両者の会話がループしてしまうケースがあるという。ほかにも、人間へのエスカレーションが多く、トークンを消費しても自律的に成果を上げられていないエージェントなどを発見し、改善を促す。
MuleSoftもAIエージェントの動きの捕捉や、最小限のトークンで動作させる機能を拡充している。「Agent Kill Switch」は、ポリシーやルールから逸脱していたり、トークン消費が激しいにもかかわらず成果を上げていなかったりするAIエージェントを停止させることで、想定外の動きを食い止められる。また、AIエージェントとMCPサーバーのやり取りを最適化する仕組みも提供する。小島統括部長は「MCPサーバーから不要な情報を取得しないようにしたり、句読点を抜いた字面にするなどAIモデル向けのテキストに圧縮してトークンを削減したりする機能の実装を進めている」と紹介する。
AIエージェントから最大限の投資対効果を得るための方法自体は徐々にそろい始めている。ニューレリックの齊藤部長は「節約のテクニックは多くある。それらが本当に実行できているか、決められたルールがしっかり守られているかどうかを、AIエージェントだけでなく、ITインフラ、アプリケーションにわたって一貫してモニタリングする」と自社の役割を説明する。他方で「監視する上では、そもそも何をもって成果とするかを明確にする必要もある。ツールの問題というより、組織の課題やミッションとAIエージェントをどう関連付けるかが重要だ」と話す。
コンテキストの整備も重要に
AIエージェントのコストを最適化し、的確なアウトプットを得るためには、AIエージェント以外の要因も考慮する必要がありそうだ。その一つは、AIエージェントの出力の精度を安定させるために、タスクの背景情報などを参照データとして手渡す「コンテキスト」の整備だ。良質なコンテキストがあれば、回答に至るまでの推論をシンプルにでき、トークンの消費を抑えられる。
セロニスは同社がプロセスマイニング技術で収集した、過去・現在の業務プロセスの情報や、今後の予測をコンテキストとしてAIに手渡す「Celonis Context Model」を提供する。村瀬社長は「AIはそのままでは優秀なジェネラリストでしかない。顧客が独自のノウハウを集積した業務プロセスをコンテキストとしてAIに共有できれば、ビジネスの改善につなげられる」と説明する。例えば、ある商品の納期が遅れた原因などを、複数部門を横断したプロセスの中から特定できるようになるという。実際にCelonis Context Modelを用いることでトークン消費量を70万から18万に削減できた事例もあるという。
ニューレリックも、同社のオブザーバビリティー基盤で監視するIT環境の情報を、コーディングAIにコンテキストとして手渡す「Ground Truth」をリリースし、顧客が利用するシステムに合わせた出力を支援している。齊藤部長は「現在、生成AIのパラドックスが起きている。生成AIで爆発的に生産性が上がった一方で、大量のコードが生まれたり、ブラックボックス化した部分が増えたりして、これを管理する後工程の業務や、プロダクトの品質の低下による障害対応の時間が増加している」と話す。コンテキストが不十分な状態でAIエージェントを使えば、トークンの消費量だけではなく、人間の業務工数も増えかねない。
AIエージェントをより重要な業務プロセスの中に組み込むことが、トークンを消費する価値の向上につながるとの声もある。セールスフォース・ジャパンの小島統括部長は「データウェアハウスから便利に検索するだけの使い方にとどまっていては、アウトカムは限定的だ。基幹システムとの連携も含めてコアな業務へ応用していかなくてはならない」と訴える。その上で「認可や認証などをMCPサーバーやAPIで制御し、検索だけではなく信頼できるアクションができるようにする」と意気込み、AIエージェントのセキュアな活用の支援に力を入れる構えだ。