GPU不足がまだ解消されていない中、今度はCPUも奪い合いになる可能性 がある
2026年5月31日、Nvidiaは88個のカスタムコアを搭載したCPU「Vera」が本格的に量産に入ったと発表しました。VeraはArm命令セットとNvidia自社開発のOlympusコアを採用し、Vera Rubinスーパーコンピューティングプラットフォームに搭載されるほか、単体でCPUサーバーにも組み込まれます。Dell、HP、Lenovo、Supermicroおよび複数のサーバー企業が、すでにVeraを搭載したシステムの製造を開始しています。
NvidiaはVeraを「AIエージェントのために設計された最初のCPU」と位置づけています。VeraはRubin GPUと共にプラットフォームを構成したり、独立したCPUサーバーにも搭載されます。長年GPUを販売してきたNvidiaが再びCPU計算能力単体の販売に乗り出したことは、一見すると異例な出来事です。
画像丨Nvidia Vera(出典:Nvidia)
過去3年間、AI産業のハードウェアへの関心・懸念はほぼGPUに集中していました。トレーニングも推論も、そしてモデルパラメータやユーザー数が増えるごとに答えは常に「より多くのGPUが必要」。CPUはタスクの起動やデータの搬送、サーバーの管理といった役回りを担っていましたが、投資家にとっては主役ではありませんでした。
AI Agentがタスクの在り方を変えるまでは。
一般的なチャットボットがテキストを受け取ってモデルを1回だけ実行し、返答する仕組みに対し、Agentはモデルの判断を実際の操作へと変換します。ファイルの読み書き、Web検索、データベース照会、APIの呼び出し、コードの実行などを行い、結果を再びモデルに返します。一つのタスクで十数回の「推論―操作―観察」ループが行われ、そのたびにCPUとGPUを行き来します。
GPUは依然として大規模なモデル計算を担いますが、モデル出力の解析やツールの種類判定、リクエスト送信、プログラムの実行、ファイル管理、結果の収集と次のタスク手配など、ほとんどはCPUで処理されます。AMDの計算および企業AI担当VP Madhu Rangarajanは、自社の実運用パイプラインで8つのフェーズのうち7つが完全にCPU上で稼働していると述べています。この比率はAMD内部テストの値で全てのシステムを代表するものではないものの、モデル推論はエージェントがタスクを完了する一部であり、それ以外のすべての調整や管理はCPUに委ねられていることを示しています。
単一のエージェントによるCPU負荷は小さいとしても、規模が拡大するとその消費は膨大なものになります。
一つのエージェントは複数のツールを同時に呼び出せますし、サブエージェントの作成も可能です。企業が同じシステムを何万人もの従業員に展開した場合、並列タスク数は急激に増えます。それぞれのエージェントが出力解析、コード実行、データ読み書きを行い、CPU負荷も断片的なものから積み重なり容量要件となります。CPUの処理が遅ければ、GPUは次の推論用入力を待たされることになります。
セキュリティチェックの強化もCPUへの負担を増しています。エージェントに権限を与えれば与えるほど、どのファイルを開いたか、どのAPIを呼び出したか、機密データに接触したかなど、システム側のチェックが不可欠になります。ルールマッチングやログ解析、小規模モデルによる審査などは分散・低遅延が求められ、GPUを個別に呼ぶほどコスパがよくありません。そのため、エージェントがより自律的になるほど検査項目が増え、CPU負担も重くなります。
今年7月には、OpenAIのエージェントが社内セキュリティ評価でサンドボックスを突破し、Hugging Faceのプロダクションシステムに侵入するという事件が起きており、このようなセキュリティメカニズムの重要性、そして実装に伴うコストの大きさを物語っています。
もう一つ見落とされがちな負担がトークナイゼーションです。
大規模言語モデルでテキストを扱う際は、まず文字列をTokenに変換します。この過程は大量の文字列処理と分岐判定を含み、GPUのような行列演算向きではありません。通常の会話では入力が非常に短く、トークナイゼーションの遅延はほとんど問題になりませんが、エージェントはツールの返却結果やコード、ログ、歴史的操作の積み増しにより、入力が数万〜数十万Token規模に伸びることがあります。
ジョージア工科大学の博士課程Euijun Chungは、IEEE Spectrumのインタビューで、ある実装では既に10万Tokenのコンテキストへさらに1,000Tokenのツール結果を加えた場合、トークナイザーが全体を再処理するケースを紹介しています。プリフィックスキャッシュやインクリメンタル・トークナイゼーションによって重複処理を減らすことも可能ですが、すべてのシステムでそうなるわけではありません。長文入力によるCPU負担は依然として重いのです。
Chungチームは最新論文でLlama 3.1やQwen3などのモデルを検証しています。長いシーケンスや大バッチ設定では、トークナイゼーションが最初のToken遅延の約80%を占める場合もありました。CPUコアが足りないと、トークナイザーのスレッドがタスクスケジューリングやGPUカーネル起動とリソースを奪い合い、結果としてCPUはフル稼働し、GPUはフルに活用されない状況が起こります。CPUコアを増やした場合、設定によって初Token遅延が1.47~5.15倍改善され、GPUを増やさずとも効果が得られます。
業界データもこの変化に呼応し始めています。2026年1月、KeyBancはサプライチェーン調査に基づき、Intelの年間サーバー向けCPU生産能力の大半が既に売り切れており、AMDも供給がフル稼働状態で、両社は値上げ余地があると判断しています。これはアナリストの推計で、メーカーの公式受注データではありません。
その後のIntelの財務書類も一部それを裏付けています。サーバー向けCPUの需要が2026年第1四半期に供給を上回り、内部生産能力の制限が年末まで続く見込みです。サーバー製品の平均価格は前年同期比27%上昇した一方で、出荷量は5%減少。Intelは値上げの理由を高付加価値製品割合の上昇と需要価格設定、コスト増加にあると説明しています。
AMDの同期間データセンター事業収入は58億ドルで、前年比57%増となりました。この成長はEPYCサーバーCPUとInstinct GPUの両方から生じており、サーバーCPU事業単体の伸び率は開示されていません。そのため、57%すべてをAIエージェント需要に起因すると断定はできません。
今後の見通しについてはより積極的です。AMDはかつてサーバーCPU市場の年間成長率を約18%と予測していましたが、2026年5月にその予測を35%以上に引き上げ、市場規模が2030年までに1,200億ドルを超える見通しとしています。AIエージェントには、オーケストレーションやデータ処理、ツール実行およびセキュリティチェックを担う独立したCPUコンピューティング層が必要である、というのがその理由です。
従来のデータセンターでは、1つのCPUで4〜8つのGPUを管理することが一般的でした。AMDは、AIエージェントシステムでは、この比率が1:1に近づいていると観察しており、一部のワークロードではそれ以上に多くのCPUを必要としています。これはあくまでも顧客のニーズをもとにしたサプライヤの評価であり、実際の構成はワークロードによってさまざまです。ただ、構成バランスの方向が変わりつつあるのは明らかで、CPUを数個追加するだけでは足りず、クラウド事業者はAIエージェント専用のCPUラックの構築を検討し始めています。
Armも2026年3月に、プロセッサ設計のライセンス提供のみならず、初めてデータセンター向けCPUの直接販売に乗り出しました。そのAGIプロセッサは最大136コアで、Metaも開発に参加しています。Armは、同じ消費電力でエージェントデータセンターに必要なCPU容量は、現行データセンターの4倍以上に達すると見込んでいます。
クアルコムもすぐに250コア超のDragonfly C1000を発表し、Metaと複数世代サーバーCPU協業契約を締結しました。Intel、AMD、Arm、クアルコム、そしてNvidiaが「AIエージェント用CPU」を各社の製品ロードマップに相次いで加えたことで、競争は従来のx86市場のみならず、Armサーバーや独自設計コア、さらには専用ラック設計にまで拡大していることが分かります。
Nvidiaはこの中でも特別な立ち位置にいます。CPU負荷を生むGPU自体を販売する一方で、その負担緩和となるVeraも販売。プロセッサ、ネットワークからストレージまで、Nvidiaは機器一式を提供可能です。Veraは単なるラインナップ拡大にはとどまらず、GPUの稼働率を守る役割もあります。GPUの待機時間が1秒減れば、それはより多くのトークン生成やラック収入増加に直結します。
ただし、チップメーカーが利益を追い求める中で、その皺寄せは結局私たち消費者へ戻ってきます。GPUやメモリチップと同様に、今回の生産能力変化によるコストもまた消費者負担となる可能性は高いです。
Intelは2025年第4四半期の決算説明会にて、社内ウェーハ供給はできる限りデータセンター向けにシフトし、クライアント製品は外部ファウンドリ比重を高めていると説明しました。その後、完全なクライアント撤退はできないとも補足しています。2026年第1四半期にはクライアント向けCPUの平均価格は前年同期比16%上昇、出荷量は13%減となり、供給制約は少なくとも上半期まで続く見通しです。
クライアント製品の価格・供給変動はAIエージェントだけが原因ではありません。Intelのプロセス変更や、社内外生産能力・メモリ供給も価格や出荷に影響します。しかし供給が限られる中で、サーバーチップはコア数が多く高価で、クラウド事業者は長期契約も進んで結ぶため、生産リソースは必然的にデータセンターへ向かいがちです。
過去3年間、一般消費者は既にGPUの価格高騰や品薄を経験しました。今度は同じことがCPUでも起きるかもしれません。
運営・レイアウト:何晨龍
注記:カバー画像/トップ画像はAI支援で生成されています
免責事項:本記事の内容はあくまでも筆者の意見を反映したものであり、いかなる立場においても当プラットフォームを代表するものではありません。また、本記事は投資判断の参考となることを目的としたものではありません。
こちらもいかがですか?
欧米の金利動向は分化する可能性!Citadel Securities:エネルギーショックと高金利がヨーロッパ経済の下押し圧力を強める可能性
キャッスル証券は、エネルギー価格のショックと欧州中央銀行による金融政策の引き締めがヨーロッパの債券利回りの上昇を促しているものの、この2つの力は最終的に利回りのさらなる上昇を制限する要因となる可能性があると考えています。

アメリカ銀行(BAC.US)、一時株価が6%急落 CEOが慎重な姿勢を示す:第3四半期の取引収益は前年同期比で横ばいの見込み 投資銀行業務の手数料収入は予想を下回る可能性
米国銀行の最高経営責任者(CEO)であるBrian Moynihanは、同銀行の第3四半期の取引業務収益が前年同期と「ほぼ同水準」になる見通しであると述べました。これは、上半期の力強い成長を経て、ウォール街の取引業務の成長勢いが鈍化しつつあることを意味しています。

前日の米株市場 | 主要3指数が下落、AI大手企業が開発ペースの減速を呼びかけ、関連株が全面安
取引終了時点で、ダウ・ジョーンズ指数は152.01ポイント下落し、下落率は0.29%、52,421.28ポイントとなりました。S&P500指数は37.03ポイント下落し、下落率は0.48%、7,619.95ポイントとなりました。ナスダック総合指数は146.62ポイント下落し、下落率は0.56%、26,186.41ポイントとなりました。

主要な迂回パイプラインが閉鎖された後、サウジアラビアがホルムズ海峡経由の原油輸出拡大を模索していると報じられる
サウジアラビアが先週攻撃を受けて閉鎖した東西石油パイプラインは、以前は日量最大500万バレルの原油を輸送していた。アメリカのエネルギー長官は、このパイプラインがまもなく運用を再開すると予想しているが、地域当局者は復旧までに数週間かかる可能性があると述べている。サウジアラビアの8月の原油輸出量は日量300万バレルまで減少し、少なくとも過去9年で最低となったが、9月には増加している。イランは、サウジアラビアの要請に応じて、ペルシャ湾諸国が今週月曜日に開催する予定だったホルムズ海峡の海運関連会合を延期したと述べた。トランプ前大統領は、イランが切迫して合意を求めており、米国が参加するかどうかは自分が決定するとし、米国側は柔軟な姿勢を示していると述べた。
