NVIDIA:一度きりのトレーニングによる大規模モデルから、トレーニング後の改善を行うAgentまで、コンピューティングパワーの需要が変化している
NVIDIAは計算能力の収益化ロジックを再構築しました。新世代のVera Rubinプラットフォームは、「一ドルあたりのインテリジェンス」指標を初めて導入し、インテリジェントAIに賭けています。モデルのトレーニング後、需要は止まらない常態化へと変化し、GPUの使用量は前世代の1/4に減少します。大手企業が移行を待ち行列しており、計算能力のブルーオーシャンに再び爆発が訪れようとしています。
Nvidiaは、次世代のVera Rubinプラットフォームのコアバリュープロポジションを「推論コスト」から「モデルのトレーニング効率」へと拡大し、「intelligence per dollar(1ドルあたりの知能)」という新たな指標を掲げ、Agentic AI時代における継続的なポストトレーニングが最重要のコンピューティング需要になると見込んでいます。
Nvidiaは公式ブログで、Agentic AI(エージェンティックAI)の台頭に伴い、モデルのポストトレーニング(後訓練)が一度きりの仕上げ作業から、連続的かつ中核的なワークロードへと進化したことを述べています。従来の生成モデルとは異なり、エージェント型モデルは、ツールの呼び出しや計画、自己修正などの機能を実行し、稼働中にも自主的にエラーを訂正します。彼らが直面する環境は週単位で常に変化し続けるため、ポストトレーニングに必要な演算資源は持続的に拡大します。Nvidiaは、Vera Rubinプラットフォームはこれらのワークロードの協調設計を実現し、最大規模モデルのトレーニングに必要なGPU数を前世代のBlackwellプラットフォームの4分の1に抑えられると説明しています。
この説明は、Nvidiaのコンピューティング資源販売ロジックに直結しています。ポストトレーニングサイクルが終わることはなく、つまり顧客のGPUクラスター需要がプロジェクトベースから常態化する方向に変化し、潜在的な市場規模も大きく広がっていきます。Prime Intellect、Perplexity、Together AIなど、すでにNvidiaプラットフォームでポストトレーニングワークロードを運用している企業も、Vera Rubinプラットフォームへの移行または拡大を表明しています。
ポストトレーニングがAgentic時代の主要なコンピューティングドライバーに
Nvidiaはブログで、ポストトレーニングの戦略的価値について体系的な説明を行っています。事前トレーニング段階でモデルには言語の流暢性が付与されますが、本当の「知能」—— 例えばコーディング、マルチステップタスクの計画、検索ツールの利用、エラーからの回復 —— はポストトレーニングフェーズで形成されます。

ポストトレーニングでは強化学習(RL)技術を用います。モデルはタスクに対して出力(順伝播)を生成し、その結果が評価されモデルの重みが更新されます(逆伝播)。数百万回の反復を経てモデルの能力が徐々に向上します。Nvidiaは、この過程が非常に大きな計算資源を必要とし、数千の環境で同時にrolloutを生成しつつ、アクセラレータを常にフル稼働させる必要があると指摘しています。
Nvidiaは、「intelligence per dollar(1ドルあたりの知能)」を「per-tokenコスト」より上位のメトリクスに位置づけています。前者は推論運用の効率を測定し、後者は展開に適したモデルを構築・維持するためのコストが妥当かを示します。両者は互いにネストしており、per-tokenコストを下げればモデルの知能構築コストも下がり、高度な知能はtokenあたりの価値を高めます。
Nemotron Ultraによる検証可能なポストトレーニングベンチマーク
上記主張を支えるため、Nvidiaは自社のオープンウェイトモデルNemotron 3 Ultraのポストトレーニング詳細を開示しました。同モデルはパラメータ数5500億を有し、Mixture of Experts(MoE)アーキテクチャを採用し、ポストトレーニング過程はNeMo RLフレームワーク上で完全に運用されています。
現実世界のプログラミングベンチマーク「SWE-bench Verified」では、Nemotron 3 Ultraは71.7%のスコアを記録。これは、オープンソースプロジェクトのバグ修正タスクにおいて、10件中約7件でプロジェクト独自のテストを通過可能な有効修正案を生成したことを意味します。Nvidiaによれば、このベンチマーク結果は検証が可能で、ポストトレーニング手法もすべて公開されています。

Nvidiaはまた、Blackwellプラットフォームが一回ごとの運用コストを下げたことで、Agentic時代に求められる高頻度のポストトレーニングが経済的に現実的になったとし、Vera Rubinプラットフォームではこのトレンドをさらに加速——より多くのrollout、より多くの並列環境、終わることのないポストトレーニングサイクルをサポートすると述べています。
主要顧客がプラットフォーム性能を検証、移行計画が顕在化
既にNvidiaプラットフォーム上でポストトレーニングワークロードを運用する複数社が、具体的な技術ディテールを公開し、Vera Rubin移行への意向を表明しています。
Prime IntellectはBlackwellプラットフォーム上で最先端のオープンモデルのポストトレーニングを継続しており、NVIDIA Dynamoを利用して推論オーケストレーションを行っています。同社はサンドボックス基盤をNVIDIA Vera CPUと統合し、x86アーキテクチャとの比較試験では、Vera CPUが現実のRLサンドボックスワークロードにおいて平均30%高いスループットを示しました。Prime Intellectは、Vera Rubinを用いて強化学習環境を拡大し、トレーニングから推論までの反復サイクルを加速する計画です。
PerplexityのRLポストトレーニングスタックは、数百枚のNvidia GPU上で非同期動作し、RDMAベースのパラメータ転送エンジンにより、兆単位パラメータモデルのトレーニングノード〜推論ノード間の同期を2秒で完了します。ポストトレーニング済みのQwen3 235Bモデルは、NVIDIA GB200 NVL72システムにて稼働します。
Together AIはサービス形態でポストトレーニング機能を提供し、スーパーバイズド微調整、強化学習、直接的選好最適化などをAPIおよびSDKで提供しています。現時点ではNvidiaプラットフォームで稼働し、Vera Rubinプラットフォームへの対応も模索中です。
免責事項:本記事の内容はあくまでも筆者の意見を反映したものであり、いかなる立場においても当プラットフォームを代表するものではありません。また、本記事は投資判断の参考となることを目的としたものではありません。
こちらもいかがですか?
7月の急落後に資金が再び流入、米株「恐怖指数」が急低下する中、ウォール街は警戒を強め始めた

