概要
NVIDIAは2026年8月11日、オープンモデル「Nemotron 3」シリーズの新モデル「Nemotron 3.5 Lightning」と、AIエージェント向けのモデルルーティングを行うオープンソースライブラリ「NeMo Switchyard」を発表しました。長時間稼働するエージェント型AI(自律的にタスクを遂行するAI)を、より速く・賢く・効率的に動かすことを目的としています。
何が発表・更新されたのか
Nemotron 3.5 Lightningは、300億パラメータのMoE(複数の専門モデルを組み合わせる方式)モデルです。公式情報によると、同クラスの他モデルと比べて最大4倍速い出力速度を実現し、エージェント型タスクの完了が30%速くなるとしています。オープンで学習データや手法も公開されており、企業が自社データで追加学習(ポストトレーニング)しやすい設計です。
もう一つの発表であるNeMo Switchyardは、エージェントの各処理ステップに応じて、最も適したモデルへ自動的にリクエストを振り分ける「ルーティング」の仕組みです。開発者はアプリを書き直さずに、精度・速度・コストの優先順位に応じてルーターを調整できます。NVIDIA社内のベンチマークでは、フロンティアレベルの精度を維持しつつ、タスク完了コストをOpus 4.8単体使用時のおよそ3分の1に抑えられたと報告されています。
なぜ重要なのか
現在のエージェント型AIは、単一の万能モデルではなく、計画立案を担う高性能モデルと、コードレビューや請求対応などの特定タスクを担う小型モデルを組み合わせた「モデル群(システム・オブ・モデルズ)」として運用される傾向が強まっています。Nemotron 3.5 Lightningはこの構成の中で特定タスクを高速・低コストに処理する役割を担い、NeMo Switchyardはモデル群全体の使い分けを自動化します。両者の組み合わせにより、精度を落とさずにコストと応答速度を改善できる点が注目されています。
誰に関係があるのか
- 自社でAIエージェントを構築・運用している開発者やエンジニア
- コスト最適化やレイテンシ改善を検討しているAI基盤担当者
- セキュリティ、法務、コードレビューなど特定業務にAIを組み込みたい企業(公式情報ではCrowdStrike、Harvey、CodeRabbitなどの活用例が紹介されています)
- LangChain、LiteLLM、Kong、Ramp、Boomiなど、AI開発ツールやプラットフォームを提供する企業
仕事や業務でどう使えるのか
Nemotron 3.5 Lightningは、コードレビュー、ツール連携、セキュリティアラート監視、請求関連の問い合わせ対応など、頻度が高く定型的なエージェントタスクの処理に向いています。ローカルPC(NVIDIA RTXなど)からデータセンター・クラウドまで、環境を選ばずに動かせる点も特徴です。NeMo Switchyardを併用すれば、簡単な処理は小型モデル、複雑な判断は高性能モデルへ自動で振り分けることができ、無駄なコストを抑えながら応答速度を保てる可能性があります。公式ブログでは、LangChainが多段タスクの74%のコスト削減、Rampがコスト58%・実行時間33%の削減を実現した例も紹介されています。
注意点
Nemotron 3.5 LightningはHugging Face、ModelScope、OpenRouter、build.nvidia.com(NVIDIA NIMマイクロサービス)などで提供され、NeMo SwitchyardはGitHubで公開されています。ただし、公式情報上では、日本での提供状況や料金・対象プランの詳細は確認できませんでした。導入を検討する場合は、各プラットフォームの公式ページで最新の提供条件を確認することをおすすめします。また、紹介されているベンチマーク結果は各社の使用条件下でのものであり、自社環境での効果は異なる可能性があります。
公式情報
関連キーワード
- Nemotron
- NeMo Switchyard
- エージェントAI
- モデルルーティング
- オープンモデル
- NVIDIA NIM





