概要
DiffusionGemmaは、Google DeepMindが開発しNVIDIAプラットフォーム向けに最適化された、テキスト生成モデルです。トークンを1つずつではなく並列に生成する「拡散(ディフュージョン)」方式により、高いスループット(処理量)を実現します。
何が発表・更新されたのか
NVIDIAは、DiffusionGemmaをNVIDIAの各種ハードウェアで効率よく動かせるよう最適化したことを発表しました。Hugging Face、NVIDIA NIM、NVIDIA NeMo AutoModelを通じて、開発者がすぐに利用・デプロイ・ファインチューニングできます。
なぜ重要なのか
従来モデルはトークンを1つずつ生成するため速度に制約がありましたが、DiffusionGemmaは1ステップで256トークンを並列生成します。公式情報では、H100 GPUで最大1,000トークン/秒、DGX Stationで最大2,000トークン/秒の速度が示されています。
誰に関係があるのか
チャットアシスタント、コパイロット、エージェント型ワークフローなどリアルタイムAIを構築する開発者や企業が主な対象です。応答速度や提供コストが課題となっている実務担当者にも関係します。
仕事や業務でどう使えるのか
高速・高スループットによって、低い提供コスト・高い同時接続数・より応答性の高いユーザー体験が期待できます。NVIDIA NIMを使えば、オンプレミス・クラウド・ハイブリッド環境で本番運用が可能です。
注意点
DiffusionGemmaはGemma 4 26B A4B MoEアーキテクチャをベースにし、総パラメータ25.2B・アクティブ3.8B・コンテキスト長最大256K、BF16とNVFP4形式に対応します。公式情報上では、日本での提供状況や対象プランの詳細は確認できませんでした。なお、build.nvidia.comでのGPUアクセラレーション付きエンドポイントは、プロトタイピング向けに無料アクセスが案内されています。
公式情報
関連キーワード
- DiffusionGemma
- NVIDIA NIM
- Hugging Face
- Google DeepMind
- 生成AI

