目次
概要
DFlash(ディーフラッシュ)は、大規模言語モデル(LLM)の推論を高速化するオープンソースの「投機的デコード」技術です。NVIDIA Blackwell GPU上で、最大15倍のスループット向上を実現したと公式に発表されました。
何が発表・更新されたのか
DFlashは複数のトークンをブロック単位で並列に生成し、本体モデルがまとめて検証する仕組みです。gpt-oss-120bで最大15倍、Gemma 4 31Bで最大5.8倍、Qwen3 8-Bで最大5.1倍の高速化が報告されています。
なぜ重要なのか
LLMは通常トークンを1つずつ順番に生成するため、低遅延が求められる場面で性能が制約されます。DFlashは処理を並列化することで、同じ応答速度のままより多くのユーザーに対応できる点が重要です。
誰に関係があるのか
LLMを自社サービスに組み込む開発者や、推論コストと応答速度の最適化に取り組むインフラ担当者に関係します。特にコード生成やエージェント用途の運用チームに向いています。
仕事や業務でどう使えるのか
SGLang・vLLM・TensorRT-LLMといった主要な推論フレームワークに統合され、アプリの作り直しなしで導入できます。Hugging Faceで20種類のモデルチェックポイントが公開されています。
注意点
公表された高速化の数値は特定のモデル・GPU・データセット条件での結果であり、環境により異なります。日本での提供状況や利用条件の詳細は、公式情報上では確認できませんでした。
公式情報
関連キーワード
- NVIDIA Blackwell
- 投機的デコード(Speculative Decoding)
- LLM推論
- TensorRT-LLM / vLLM / SGLang
- Hugging Face

