Generatived(Beta)|生成AIの最新ニュースとトレンドを提供

NVIDIA、TensorRTでCLIP推論高速化
Generatived
26/6/11 9:00
NVIDIA(米カリフォルニア州サンタクララ)は、量子化済みのCLIPモデルをNVIDIA TensorRT向けに変換し、本番環境での推論性能を向上させる手法を紹介したと発表した。前回取り上げたFP8量子化済みチェックポイントを基に、ONNX形式へのエクスポートからTensorRTエンジン生成までの流れを示したという。
同社によると、Model Optimizerを用いて生成したFP8量子化モデルをONNXへ出力することで、FP16モデルと比べてファイルサイズを大幅に削減可能とされる。CLIPテキストエンコーダーでは約34%、画像エンコーダーでは約50%の容量削減が確認されたという。
さらにTensorRTを用いた推論評価では、RTX 6000 Ada GPU上で画像エンコーダーの推論レイテンシが166.2ミリ秒から119.8ミリ秒へ短縮され、テキストエンコーダーも13.2ミリ秒から9.1ミリ秒へ改善したとされる。これにより約1.4倍の高速化を実現したという。
同社は、TensorRTがONNX内のQuantizeLinearおよびDequantizeLinearノードを最適化し、FP8 Tensor Core向けの専用カーネルへ統合することで性能向上を実現すると説明している。量子化モデルの実運用に向けたワークフローとして、Model OptimizerとTensorRTの活用を提案している。
最新のニュース
OpenAIがGPT-6高速版
26/10/5 7:00
OpenAI(米国サンフランシスコ)は、NVIDIAのBlackwellグラフィックス処理装置上で動作するAIモデル『GPT-6 Astra Ultrafast』の提供を開始した。
NVIDIAが映像解析基盤
26/10/5 7:00
NVIDIA(米国カリフォルニア州)は、動画検索・要約基盤の最新版『Metropolis Blueprint for Video Search and Summarization (VSS) 3.3』を発表した。
NVIDIAがデスクトップ基盤
26/10/5 7:00
NVIDIA(米国カリフォルニア州)は、パーソナルAIスーパーコンピュータ『NVIDIA DGX Spark』の新たな構成として64GBユニファイドメモリ搭載モデルを発表した。
Copyright © 2024 Generatived - All right Reserved.
ニュース
Generatived は、Generative AIに特化した情報やトレンドをお届けするサービスです。大きく変わりゆく世界の情報を全力でお届けします。
最新のニュース
OpenAIがGPT-6高速版
26/10/5 7:00
OpenAI(米国サンフランシスコ)は、NVIDIAのBlackwellグラフィックス処理装置上で動作するAIモデル『GPT-6 Astra Ultrafast』の提供を開始した。
NVIDIAが映像解析基盤
26/10/5 7:00
NVIDIA(米国カリフォルニア州)は、動画検索・要約基盤の最新版『Metropolis Blueprint for Video Search and Summarization (VSS) 3.3』を発表した。
NVIDIAがデスクトップ基盤
26/10/5 7:00
NVIDIA(米国カリフォルニア州)は、パーソナルAIスーパーコンピュータ『NVIDIA DGX Spark』の新たな構成として64GBユニファイドメモリ搭載モデルを発表した。

%20(1).webp)
%20(1).webp)
%20(1).webp)
%20(1).webp)

