Generatived(Beta)|生成AIの最新ニュースとトレンドを提供

NVIDIA、TensorRTでCLIP推論高速化
Generatived
26/6/11 9:00
NVIDIA(米カリフォルニア州サンタクララ)は、量子化済みのCLIPモデルをNVIDIA TensorRT向けに変換し、本番環境での推論性能を向上させる手法を紹介したと発表した。前回取り上げたFP8量子化済みチェックポイントを基に、ONNX形式へのエクスポートからTensorRTエンジン生成までの流れを示したという。
同社によると、Model Optimizerを用いて生成したFP8量子化モデルをONNXへ出力することで、FP16モデルと比べてファイルサイズを大幅に削減可能とされる。CLIPテキストエンコーダーでは約34%、画像エンコーダーでは約50%の容量削減が確認されたという。
さらにTensorRTを用いた推論評価では、RTX 6000 Ada GPU上で画像エンコーダーの推論レイテンシが166.2ミリ秒から119.8ミリ秒へ短縮され、テキストエンコーダーも13.2ミリ秒から9.1ミリ秒へ改善したとされる。これにより約1.4倍の高速化を実現したという。
同社は、TensorRTがONNX内のQuantizeLinearおよびDequantizeLinearノードを最適化し、FP8 Tensor Core向けの専用カーネルへ統合することで性能向上を実現すると説明している。量子化モデルの実運用に向けたワークフローとして、Model OptimizerとTensorRTの活用を提案している。
最新のニュース
NVIDIAがC++基盤公開
26/10/5 7:00
NVIDIA(米国カリフォルニア州)は、ローカル環境のアプリケーションへAIモデルをネイティブ組み込みするための開発サンプル群『Do Inference Now (DIN) Deploy』をオープンソースとして公開した。
Microsoftがデータ基盤強化
26/10/5 7:00
Microsoft(米国ワシントン州)は、統合データプラットフォーム『Microsoft Fabric』およびデータベース関連機能の最新アップデートを発表した。
Copyright © 2024 Generatived - All right Reserved.
ニュース
Generatived は、Generative AIに特化した情報やトレンドをお届けするサービスです。大きく変わりゆく世界の情報を全力でお届けします。
最新のニュース
NVIDIAがC++基盤公開
26/10/5 7:00
NVIDIA(米国カリフォルニア州)は、ローカル環境のアプリケーションへAIモデルをネイティブ組み込みするための開発サンプル群『Do Inference Now (DIN) Deploy』をオープンソースとして公開した。
Microsoftがデータ基盤強化
26/10/5 7:00
Microsoft(米国ワシントン州)は、統合データプラットフォーム『Microsoft Fabric』およびデータベース関連機能の最新アップデートを発表した。




%20(1).webp)

