top of page

Generatived(Beta)|生成AIの最新ニュースとトレンドを提供

logo.png

NVIDIA、TensorRTでCLIP推論高速化

Generatived

26/6/11 9:00

NVIDIA(米カリフォルニア州サンタクララ)は、量子化済みのCLIPモデルをNVIDIA TensorRT向けに変換し、本番環境での推論性能を向上させる手法を紹介したと発表した。前回取り上げたFP8量子化済みチェックポイントを基に、ONNX形式へのエクスポートからTensorRTエンジン生成までの流れを示したという。

同社によると、Model Optimizerを用いて生成したFP8量子化モデルをONNXへ出力することで、FP16モデルと比べてファイルサイズを大幅に削減可能とされる。CLIPテキストエンコーダーでは約34%、画像エンコーダーでは約50%の容量削減が確認されたという。

さらにTensorRTを用いた推論評価では、RTX 6000 Ada GPU上で画像エンコーダーの推論レイテンシが166.2ミリ秒から119.8ミリ秒へ短縮され、テキストエンコーダーも13.2ミリ秒から9.1ミリ秒へ改善したとされる。これにより約1.4倍の高速化を実現したという。

同社は、TensorRTがONNX内のQuantizeLinearおよびDequantizeLinearノードを最適化し、FP8 Tensor Core向けの専用カーネルへ統合することで性能向上を実現すると説明している。量子化モデルの実運用に向けたワークフローとして、Model OptimizerとTensorRTの活用を提案している。

この記事を共有:

最新のニュース
NVIDIAがAgent基盤開発

NVIDIAがAgent基盤開発

26/8/24 14:00

NVIDIA(サンフランシスコ)は、汎用コード生成エージェント「AVO」のアーキテクチャ概要および長時間の自律運用を可能にする制御機構を公表した模様だ。

NVIDIAがAIセキュリティ提案

NVIDIAがAIセキュリティ提案

26/8/24 14:00

NVIDIA(サンフランシスコ)は、自律型AIエージェントの安全性を確保するための階層型セキュリティモデルを提唱した模様だ。

MavenAGIが支援展開

MavenAGIが支援展開

26/8/24 14:00

Maven AGI(サンフランシスコ)は、Microsoft Azureの技術基盤を活用し、顧客の問い合わせを自動で完結させるAIエージェントプラットフォームを展開している模様だ。

Stampliが生成AI活用

Stampliが生成AI活用

26/8/24 14:00

Stampli(マウンテンビュー)は、CodexやChatGPT Workを活用して新製品「Deep Finance」の市場投入準備を劇的に短縮させた模様だ。

Copyright © 2024 Generatived - All right Reserved.

この記事を共有:

この記事を共有:

Generatived AI Logo

Generatived は、Generative AIに特化した情報やトレンドをお届けするサービスです。大きく変わりゆく世界の情報を全力でお届けします。

  • Facebook
  • X

フォローをお願いします

言語

最新のニュース
NVIDIAがAgent基盤開発

NVIDIAがAgent基盤開発

26/8/24 14:00

NVIDIA(サンフランシスコ)は、汎用コード生成エージェント「AVO」のアーキテクチャ概要および長時間の自律運用を可能にする制御機構を公表した模様だ。

NVIDIAがAIセキュリティ提案

NVIDIAがAIセキュリティ提案

26/8/24 14:00

NVIDIA(サンフランシスコ)は、自律型AIエージェントの安全性を確保するための階層型セキュリティモデルを提唱した模様だ。

MavenAGIが支援展開

MavenAGIが支援展開

26/8/24 14:00

Maven AGI(サンフランシスコ)は、Microsoft Azureの技術基盤を活用し、顧客の問い合わせを自動で完結させるAIエージェントプラットフォームを展開している模様だ。

Stampliが生成AI活用

Stampliが生成AI活用

26/8/24 14:00

Stampli(マウンテンビュー)は、CodexやChatGPT Workを活用して新製品「Deep Finance」の市場投入準備を劇的に短縮させた模様だ。

bottom of page