top of page
Generatif (Beta) |. Memberikan berita dan tren terkini dalam AI generatif
logo.png

NVIDIA TensorRT Mendukung AI dengan Pengoptimal Model

Generatived

5/8/25, 09.00

Kuantisasi telah menjadi teknik penting bagi pengembang untuk meningkatkan kinerja inferensi model AI. Mengurangi presisi model dapat meningkatkan latency, throughput, dan efisiensi memori tanpa memerlukan pelatihan ulang. Saat ini, model umumnya dilatih dalam FP16 atau BF16, dengan beberapa model lanjutan menggunakan FP8. Memperluas kuantisasi ke format seperti FP4 menjanjikan peningkatan efisiensi yang lebih besar.

Kerangka kerja kuantisasi pasca-pelatihan (PTQ) TensorRT Model Optimizer NVIDIA menyediakan solusi fleksibel dan modular untuk menerapkan optimasi ini. Kerangka kerja ini mendukung berbagai format, termasuk NVFP4, yang dikustomisasi untuk GPU NVIDIA Blackwell. Kerangka kerja ini menggabungkan teknik kalibrasi, seperti SmoothQuant, kuantisasi bobot berbasis aktivasi (AWQ), dan AutoQuantize, untuk meningkatkan hasil kuantisasi. Selain itu, PTQ Model Optimizer dirancang dengan mempertimbangkan kompatibilitas ekosistem, mendukung checkpoint PyTorch, Hugging Face, NeMo, dan Megatron-LM asli, serta mudah diintegrasikan dengan kerangka kerja inferensi seperti NVIDIA TensorRT-LLM, vLLM, dan SGLang.

Artikel ini memberikan detail lebih lanjut tentang teknologi PTQ dan menjelaskan bagaimana Model Optimizer PTQ dapat digunakan untuk mengompresi model AI dengan tetap mempertahankan akurasi tinggi. Hal ini tidak hanya meningkatkan pengalaman pengguna tetapi juga meningkatkan kinerja aplikasi AI. Jaringan saraf tiruan terdiri dari lapisan-lapisan dengan nilai-nilai yang telah disetel dengan baik melalui proses pra dan pasca pelatihan. Nilai-nilai ini, yang disimpan sebagai bobot, aktivasi, dan bias, awalnya dilatih dengan presisi penuh, dan kemudian dikuantisasi ke format presisi yang lebih rendah, seperti 8-bit atau 4-bit, memungkinkan nilai-nilai tersebut dikompresi ke dalam rentang representasi yang lebih kecil.

Proses kuantisasi menyesuaikan nilai agar sesuai dengan rentang tipe data target, yang dapat memengaruhi granularitas nilai. Misalnya, kuantisasi dari FP16 ke FP8 mengurangi detail dan resolusi nilai. Pustaka Model Optimizer PTQ menyediakan teknik optimasi tingkat lanjut untuk meningkatkan kinerja inferensi model dan dapat diimplementasikan dalam berbagai kerangka kerja inferensi.

Pengoptimal Model mendukung berbagai format kuantisasi dan menawarkan beberapa metode kalibrasi untuk membantu Anda memilih format dan kalibrasi yang tepat untuk model dan beban kerja spesifik Anda. Metode-metode ini meliputi Kalibrasi Min-Maks, SmoothQuant, AWQ, dan AutoQuantize. Setiap metode memiliki keunggulannya sendiri dan memengaruhi akurasi akhir model terkuantisasi Anda, jadi Anda harus mempertimbangkannya dengan mempertimbangkan persyaratan sensitivitas dan latency beban kerja Anda.

Singkatnya, kuantisasi merupakan teknik ampuh untuk meningkatkan inferensi model, didukung oleh ekosistem teknologi sumber terbuka yang terus berkembang. Kerangka kerja TensorRT Model Optimizer PTQ dari NVIDIA menyediakan perangkat komprehensif bagi pengembang untuk kompresi model yang menjaga akurasi dan meningkatkan penerapan AI. Pengembang dapat merasakan manfaat ini secara langsung dengan mengikuti tutorial Jupyter Notebook dan bereksperimen dengan titik pemeriksaan pra-kuantisasi.

Bagikan artikel ini:

Tin tức mới nhất
ZENKIGENが選考��連携

ZENKIGENが選考連携

30/9/26, 07.00

ZENKIGEN(東京都港区)は、対話型AI選考システム「harutaka AI面接」において、ヒューマネージが提供する採用管理システム「i-web」とのAPI連携を開始したと発表した。

Liquidがパスキー認証15億件突破

Liquidがパスキー認証15億件突破

30/9/26, 07.00

Liquid(東京都中央区)は、提供するパスキー認証基盤「LIQUID Auth Passkey」の累計認証件数が15億件を超えたと発表した。

Mayuiが医療AI検索調査

Mayuiが医療AI検索調査

30/9/26, 07.00

Mayui(神奈川県秦野市)は、対話型AI「ChatGPT」における医療機関の情報表示を分析した「クリニックAI可視性調査」を実施した。

TR55がビジネス解説マガジン

TR55がビジネス解説マガジン

30/9/26, 07.00

TR-55(東京都渋谷区)は、最新のビジネスニュースを専門家視点で解説するnoteマガジン「新規事業・事業投資の専門家視点から読み解くビジネスニュース」を開設した。

Copyright © 2024 Generatived - All right Reserved.

Bagikan artikel ini:

Bagikan artikel ini:

Generatived

Hãy theo dõi chúng tôi

  • Facebook
  • X

Bahasa

Generatived là dịch vụ cung cấp thông tin và xu hướng chuyên về Generative AI. Chúng tôi sẽ cố gắng hết sức để cung cấp thông tin về thế giới đang thay đổi nhanh chóng.

Generatived AI Logo

Generatived adalah layanan yang memberikan informasi dan tren khusus dalam AI Generatif. Kami akan melakukan yang terbaik untuk menyampaikan informasi tentang dunia yang berubah dengan cepat.

  • Facebook
  • X

Ikuti kami

Bahasa

Berita terkini
ZENKIGENが選考連携

ZENKIGENが選考連携

30/9/26, 07.00

ZENKIGEN(東京都港区)は、対話型AI選考システム「harutaka AI面接」において、ヒューマネージが提供する採用管理システム「i-web」とのAPI連携を開始したと発表した。

Liquidがパスキー認証15億件突破

Liquidがパスキー認証15億件突破

30/9/26, 07.00

Liquid(東京都中央区)は、提供するパスキー認証基盤「LIQUID Auth Passkey」の累計認証件数が15億件を超えたと発表した。

Mayuiが医療AI検索調査

Mayuiが医療AI検索調査

30/9/26, 07.00

Mayui(神奈川県秦野市)は、対話型AI「ChatGPT」における医療機関の情報表示を分析した「クリニックAI可視性調査」を実施した。

TR55がビジネス解説マガジン

TR55がビジネス解説マガジン

30/9/26, 07.00

TR-55(東京都渋谷区)は、最新のビジネスニュースを専門家視点で解説するnoteマガジン「新規事業・事業投資の専門家視点から読み解くビジネスニュース」を開設した。

bottom of page