Generatived (Beta) | Cung cấp tin tức và xu hướng mới nhất về AI sáng tạo

Sarvam AI と NVIDIA が多言語 AI モデルを加速

Generatived

0:00 20/2/26

インド・ベンガルールのAIスタートアップ企業Sarvam AIは、インドの多様な言語ニーズに応えるため、大規模な多言語基盤モデルを構築するという野心的なプロジェクトに着手しました。同社はNVIDIAと提携し、Sovereign 30Bモデルの性能向上を図り、厳しいレーテンシー目標の達成と推論効率の向上を目指しています。この協業により、NVIDIAのBlackwell GPUにおける推論速度は、NVIDIA H100 GPUのベースライン性能と比較して4倍に向上しました。

Sarvam AIとNVIDIAの共同エンジニアリングの取り組みにより、22のインド言語、英語、数学、そしてコードをサポートする基盤モデルの開発に成功しました。これらのモデルは、データから展開までをカバーするNVIDIAのAIプラットフォームを用いて最適化されており、高いパフォーマンスとローカライズされたAI機能を実現します。また、このパートナーシップにより、NeMoフレームワークやNeMo-RLなど、NVIDIAのNemotronライブラリでトレーニングされた新たなソブリン基盤モデルファミリーも誕生しました。

Sarvam AIのモデルは、ディープリーディングと言語密度のために設計されたMixture-of-Experts（MoE）アーキテクチャを採用しています。Sarvam 30Bモデルは19層の深さで128のエキスパートを擁し、Sarvam 100Bモデルは最大32層まで拡張可能です。両モデルとも、共通の特徴と特殊なタスクを処理するために、共通のエキスパート設計を採用しています。今回の協業では、これらのモデルをNVIDIAのHopper GPUとBlackwell GPU向けに最適化し、固有のサービス提供課題に対処することに注力しています。

Sarvam 30Bモデルの最適化プロセスでは、生の速度向上だけでなく、厳しいレーテンシー制約内での密度の最大化も考慮されました。チームは音声対音声エージェントのサービスレベル契約（SLA）を確立し、95パーセンタイルの最初のトークンまでの時間（TTFT）を1000ミリ秒未満、トークン間レーテンシー（ITL）を15ミリ秒未満とすることを目標としました。初期のパフォーマンス分析は、Sarvam 30Bアーキテクチャにとって重要な、KVキャッシュを基数ツリーとして管理するSGLang推論エンジンを用いて実施されました。チームは、MoEレイヤーのメモリ要件とコンピューティング要件のバランスを取りながら、モデルを2基のNVIDIA H100 SXM GPUに実装しました。

パフォーマンス分析の結果、SLAを満たすには、より深い最適化が必要であることが明らかになりました。チームは、32～64リクエストの同時実行範囲でボトルネックを特定し、NVIDIA Nsight Systemsを用いて実行トレースをキャプチャしました。最適化の対象として最もコストの高いカーネルを絞り込むことで、トランスフォーマー層の時間を34%削減しました。さらに、プリフィルとデコードの混合スケジューリングによってGPU使用率が向上し、分散サービングによってクリティカルパスのボトルネックが解消され、スループットが1.5倍向上しました。

エンドツーエンドのパフォーマンス向上は、カーネルの最適化、スケジューリング効率、そして分散型サービングによって実現しました。NVIDIA Blackwell GPU上でのSarvam 30Bモデルのパフォーマンスは、最大20PFLOPSのピークFP4演算性能と8TB/sのメモリ帯域幅を実現し、NVIDIA Blackwellアーキテクチャが生成AIを加速させるポテンシャルを実証しました。NVIDIA Model Optimizerを用いてモデルをNVFP4形式に量子化することで、特定の動作点において推論サービングのスループットが4倍に向上しました。

Sarvam AIとNVIDIAのコラボレーションは、モデル設計、カーネルエンジニアリング、スケジューリング戦略、量子化、そしてGPUアーキテクチャを相互最適化する潜在能力を示しています。その結果、国家レベルのワークロードに拡張可能な、より高速で経済的に実現可能かつ国家レベルで利用可能な推論スタックが実現します。このアプローチは、NVIDIAプラットフォーム上で大規模な実稼働レベルのAIシステムを構築する他のチームにとっての青写真となります。

Nguồn: Blog dành cho nhà phát triển của NVIDIA

Chia sẻ bài viết này:

Tin tức mới nhất

Kho dữ liệu AI tăng cường Cloudera

0:00 13/2/26

Cloudera (Chuo-ku, Tokyo) thông báo đã mở rộng Cloudera Data Warehouse, được hỗ trợ bởi Cloudera AI Inference và Trino, sang môi trường tại chỗ

đọc thêm

Công nghệ đồng bộ hóa thế hệ ngược AI được cấp bằng sáng chế của Jitera

0:00 13/2/26

Công ty Jitera (Tokyo) đã được cấp bằng sáng chế (Bằng sáng chế số 7789284) cho một quy trình kỹ thuật sử dụng Generative AI(LLM) độc quyền của mình.

đọc thêm

Tăng cường thương mại điện tử thế hệ mới thông qua hợp tác kênh với ZETA.

0:00 13/2/26

ZETA (quận Setagaya, Tokyo) đã công bố hợp tác kinh doanh với Channel Corporation (quận Chiyoda, Tokyo).

đọc thêm

Dịch vụ AI và kho dữ liệu mới của Cloudera

0:00 13/2/26

Cloudera (Santa Clara, California) vừa công bố các dịch vụ mới mở rộng khả năng ứng dụng trí tuệ nhân tạo (AI) và phân tích dữ liệu vào môi trường tại chỗ.

đọc thêm

Chia sẻ bài viết này:

Danh mục

Trình nâng cao hình ảnh AI

Trình tạo mã AI

Quản lý tác vụ AI

Không có mã/mã thấp

Trình tạo thiết kế đồ họa AI

Trình tạo minh họa/nghệ thuật AI

Tất cả công cụ

Tin tức

AI và luật/hệ thống/kinh tế/xã hội

Các công ty/sản phẩm/công nghệ AI

AI công nghệ lớn

OpenAI/ChatGPT

AI thế hệ sáng tạo

AI thế hệ dựa trên văn bản

AI sáng tạo của Nhật Bản

Cơ bản về AI sáng tạo

Hướng dẫn ứng dụng AI cơ bản

Hồ sơ công ty

Giới thiệu về chúng tôi

Chính sách quyền riêng tư

Điều khoản sử dụng trang web

Công ty điều hành

Hãy theo dõi chúng tôi

Ngôn ngữ

Generatived là dịch vụ cung cấp thông tin và xu hướng chuyên về Generative AI. Chúng tôi sẽ cố gắng hết sức để cung cấp thông tin về thế giới đang thay đổi nhanh chóng.

Hãy theo dõi chúng tôi

Ngôn ngữ

Danh mục

Tất cả công cụ

Quản lý tác vụ AI

Trình tạo thiết kế đồ họa AI

Không có mã/mã thấp

Trình tạo mã AI

Trình nâng cao hình ảnh AI

Trình tạo minh họa/nghệ thuật AI

AI và luật/hệ thống/kinh tế/xã hội

Các công ty/sản phẩm/công nghệ AI

AI công nghệ lớn

OpenAI/ChatGPT

AI thế hệ sáng tạo

AI thế hệ dựa trên văn bản

AI sáng tạo của Nhật Bản

Cơ bản về AI tạo ra

Hướng dẫn ứng dụng AI cơ bản

Tin tức

Giới thiệu về chúng tôi

Chính sách quyền riêng tư

Điều khoản sử dụng của trang web

Công ty điều hành

Hồ sơ công ty

Tin tức mới nhất

Kho dữ liệu AI tăng cường Cloudera

0:00 13/2/26

Cloudera (Chuo-ku, Tokyo) thông báo đã mở rộng Cloudera Data Warehouse, được hỗ trợ bởi Cloudera AI Inference và Trino, sang môi trường tại chỗ

đọc thêm

Công nghệ đồng bộ hóa thế hệ ngược AI được cấp bằng sáng chế của Jitera

0:00 13/2/26

Công ty Jitera (Tokyo) đã được cấp bằng sáng chế (Bằng sáng chế số 7789284) cho một quy trình kỹ thuật sử dụng Generative AI(LLM) độc quyền của mình.

đọc thêm

Tăng cường thương mại điện tử thế hệ mới thông qua hợp tác kênh với ZETA.

0:00 13/2/26

ZETA (quận Setagaya, Tokyo) đã công bố hợp tác kinh doanh với Channel Corporation (quận Chiyoda, Tokyo).

đọc thêm

Dịch vụ AI và kho dữ liệu mới của Cloudera

0:00 13/2/26

Cloudera (Santa Clara, California) vừa công bố các dịch vụ mới mở rộng khả năng ứng dụng trí tuệ nhân tạo (AI) và phân tích dữ liệu vào môi trường tại chỗ.

đọc thêm