top of page
Generatif (Beta) |. Memberikan berita dan tren terkini dalam AI generatif
%20(1).webp)
NVIDIAが新評価指標発表
Generatived
24/9/26, 07.00
NVIDIA(米国カリフォルニア州)は、推論サーバー向けソフトウェアにおけるAIコーディングエージェントの性能を測定する新評価指標『SWE-Serve』を発表した。オープンソースの推論エンジン「SGLang」への統合変更を基に構築された53の実行可能タスクで構成され、実際のサーバー稼働状態を模した総合的な検証を行う仕組みとされる。
実稼働検証を含む19のタスクでは、通常の検証を通過した修正パッチの約3割がライブサーバー環境でのテストで不合格になる実態が明らかになった模様だ。従来のローカルチェックのみでは検出できなかったモデルロード処理や排他的ルーティング、リアルタイムのレスポンス精度などの問題が可視化されたという。
主要な大規模言語モデル群を用いた検証では最高75.5%の成功率が記録されたものの、タスクの難易度やコスト面で大きな差異が確認されたとのことだ。同社は開発環境と実稼働環境の乖離を埋める評価基盤を提供し、推論エンジニアリング領域におけるAIエージェントの実用化と品質向上を後押ししていく構想と報じられている。
Bagikan artikel ini:


