Generatived (Beta) | Cung cấp tin tức và xu hướng mới nhất về AI sáng tạo
%20(1).webp)
NVIDIA DFlash giúp tăng hiệu suất suy luận AI một cách đáng kể.
Generatived
9:00 25/6/26
NVIDIA đã công bố DFlash, một công nghệ giải mã dự đoán mã nguồn mở được thiết kế để cải thiện hiệu quả suy luận mô hình ngôn ngữ lớn trên các nền tảng GPU hiện đại.
Công ty cho biết DFlash sử dụng bộ soạn thảo khuếch tán khối tạo ra nhiều mã thông báo ứng cử viên song song, cho phép các mô hình mục tiêu xác minh đầu ra hiệu quả hơn so với các phương pháp giải mã tuần tự.
Thử nghiệm trên hệ thống NVIDIA Blackwell cho thấy thông lượng cao hơn tới 15 lần đối với gpt-oss-120b trong khi vẫn duy trì cùng mức độ tương tác. Hiệu suất được cải thiện cũng được ghi nhận đối với Llama 3.1 8B và các mô hình mở khác.
DFlash có sẵn thông qua TensorRT-LLM, vLLM và SGLang, với 20 điểm kiểm tra mô hình được phát hành trên Hugging Face. Phương pháp này nhằm mục đích giúp các nhà phát triển tăng tốc quá trình suy luận mà không cần thay đổi lớn trong ứng dụng.
Chia sẻ bài viết này:


