Generatived (Beta) | Cung cấp tin tức và xu hướng mới nhất về AI sáng tạo
%20(1).webp)
Alibaba ra mắt mẫu Qwen3.8 Flash Next.
Generatived
7:00 28/8/26
Alibaba đã công bố trọng số cho Qwen3.8-Flash-Next, một mô hình xem trước thể hiện kiến trúc đa phương thức Qwen4 sắp ra mắt. Với bố cục Mixture-of-Experts gồm 125 tỷ tham số, mô hình hỗ trợ các cửa sổ ngữ cảnh gốc với 262.144 token, có thể mở rộng lên đến một triệu token bằng cách sử dụng các phương pháp mở rộng ngữ cảnh YaRN.
Hệ thống tích hợp các công nghệ Gated DeltaNet và Qwen Sparse Attention để giảm áp lực bộ nhớ trong các thao tác xử lý dữ liệu nặng. Các đánh giá Benchmark cho thấy tốc độ xử lý của nhân attention tăng lên tới 7,6 lần trong giai đoạn điền trước dữ liệu, giúp tăng đáng kể hiệu suất xử lý cho việc mã hóa tác nhân liên tục và phân tích tài liệu phức tạp.
NVIDIA đã kiểm chứng mô hình trên các framework suy luận SGLang, vLLM và TensorRT LLM, đảm bảo tối ưu hóa trên các hệ thống GB300 NVL72. Các nhà phát triển có thể truy cập các công thức tinh chỉnh thông qua NeMo AutoModel, cho phép đào tạo và triển khai quy mô lớn trên các máy trạm và trung tâm dữ liệu doanh nghiệp.
