Generatif (Beta) |. Memberikan berita dan tren terkini dalam AI generatif

Dion Optimizer Mendukung Pelatihan Model AI Skala Besar
Generatived
18/8/25, 00.00
Di dunia pelatihan model AI yang sangat kompetitif, sebuah alat optimasi baru bernama Muon telah muncul, yang menghasilkan gebrakan signifikan dengan mencapai kinerja yang sebanding dengan mengurangi separuh jumlah GPU. Kemajuan ini telah dianut oleh berbagai lembaga penelitian AI, dan peningkatan skalabilitas yang signifikan telah dilaporkan. Namun, ketergantungan Muon pada perkalian matriks yang ekstensif menimbulkan tantangan bagi model besar yang membutuhkan komunikasi intensif.
Untuk mengatasi hambatan ini, sebuah alat optimasi baru bernama Dion telah diperkenalkan. Pendekatan Dion berfokus pada pembaruan ortogonal, yang bertujuan untuk membuat perubahan aktivasi keluaran selama pelatihan invarian terhadap arah masukan. Metode ini menjanjikan untuk mempertahankan kinerja sekaligus mengurangi beban komputasi, terutama untuk model besar di mana komunikasi dan komputasi merupakan faktor krusial.
Metode Dion menggunakan strategi skalabel yang hanya mengortogonalisasikan vektor singular teratas, sehingga mengurangi beban komunikasi dan komputasi. Alat optimasi ini telah terbukti berkinerja baik bahkan pada peringkat rendah, menunjukkan potensi efektivitasnya dalam model yang sangat besar. Para pengembang telah merilis implementasi Dion mereka secara publik dengan harapan dapat meningkatkan efisiensi pelatihan model-model besar di seluruh komunitas AI.
Dalam pengujian kami, Dion menunjukkan tren yang menarik. Meskipun penambahan kendala biasanya menyebabkan penurunan performa, Dion mengungguli Muon dalam skala besar. Hal ini menunjukkan bahwa akurasi ortogonalisasi Dion menjadi lebih bermanfaat seiring dengan peningkatan skala model. Pengoptimal ini juga menunjukkan ketahanan terhadap penurunan performa yang disebabkan oleh peningkatan ukuran batch, sebuah masalah umum dalam pelatihan model. Hasil ini menunjukkan bahwa Dion berpotensi menjadi alat yang berguna untuk melatih model AI skala besar, dan peluncurannya sebagai sumber terbuka diharapkan akan bermanfaat bagi komunitas riset AI yang lebih luas.
Bagikan artikel ini:
Tin tức mới nhất
NVIDIA Membagikan Panduan Desain Perangkat Keras untuk LLM
14/7/26, 00.00
NVIDIA merilis panduan desain yang menguraikan praktik yang mempertimbangkan perangkat keras untuk model bahasa besar.
Microsoft Memperluas Copilot dengan Agen Layanan Penjualan
14/7/26, 00.00
Microsoft mengumumkan kemampuan AI berbasis agen baru untuk Microsoft 365 Copilot dan Dynamics 365, memperkenalkan Sales Agent dan Service Agent
NVIDIA Menyoroti Fitur Offloading Host JAX untuk Pelatihan LLM
14/7/26, 00.00
NVIDIA menjelaskan bagaimana host offloading di JAX dapat mengurangi tekanan memori bandwidth tinggi GPU selama pelatihan model bahasa yang besar.
Copyright © 2024 Generatived - All right Reserved.
Bagikan artikel ini:
Bagikan artikel ini:
Kategori
Berita
AI dan hukum/peraturan/masyarakat
Generatived là dịch vụ cung cấp thông tin và xu hướng chuyên về Generative AI. Chúng tôi sẽ cố gắng hết sức để cung cấp thông tin về thế giới đang thay đổi nhanh chóng.
Berita terkini
NVIDIA Membagikan Panduan Desain Perangkat Keras untuk LLM
14/7/26, 00.00
NVIDIA merilis panduan desain yang menguraikan praktik yang mempertimbangkan perangkat keras untuk model bahasa besar.
Microsoft Memperluas Copilot dengan Agen Layanan Penjualan
14/7/26, 00.00
Microsoft mengumumkan kemampuan AI berbasis agen baru untuk Microsoft 365 Copilot dan Dynamics 365, memperkenalkan Sales Agent dan Service Agent
NVIDIA Menyoroti Fitur Offloading Host JAX untuk Pelatihan LLM
14/7/26, 00.00
NVIDIA menjelaskan bagaimana host offloading di JAX dapat mengurangi tekanan memori bandwidth tinggi GPU selama pelatihan model bahasa yang besar.






