$AMD merilis model open penuh yang canggih, dilatih sepenuhnya pada GPU MI300X dan MI325X menggunakan ROCm


Instella-MoE adalah model mixture-of-experts dengan 16 miliar parameter yang hanya mengaktifkan 2,8 miliar parameter per token, menurunkan biaya inferensi sambil tetap kompetitif dengan model dense dan MoE dengan jumlah parameter aktif yang serupa atau lebih besar
Model ini mendukung jendela konteks 64K dan dilatih melalui enam tahap, dari pre-training hingga reinforcement learning
AMD juga memperkenalkan dua teknik efisiensi baru:
- Gated Multi-head Latent Attention, yang menyaring keluaran attention bernilai rendah.
- FarSkip-Collective, yang tumpang tindih komunikasi dan komputasi, meningkatkan kecepatan pre-training sebesar 12,7% dan mengurangi waktu hingga token pertama hingga 39,2%.
AMD-5,15%
Lihat Asli
post-image
Halaman ini mungkin berisi konten pihak ketiga, yang disediakan untuk tujuan informasi saja (bukan pernyataan/jaminan) dan tidak boleh dianggap sebagai dukungan terhadap pandangannya oleh Gate, atau sebagai nasihat keuangan atau profesional. Lihat Penafian untuk detailnya.
  • Hadiah
  • 2
  • 1
  • Bagikan
Komentar
Tambahkan komentar
Tambahkan komentar
GateUser-17ba047d
· 07-27 10:00
Bagaimana teknologi blockchain bekerja
Lihat AsliBalas0
Mehedi667
· 07-27 09:54
😉🔥
Balas0