$AMD a publié un modèle à la pointe de la technologie, entièrement ouvert, entraîné intégralement sur des GPU MI300X et MI325X en utilisant ROCm


Instella-MoE est un modèle à mélange d’experts (mixture-of-experts) de 16 milliards de paramètres qui n’en active que 2,8 milliards par token, réduisant les coûts d’inférence tout en restant compétitif avec les modèles denses et MoE dotés de nombres de paramètres actifs similaires ou supérieurs
Il prend en charge une fenêtre de contexte de 64K et a été entraîné en six étapes, du pré-entraînement à l’apprentissage par renforcement
AMD a également introduit deux nouvelles techniques d’efficacité :
- Gated Multi-head Latent Attention, qui filtre les sorties d’attention de faible valeur.
- FarSkip-Collective, qui superpose la communication et le calcul, améliorant la vitesse de pré-entraînement de 12,7% et réduisant le time-to-first-token jusqu’à 39,2%.
AMD-3,29%
Voir l'original
post-image
Cette page peut inclure du contenu de tiers fourni à des fins d'information uniquement. Gate ne garantit ni l'exactitude ni la validité de ces contenus, n’endosse pas les opinions exprimées, et ne fournit aucun conseil financier ou professionnel à travers ces informations. Voir la section Avertissement pour plus de détails.
  • Récompense
  • 2
  • Reposter
  • Partager
Commentaire
Ajouter un commentaire
Ajouter un commentaire
GateUser-17ba047d
· Il y a 1h
Comment fonctionne la technologie blockchain
Voir l'originalRépondre0
Mehedi667
· Il y a 1h
😉🔥
Répondre0
  • Épinglé