$AMD выпустила передовую, полностью открытую модель, обученную полностью на GPU MI300X и MI325X с использованием ROCm


Instella-MoE — это модель типа mixture-of-experts с 16 миллиардами параметров, которая активирует только 2,8 миллиарда параметров на токен, снижая расходы на инференс при сохранении конкурентоспособности с плотными и MoE-моделями с сопоставимым или большим числом активных параметров
Она поддерживает контекстное окно 64K и была обучена в шесть этапов — от предобучения до обучения с подкреплением
AMD также представила две новые техники повышения эффективности:
- Gated Multi-head Latent Attention, которая фильтрует низкозначимые выходы внимания.
- FarSkip-Collective, которая перекрывает коммуникацию и вычисления, ускоряя предобучение на 12,7% и сокращая время до первого токена до 39,2%.
AMD-3,29%
Посмотреть Оригинал
post-image
На этой странице может содержаться сторонний контент, который предоставляется исключительно в информационных целях (не в качестве заявлений/гарантий) и не должен рассматриваться как поддержка взглядов компании Gate или как финансовый или профессиональный совет. Подробности смотрите в разделе «Отказ от ответственности» .
  • Награда
  • 2
  • Репост
  • Поделиться
комментарий
Добавить комментарий
Добавить комментарий
GateUser-17ba047d
· 32м назад
Как работает технология блокчейн
Посмотреть ОригиналОтветить0
Mehedi667
· 38м назад
😉🔥
Ответить0
  • Закреплено