$AMD випустила найсучаснішу повністю відкриту модель, навчання якої повністю проводилося на GPU MI300X та MI325X із використанням ROCm


Instella-MoE — це модель із 16-мільярдами параметрів типу mixture-of-experts, яка активує лише 2,8 мільярда параметрів на токен, знижуючи витрати на інференс, залишаючись конкурентоспроможною з щільними та MoE-моделями з подібною або більшою кількістю активних параметрів
Вона підтримує вікно контексту 64K і була навчена за шість етапів — від переднавчання до навчання з підкріпленням
AMD також представила дві нові техніки ефективності:
- Gated Multi-head Latent Attention, яка фільтрує маловартісні виходи уваги.
- FarSkip-Collective, яка накладає комунікацію та обчислення, підвищуючи швидкість переднавчання на 12,7% і скорочуючи час до першого токена щонайбільше на 39,2%.
AMD-5,15%
Переглянути оригінал
post-image
Ця сторінка може містити контент третіх осіб, який надається виключно в інформаційних цілях (не в якості запевнень/гарантій) і не повинен розглядатися як схвалення його поглядів компанією Gate, а також як фінансова або професійна консультація. Див. Застереження для отримання детальної інформації.
  • Нагородити
  • 2
  • 1
  • Поділіться
Прокоментувати
Додати коментар
Додати коментар
GateUser-17ba047d
· 07-27 10:00
Як працює технологія блокчейн
Переглянути оригіналвідповісти на0
Mehedi667
· 07-27 09:54
😉🔥
відповісти на0
  • Закріплено