這個模型能放在單一 DGX Spark 上運行,速度為每秒 30 - 40 個 tokens,且擊敗了接近其規模約 10 倍的開放權重系統。


我們過度配置資源,因為我們假設規模是唯一槓桿,但他們把持久化(persistence)和回溯(backtracking)從一個小模型中直接移除了。
如果一支不到 70 人的團隊能打造出如此精簡的基礎設施,那麼當可重現性是第一個功能而不是最後一個功能時,我們其餘的建置者與營運者還能多精簡地運行,這又意味著什麼?
查看原文
此頁面可能包含第三方內容,僅供參考(非陳述或保證),不應被視為 Gate 認可其觀點表述,也不得被視為財務或專業建議。詳見聲明
  • 打賞
  • 回覆
  • 轉發
  • 分享
回覆
請輸入回覆內容
請輸入回覆內容
暫無回覆