前 OpenAI 技術長 Mira Murati 離開兩年後首作亮相:975B 引數開源模型 Inkling 號稱西方最強,但 Decrypt 完整實測揭露三大短版,複雜編碼全軍覆沒、創意寫作捏造事實、價效比不敵中國對手。 (前情提要:對話 ChatGPT 神秘教母》訓練資料是否侵權、Sora 比聊天機器人危險、GPT-5 有多強大?) (背景補充:OpenAI 承認自家 AI 模型意外駭進 Hugging Face)
本文目錄
Toggle
離開 OpenAI 整整兩年後,前技術長 Mira Murati 終於在 7 月 15 日端出她新創公司 Thinking Machines Lab 的第一個作品,開源 AI 模型 Inkling。這是西方實驗室至今從零訓練出的最強開源模型,但在經過完整實測後,評價卻相當兩極:基準測試亮眼,實際使用體驗離「日常可用」還有一段距離。
Inkling 的誕生本身就帶有象徵意義。過去一年,開源 AI 賽道幾乎被中國團隊壟斷,阿里巴巴的 Qwen、Z.ai 的 GLM、Moonshot AI 的 Kimi 接連霸榜,西方實驗室僅有 Nvidia 的 Nemotron 勉強留在榜上,但離「頂尖」還很遠。Inkling 的出現,等於是西方陣營在開源戰場上的第一次有力回擊。
Inkling 採用混合專家(MoE)架構,總引數高達 975B,推理時僅啟動 41B 引數。支援文字、圖片、音訊三模態輸入,擁有 100 萬 token 的超長上下文視窗,並在 45 兆 token 的資料上從零預訓練。模型權重已在 Hugging Face 上以 Apache 2.0 授權完全開放。
一句話總結硬體需求:你不可能在本機跑。這不是給個人開發者下載到筆電玩的模型,而是定位在企業級部署。
在基準測試上,Inkling 最突出的勝利來自代理工具使用能力。MCP Atlas,一項衡量 AI 代理透過 Model Context Protocol 標準完成真實世界任務的指標,Inkling 拿下 74.1%,比 Nvidia Nemotron 3 Ultra 高出近 30 個百分點。在衡量自動化 GitHub 除錯能力的 SWE-Bench Verified 上,Inkling 也以 77.6% 勝過 Nemotron 的 70.7%。
但基準測試是一回事,實際坐下來使用是另一回事。Decrypt 團隊設計了一系列任務來模擬一般使用者的體驗,結果好壞參半。
首先是編碼,這正是多數開發者最關心的能力。在一個高複雜度提示詞(1,955 字、要求製作殭屍射擊遊戲)下,Inkling 直接產出一片空白畫面,完全無法執行。當團隊將提示縮減到 99 字後,模型終於產出了一個能跑的遊戲,但敵人是長方形和球體,沒有背景、沒有可視畫面,只有抽象幾何圖形在螢幕上移動。
輸入邏輯是正確的,鍵盤按鍵確實對應到字母、追蹤也穩定,但視覺呈現幾乎可以說是 MVP 的最低標。
創意寫作方面同樣兩極。當被要求以科幻作家菲力普.K.狄克的風格創作時,Inkling 產出了相當有水準的文學段落,「大海如此湛藍,藍得近乎淫蕩地敞開」。但細究之下,支撐這些華麗文字的邏輯極其薄弱:角色透過在海灘上說出「決定論」這個詞,就憑空產出了 2150 年的演算法,完全沒有推理過程。
更嚴重的問題是事實錯誤。Inkling 雖然正確地使用代理工具上網搜尋了西元 1000 年的海上貿易路線,卻為一位委內瑞拉作家憑空捏造了菲律賓-墨西哥血統,以及不存在的貿易路線。它在工具使用上做對了時代,卻完全搞錯了人。
Inkling 有一個值得一提的優點:隱私。即使在 Thinking Machines 自家介面上使用,模型也明確宣稱對話完全私密。對於不能將資料路由到北京伺服器的合規導向企業來說,這是一張有份量的牌。
價格方面,Inkling 已上線 OpenRouter,每百萬輸入 token 收費 1 美元、輸出 4.05 美元。任何透過 OpenRouter 路由的 Hermes 或 OpenClaw 設定都可以直接接入,無需額外配置。
但若以每美元能買到的編碼能力來衡量,中國模型仍然領先。Decrypt 的測試中,一款僅 27B 引數、能在手機上跑的模型,在編碼任務上就擊敗了 Inkling,這個事實比任何基準測試數字都更具說服力。
Inkling 的適用場景其實很明確。第一,有合規需求的組織,不能或不願將 AI 工作負載送到中國伺服器的歐美企業,Inkling 是極少數能用、能改、能自託管的西方開源高階模型。Apache 2.0 授權也讓法務團隊無後顧之憂。
第二,代理工具使用管線,MCP Atlas 74.1% 的分數意味著它在自動化工作流場景中有實戰價值,任何透過 OpenRouter 接入的 Hermes 或 OpenClaw 設定都可直接呼叫。
但對於預算敏感的小型開發者、追求極致編碼效能的工程師、或是需要無審查輸出的使用者來說,Inkling 目前還不是最佳選擇。27B 手機級模型就能在編碼上勝出的事實,說明「西方最強開源」這個標籤既是賣點,也是天花板。
Murati 的團隊從零打造了一個真正可訓練的基礎模型,這對西方開源生態的長期意義不可忽視。但第一版 Inkling 更像是一個專用工具,而不是日常驅動。它的存在證明瞭西方實驗室仍然有能力在開源賽道上競爭;下一步,是把「有能力」變成「有優勢」。
190.06萬 熱度
4.29萬 熱度
1.31億 熱度
75.45萬 熱度
11.49萬 熱度
OpenAI前技術長 Mira Murati 兩年首作實測:西方最強開源 AI,實測卻被手機模型打敗
前 OpenAI 技術長 Mira Murati 離開兩年後首作亮相:975B 引數開源模型 Inkling 號稱西方最強,但 Decrypt 完整實測揭露三大短版,複雜編碼全軍覆沒、創意寫作捏造事實、價效比不敵中國對手。
(前情提要:對話 ChatGPT 神秘教母》訓練資料是否侵權、Sora 比聊天機器人危險、GPT-5 有多強大?)
(背景補充:OpenAI 承認自家 AI 模型意外駭進 Hugging Face)
本文目錄
Toggle
離開 OpenAI 整整兩年後,前技術長 Mira Murati 終於在 7 月 15 日端出她新創公司 Thinking Machines Lab 的第一個作品,開源 AI 模型 Inkling。這是西方實驗室至今從零訓練出的最強開源模型,但在經過完整實測後,評價卻相當兩極:基準測試亮眼,實際使用體驗離「日常可用」還有一段距離。
Inkling 的誕生本身就帶有象徵意義。過去一年,開源 AI 賽道幾乎被中國團隊壟斷,阿里巴巴的 Qwen、Z.ai 的 GLM、Moonshot AI 的 Kimi 接連霸榜,西方實驗室僅有 Nvidia 的 Nemotron 勉強留在榜上,但離「頂尖」還很遠。Inkling 的出現,等於是西方陣營在開源戰場上的第一次有力回擊。
975B 引數 MoE 架構:規格豪華,但別想在本機跑
Inkling 採用混合專家(MoE)架構,總引數高達 975B,推理時僅啟動 41B 引數。支援文字、圖片、音訊三模態輸入,擁有 100 萬 token 的超長上下文視窗,並在 45 兆 token 的資料上從零預訓練。模型權重已在 Hugging Face 上以 Apache 2.0 授權完全開放。
一句話總結硬體需求:你不可能在本機跑。這不是給個人開發者下載到筆電玩的模型,而是定位在企業級部署。
在基準測試上,Inkling 最突出的勝利來自代理工具使用能力。MCP Atlas,一項衡量 AI 代理透過 Model Context Protocol 標準完成真實世界任務的指標,Inkling 拿下 74.1%,比 Nvidia Nemotron 3 Ultra 高出近 30 個百分點。在衡量自動化 GitHub 除錯能力的 SWE-Bench Verified 上,Inkling 也以 77.6% 勝過 Nemotron 的 70.7%。
實測環節:寫遊戲變方塊大戰、創意寫作捏造事實
但基準測試是一回事,實際坐下來使用是另一回事。Decrypt 團隊設計了一系列任務來模擬一般使用者的體驗,結果好壞參半。
首先是編碼,這正是多數開發者最關心的能力。在一個高複雜度提示詞(1,955 字、要求製作殭屍射擊遊戲)下,Inkling 直接產出一片空白畫面,完全無法執行。當團隊將提示縮減到 99 字後,模型終於產出了一個能跑的遊戲,但敵人是長方形和球體,沒有背景、沒有可視畫面,只有抽象幾何圖形在螢幕上移動。
輸入邏輯是正確的,鍵盤按鍵確實對應到字母、追蹤也穩定,但視覺呈現幾乎可以說是 MVP 的最低標。
創意寫作方面同樣兩極。當被要求以科幻作家菲力普.K.狄克的風格創作時,Inkling 產出了相當有水準的文學段落,「大海如此湛藍,藍得近乎淫蕩地敞開」。但細究之下,支撐這些華麗文字的邏輯極其薄弱:角色透過在海灘上說出「決定論」這個詞,就憑空產出了 2150 年的演算法,完全沒有推理過程。
更嚴重的問題是事實錯誤。Inkling 雖然正確地使用代理工具上網搜尋了西元 1000 年的海上貿易路線,卻為一位委內瑞拉作家憑空捏造了菲律賓-墨西哥血統,以及不存在的貿易路線。它在工具使用上做對了時代,卻完全搞錯了人。
隱私承諾是亮點,但價效比不敵中國模型
Inkling 有一個值得一提的優點:隱私。即使在 Thinking Machines 自家介面上使用,模型也明確宣稱對話完全私密。對於不能將資料路由到北京伺服器的合規導向企業來說,這是一張有份量的牌。
價格方面,Inkling 已上線 OpenRouter,每百萬輸入 token 收費 1 美元、輸出 4.05 美元。任何透過 OpenRouter 路由的 Hermes 或 OpenClaw 設定都可以直接接入,無需額外配置。
但若以每美元能買到的編碼能力來衡量,中國模型仍然領先。Decrypt 的測試中,一款僅 27B 引數、能在手機上跑的模型,在編碼任務上就擊敗了 Inkling,這個事實比任何基準測試數字都更具說服力。
誰該用 Inkling?合規企業與代理工作流
Inkling 的適用場景其實很明確。第一,有合規需求的組織,不能或不願將 AI 工作負載送到中國伺服器的歐美企業,Inkling 是極少數能用、能改、能自託管的西方開源高階模型。Apache 2.0 授權也讓法務團隊無後顧之憂。
第二,代理工具使用管線,MCP Atlas 74.1% 的分數意味著它在自動化工作流場景中有實戰價值,任何透過 OpenRouter 接入的 Hermes 或 OpenClaw 設定都可直接呼叫。
但對於預算敏感的小型開發者、追求極致編碼效能的工程師、或是需要無審查輸出的使用者來說,Inkling 目前還不是最佳選擇。27B 手機級模型就能在編碼上勝出的事實,說明「西方最強開源」這個標籤既是賣點,也是天花板。
Murati 的團隊從零打造了一個真正可訓練的基礎模型,這對西方開源生態的長期意義不可忽視。但第一版 Inkling 更像是一個專用工具,而不是日常驅動。它的存在證明瞭西方實驗室仍然有能力在開源賽道上競爭;下一步,是把「有能力」變成「有優勢」。