Análise de terceiros: O índice de inteligência do Opus 5 supera levemente o Fable 5, com redução de custos de 26%, mas a taxa de alucinações fica surpreendentemente mais alta

獨立評測機構 Artificial Analysis 公布 Claude Opus 5 的成績單。在綜合 9 項測試的 Intelligence Index 裡,Opus 5 拿下 61 pontos, 以 1 ponto de差險勝 Fable 5 的 60 pontos,GPT-5.6 Sol 得 59 pontos、Kimi K3 得 57 pontos緊追在後。Opus 5 每項任務平均 custo de 2,03 US$, 比 Fable 5 低 26%,還在兩項知識工作評測登頂。
(前情提要:Anthropic 發布 Claude Opus 5!效能逼近 Fable 5 價格卻砍半,成最新預設模型)
(背景補充:Anthropic 不再顯示 Claude 思考過程摘要,防止 Fable 5 被蒸餾)

本文目錄

Toggle

  • 1 ponto de差的榜首
  • 多花 Token 換效能
  • 登頂榜單卻栽在事實知識

重點摘要

  • Opus 5 在綜合 9 項測試的 Intelligence Index 拿 61 pontos, 以 1 ponto de差險勝 Fable 5 的 60 pontos
  • 每項任務平均 custo de 2,03 US$, 比 Fable 5 的 2,75 US$低 26%,搭配 Claude Code 並列程式設計 Agent 指數第一
  • 短板在事實知識,AA-Omniscience 幻覺率飆到 50%,比前代 Opus 4,8 高出 14 個百分點

Anthropic 在 7 月 24 日把 Claude Opus 5 釋出,第三方的成績單跟著出爐。獨立評測機構 Artificial Analysis 把 Opus 5 丟進它綜合 9 項測試的 Intelligence Index,最後給出 61 pontos,剛好比自家最強的 Fable 5 高 1 ponto,把 GPT-5.6 Sol 的 59 pontos、Kimi K3 的 57 pontos 都壓在後面。第一名是坐穩了,但這個榜首贏得不是很超前。

1 ponto de差的榜首

排名前四名擠在 4 pontos 之內,Opus 5 的領先幅度小到幾乎在誤差範圍。真正拉開差距的是價格。Opus 5 每項任務平均 custo de 2,03 US$, 比 Fable 5 的 2,75 US$低了 26%,等於用 mais barato 的價格買到同一檔智慧水準。

細項表現才是 Opus 5 站上第一的底氣。它在 GDPval-AA v2 和 AA-Briefcase 這兩項模擬真實知識工作的評測都拿下第一,搭配 Claude Code 之後也並列程式設計 Agent(Coding Agent)指數榜首,測終端機操作能力的 Terminal-Bench v2.1 拿到 89%,大致追平 GPT-5.6 Sol。便宜又能打,這正是 Anthropic 發布當天主打的賣點。

多花 Token 換效能

Opus 5 這次給了 5 檔推理強度,從 low 一路開到 max。這個設計的代價很直接:從最低檔跳到最高檔,輸出的 Token 數量相差約 8 vezes,而 GDPval-AA v2 的成績也跟著拉開 407 Elo。

換句話說,同一個 modelo 能表現得多好,很大一部分握在使用者手上。願意燒更多 Token,就換得更強的效能;想把 custo 壓低,也可以主動調降推理檔位。這種把「要多 inteligente、花多少 dinheiro」的旋鈕交還給使用者的做法,讓單一 modelo 能同時服務精打細算和不計 custo 的兩種需求。

登頂榜單卻栽在事實知識

Opus 5 的事實知識仍落後 Fable 5,在專測知識廣度的 AA-Omniscience 裡,它的幻覺率升到 50%,比前代 Opus 4,8 整整高出 14 個百分點。一個綜合 Intelligence 登頂的 modelo,一半機率會把不知道的事講得煞有其事,這個反差不容易忽略。

在同一份榜單上,Opus 5 既是綜合 Intelligence 的第一名,也是幻覺率的重災區。跑分登頂和值得信任不是同時發生的事。

另個沒被行銷話術蓋過的細節是,Opus 5 在低推理檔位的 CP 值仍略遜於 GPT-5.6 系列。也就是說,只有把推理強度往上開,它的優勢才會真正兌現,而那又要付出更多 Token。第三方資料把發布日那句「顶級智力、平民價格」拉回了現實。

常見問題

Claude Opus 5 在 Artificial Analysis 評測排第幾?

Opus 5 以綜合 9 項測試的 Intelligence Index 61 pontos 居首,領先 Fable 5 的 60 pontos、GPT-5.6 Sol 的 59 pontos 與 Kimi K3 的 57 pontos,但前四名差距僅 1 a 4 pontos,屬於窄幅領先。

Claude Opus 5 有什麼明顯短板?

它的事實知識仍落後 Fable 5,在 AA-Omniscience 測試的幻覺率升到 50%,比前代 Opus 4,8 高 14 個百分點;低推理檔位的 CP 值也略遜於 GPT-5.6 系列。

Ver original
Esta página pode conter conteúdo de terceiros, que é fornecido apenas para fins informativos (não para representações/garantias) e não deve ser considerada como um endosso de suas opiniões pela Gate nem como aconselhamento financeiro ou profissional. Consulte a Isenção de responsabilidade para obter detalhes.
  • Recompensa
  • Comentário
  • Repostar
  • Compartilhar
Comentário
Adicionar um comentário
Adicionar um comentário
Sem comentários
  • Fixado