首頁LBank 新聞中心
中國的 DeepSeek 升級 V4 Pro:Claude Fable 僅好 5%,價格卻高出 4,500%
china-deepseek-upgrades-v4-pro-claude-fable
中國的 DeepSeek 升級 V4 Pro:Claude Fable 僅好 5%,價格卻高出 4,500%
4 月的預覽版在基準測試中被反覆檢驗到幾乎無所遁形,最後比 Anthropic 的旗艦模型落後 18 分。DeepSeek 對正式版模型所公布的數據,則呈現出截然不同的情況。
2026-08-12 來源:decrypt.co

簡要來說

  • DeepSeek 悄悄地將 deepseek-v4-pro 更換為 0813 版本,這是自四月以來一直以預覽版形式運行的模型的正式發布版本。
  • 在九個對兩種模型進行評分的代理基準測試中,DeepSeek 的表格顯示 Claude Fable 5 平均領先 5.3%。其中兩個 DeepSeek 獲勝。
  • Fable 5 的成本為每百萬輸入代幣 10 美元,每百萬輸出代幣 50 美元。V4 Pro 的成本為 0.435 美元和 0.87 美元。

DeepSeek 於週三悄無聲息地發布了其旗艦產品的最終版本,沒有任何部落格文章或公告。線索是表格中的一個儲存格:「deepseek-v4-pro」在 API 定價頁面上的模型版本現在顯示為 DeepSeek-V4-Pro-0813。

使用此模型的成本約為每百萬輸入和輸出代幣(模型可處理的基本資訊單位)0.435 美元和 0.87 美元。因此,定價結構保持不變,但底層的權重有所改變。

Deepseek V4 Pro 自四月以來一直廣為人知,價格比 GPT-5 Pro 低 98%,並且每個獨立測試它的實驗室當時都在測試預覽版。DeepSeek 在 7 月 31 日將 V4-Flash 推向正式發布時自己也表示,Pro API「未變」,正式發布「即將跟進」。Hugging Face(開源 AI 專案的首選儲存庫)上的模型卡片仍然將 V4 系列描述為「預覽版本」。

因此,廣泛流傳的評分所描述的是 DeepSeek 認為尚未完成的版本。公司外部沒有人獨立測試過 0813。

DeepSeek 的表格聲稱了什麼

該公司發布了跨越 10 個代理基準測試的比較結果。在 Fable 5 或其他模型佔優勢的八個測試中,差距很小。

將 Fable 5 在所有基準測試中的相對領先優勢平均,你會得到 5.3%。如果去除「Humanity’s Last Exam without tools」(DeepSeek 得分 42.7,而 Fable 5 得分 53.3,這個 10.6% 的差距會扭曲所有結果),剩下的平均差距為 2.8%。

雙方的定價都是公開的,這也讓比較不再勢均力敵。Fable 5 每百萬輸入代幣的成本為 10 美元,每百萬輸出代幣為 50 美元。V4 Pro 的成本為 0.435 美元和 0.87 美元,緩存輸入為 0.003625 美元。綜合費率計算,Fable 5 的 30 美元對比 V4 Pro 的 0.65 美元——大約是 46 倍,或者說成本高出 4,600%。這種巨大的差距在企業大規模使用 AI 工具時至關重要。

每完成任務的成本差距更大,因為 Fable 5 的思考時間更長,輸出內容也更多。Artificial Analysis 測量顯示,每個基準任務 Fable 5 的成本為 3.15 美元,而 V4-Flash 僅為 3 美分,便宜約 105 倍。Hugging Face 執行長 Clément Delangue 表示,差距超過每個任務 31 美元對比大約 0.04 美元。0813 的單任務成本數據尚不存在。

Anthropic 自己的產品線使得其高價位更加複雜。Claude Opus 5 在大多數基準測試中得分都高於 Fable 5,但價格卻是後者的一半。

DeepSeek 在其尚未發布的基礎設施上自行評分了這些結果。其七月份的說明指出,DeepSeek Harness 最小模式「即將發布」,該模式將以最大努力和高創造力運行。在十個基準測試中,有兩個——DSBench-FullStack 和 DSBench-Hard——是內部測試集,沒有公開排行榜可供比對。

不過,發展方向是一致的。中國的開源權重實驗室在性能上與美國領先者僅有數點之遙,但價格卻低廉得多——Kimi K3 在發布時擊敗了 Fable 5 和 GPT-5.6 Sol,而 DeepSeek 和小米在降低前沿成本方面達到 99%,而美國實驗室則朝著相反方向發展。DeepSeek 的權重是 MIT 授權的,並可在 Hugging Face 上取得,因此獨立驗證僅需下載即可。