首頁 > 其他 > GPT-6.1性能提升表現

GPT-6.1性能提升表現

更新時間:2026-10-03 21:55:15 發布時間:11小時前 閱讀:3 views次

GPT-6.1性能提升表現

GPT-6.1 Sol在發佈後一周內便取代了前代GPT-6 Sol的位置。第三方評測機構Artificial Analysis將其置於Intelligence Index上,得分51.8,僅落後旗艦GPT-6 Astra 0.84分,而單任務評估成本僅為後者的約五分之一。這種”接近旗艦、成本驟降”的組合,是GPT-6.1最核心的性能提升特徵。以下從編程、計算機操作、知識工作、科學任務四個維度,梳理其實際表現。

編程能力的躍升

DeepSWE v1.1是衡量模型在真實程式碼庫中完成複雜軟體工程任務的基准。GPT-6.1 Sol在這項評估中以約五分之一的成本達到了與GPT-6 Astra相當的水平,同時以更低的推理強度和成本,比GPT-6 Sol的最高得分高出6.4個百分點。這一提升的獨特之處在於:使用者不需要把推理強度拉到最高,就能獲得超越前代最佳配置的編程能力。

Artificial Analysis的獨立數據提供了交叉驗證。在其Coding Agent Index中,GPT-6.1 Sol在xhigh推理設定下的得分比GPT-6 Astra高出1分,而單任務成本不到Astra的15%。從實際開發工作流的角度看,這意味着更快的響應速度與更低的調用成本可以同時實現,而非此前的二選一。Salesforce的工程負責人也公開表示,該模型在識別無障礙和語言支持問題、排查測試環境限制方面展現了”我們期望從AI編碼伙伴那裡獲得的問題解決能力”。

計算機操作能力的改善

OSWorld 2.0的離線測試集專門評估智能體操作電腦應用的能力。GPT-6.1 Sol在最高推理強度下的得分比GPT-6 Sol高出9.1個百分點,增幅相當可觀。

這個提升說明新版本在”看懂界麵、點對按鈕”這類實際操作上有明顯改善。對於需要自動化瀏覽器操作、填寫表單、操作軟體界麵的Agent任務來說,這個進步直接決定了可用性。相比之下,GPT-6 Sol在複雜界麵操作上經常出現”找不到按鈕”或”點錯位置”的問題,6.1 Sol在這方面的改進是實打實的。

知識工作場景的覆蓋

在MMLU-Pro和LiveCodeBench的測試中,GPT-6.1 Sol在中等難度推理任務上的表現與Astra基本持平,但在最高難度題目上仍有明顯差距。這符合OpenAI的產品策略——把90%的使用者日常場景做到接近旗艦水平,把剩下10%的極致推理留給Astra。

對於知識工作者來說,這個定位非常實用。日常的文檔總結、郵件回覆、數據表格分析,這些任務不需要模型去解最難的數學題,只需要它準確理解上下文并給出合理輸出。GPT-6.1 Sol在這些場景下的表現已經足夠好,而成本只有Astra的五分之一。

科學任務與極限推理

在GPQA Diamond和AIME 2026上,GPT-6.1 Sol與GPT-6 Astra的差距已經縮小到1到2個百分點。也就是說,如果你不是做最硬核的科研推理,Sol的表現已經夠用了。

但在最高難度的科學推理任務上,Sol仍有明顯差距。這是OpenAI刻意做的產品分層,把極致推理能力留給旗艦模型Astra,用Sol覆蓋大部分日常場景。

延伸閱讀:
GPT-6.1測試失敗原因
GPT-6.1模型性能評測