
GPT-6.1 Sol在發佈後一周內便取代了前代GPT-6 Sol的位置。第三方評測機構Artificial Analysis將其置於Intelligence Index上,得分51.8,僅落後旗艦GPT-6 Astra 0.84分,而單任務評估成本僅為後者的約五分之一。這種”接近旗艦、成本驟降”的組合,是GPT-6.1最核心的性能提升特徵。以下從編程、計算機操作、知識工作、科學任務四個維度,梳理其實際表現。
DeepSWE v1.1是衡量模型在真實程式碼庫中完成複雜軟體工程任務的基准。GPT-6.1 Sol在這項評估中以約五分之一的成本達到了與GPT-6 Astra相當的水平,同時以更低的推理強度和成本,比GPT-6 Sol的最高得分高出6.4個百分點。這一提升的獨特之處在於:使用者不需要把推理強度拉到最高,就能獲得超越前代最佳配置的編程能力。
Artificial Analysis的獨立數據提供了交叉驗證。在其Coding Agent Index中,GPT-6.1 Sol在xhigh推理設定下的得分比GPT-6 Astra高出1分,而單任務成本不到Astra的15%。從實際開發工作流的角度看,這意味着更快的響應速度與更低的調用成本可以同時實現,而非此前的二選一。Salesforce的工程負責人也公開表示,該模型在識別無障礙和語言支持問題、排查測試環境限制方面展現了”我們期望從AI編碼伙伴那裡獲得的問題解決能力”。
OSWorld 2.0的離線測試集專門評估智能體操作電腦應用的能力。GPT-6.1 Sol在最高推理強度下的得分比GPT-6 Sol高出9.1個百分點,增幅相當可觀。
這個提升說明新版本在”看懂界麵、點對按鈕”這類實際操作上有明顯改善。對於需要自動化瀏覽器操作、填寫表單、操作軟體界麵的Agent任務來說,這個進步直接決定了可用性。相比之下,GPT-6 Sol在複雜界麵操作上經常出現”找不到按鈕”或”點錯位置”的問題,6.1 Sol在這方面的改進是實打實的。
在MMLU-Pro和LiveCodeBench的測試中,GPT-6.1 Sol在中等難度推理任務上的表現與Astra基本持平,但在最高難度題目上仍有明顯差距。這符合OpenAI的產品策略——把90%的使用者日常場景做到接近旗艦水平,把剩下10%的極致推理留給Astra。
對於知識工作者來說,這個定位非常實用。日常的文檔總結、郵件回覆、數據表格分析,這些任務不需要模型去解最難的數學題,只需要它準確理解上下文并給出合理輸出。GPT-6.1 Sol在這些場景下的表現已經足夠好,而成本只有Astra的五分之一。
在GPQA Diamond和AIME 2026上,GPT-6.1 Sol與GPT-6 Astra的差距已經縮小到1到2個百分點。也就是說,如果你不是做最硬核的科研推理,Sol的表現已經夠用了。
但在最高難度的科學推理任務上,Sol仍有明顯差距。這是OpenAI刻意做的產品分層,把極致推理能力留給旗艦模型Astra,用Sol覆蓋大部分日常場景。
延伸閱讀:
GPT-6.1測試失敗原因
GPT-6.1模型性能評測
即夢怎麼製作?它是字節跳動旗下的AI創作工具,能生成圖片、影片,也能做數字人口播和故事短片。很多人卡住不是不會操作,是...
2026-10-02
汽車之家極速版邀請碼92871546,在“賺錢-新手任務-填寫邀請碼”中,填後可領500金幣。下載汽車之家極速版,能領最高18元新人紅...
2020-09-07賺客官方邀請碼是多少?賺客邀請碼在哪裏輸入?是8264415。在“我的邀請人”頁麵,可以輸入賺客邀請碼。 1.賺客官方邀請碼是多...
2019-11-27
uc瀏覽器極速版怎麼退出登入帳號?在uc瀏覽器極速版,點擊“任務-頭像”,再點頭像。在管理頁,點擊右上角“…”,退出。 ...
2022-02-18
很多人聽說快手出了個AI影片創作工具叫likli,但不知道它什麼時候開始內測、怎麼申請、現在能不能用。這篇文章把likli的內測...
2026-09-30