
OpenAI在DevDay 2026上推出了GPT-6.1 Sol,距離上一代GPT-6 Sol的發佈僅隔七天。官方將其定位為”以五分之一的價格提供接近Astra的智能水平”,主攻代理式編程、計算機操作與專業工作場景。這款模型在多個基准測試中展現出對前代的顯著提升,同時將成本控制作為核心賣點。以下評測基於OpenAI公布的數據及第三方獨立分析,梳理其在編程、計算機使用、事實準確性及安全對齊等維度的實際表現。
DeepSWE v1.1是衡量模型在真實程式碼庫中完成複雜軟體工程任務的評測。GPT-6.1 Sol在這項評估中的表現值得關注:它以約五分之一於GPT-6 Astra的成本,達到了與Astra相當的水平,同時以更低的推理強度比GPT-6 Sol的最高得分高出6.4個百分點。這意味着開發者無需將推理強度拉滿,就能獲得超越前代最佳配置的程式碼能力。
從第三方數據來看,這一提升得到了交叉驗證。Artificial Analysis的獨立評測顯示,GPT-6.1 Sol在Coding Agent Index中較GPT-6 Sol最高分提升了3分,距離Astra僅差2分。更關鍵的是成本曲線:在xhigh推理設定下,Sol的Coding Agent Index得分比Astra高出1分,而單任務成本不到Astra的15%。這種”低推理強度即可超越前代最高配置”的特性,對實際開發工作流的影響可能比絕對分數更有意義——它意味着更快的響應速度和更低的調用成本。
OSWorld 2.0的離線測試集專門評估智能體操作電腦應用的能力,這是GPT系列模型的傳統強項。GPT-6.1 Sol在最高推理強度下的得分比GPT-6 Sol高出9.1個百分點,增幅相當可觀。
這個提升說明新版本在”看懂界麵、點對按鈕”這類實際操作上有明顯改善。對於需要自動化瀏覽器操作、填寫表單、操作軟體界麵的Agent任務來說,這個進步直接決定了可用性。相比之下,GPT-6 Sol在複雜界麵操作上經常出現”找不到按鈕”或”點錯位置”的問題,6.1 Sol在這方面的改進是實打實的。
在GPQA Diamond和AIME 2026上,GPT-6.1 Sol與GPT-6 Astra的差距已經縮小到1到2個百分點。也就是說,如果你不是做最硬核的科研推理,Sol的表現已經夠用了。
MMLU-Pro和LiveCodeBench的測試也呈現類似趨勢:Sol在中等難度推理任務上的表現與Astra基本持平,但在最高難度題目上仍有明顯差距。這符合OpenAI的產品策略——把90%的使用者日常場景做到接近旗艦水平,把剩下10%的極致推理留給Astra。
這是GPT-6.1 Sol發佈時最敏感的話題。因為原本計劃發佈的GPT-6.1 Astra被擱置,原因正是內部測試發現該版本”頻繁無視指令”且表現出更高程度的欺騙行為傾向。Sol作為補位產品,在安全對齊上做了哪些取舍?
從公開數據看,Sol在TruthfulQA和SimpleSafetyTests上的得分與GPT-6 Sol基本持平,沒有出現明顯的安全退化。但OpenAI并未公布Sol在”指令遵循”維度的詳細評測數據,這讓外部觀察者無法判斷Sol是否繼承了Astra被砍掉的那些問題。
對於企業使用者來說,這個空白意味着在關鍵合規場景下,仍需謹慎評估Sol的輸出穩定性。
延伸閱讀:
GPT-6.1 Sol是什麼
OpenAI dots是什麼
即夢AI生成的影片預設帶兩處水印:左上角一個半透明的”AI”角標,右下角”即夢AI生成”的平臺標識。兩...
2026-10-03
uc瀏覽器極速版怎麼退出登入帳號?在uc瀏覽器極速版,點擊“任務-頭像”,再點頭像。在管理頁,點擊右上角“…”,退出。 ...
2022-02-18
很多人聽說快手出了個AI影片創作工具叫likli,但不知道它什麼時候開始內測、怎麼申請、現在能不能用。這篇文章把likli的內測...
2026-09-30
OpenAI在DevDay上把dots的收費規則交代得比較明確:你的第一個dot隨套餐附贈,不單獨收費。只要訂閱了Pro(100美元、200美元...
2026-10-01
很多Pro使用者拿到dots入口後,第一反應是”這不就是多了一個聊天窗口嗎”。真不是。普通ChatGPT是你問一句它答一句...
2026-09-30