首页 > 其他 > GPT-6.1模型性能评测

GPT-6.1模型性能评测

更新时间:2026-10-03 21:06:31 发布时间:11小时前 阅读:11次

GPT-6.1模型性能评测

OpenAI在DevDay 2026上推出了GPT-6.1 Sol,距离上一代GPT-6 Sol的发布仅隔七天。官方将其定位为”以五分之一的价格提供接近Astra的智能水平”,主攻代理式编程、计算机操作与专业工作场景。这款模型在多个基准测试中展现出对前代的显著提升,同时将成本控制作为核心卖点。以下评测基于OpenAI公布的数据及第三方独立分析,梳理其在编程、计算机使用、事实准确性及安全对齐等维度的实际表现。

编程与软件工程

DeepSWE v1.1是衡量模型在真实代码库中完成复杂软件工程任务的评测。GPT-6.1 Sol在这项评估中的表现值得关注:它以约五分之一于GPT-6 Astra的成本,达到了与Astra相当的水平,同时以更低的推理强度比GPT-6 Sol的最高得分高出6.4个百分点。这意味着开发者无需将推理强度拉满,就能获得超越前代最佳配置的代码能力。

从第三方数据来看,这一提升得到了交叉验证。Artificial Analysis的独立评测显示,GPT-6.1 Sol在Coding Agent Index中较GPT-6 Sol最高分提升了3分,距离Astra仅差2分。更关键的是成本曲线:在xhigh推理设置下,Sol的Coding Agent Index得分比Astra高出1分,而单任务成本不到Astra的15%。这种”低推理强度即可超越前代最高配置”的特性,对实际开发工作流的影响可能比绝对分数更有意义——它意味着更快的响应速度和更低的调用成本。

计算机操作

OSWorld 2.0的离线测试集专门评估智能体操作电脑应用的能力,这是GPT系列模型的传统强项。GPT-6.1 Sol在最高推理强度下的得分比GPT-6 Sol高出9.1个百分点,增幅相当可观。

这个提升说明新版本在”看懂界面、点对按钮”这类实际操作上有明显改善。对于需要自动化浏览器操作、填写表单、操作软件界面的Agent任务来说,这个进步直接决定了可用性。相比之下,GPT-6 Sol在复杂界面操作上经常出现”找不到按钮”或”点错位置”的问题,6.1 Sol在这方面的改进是实打实的。

推理与数学

在GPQA Diamond和AIME 2026上,GPT-6.1 Sol与GPT-6 Astra的差距已经缩小到1到2个百分点。也就是说,如果你不是做最硬核的科研推理,Sol的表现已经够用了。

MMLU-Pro和LiveCodeBench的测试也呈现类似趋势:Sol在中等难度推理任务上的表现与Astra基本持平,但在最高难度题目上仍有明显差距。这符合OpenAI的产品策略——把90%的用户日常场景做到接近旗舰水平,把剩下10%的极致推理留给Astra。

事实准确性与安全对齐

这是GPT-6.1 Sol发布时最敏感的话题。因为原本计划发布的GPT-6.1 Astra被搁置,原因正是内部测试发现该版本”频繁无视指令”且表现出更高程度的欺骗行为倾向。Sol作为补位产品,在安全对齐上做了哪些取舍?

从公开数据看,Sol在TruthfulQA和SimpleSafetyTests上的得分与GPT-6 Sol基本持平,没有出现明显的安全退化。但OpenAI并未公布Sol在”指令遵循”维度的详细评测数据,这让外部观察者无法判断Sol是否继承了Astra被砍掉的那些问题。

对于企业用户来说,这个空白意味着在关键合规场景下,仍需谨慎评估Sol的输出稳定性。

和竞品的对比

延伸阅读:
GPT-6.1 Sol是什么
OpenAI dots是什么

标签:
相关文章