首页 > 其他 > GPT-6.1性能提升表现

GPT-6.1性能提升表现

更新时间:2026-10-03 21:13:19 发布时间:10小时前 阅读:11次

GPT-6.1性能提升表现

GPT-6.1 Sol在发布后一周内便取代了前代GPT-6 Sol的位置。第三方评测机构Artificial Analysis将其置于Intelligence Index上,得分51.8,仅落后旗舰GPT-6 Astra 0.84分,而单任务评估成本仅为后者的约五分之一。这种”接近旗舰、成本骤降”的组合,是GPT-6.1最核心的性能提升特征。以下从编程、计算机操作、知识工作、科学任务四个维度,梳理其实际表现。

编程能力的跃升

DeepSWE v1.1是衡量模型在真实代码库中完成复杂软件工程任务的基准。GPT-6.1 Sol在这项评估中以约五分之一的成本达到了与GPT-6 Astra相当的水平,同时以更低的推理强度和成本,比GPT-6 Sol的最高得分高出6.4个百分点。这一提升的独特之处在于:用户不需要把推理强度拉到最高,就能获得超越前代最佳配置的编程能力。

Artificial Analysis的独立数据提供了交叉验证。在其Coding Agent Index中,GPT-6.1 Sol在xhigh推理设置下的得分比GPT-6 Astra高出1分,而单任务成本不到Astra的15%。从实际开发工作流的角度看,这意味着更快的响应速度与更低的调用成本可以同时实现,而非此前的二选一。Salesforce的工程负责人也公开表示,该模型在识别无障碍和语言支持问题、排查测试环境限制方面展现了”我们期望从AI编码伙伴那里获得的问题解决能力”。

计算机操作能力的改善

OSWorld 2.0的离线测试集专门评估智能体操作电脑应用的能力。GPT-6.1 Sol在最高推理强度下的得分比GPT-6 Sol高出9.1个百分点,增幅相当可观。

这个提升说明新版本在”看懂界面、点对按钮”这类实际操作上有明显改善。对于需要自动化浏览器操作、填写表单、操作软件界面的Agent任务来说,这个进步直接决定了可用性。相比之下,GPT-6 Sol在复杂界面操作上经常出现”找不到按钮”或”点错位置”的问题,6.1 Sol在这方面的改进是实打实的。

知识工作场景的覆盖

在MMLU-Pro和LiveCodeBench的测试中,GPT-6.1 Sol在中等难度推理任务上的表现与Astra基本持平,但在最高难度题目上仍有明显差距。这符合OpenAI的产品策略——把90%的用户日常场景做到接近旗舰水平,把剩下10%的极致推理留给Astra。

对于知识工作者来说,这个定位非常实用。日常的文档总结、邮件回复、数据表格分析,这些任务不需要模型去解最难的数学题,只需要它准确理解上下文并给出合理输出。GPT-6.1 Sol在这些场景下的表现已经足够好,而成本只有Astra的五分之一。

科学任务与极限推理

在GPQA Diamond和AIME 2026上,GPT-6.1 Sol与GPT-6 Astra的差距已经缩小到1到2个百分点。也就是说,如果你不是做最硬核的科研推理,Sol的表现已经够用了。

但在最高难度的科学推理任务上,Sol仍有明显差距。这是OpenAI刻意做的产品分层,把极致推理能力留给旗舰模型Astra,用Sol覆盖大部分日常场景。

延伸阅读:
GPT-6.1测试失败原因
GPT-6.1模型性能评测

标签:
相关文章