
GPT-6.1 Sol在发布后一周内便取代了前代GPT-6 Sol的位置。第三方评测机构Artificial Analysis将其置于Intelligence Index上,得分51.8,仅落后旗舰GPT-6 Astra 0.84分,而单任务评估成本仅为后者的约五分之一。这种”接近旗舰、成本骤降”的组合,是GPT-6.1最核心的性能提升特征。以下从编程、计算机操作、知识工作、科学任务四个维度,梳理其实际表现。
DeepSWE v1.1是衡量模型在真实代码库中完成复杂软件工程任务的基准。GPT-6.1 Sol在这项评估中以约五分之一的成本达到了与GPT-6 Astra相当的水平,同时以更低的推理强度和成本,比GPT-6 Sol的最高得分高出6.4个百分点。这一提升的独特之处在于:用户不需要把推理强度拉到最高,就能获得超越前代最佳配置的编程能力。
Artificial Analysis的独立数据提供了交叉验证。在其Coding Agent Index中,GPT-6.1 Sol在xhigh推理设置下的得分比GPT-6 Astra高出1分,而单任务成本不到Astra的15%。从实际开发工作流的角度看,这意味着更快的响应速度与更低的调用成本可以同时实现,而非此前的二选一。Salesforce的工程负责人也公开表示,该模型在识别无障碍和语言支持问题、排查测试环境限制方面展现了”我们期望从AI编码伙伴那里获得的问题解决能力”。
OSWorld 2.0的离线测试集专门评估智能体操作电脑应用的能力。GPT-6.1 Sol在最高推理强度下的得分比GPT-6 Sol高出9.1个百分点,增幅相当可观。
这个提升说明新版本在”看懂界面、点对按钮”这类实际操作上有明显改善。对于需要自动化浏览器操作、填写表单、操作软件界面的Agent任务来说,这个进步直接决定了可用性。相比之下,GPT-6 Sol在复杂界面操作上经常出现”找不到按钮”或”点错位置”的问题,6.1 Sol在这方面的改进是实打实的。
在MMLU-Pro和LiveCodeBench的测试中,GPT-6.1 Sol在中等难度推理任务上的表现与Astra基本持平,但在最高难度题目上仍有明显差距。这符合OpenAI的产品策略——把90%的用户日常场景做到接近旗舰水平,把剩下10%的极致推理留给Astra。
对于知识工作者来说,这个定位非常实用。日常的文档总结、邮件回复、数据表格分析,这些任务不需要模型去解最难的数学题,只需要它准确理解上下文并给出合理输出。GPT-6.1 Sol在这些场景下的表现已经足够好,而成本只有Astra的五分之一。
在GPQA Diamond和AIME 2026上,GPT-6.1 Sol与GPT-6 Astra的差距已经缩小到1到2个百分点。也就是说,如果你不是做最硬核的科研推理,Sol的表现已经够用了。
但在最高难度的科学推理任务上,Sol仍有明显差距。这是OpenAI刻意做的产品分层,把极致推理能力留给旗舰模型Astra,用Sol覆盖大部分日常场景。
延伸阅读:
GPT-6.1测试失败原因
GPT-6.1模型性能评测
GPT-6.1 Sol的定价表看起来简单,但其中藏着一个容易被误读的结构。官方宣传”五分之一于Astra的价格”,这个表述...
2026-10-03
GPT-6.1 Sol发布后,官方基准数据看似亮眼,但实际测试中暴露出一系列结构性问题。第三方评测显示,模型在代理任务上运行时...
2026-10-03
2026年9月29日,OpenAI在旧金山DevDay上正式发布GPT-6.1 Sol。这是一款定位中端的模型,官方宣称其性能接近旗舰级GPT-6 Astr...
2026-10-03
OpenAI在DevDay 2026上推出了GPT-6.1 Sol,距离上一代GPT-6 Sol的发布仅隔七天。官方将其定位为”以五分之一的价格提供...
2026-10-03
任务达人邀请码R46904380,注册时可填。单次提现20元以内,实时到账。大于20元一个工作日,最高可提5万元。在任务达人APP,可...
2020-07-01