OpenAI发布GPT-6.1 Sol:性能逼近旗舰Astra,成本仅为其七分之一

SmartHey9月30日消息,在北京时间今日凌晨举行的OpenAI开发者活动日上,官方正式推出全新大语言模型——GPT-6.1 Sol。该模型在多项关键任务中性能接近旗舰级GPT-6 Astra,而单位Token成本仅为Astra的五分之一,被官方称为‘当前同性能水平下性价比最高的模型’。

GPT-6 Astra是OpenAI于2026年9月发布的旗舰模型,定位为‘迄今最智能、最对齐(即最精准响应人类意图)’的大模型,专为长周期、多步骤复杂任务及专业工作流设计。

在成本控制方面,GPT-6.1 Sol每百万Token缓存费用低至0.1美元,较前代GPT-6 Sol降价50%,大幅降低企业与开发者的推理开销。

性能实测显示:在智能体编程、电脑操作与专业工作流等核心场景中,GPT-6.1 Sol表现紧贴GPT-6 Astra;而标准输入/输出Token价格仅为Astra的20%。

软件工程(DeepSWE v1.1,高推理强度):GPT-6.1 Sol与GPT-6 Astra持平;在低推理强度设定下,其得分比GPT-6 Sol高出6.4个百分点。

专业文档与复杂任务(GDP.pdf):以不到Opus 5.5一半的成本,达成更优任务结果。

自动化工作流(AutomationBench,中等推理强度):得分领先Opus 5.5达2.2个百分点,成本约为其三分之一。

电脑操作(OSWorld 2.0离线版,最大推理强度):得分比GPT-6 Sol高7个百分点,成本不足其一半;相较Astra仅低2.1个百分点,但单任务成本约为Astra的七分之一。

科学终端任务(Terminal-Bench Science 0.1,最大推理强度):得分超GPT-6 Sol两倍以上;单任务平均成本仅5.47美元,显著低于Opus 5.5(23.21美元)与Astra(23.80美元)。

除高效能外,GPT-6.1 Sol在可靠性与对齐能力上亦有明显提升:

事实准确性增强:低推理强度下,事实错误率由GPT-6 Sol的11.4%降至7.7%,降幅约32%;在所有推理配置中,其错误率与Astra的差距稳定控制在1.9%以内。

用户意图遵循更严谨:在高难度评测中,更少忽略失效工具、更严格遵守显性约束,并显著减少未授权操作;安全测试中全程未出现绕过自动化审查器的行为。

调用支持已全面开放:自9月29日起,GPT-6.1 Sol已面向ChatGPT Work与Codex的Plus、Pro、Business、Enterprise及Edu订阅用户上线;开发者可通过API以模型标识符gpt-6.1-sol直接调用。