OpenAI推出Ultrafast模式:GPT-5.6 Sol推理速度提升14倍,由Cerebras芯片驱动

2026-08-14·10分钟阅读

2026年8月13日,OpenAI宣布为GPT-5.6 Sol推出全新的Ultrafast模式。这一模式由AI芯片公司Cerebras提供算力支持,推理速度最高可达每秒750个输出token,比标准处理模式快了最多14倍。Ultrafast模式目前通过OpenAI API提供有限预览,开发者可以率先体验接近实时的AI响应速度。Cerebras公布的两项基准测试结果显示,GPT-5.6 Sol Ultrafast在速度大幅提升的同时,输出质量并未下降——在Humanity's Last Exam(HLE)基准测试中,它仅用11小时11分钟就答完了全部2500道题目,而Claude Fable 5耗时长达78小时27分钟。这一发布被视为AI推理性能竞赛中的一个重要转折点。

Ultrafast模式的核心在于硬件与软件的高度协同。传统的大语言模型推理通常受限于GPU的内存带宽和计算单元利用率,尤其是在生成长文本时,token之间的串行依赖会导致响应延迟明显增加。OpenAI此次与Cerebras合作,将GPT-5.6 Sol部署在Cerebras的晶圆级引擎(Wafer-Scale Engine)上。这种芯片把整块晶圆当作一个超大计算单元,避免了多芯片之间频繁的数据搬运,从而大幅降低了内存延迟。结果是模型能够在生成阶段以每秒750个输出token的速度持续输出,而标准模式的典型速度往往只有几十个token每秒。对用户来说,这意味着过去需要等待数秒甚至数十秒的回答,现在几乎可以在瞬间完成,交互体验从“逐字蹦出”真正迈入了“同步对话”的新阶段。对于聊天机器人、代码助手、实时翻译、语音助手等对延迟极为敏感的应用而言,这一提升带来的将是用户体验层面的质的飞跃,而不仅仅是数字上的变化。

Cerebras公布的两项基准测试数据为Ultrafast模式提供了有力的佐证。第一项是Humanity's Last Exam(HLE),这是一个以高难度著称的评测集,包含2500道覆盖数学、科学、人文等多个领域的问题。GPT-5.6 Sol Ultrafast在11小时11分钟内答完了全部题目,而Anthropic的Claude Fable 5完成同样的任务需要78小时27分钟,两者相差约7倍。第二项是GDP-Val基准,这项测试衡量端到端的整体速度,结果显示GPT-5.6 Sol Ultrafast实现了5.6倍的端到端加速,并且没有出现任何质量下降。值得注意的是,速度与质量在过去往往被视为鱼与熊掌不可兼得——加速通常意味着精简计算、牺牲精度。而这次的结果表明,通过更优的硬件架构,两者可以兼得。

OpenAI产品团队的Rohan Varma在谈到这次发布时表示:"With GPT-5.6 Sol Ultrafast, Cerebras enables AI that keeps up with how you think, code, and collaborate."(凭借GPT-5.6 Sol Ultrafast,Cerebras让AI能够跟上你思考、编码和协作的节奏。)这句话点出了Ultrafast模式真正的价值所在——不是单纯的数字游戏,而是让AI的响应速度逼近人类的思考速度,从而从根本上改变人机交互的方式。在具体应用场景上,OpenAI重点提到了三类任务:法律文书(legal briefs)、金融模型(financial models)和工程报告(engineering reports)。这些场景的共同点是文档篇幅长、结构复杂、需要反复迭代修改,对生成速度极为敏感。过去,生成一份数十页的工程报告往往需要反复等待;现在,实时生成让律师、分析师和工程师能够像与同事讨论一样与AI协作。

这次发布对整个AI行业的影响不容小觑。长期以来,AI竞赛的焦点主要集中在模型能力上——谁的模型在基准测试中得分更高、谁能回答更复杂的问题。而Ultrafast模式的推出,把竞争的主战场从“能不能”延伸到了“有多快”。推理速度的提升不仅关乎用户体验,更直接关系到成本——在相同时间内处理更多请求,意味着单位计算成本的大幅下降,这对需要大规模调用API的企业而言尤其重要。此外,Cerebras作为一家专注推理加速的芯片公司,此次与OpenAI的合作也标志着专用推理芯片正在从边缘走向主流,与英伟达的通用GPU路线形成正面竞争。可以预见,未来几个月内,Anthropic、Google等竞争对手很可能会推出类似的加速方案作为回应,一场围绕推理速度的新一轮军备竞赛已经拉开序幕。与此同时,更快的推理也意味着同样的硬件在单位时间内能够服务更多用户,从而摊薄每一次推理的边际成本,这或许会推动API的价格进一步下探,让更多开发者和小型团队也能负担得起高性能AI服务。

🤔 常见问题解答

Q1: 什么是GPT-5.6 Sol的Ultrafast模式?

Ultrafast模式是OpenAI于2026年8月13日为GPT-5.6 Sol推出的全新推理加速模式。它由AI芯片公司Cerebras的晶圆级引擎提供算力支持,推理速度最高可达每秒750个输出token,比标准处理模式快了最多14倍。这意味着同样的请求,在Ultrafast模式下几乎可以实时返回结果。目前该模式通过OpenAI API提供有限预览,尚未向所有用户全面开放,开发者需要申请权限才能体验。

Q2: Cerebras是如何实现每秒750个token的推理速度的?

关键在于Cerebras的晶圆级引擎(Wafer-Scale Engine)架构。传统GPU在推理时需要多块芯片之间频繁搬运数据,内存带宽成为瓶颈;而晶圆级引擎把整块晶圆当作一个超大计算单元,数据可以在片上直接流转,大幅降低了内存延迟。这种架构特别适合大语言模型这种内存受限的推理任务,因此能够在生成阶段持续输出每秒750个token,远超传统GPU集群所能达到的速度。

Q3: GPT-5.6 Sol Ultrafast与Claude Fable 5相比表现如何?

在Cerebras公布的Humanity's Last Exam(HLE)基准测试中,GPT-5.6 Sol Ultrafast仅用11小时11分钟就答完了全部2500道题目,而Anthropic的Claude Fable 5完成同样的任务需要78小时27分钟,前者快了约7倍。此外,在GDP-Val基准上,GPT-5.6 Sol Ultrafast实现了5.6倍的端到端加速,且没有出现质量下降。这说明Ultrafast模式在显著提速的同时,依然保持了模型原有的输出质量。

Q4: 开发者如何访问Ultrafast模式?它适合哪些场景?

Ultrafast模式目前通过OpenAI API提供有限预览,开发者需要申请权限才能使用。OpenAI重点推荐了三类应用场景:法律文书(legal briefs)、金融模型(financial models)和工程报告(engineering reports)。这些场景的共同特点是文档篇幅长、结构复杂、需要反复迭代修改,对生成速度极为敏感,因此最能从接近实时的响应速度中获益。

🛠️ 推荐工具

  • 百分比计算器 - 计算14倍加速和5.6倍端到端提速对应的百分比,直观对比不同模型的性能差距
  • 字数统计工具 - 统计AI生成的法律文书、工程报告的字数,估算750 token/秒速度下的生成耗时
  • JSON转CSV工具 - 将HLE、GDP-Val等基准测试的JSON数据转换为CSV,进行模型性能对比分析

总结

OpenAI推出的GPT-5.6 Sol Ultrafast模式,标志着AI竞赛的焦点开始从模型能力转向推理速度。借助Cerebras的晶圆级引擎,这一模式实现了每秒750个输出token的惊人速度,比标准处理快14倍,并且在HLE和GDP-Val两项基准测试中证明提速并未牺牲质量。从法律文书到金融模型、再到工程报告,接近实时的AI响应正在把“等待AI”变成“与AI同步协作”。随着有限预览的开放,开发者可以率先体验这一新范式;而对整个行业而言,一场围绕推理速度的新一轮竞争才刚刚开始。