GEO资讯

OpenAI推Ultrafast模式,旗舰模型提速14倍

发布于 2026/8/17 63 次阅读
OpenAI推Ultrafast模式,旗舰模型提速14倍

OpenAI推Ultrafast模式,旗舰模型提速14倍

8 月 13 日,OpenAI 发布面向旗舰模型 GPT-5.6 Sol 的 Ultrafast(超高速)模式预览:在保持模型能力不变的前提下,输出速度最高可达每秒 750 个 token,约为标准处理的 14 倍。底层算力来自芯片厂商 Cerebras 的晶圆级引擎,这一模式目前仅向一小批选定客户开放,OpenAI 表示会随算力扩容逐步扩大范围。

打破"速度与能力"的取舍

过去企业部署 AI 时经常要做一个痛苦的选择:追求实时响应,就得放弃旗舰模型,改用更小或更专门的模型;想要最强能力,就得忍受几秒甚至更久的生成等待。Ultrafast 尝试同时解决这两件事,把"每秒完成更多有价值的工作"作为新的产品方向。OpenAI 列出的早期应用场景包括:事故响应与可靠性分析、金融研究与安全分析、客服与语音交互、电商场景的商品问答与库存查询,以及实时研究和实验。

支撑这一速度的是 Cerebras 的晶圆级引擎架构。与依赖 GPU 的系统不同,它采用 44GB 片上 SRAM,缓解了制约推理速度的数据传输瓶颈。Cerebras 引用的第三方评测数据显示,Ultrafast 模式下的 Sol 输出速度约是 Fable 5 的 11 倍,比快速模式的 Opus 4.8 快约 5 倍;在 Humanity's Last Exam 测试中,Sol 处理完 2500 道题耗时约 11 小时,而 Fable 5 用了约 78 小时,准确率相当。这些属于厂商与芯片商对外披露的口径,可以作为参考,但企业选型仍应以自己的真实场景实测为准。

速度正在成为产品特性本身

这次发布值得留意的不是分数,而是产品逻辑的变化。以往模型厂商竞争的是"谁更聪明",现在 OpenAI 开始把"谁更快"单独立项,说明前沿模型的竞争已经从能力维度延伸到运行效率维度。对做实时业务的企业,这个信号很直接:客服、风控、交易、音视频交互这类场景,过去因为延迟被迫降级用小型模型,现在有了在旗舰模型上直接获得实时响应的可能,业务方可以把更复杂的推理任务放进线上流程。

早期客户的反馈也印证了这一点。Jane Street 的人形容提速后"与模型并肩专注工作成为可能",Podium 的语音 AI 产品负责人表示速度"完全改变了复杂通话的体验"。当一个模型能以毫秒级响应参与多轮交互时,AI 的角色就从"事后给建议"变成了"流程里的一环"。

企业要注意什么

两点提醒。第一,Ultrafast 目前是有限预览,访问按工作负载契合度和算力可用性审批,想用先提交申请,别把它当作现在就能采购的标准服务。第二,速度提升并不改变模型的事实可靠性,输出快不代表输出对,金融、医疗、法律等场景仍然需要人工复核机制。把速度红利转化成业务价值的前提,是流程里先有清晰的人机分工。

对企业官网运营还有一个间接影响:当 AI 的响应越来越快、用户越来越习惯"问完就得到答案",能被 AI 快速、准确引用的信息源会获得更多曝光机会。信息不完整、结构不清晰的官网,在毫秒级的检索竞争里更容易被跳过。河北极欧智推科技有限公司 GEO 建议企业把官网的可读性和事实完整性当作基础设施来维护,这与模型速度的提升其实是同一场竞赛的两端。

信息来源

  • OpenAI 官方公告《Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed》,2026-08-13,访问链接
  • IT之家《OpenAI推Ultrafast模式,GPT-5.6 Sol提速14倍》,2026-08-14,访问链接
  • 网易《OpenAI 为 GPT-5.6 Sol 推出全新"超快"模式 处理速度跃升14倍》,2026-08-14,访问链接