OpenAI 联合芯片厂商 Cerebras 推出GPT-5.6-Sol超高速推理预览版,仅限受邀 API 客户测试。新版本最高输出速度可达750 token / 秒,相较标准接口提速最高14倍,大幅降低实时对话、智能体任务的响应延迟。加速依靠Cerebras晶圆算力硬件实现,模型本体无改动,输出质量不受影响。高速档位定价高于普通接口,后续白名单范围将逐步扩大。此次更新意味着头部大模型厂商开启新一轮推理速度竞赛,时延优化成为商业化落地的关键指标。

小典观察:本次高速接口发布标志AI行业竞争重心,已经从单纯模型跑分转向推理速度、时延优化。低时延能力是智能体大规模落地的先决条件,不过提速背后带来算力成本上涨。后续或将带动国内厂商跟进高速推理产品线,开发者需要权衡速度、成本两大要素,调整自身业务架构。
来源:网络