GPT-5.3-Codex在SWE-Bench Pro和Terminal-Bench 2.0这两个编程基准测试中拿到了SOTA,并在OSWorld和GDPval等智能体能力和真实世界任务测评中,较GPT-5.2-Codex实现一定提升。在Terminal-Bench 2.0上,GPT-5.3-Codex的得分比Claude Opus 4.6高了11.9%。不过,OpenAI参加的基准测试数量更少,也基本没有和Claude Opus 4.6重叠的,得分只能作为参考。为演示其编程能力,OpenAI晒出了一个由GPT-5.3-Codex打造的赛车游戏。这个游戏里有多辆赛车同时开展比拼,还配备了8张地图,甚至还能用空格键使用道具,就是画风确实有些简陋。我们也简单试玩了一下这个游戏,完成度还挺高的。体验链接:https://cdn.openai.com/gpt-examples/7fc9a6cb-887c-4db6-98ff-df3fd1612c78/racing_v2.htmlOpenAI还透露,GPT-5.3-Codex是OpenAI首个在自我创建过程中发挥关键作用的模型。GPT-5.3-Codex的早期版本,被Codex团队用来调试模型训练、管理部署、诊断测试结果和评估,加速了模型的开发。GPT-5.3-Codex其实就是GPT-5.2-Codex和GPT-5.2的结合体,具备前者的编程能力和后者的推理能力和专业知识储备,且速度也提升了25%。这意味着GPT-5.3-Codex不仅可以用于编程,也可用于软件工程里的所有其他工作,比如调试、部署、监控、测试、指标分析等。你还可以用GPT-5.3-Codex来做PPT、Excel、Word等等,从OpenAI分享的案例来看效果还不错。
目前,GPT-5.3-Codex已向付费ChatGPT用户开放,可在Codex应用、CLI、IDE插件和Web中使用。API访问仍需等待后续更新。Frontier现阶段仅面向有限客户,未来几个月将有更广泛的可用性。不过,在这波发布中,与隔壁的Claude Opus 4.6相比,GPT-5.3-Codex和Frontier在讨论热度上明显逊色一筹,发布模型的推文转赞评数量都只有Claude Opus 4.6的不到一半,评论区中也能看到不少质疑声。关心编程能力的用户认为GPT-5.3-Codex在实际使用体验和安全性上和Claude Opus 4.6仍有差距,而将OpenAI模型用于写作等其他场景的用户,则认为OpenAI不再重视他们。这显示出OpenAI在编程等市场的产品号召力和社区影响力上,以及如何平衡自家的ToC和ToB业务上,仍有很长的路要走。 01.能在数百万token代码库修Bug还会给人类主动汇报工作