具体来说,它干了四件事。
1、分析OpenAI真实的生产流量。
GPT-5.6会寻找不同机器和服务节点之间的负载不均,并测试新的路由策略,把请求分配到更合适的位置。
2、重写和优化生产Kernel。
GPT-5.6会深入模型的forward pass,寻找可以提前计算、省略或并行执行的部分,再通过Codex改写生产环境中的Triton和Gluon Kernel。
3、优化自己的推测解码系统。
GPT-5.6为自己的draft model设计方案,并自动运行数百次实验,测试不同的模型大小、结构和特征。
在训练过程中,它还会持续监控实验,并在发生硬件故障或训练不稳定时主动介入。
4、针对不同任务,自己寻找最优部署参数。
面对短对话、长上下文、代码任务等不同负载,GPT-5.6会自动搜索batching、sharding和KV Cache管理的更优组合。
四件事连起来,GPT-5.6参与的已经不再是某个孤立的代码任务,而是一条真实的工程反馈回路:
观察生产系统、寻找瓶颈、提出方案、运行实验、处理故障,再把有效改进部署回承载自己运行的系统。
人类依旧站在圈里
当然,RSI也没那么快,人类依旧站在圈里,也就是human in the loop。
GPT-5.6虽然开始参与改造自己,但优化目标、工具权限、评测指标,以及代码能否进入生产环境,仍然由人类决定。
而且,模型内部省完了,模型外面还有大量重复开销。
比如,ChatGPT Work和Codex执行复杂任务时,往往要不断经历:
模型思考-调用工具-读取结果-继续思考。
一次用户请求,背后可能循环十几轮甚至几十轮。










