GPT-5.6 正在自我优化,一种新的自举方法已经出现
OpenAI
OpenAI 的技术报告显示,GPT-5.6 已应用于生产环境中,用于优化自身的运行时环境,包括分析流量、调整请求路由、重写底层内核以及优化投机性解码。这些改进使端到端服务成本降低了 20%,令牌生成效率提高了超过 15%。与此同时,人类监督仍然存在,优化目标和部署决策由人员控制。
OpenAI 发布了一份技术报告,详细介绍了应用于 GPT-5.6 的递归自我改进(Recursive Self-Improvement,RSI)。该模型现已投入生产:它分析流量、调整路由、重写 Triton 和 Gluon 内核,通过运行数百次实验优化自身的推测解码系统,并搜索最优的部署参数(批处理、分片、KV 缓存管理)。结果,OpenAI 的端到端服务成本下降了 20%,令牌生成效率提高了超过 15%。值得注意的作者包括 Triton 的创建者 Philippe Tillet。然而,人工监督仍然存在:人类设定优化目标、工具权限、评估指标以及最终的部署决策。此外,OpenAI 构建了一个基于 Rust 的 Agent Harness,以减少代理循环中的重复开销,并进行了优化,例如延迟工具发现(仅在需要时显示工具)和仅追加的提示缓存以保持上下文重用。在 GPT-5.6 内部测试期间,每位活跃研究员的每日令牌输出量相比 GPT-5.5 的峰值翻了一番;内部编程推理的研究计算量在六个月内增长了 100 倍,内部代理的令牌使用量增长了约 22 倍。
来源: QbitAI 量子位 —
原文
