OpenAI的全栈算力战略:从芯片到模型,如何降低智能成本
AI竞争正在从单点性能走向全栈协同
OpenAI CFO Sarah Friar认为,AI进步最快的方式不是只优化模型或芯片,而是让整个系统共同进化。这套系统覆盖数据中心和芯片、前沿模型、开发者平台、消费级与企业级产品,以及AI原生设备。
其中的逻辑是一个循环:更好的软件提高硬件利用率;针对实际工作负载设计的硬件改善速度和效率;更强的模型催生更好的产品,进而带来更多需求、使用量和反馈,再推动整个系统继续优化。
自研推理芯片成为新的控制点
OpenAI公布了首款自研推理芯片 Jalapeño 的实测结果。在使用 GPT-OSS 120B 的公开基准 InferenceX 上,Jalapeño相较参与比较的商业系统实现了更高的峰值每千瓦吞吐量和更低的Token延迟;在 DeepSeek R1 和 Kimi K2 上也表现强劲。
Friar表示,自研芯片让OpenAI能够更直接地控制模型运行方式以及推理服务的经济性。模型、服务软件、芯片、内存和网络可以协同设计,从系统层面同时优化吞吐量、延迟、能源效率和成本。
这并不意味着OpenAI准备完全依赖自研硬件。其策略更接近于建立一条可控的自有技术路线,同时继续使用合作伙伴提供的加速计算资源。
多供应商,而不是押注单一路线
不同AI工作负载对基础设施的要求并不相同。前沿模型训练、大规模推理以及持续运行的智能体,对芯片、软件、网络、电力和延迟都有不同要求。
因此,OpenAI希望针对每类工作负载,在能力、速度、可靠性、效率和成本之间寻找更优组合。
微软提供的计算资源以及英伟达芯片一直是OpenAI发展的重要基础。目前其基础设施组合还包括 AWS、AMD、Broadcom、Cerebras、CoreWeave、Oracle、SB Energy 和 SoftBank,分别覆盖云基础设施、加速计算、低延迟推理、数据中心建设和能源供应等不同环节。
OpenAI的思路是:在最需要能力的任务上使用高性能系统,在规模和成本更重要的场景中优先优化效率。保留多个供应商、硬件和部署方案,也有助于根据性能和成本变化调整计算需求。
衡量效率的关键:每一美元能获得多少有效智能
Friar提出,整个系统最终应该衡量的不是单纯的算力,而是每单位计算资源能够产生多少有用的智能。
模型如果能够用更少尝试得到正确结果,路由和上下文管理能够减少无效计算,再结合优化后的软件和专用硬件,就可能同时改善速度和能源效率。
文章举例称,在 Artificial Analysis Coding Agent Index 上,采用最高推理强度的 GPT-5.6 Sol 创下新高,同时相比另一款领先模型减少了54%的输出Token。
对于客户而言,这类效率提升可能体现为更快的结果、更少的重试、更长的智能体工作流程,以及完成任务所需总成本的下降。OpenAI将这种思路概括为关注“每一美元能够获得多少有效智能”。
效率提升可能反而扩大算力需求
文章还借用了“杰文斯悖论”解释AI需求增长:当一种资源的使用效率提高、成本下降后,可行的使用场景可能增加,从而推动总消费量继续增长。
在AI领域,这意味着随着智能能力提高、价格下降,此前成本过高的工作可能变得经济可行,例如为每位客户提供定制分析、审查更多合同、实时运行财务情景分析,或帮助工程师测试更多方案。
OpenAI认为,这会形成一个持续强化的循环:更高效的计算和更具竞争力的供应体系降低服务成本,增长带来的收入继续投入研究、基础设施和安全建设,再推动下一轮技术进步。
从这一框架看,OpenAI正在把竞争边界从单一模型能力扩展到芯片、数据中心、软件、模型和产品组成的完整技术栈。
