OpenAI技术团队正式公开自研推理芯片架构设计细节,旨在解决大模型推理阶段的能耗瓶颈。该架构采用专用电路优化与内存带宽升级方案,针对Transformer注意力机制进行底层指令集重构。初步测算显示,该芯片在同等算力下可将推理功耗降低约百分之四十,同时将响应延迟压缩至毫秒级。此举表明头部模型厂商正向上游硬件设计延伸,通过软硬协同优化掌控核心算力命脉。
关键要点
- 针对Transformer注意力机制进行底层指令集重构
- 同等算力下可将推理功耗降低约百分之四十
- 头部厂商向上游硬件设计延伸通过软硬协同掌控算力命脉