乱序执行
通过指令动态调度打破按序执行限制,充分挖掘指令级并行 (ILP)。
玄铁 C930 采用 6 译码宽度、10+ 发射宽度的乱序超标量流水线,通用性能达 SPECint2006 15/GHz 的服务器级水准。C950 进一步升级至 8 译码、乱序窗口超 1000 条,3.2GHz 主频下 SPECint2006 单核首破 70 分 (22+/GHz)。
典型收益场景:数据库、编译器、分支密集的业务逻辑等不规则负载。
TAGE 分支预测Out-of-OrderSuperscalar
多核扩展
基于一致性总线与多簇互联,从单核弹性扩展至服务器级多核系统。
C930 采用 CHI 一致性协议总线,原生支持多核多 Cluster 扩展,配套 XL200 多簇一致性互联可构建更大规模的 SMP 系统; C950 进一步实现 64 核服务器级规模,每 8 核一组通过 AMBA CHI 总线互联。
AIA 高级中断、IOMMU、RAS 等服务器级特性齐备,满足智算中心与云服务器对可靠性、虚拟化的要求。
CHI CoherencySMP × 64AIA · IOMMU · RAS
RVV 向量加速
RVV 1.0 向量扩展以 VLA (向量长度无关) 编程模型提供高效的数据级并行能力。
C930 搭载 512-bit RVV1.0 向量引擎,与 8 TOPS Matrix 引擎组成“通用+AI”双引擎; C950 升级为 4K 超宽 Vector 引擎 (最大 4096-bit) 与 Matrix 引擎 (单核最高 8T@FP8),与 CPU 统一编址、消除数据拷贝瓶颈,可原生运行 Qwen3-235B、DeepSeek V3-671B 等千亿参数大模型。
数据密集负载可获得数倍于标量运算的吞吐提升。
VLA ModelFP4/FP8/MXMatrix Engine
自定义指令 · DSA 扩展
开放 DSA 扩展接口,为领域专用负载注入自定义指令加速。
C930 开放 DSA (Domain-Specific Architecture) 扩展接口,芯片厂商可针对网络包处理、加解密、AI 算子等场景添加专用指令;配套 Flex 可扩展平台提供全套建模、验证环境与工具链。
通用软件栈完全兼容的前提下可获得数量级的专用加速——中兴通讯通过扩展指令将 EC 性能提升 4 倍。这是 RISC-V 相对固定指令集架构的核心差异化能力。
Custom ISAFlex PlatformDomain-Specific