高性能 RISC-V 能扛起什么负载:从数据库到 LLM 推理的实测边界

芯向开源
2026-09-04
收藏
0
点赞
0
17
盘点服务器级 RISC-V 在数据库、Web 服务与 LLM 推理负载上的实测边界:区分发布方口径与独立评测,分析通推一体的统一编址路径与当前性能制约,给出分层能力判断。
服务器级 RISC-V 平台的负载能力,需要拆成两类证据评估:一类来自可复现的独立评测(论文、公开测量),另一类来自发布方口径(厂商测试、发布会演示)。两者结论强度不同,不宜混用。本文以数据库、Web 服务与 LLM 推理三类典型高负载为主线,盘点 2026 年服务器级 RISC-V 平台(涵盖 RVA23 基线形成前与面向 RVA23 的新一代产品)的实际承载边界,并讨论"通推一体"——通用计算与 AI 推理融合在同一处理器——这一架构路径如何改变负载形态。

一、服务器级平台的评估框架

服务器级 RISC-V 平台指多核、可运行完整 Linux 服务器发行版、面向云计算与推理负载的算力档位,与 MCU、端侧 SoC 的评估口径完全不同。该档位的架构基线是 RVA23 Profile。RVA23 为 64 位应用处理器定义了统一的软件 ISA 基线:RVA23U64 将向量(RVV 1.0)等扩展纳入必选集合,面向操作系统的 S64 Profile 进一步覆盖虚拟内存与 Hypervisor 等系统级能力,使操作系统、编译器与中间件能以一致的扩展集为目标做优化。但 RVA23 不等于服务器认证标准——平台能否承接服务器负载,仍取决于内存容量与带宽、I/O、NUMA、虚拟化、固件与软件生态等系统级条件。
在公开资料中,SG2042(64 核,2023 年量产)是拥有较多社区与独立测试记录的多核高性能 RISC-V SoC,其 ISA 基线形成早于 RVA23;玄铁 C950 则代表面向 RVA23 软件基线及 AI 推理能力的新一代高性能处理器,于 2026 年 3 月发布。两者的公开证据类型不同:前者以社区与研究测试为主,后者目前更多来自发布方公布的数据,量产与可获得状态以官方信息为准。
评估可沿三轴展开:通用算力(SPEC 类基准)、AI 推理(模型吞吐与延迟)、软件栈成熟度(发行版、内核、工具链对平台的支持深度)。

二、数据库与 Web 服务:发布方口径与独立评测的分界

数据库与 Web 服务是服务器最典型的负载,RISC-V 在该类负载上的证据分布呈现明显分界。
发布方口径:2026 玄铁 RISC-V 生态大会公布,玄铁 C950 经软硬件协同优化,在 MySQL、Redis、Nginx、OpenSSL 等任务上达到"业界领先"水平,云网络与云存储性能较"部分主流产品"提升 30% 以上。该表述来自发布方测试,未公开对比对象、具体配置与完整测试条件,只能说明特定软硬件组合下的优化效果,不能作为与特定 x86 服务器产品的直接对比结论。
独立评测:截至本文写作,公开社区资料已证明 PostgreSQL/MySQL、Redis、Nginx 等常见服务器软件可在 riscv64 Linux 环境中部署与运行,但针对 SPEC、OLTP、HTTP 吞吐等统一条件下的大规模第三方横向对比仍相对有限。这一缺口本身就是当前边界的一部分:负载的"可运行"已基本确立,"可对比"尚缺足够的第三方证据。服务器发行版方面,龙蜥社区的 Anolis OS 已将 RISC-V 纳入官方支持架构,Anolis OS 23.4 起提供面向 RVA23 平台的镜像,由社区 RISC-V SIG 持续维护(openanolis.cn)。面向下一代 Agentic 操作系统的发行版底座正在成形。

三、通推一体:推理算力并入 CPU 的统一编址路径

LLM 推理负载改变了传统服务器 CPU 的评估方式。在分离架构(CPU 加独立加速卡)下,推理数据需经总线在宿主内存与设备内存间反复搬运;对数百亿乃至千亿参数模型而言,权重可达数十至数百 GB,即便经低比特量化,LLM 推理仍是内存容量与带宽敏感型负载,访存密集特性使数据搬运开销成为吞吐的主要损耗之一。
通推一体(通用计算与 AI 推理一体化)的应对方式,是把矩阵与向量加速单元并入处理器核心体系,与 CPU 共享统一的地址空间。若同时具备共享内存或高效的一致性访问机制,模型权重与中间结果可减少传统分离架构中的显式数据搬运;实际能省去多少拷贝与同步开销,取决于具体实现的内存架构、一致性机制与软件运行时。该路径的价值不在替代训练用加速卡,而在通用计算与推理并存的服务器场景中,降低异构系统带来的部署复杂度与数据移动成本。
RISC-V 之所以具备走通该路径的架构条件,在于其开放扩展机制:矩阵乘这类领域专用能力,可以自定义指令或协处理器接口的形式加入,不受专有指令集授权路线的约束。这一机制本身是 RISC-V 生态层级的既定特性,而非特定厂商的路线图承诺。
具体实现样本方面,玄铁 C950 在 2026 年 3 月发布材料中公布了集成式加速引擎方案:Vector 引擎面向向量类负载,Matrix 引擎面向大模型张量计算,发布方称单核算力 8 TFLOPS(FP8)、支持含 FP8/FP4 与 MXFP 格式在内的低精度数据类型,并采用统一编址。

四、LLM 推理的实测边界

该负载上两类证据并存,是判断边界最清晰的样本。
独立评测:可复现记录的代表是 V-Seek 工作(都灵理工大学与 ETH 苏黎世,2025)。该研究在 SG2042(64 核,服务器级)上针对 llama.cpp 优化量化 GEMM/GEMV kernel、NUMA 策略与工具链组合,测得 DeepSeek R1 Distill Llama 8B 与 Qwen 14B 在 4-bit 量化下生成吞吐 4.32/2.29 token/s、预填充 6.54/3.68 token/s,较基线最高提升约 3.0 倍。该数字基于 Xuantie GCC 10.4 与上游 GCC 13.2/Clang 19 的特定工具链组合,并受量化方式、上下文长度、线程数、batch size 与测试运行时影响;相关结论仅在该平台与条件下成立,用于说明该研究中的优化幅度,不应直接作为跨平台性能排名。
向量扩展是此类推理栈的性能基础。确认运行平台是否向软件暴露 RISC-V 向量扩展,可结合 /proc/cpuinfo、lscpu 等渠道查看 ISA 信息,但 字段格式会随内核版本与发行版而异;对实际部署更可靠的方式,是结合内核暴露的 ISA 信息与运行时的 feature detection(如 hwprobe 机 制)进行确认。
发布方演示口径:2026 玄铁 RISC-V 生态大会演示了 C950 运行 Qwen 系列与 DeepSeek V3 671B 全量模型(发布材料转述生成吞吐约 18 token/s 量级);随后公开报道称 C950 可原生运行 27B 级稠密模型,解码约 30 token/s、首 token 延迟约 1.9 s。以上为发布会与媒体报道口径,尚无独立第三方复现,引用时需与 V-Seek 一类可复现数据严格区分。
部署工具链:模型落地还需转换与量化环节。玄铁的 AI部署工具 是面向 RISC-V 平台的 AI 模型部署工具,支持大语言模型与 CNN/Transformer 的量化推理,与 llama.cpp 等开源运行时并行构成从模型转换到部署的路径。

五、边界与制约

按上文口径,服务器级 RISC-V 的性能边界可收敛为四点:
1.
内存带宽是低 batch 解码的主要约束对大模型的低 batch decode 场景,内存带宽通常是核心瓶颈之一,吞吐与权重搬运带宽直接相关,DDR 带宽水平决定吞吐上限;而在 prefill 或更高 batch 的推理场景中,计算吞吐、矩阵单元利用率与 KV Cache 访问同样可能成为主要约束。内存带宽若不随核心数同步扩展,单纯增加核心数通常无法线性提升 LLM 推理吞吐。
2.
软件优化深度决定实际利用率GEMM/GEMV kernel 是否向量化或矩阵化、NUMA 策略是否感知,可造成数倍差距——V-Seek 的约 3.0 倍提升即为例证,这也意味着优化空间与优化义务并存。
3.
独立证据稀缺服务器级平台的第三方基准、内核与驱动优化仍处爬坡期,决策者可引用的公开复现数据远少于成熟架构,发布方数据与独立评测之间的缺口需要时间填补。
4.
大规模训练与重型生态仍处早期大规模 LLM 训练目前尚不是服务器级 RISC-V CPU 的主要优势场景:与成熟 GPU 加速生态相比,RISC-V 在高性能训练加速器、分布式训练通信与主流 AI 软件栈适配方面仍处于较早阶段;与主流加速生态同级的软件栈,以及闭源商业中间件的 riscv64 分发,同样仍是缺位状态。

结语

按负载类型分层判断:数据库与 Web 服务在服务器级 RISC-V 上可运行,发布方数据指向乐观的优化效果,但独立对比证据待补;LLM 推理在 8B–14B 档已有可复现的独立记录,数百亿至千亿档目前仅有演示与报道口径;通推一体把推理算力并入 CPU,以减少异构搬运开销为目标,其实际收益取决于硬件利用率与软件栈跟进速度。总体而言,服务器级 RISC-V 完成了"能承载高负载"的架构闭环,正处于从"可运行"走向"可对比"的阶段。
如需深入了解相关内容,可参考高性能 RISC-V 计算页

相关阅读

RISC-V高性能计算LLM 推理
您尚未登录,请登录后再评论
回答(0)
非常抱歉,暂无相关数据
非常抱歉,暂无相关数据
订阅
商务咨询
AI Assistant
AI