CPU 重回 C 位:玄铁在 RISC-V 香山昆明湖 V3 上实现空间多线程,RISC-V 高性能算力的关键一跃
背景:智能体时代,CPU 为什么重新站到舞台中央
过去两年,AI 产业的叙事几乎被 GPU 垄断。大模型参数规模、算力集群规模、Token 生成速度——这些指标构成了行业竞争的核心坐标系。但当 AI 从"能说会道"的大模型阶段,迈入"能干活、能创造价值"的 Agentic AI 时代,游戏规则正在悄然改变。
2026 年 7 月的世界人工智能大会(WAIC 2026)上,阿里巴巴达摩院首席科学家孟建熠抛出了一个让很多人意外的数据:在智能体的工作流总延迟中,高达 90.6% 发生在 CPU 端的工具处理环节。
这个数字意味着什么?我们来拆解一下当今一个典型 AI Agent 系统的执行路径。当用户向 Agent 发出一条指令,比如"帮我分析这份报告并生成摘要",背后发生的流程是:
用户请求 → LLM 推理(GPU)→ 任务拆解 → 工具调用(查数据库)→ 工具调用(执行脚本)→ 子 Agent 协作 → 上下文管理 → LLM 推理(GPU)→ 结果返回
在这条链路中,GPU 负责的是模型推理这一环——生成 Token。而围绕在它周围的:任务路由、工具调用链的编排、多个 Agent 之间的状态同步、长期记忆的读写、RL 沙箱的执行调度……这些"脏活累活",全部由 CPU 承担。
换句话说,当智能体任务变得复杂,CPU 的吞吐与响应速度直接决定了整个系统的天花板。单纯堆砌 GPU 算力,无法解决工具调用与逻辑协同的瓶颈。
这就是为什么在全球范围内,CPU 重回 C 位的声音开始出现。英伟达在 Vera CPU 中探索 Spatial SMT(空间多线程),AMD 在 EPYC 处理器中持续强化 SMT 能力,Intel 在 Xeon 系列中早已标配超线程——这些动作的背后,都在争夺 Agentic AI 时代"最合适的 CPU 底座"这一战略高地。
而在这场竞争中,一个值得关注的中国力量正在悄然推进:阿里巴巴达摩院玄铁团队,正与开芯院、中科院软件所联合研发,在 RISC-V 开源架构上实现自主可控的 SMT 能力,并将这一技术注入香山昆明湖 V3 处理器。
一、SMT:高性能 CPU 的"核武器",RISC-V 欠缺的最后一环
1.1 什么是 SMT?为什么它对服务器 CPU 至关重要
SMT(Simultaneous Multi-Threading,同步多线程) 并不是一个新概念。Intel 在 2002 年的 Pentium 4 HT 处理器上就引入了这项技术,AMD 的 Zen 架构从第一代起就全面支持 SMT,ARM 的 Neoverse 系列服务器 CPU 也早已标配 SMT。但对于 RISC-V 架构来说,SMT 一直是缺失的一环。
要理解 SMT 的价值,我们需要先理解现代超标量处理器的执行方式。
一个典型的现代高性能 CPU 微架构是这样的:
取指单元(IFU) → 解码单元 → 重命名单元(Rename) → 发射队列(IQ) → 执行单元(EX) → 重排序缓冲区(ROB) → 提交(Retire)
这条流水线中,不同阶段并行工作:一条指令在执行时,下一条指令可能还在解码,再下一条可能在取指。但这里有一个根本矛盾——程序的指令流中,并非所有指令都同等重要。
考虑这样一个场景:
// 模拟一个典型的数据库查询处理循环
for (int i = 0; i < n; i++) {
// 内存密集型:等待 L1/L2/L3 缓存命中
Record* rec = get_record(i);
// 计算密集型:CPU 执行单元全力运转
process_record(rec);
// 分支密集型:if-else 判断,影响流水线效率
if (should_index(rec)) {
build_index(rec);
}
}
在这个循环中,get_record() 是一个典型的内存密集型操作——指令本身执行只需要几个时钟周期,但等待数据从内存加载到寄存器可能需要数百个周期。在这段时间里,CPU 的执行单元实际上是空闲的。传统做法是 CPU 停顿(stall),等待数据加载完成后再继续——这叫 流水线气泡(Pipeline Bubble),是性能的极大浪费。
SMT 的核心思想是:当一个线程因内存访问等待而停顿时,让另一个线程使用空闲的执行单元资源。 在物理层面,两个(或更多)线程的指令在同一个时钟周期内同时流入流水线,共享核心的执行资源,但各自拥有独立的寄存器状态和程序计数器。
用一个更形象的比喻:传统单线程 CPU 像一条只有一个收费窗口的高速公路收费站,车辆(指令)必须排队等待;SMT 则是在同一个收费广场开辟多个窗口,让不同方向的车流(不同线程的指令)可以并行通过。
1.2 x86/ARM 早已标配,RISC-V 为什么迟迟没有
在 x86 和 ARM 主导的服务器 CPU 市场中,SMT 早已是数据中心和 AI 推理芯片的标配技术:
| CPU 系列 | SMT 策略 | 典型应用场景 |
|---|---|---|
| Intel Xeon (Sapphire Rapids) | 2-way SMT | 云服务器、AI 推理 |
| AMD EPYC (Zen 4) | 2-way SMT | 数据中心、HPC |
| ARM Neoverse (N2/V2) | 2-way SMT | 5G 核心网、云原生 |
| NVIDIA Grace (ARM Neoverse) | 2-way SMT | AI 训练推理一体机 |
但对于 RISC-V 来说,情况要复杂得多。RISC-V 是一个开源指令集架构(ISA),它的优势在于开放性和可定制性——任何公司都可以基于 RISC-V 设计自己的处理器,不需要向任何人支付专利授权费。这使得 RISC-V 在物联网芯片、嵌入式设备、AIoT 领域迅速崛起。
然而,高性能服务器级 RISC-V 处理器,一直是整个生态的短板。RISC-V 国际基金会虽然在 2021 年发布了 RVA22 profile(面向应用处理器的配置规范),但对 SMT 的支持一直停留在规范层面,缺乏成熟的开源实现。
香山处理器是中国科学院计算技术研究所主导的开源 RISC-V 高性能处理器项目,其昆明湖(Lake)微架构系列是面向服务器市场的最新迭代。与达摩院玄铁的合作,将 SMT 能力引入香山昆明湖 V3,不仅补全了 RISC-V 高性能处理器生态的关键空白,更意味着中国在开源处理器架构上拥有了自主可控的多线程实现。
二、空间多线程:玄铁的差异化路线
2.1 传统 SMT 的"甜蜜陷阱"
在深入玄铁的技术方案之前,我们需要先理解传统 SMT 的局限性。
传统的 SMT 实现(Intel 的 HT、AMD 的 SMT、ARM 的 SMT)都是动态竞争式的:所有线程共享同一组物理执行资源,包括发射队列(Issue Queue)、物理寄存器文件、执行单元、缓存等。资源调度由硬件在运行时动态决定。
这种设计在大多数场景下工作良好,但存在两个根本问题:
问题一:线程饥饿(Thread Starvation)
当两个线程的计算特征差异很大时(例如一个线程是内存密集型,另一个是计算密集型),动态调度器倾向于优先调度计算密集型线程,因为它们的指令可以更快地流过流水线。但这会导致内存密集型线程被长期"饿死",其延迟敏感型操作无法及时得到服务。
问题二:尾部延迟不可预测
在多租户云环境和 AI Agent 场景中,"公平性"和"可预测性"比"总吞吐量"更重要。传统 SMT 中,一个线程的行为会直接影响另一个线程的性能表现——如果线程 A 执行了一个长延迟操作(如 L3 未命中),线程 B 的请求响应时间会随之增加。这种"相互影响"在 SLA 敏感型场景中是致命的。
2.2 空间多线程:资源从"动态竞争"到"静态分区"
玄铁提出的"空间多线程(Space-based Multi-Threading)"方案,核心创新在于:将共享资源从动态竞争改为静态分区(Static Partitioning)。
这意味着什么?让我们用一张图来对比两种设计哲学:
【传统 SMT:动态竞争模型】
线程A ──┐
├──→ [共享发射队列IQ] ──→ [共享执行单元] ──→ [共享ROB]
线程B ──┘ ↑ ↑ ↑
(动态调度, (执行单元 (ROB条目
线程间竞争) 线程间共享) 线程间竞争)
【空间多线程:静态分区模型】
线程A ──→ [专属发射队列A] ──→ [专属执行单元A] ──→ [专属ROB-A]
(固定资源) (固定资源) (固定资源)
线程B ──→ [专属发射队列B] ──→ [专属执行单元B] ──→ [专属ROB-B]
(固定资源) (固定资源) (固定资源)
在静态分区模型中,每个线程(或 vCPU)被分配固定的物理资源份额:
- 专属发射队列(Per-Thread IQ):线程 A 的指令只能在专属 IQ 中等待,不会被线程 B 的指令抢占位置。
- 专属执行单元(Per-Thread Execution Unit):计算资源被分区,两个线程不会互相干扰执行流水线。
- 专属 ROB 条目(Per-Thread ROB):重排序缓冲区的条目也是固定的,线程间的提交进度互不影响。
这种设计的直接效果是:单线程性能几乎无损,尾部延迟低且稳定。在每个核上运行两个线程时,空间多线程保证每个线程都能获得可预测的高性能——不会出现传统 SMT 中"一个线程被另一个线程拖累"的情况。
2.3 动态模式切换:灵活性与确定性的兼得
玄铁方案的另一个亮点是运行时动态模式切换。在空间多线程架构中,可以根据工作负载特征,在以下两种模式之间动态切换:
- 1T 模式(1 Thread per Core):最大化单线程性能。适合对延迟极度敏感、对吞吐量要求一般的场景,如 RL 沙箱中的单次编译任务。
- 2T 模式(2 Threads per Core):提升总吞吐量和资源利用率。适合多租户环境、并发任务处理。
关键在于,这种切换无需重启操作系统或虚拟机——在运行过程中,硬件根据调度器的策略指示,动态调整资源分区方案。这为 AI Agent 系统的动态负载均衡提供了硬件级支持。
三、香山昆明湖 V3 的微架构优化:那些让人眼前一亮的数据
3.1 从 C910 到 C950:玄铁的高性能 RISC-V 之路
在深入 SMT 实现细节之前,有必要先梳理一下玄铁处理器的发展脉络,理解这次 SMT 攻关在其中的位置:
| 处理器 | 发布时间 | 定位 | 主要突破 |
|---|---|---|---|
| 玄铁 C906 | 2019 | 嵌入式 | RISC-V 64位高性能开源处理器,物联网旗舰 |
| 玄铁 C910 | 2021 | 通用 | 多核支持,向高性能应用扩展 |
| 玄铁 C907 | 2022 | 通用 | 增强向量扩展,更强 AI 推理能力 |
| 玄铁 C920 | 2024 | 高性能 | 多核一致性和向量性能大幅提升 |
| 玄铁 C950 | 2025 | 服务器 | 向高性能服务器市场全面进发 |
| 香山昆明湖 V3 + SMT | 2026 | 服务器 | SMT 能力注入,联合研发,开源贡献 |
从 C910 到 C950,玄铁持续推动 RISC-V 架构从嵌入式向高性能方向突破。这次与香山昆明湖 V3 的 SMT 联合研发,标志着玄铁的 RISC-V 高性能战略进入了一个新的阶段——不仅做处理器核本身,还要推动整个 RISC-V 高性能软件生态的建立。
3.2 微架构优化细节:发射队列、ROB 与物理寄存器
达摩院玄铁 RISC-V 处理器架构团队高级技术专家郝子轶在 SMT SIG 首期技术沙龙中,披露了香山昆明湖 V3 SMT 项目的多个微架构优化细节,每一项都值得深入拆解。
优化一:发射队列(IQ)分配策略 —— WM2 水位线保留
发射队列是超标量处理器中最关键的资源之一,它负责从已重命名的指令中选择哪些指令发送到执行单元。在全动态共享模式下,所有线程共享同一个 IQ,当某个线程的指令填满了 IQ 的所有条目时,其他线程的新指令就无法进入 IQ,导致流水线停顿。
达摩院团队发现,在香山昆明湖 V3 的原始实现中,全动态共享存在线程饥饿风险——某个线程可能在 IQ 满载时长时间无法分配新条目。
解决方案是引入 WM2 水位线保留(Watermark-based Reservation) 策略:
# WM2 策略的简化示意(Python 伪代码)
def allocate_iq_entry(thread_id, iq):
# 当 IQ 占用率超过 WM2 水位线(e.g., 80%)时
# 限制"贪婪"线程继续填充
# 保证每个线程至少保留 WM2 比例的空间
if iq.occupancy() > WM2_THRESHOLD:
if thread_id in "memory_intensive_threads":
# 内存密集型线程优先保留,确保其指令能及时发射
if iq.thread_reserved_space(thread_id) >= MIN_RESERVED:
return iq.allocate(thread_id)
else:
return None # 计算密集型线程暂停分配
else:
return iq.allocate(thread_id)
实践验证表明,WM2 策略显著改善了多线程场景下的 IQ 利用效率和公平性。
优化二:ROB 重排序缓冲区 —— dynamic borrowing 与延迟滤波
ROB(Re-Order Buffer)是超标量处理器中负责指令乱序执行结果提交的组件。在 SMT 场景下,ROB 条目是稀缺资源——如果一个线程占用了大量 ROB 条目(通常是该线程有大量长延迟指令在流水线中),另一个线程就无法提交新指令。
香山昆明湖 V3 实现了一种 dynamic borrowing(动态借用)机制:当一个线程(donor)的 ROB 占用率过高时,可以"借出"部分 ROB 条目给另一个线程(borrower)。这个设计本身是好的,但达摩院团队通过 6 组对照实验发现了一个问题:
donor 线程判定过于灵敏——系统过早地将一个线程标记为 donor,导致它的一些重要指令被"借用"走,反而降低了性能。
解决方案是引入**延迟滤波(Delayed Filtering)**机制:
// 延迟滤波机制示意(C 伪代码)
typedef struct {
int rob_utilization; // 当前 ROB 占用
int recent_donor_count; // 最近被标记为 donor 的次数
int filtered_donor_count; // 经滤波后的稳定 donor 标记
} ThreadState;
// 引入延迟滤波:将连续多次判定为 donor 才真正标记
bool should_mark_as_donor(ThreadState* ts) {
if (ts->rob_utilization > HIGH_WATERMARK) {
ts->recent_donor_count++;
} else {
ts->recent_donor_count = 0; // 重置计数
}
// 延迟滤波:连续 3 次判定为 donor 才触发
// 这避免了瞬时高负载导致的过早借用
if (ts->recent_donor_count >= DELAY_THRESHOLD) {
return true;
}
return false;
}
// 实验结果:donor 保留条目提升至 64 时
// 获得约 0.5% 的 SPECint2006 性能改善
0.5% 看起来不大,但在 CPU 性能优化的语境中,这是一个实打实的工程进步——尤其是在香山昆明湖 V3 已经高度优化的微架构基础上。
优化三:物理寄存器分配 —— 从全共享到策略化分配
现代超标量处理器使用物理寄存器文件(Physical Register File, PRF) 来实现寄存器重命名。与 ROB 类似,物理寄存器也是稀缺资源——有多少个物理寄存器,就同时支持多少个未提交指令的寄存器状态。
全共享的物理寄存器分配会导致类似 ROB 的问题:线程之间互相竞争资源。达摩院团队的初步验证表明,从全共享向策略化分配(Policy-based Allocation)转变具有显著价值。策略化分配意味着根据线程类型和当前负载,动态调整物理寄存器的分配策略——这与空间多线程的"静态分区"哲学是一脉相承的。
优化四:Store Buffer 跨线程反压
Store Buffer 是 CPU 中用于暂存写操作结果的缓冲区。当一个线程的 Store Buffer 满载时,后续的写操作会被"反压(back-pressure)",导致流水线停顿。
在 SMT 场景下,这个问题更加复杂——一个线程的 Store 操作可能因为另一个线程的内存访问模式而变慢。达摩院团队提出的优化方向是按线程拆分 Store Buffer(Per-Thread Store Buffer Partitioning),每个线程拥有独立的 Store Buffer 空间,彻底消除跨线程反压。
3.3 性能目标:从 20% 到 30% 的 SPECint 双线程提升
基于上述微架构优化,香山昆明湖 V3 SMT 项目的性能目标非常清晰:
SPECint2006 双线程性能提升:20% → 30%
SPECint2017 切片:推进中
SMT 向 4/8/16 线程扩展:探索中(应对 AI 并发场景)
20% 到 30% 的 SPECint 双线程性能提升意味着什么?这代表在 2T 模式下,香山昆明湖 V3 能以几乎线性的效率利用两个线程的资源。对于多租户云服务和 AI Agent 场景,这意味着更高的资源利用率和更可预测的响应延迟。
四、SMT 对 AI Agent 场景的三大工程价值
4.1 RL 沙箱:确定性延迟保障编译-测试周期
强化学习(RL)训练是当前 AI Agent 自我进化的核心技术路径之一。一个典型的 RL 训练流程是:
环境交互 → 生成轨迹数据 → 奖励计算 → 策略更新 → (循环)
其中,"环境交互"环节通常需要启动沙箱来执行代码——Agent 生成一段代码,沙箱负责编译和运行测试。在大规模 RL 训练中,上百个沙箱可能同时运行,每个沙箱都是一个独立的执行环境。
关键约束是:每个沙箱必须在固定的"时间窗口"内完成编译和测试,否则会拖慢整个 GPU 训练周期。GPU 在等待沙箱结果的这段时间里是空闲的——沙箱延迟的每一毫秒,都直接转化为 GPU 利用率的损失。
在传统 SMT 或物理机上运行这些沙箱时,由于线程间的资源竞争,不同沙箱的完成时间会有显著差异——有的快、有的慢,这导致 RL 训练周期难以精确预测。
空间多线程通过静态分区,为每个沙箱提供确定性的资源保证——即使在 100+ 线程全开的场景下,每个沙箱仍能获得可预测的高性能。这对于 RL 训练的稳定性和效率提升至关重要。
4.2 智能体工具调用:多租户 SLA 隔离
AI Agent 的核心能力之一是工具调用(Tool Use)。一个用户请求可能触发多个工具调用——查数据库、执行脚本、调用外部 API。这些工具调用在底层往往涉及数据库连接池、文件系统 I/O、网络请求等操作。
在多租户环境中,不同用户的 Agent 请求可能在同一个 CPU 核心上交错执行。传统 SMT 中,如果"邻居"线程执行了一个高负载操作(如复杂数据库查询),当前线程的工具调用延迟会随之增加——这直接违反了 SLA 承诺。
空间多线程的静态分区天然提供了强隔离。每个租户的 Agent 工作负载运行在专属的物理资源上,一个租户的行为不会影响另一个租户的响应时间。这对于企业级 AI Agent 服务平台来说是关键的 SLA 保障。
4.3 灵活调度:运行时动态切换线程模式
AI Agent 系统的负载特征是动态变化的:
- 低并发时段(如深夜),Agent 处理少量复杂任务,单线程性能优先
- 高并发时段(如工作日),Agent 处理大量简单任务,吞吐量优先
空间多线程的运行时动态模式切换能力,使得系统可以根据当前负载特征,在 1T 模式和 2T 模式之间自动切换:
# 动态 SMT 模式调度示意
import psutil
def adjust_smt_mode():
active_threads = psutil.cpu_count() # 当前活跃线程数
avg_load = psutil.getloadavg()[0] # 系统平均负载
# 根据负载动态选择 SMT 模式
if avg_load < 0.5:
set_smt_mode("1T") # 低负载:最大化单线程性能
print("Switched to 1T mode: max single-thread performance")
elif avg_load < 1.0:
set_smt_mode("2T") # 中等负载:平衡模式
print("Switched to 2T mode: balanced performance")
else:
set_smt_mode("2T") # 高负载:最大化吞吐量
print("High load detected: 2T mode for maximum throughput")
# 关键:切换过程无需重启
# 硬件自动调整资源分区,软件层无感知
这种灵活性,是传统固定 SMT 策略无法提供的独特价值。
五、工程挑战:SMT 在 RISC-V 上的实现难点
5.1 RISC-V 的 SMT 规范现状
RISC-V 指令集规范对 SMT 的支持经历了漫长的标准化过程:
- RVA20 / RVA22 Profile:应用处理器 profile 规范了 RISC-V 处理器应支持的指令扩展,但早期版本对 SMT 的规范较为模糊
- RVA23 Profile(2023):在 2023 年的 RISC-V 峰会上,RVA23 profile 正式引入了 SMT 相关规范,为 RISC-V 高性能处理器实现 SMT 提供了标准化的接口规范
- Zicounts / Zawrs 扩展:引入了硬件计数器和等待-恢复指令支持,为 SMT 的资源管理和线程切换提供了 ISA 层面的基础
但规范到实现的距离,往往比想象中远得多。RISC-V 生态的碎片化(不同厂商实现方式各异)、开源社区的协作复杂度、以及香山这样的研究处理器的特殊性,都是 SMT 落地的工程挑战。
5.2 开源协作的复杂性:从 XS-GEM5 到香山昆明湖 V3
达摩院 SMT 工作组采用了模拟器优先的研发路线:基于 XS-GEM5 性能模拟器快速完成 SPECint2006 切片运行,在模拟环境中验证优化策略,再将有效的优化移植到香山昆明湖 V3 的RTL设计中。
这种"模拟器先行"的策略有几个关键优势:
- 快速迭代:修改模拟器的微架构模型比修改 RTL(寄存器传输级)代码快 10-100 倍
- 可重复验证:SPECint 基准测试可以在完全相同的环境下重复运行
- 风险可控:在模拟环境中发现的 bug 不会导致硬件流片失败
但也面临挑战:XS-GEM5 模拟器的模型精度(与真实 RTL 的吻合度)、香山昆明湖 V3 的 RTL 实现与模拟模型的差异、以及多团队协作中的沟通成本,都是需要持续克服的工程难题。
达摩院团队在 SMT SIG 技术沙龙上强调了一个核心原则:"Talk is cheap, show me the code"。所有分析结论必须转化为有效的代码合入香山昆明湖 V3 的开源仓库——这既是工程标准,也是开源社区的贡献要求。
5.3 向 4/8/16 线程扩展的挑战
当前的 SMT 实现是 2-way(每核 2 线程)。向更多线程扩展面临一系列工程挑战:
2T → 4T → 8T → 16T 的扩展路径分析:
资源翻倍:
├── 发射队列条目数 × N
├── 物理寄存器数量 × N
├── 重排序缓冲区大小 × N
├── 取指/解码带宽 × N
└── L1 D-Cache 带宽 × N
挑战:
├── 芯片面积增长(成本压力)
├── 跨线程一致性协议的复杂度
├── 取指带宽的物理限制(连取指端口都变稀缺)
└── 散热和功耗管理(TDP 约束)
英特尔的 Xeon Phi(Knights Landing)曾尝试 4-way SMT,AMD 的 EPYC 则一直坚守 2-way——这背后有深刻的工程权衡。玄铁团队对 4/8/16 线程的探索,将为 RISC-V 社区积累宝贵的高线程数 SMT 经验。
六、生态影响:RISC-V 高性能服务器的最后一块拼图
6.1 从"能用"到"好用":RISC-V 的高性能之路
RISC-V 的发展可以用一个词来概括:补短板。
2019-2021 年,RISC-V 的短板是基础指令集和工具链——GCC/LLVM 对 RISC-V 的支持、RISC-V Linux 发行版、各种语言的运行时支持。这些在 2022 年之前基本解决。
2022-2024 年,RISC-V 的短板是向量扩展和 AI 加速——RVV(RISC-V Vector Extension)规范落地、玄铁 C907/C920 的向量能力突破。这一阶段基本完成。
2025-2026 年,RISC-V 的短板是服务器级特性和软件生态——SMT、一致性协议、安全扩展、虚拟化支持。SMT 是这个阶段最核心的特性之一。
从 RISC-V 国际基金会的发展路线图来看,RVA23 profile 明确要求高性能应用处理器支持 SMT 能力。香山昆明湖 V3 + 玄铁 SMT 的联合研发,不仅是中国团队的技术突破,也是 RISC-V 生态走向成熟的重要里程碑。
6.2 对国产 AI 芯片生态的启示
2026 年 7 月,搭载蓝芯 LX500 芯片的量产 RISC-V 服务器在联想联宝工厂正式下线——这是全球首台 RISC-V 量产服务器。该芯片采用 48 核心异构设计(32 个高性能核心 + 16 个高能效核心),峰值算力达 75 TOPS,RISC-V 通用计算与 AI 智算实现原生融合。
在这个背景下,玄铁的 SMT 能力具有更广阔的战略意义:为 RISC-V 服务器芯片提供与国际主流产品(Intel Xeon、AMD EPYC、ARM Neoverse)同等的 SMT 能力,是 RISC-V 真正进入数据中心市场的技术前提。
没有 SMT 的 RISC-V 服务器芯片,在多线程工作负载下的性能将明显落后于配备 SMT 的竞品。玄铁与香山的联合研发,为国产 RISC-V 服务器芯片补上了这一关键能力。
6.3 开源的力量:从"拿来主义"到"自主可控"
值得特别强调的是,这次 SMT 研发是全流程开源的:
- 达摩院团队的分析成果和优化 patch 同步提交到香山昆明湖 V3 的开源仓库
- XS-GEM5 模拟器的 SMT 模型改进同步回馈给上游 GEM5 社区
- SMT SIG 技术沙龙的所有技术内容在玄铁视频号公开回放
这意味着,玄铁的 SMT 实现不是闭源的黑盒子,而是 RISC-V 生态的公共资产。任何基于 RISC-V 设计高性能处理器的团队,都可以参考香山昆明湖 V3 的 SMT 实现来构建自己的方案。这正是开源架构的真正价值——让整个生态受益于每一个团队的工程投入。
总结:RISC-V 高性能时代的确定性时刻
回顾整个技术演进脉络,我们可以看到一条清晰的逻辑链:
Agentic AI 时代 → 控制流密集型负载增加 → CPU 重回系统核心 → 高性能 CPU 需要 SMT → RISC-V 需要自主可控的 SMT 能力 → 玄铁 × 香山昆明湖 V3 的 SMT 联合研发
这不是一个孤立的硬件特性突破,而是整个 AI 基础设施演进链条上的关键一环。
玄铁空间多线程方案的核心创新——资源静态分区、单线程性能无损、尾部延迟稳定、运行时动态模式切换——直击 Agentic AI 场景中 CPU 作为"总指挥"的三大核心诉求:RL 沙箱的确定性延迟、多租户 SLA 隔离、灵活的资源调度。
从工程角度看,达摩院团队采用的"模拟器先行、微架构优化、代码开源"的路线,既保证了研发效率,又确保了成果的可验证性和可复用性。SPECint2006 双线程性能从 20% 向 30% 的推进,以及向 4/8/16 线程扩展的探索,为 RISC-V 生态积累了宝贵的高性能 SMT 经验。
在 AI Agent 时代,确定性和隔离性,将和绝对吞吐量同等重要。玄铁在 RISC-V 开源架构上实现自主可控的空间多线程,不仅为 RISC-V 进军高性能服务器市场迈出了关键一步,更展示了一条不同于 x86 和 ARM 的、开放且自主的高性能处理器发展道路。
这条路上,代码即共识,commit 即贡献。香山昆明湖 V3 的每一次 PR 合入,都在为 RISC-V 高性能时代添砖加瓦。
选题来源:RISC-V SMT 玄铁 香山 2026 WAIC
字数:约 9500 字
tags:RISC-V|SMT|玄铁|香山|CPU|微架构|AI Agent|空间多线程|处理器
keywords:RISC-V|玄铁|香山|SMT|空间多线程|AI Agent|CPU微架构|高性能服务器|开源处理器