
8月21日-23日,由浙江大学杭州国际科创中心(简称科创中心)主办,国科大杭州高等研究院、中国开放指令生态(RISC-V)联盟、RISC-V工作委员会(RVEI)联合主办的2024 RISC-V中国峰会主会在中国杭州黄龙饭店正式拉开帷幕。
RISC-V 中国峰会至今已成功举办四届,现已成为中国大陆规格最高、规模最大、影响力最强的专业会议之一,本届峰会汇聚了领域内3000余位专家学者和行业精英,共同探讨前沿技术和产业发展趋势。
中国科学院计算技术研究所、计算机科学与技术研究生二年级唐浩晋做了主题为“香山开源处理器昆明湖架构的设计演进”的演讲报告,他分享了,昆明湖架构的最新技术进展。过去一段时间,昆明湖架构在多个核心领域取得了显著成果,包括指令集扩展、架构性能优化、功耗控制、缓存设计以及整体可靠性提升等方面,均取得了突破性进展。
首先,关于指令集扩展的进展,他表示,昆明湖架构在指令集方面引入了先进的向量扩展技术,这与Intel的AVX、ARM的SVE等高性能指令集有些类似。这一扩展增强了我们SIMD(单指令多数据)的计算能力,支持128位的向量长度,并可以灵活处理8比特到64比特的整数,以及16位到64位的浮点数运算。尤其值得关注的是,昆明湖的最大向量长度达到了1024比特,为我们在大数据处理、AI计算等高强度工作负载的性能提升带来了巨大的潜力。在SPEC 2006的Hammer测试中,通过这些向量扩展,昆明湖的向量性能相比标量性能提升了惊人的24.4%。
而在功能扩展方面,唐浩晋表示,除了基础的向量指令扩展之外,昆明湖还增加了支持RISC-V RVL3 Profile的拓展能力。这一扩展确保了昆明湖能够在服务器生态中具备更强的通用性,特别是在高性能计算和数据中心应用场景中表现尤为突出。我们的架构支持最大256TB的单进程虚拟地址空间,物理地址空间同样支持扩展到256TB。这一巨大扩展为服务器提供了更多的可扩展性,同时确保了架构在未来服务器需求增长中具备极高的灵活性。
唐浩晋后续还深入介绍了在性能、功耗和面积(PPA)优化方面的具体进展,昆明湖架构在前端架构上进行了深度优化,特别是在I-Cache的设计方面。通过重新设计预取器,我们实现了预取器与I-Cache的深度集成,从而大幅提升了指令缓存的利用效率。更重要的是,通过引入更细粒度的缓存拆分与软件预取功能,我们成功地将I-Cache功耗降低了70%。在实际测试中,I-Cache的功耗从0.3395瓦降到了0.105瓦,这对于功耗敏感的应用场景来说无疑是巨大的优势。
而在后端架构方面,我们也做了大量的改进。我们的设计团队对整个流水线进行了重构,包括乱序调度、计算器堆重组、以及Load Queue的优化设计等。这些优化显著提高了架构的发射后读取性能,并通过增加访存带宽,使整体带宽能力提升了50%。特别是在缓存设计上,我们支持了拆总线协议,大大提升了系统的并发处理能力与执行效率。
唐浩晋提到,昆明湖架构针对MMU(内存管理单元)也进行了升级,我们在这里引入了压缩特性,优化了虚拟内存的访问效率,使得整体的内存管理性能得到了显著提升。正是通过这些多方位的优化,我们在SPEC 2006的性能评估中,昆明湖架构在三级缓存支持下,性能从16.94分提升到了44分,并在经过进一步的优化后,峰值性能达到了49.96分,这表明昆明湖架构在高性能计算场景下具备了非常强大的潜力。
同时,昆明湖架构在功耗控制方面也取得了不小的成就,除了前面提到的I-Cache功耗优化之外,我们还针对整个处理器的功耗进行了精细化管理。通过智能电源管理机制的引入,我们能够更好地根据实际应用场景动态调节处理器的功耗,确保在高性能模式下获得最佳的计算能力,而在低负载或待机模式下能够最大化地降低功耗。
最后,唐浩晋重点介绍一下在可靠性提升方面所做的工作,在硬件设计的过程中,验证环节至关重要。为了确保昆明湖架构的高可靠性,昆明湖架构在开发过程中采用了更为严格的验证流程,验证团队和设计团队紧密合作,确保设计的每一部分都经过详细验证,以避免流片后的潜在问题。此外,引入了敏捷开发框架,使得验证流程更加高效。通过这一优化,流片成功率显著提升,确保了昆明湖架构的可靠性和商业化进程中的稳定性。
不仅如此,昆明湖架构还与多家产业伙伴合作,结合他们的应用需求,进一步对昆明湖架构进行调优,确保其在商业化部署中的高效性和适应性。
昆明湖架构在指令集扩展、性能提升、功耗控制、缓存设计以及可靠性提升等方面均取得了显著进展。这些进展不仅让昆明湖架构能够应对当前高性能计算和AI等领域的挑战,也为未来技术的发展奠定了坚实基础,展望未来,昆明湖架构将在各个应用场景中展现出卓越的竞争力,为行业带来新的机遇与突破。