10.3785/j.issn.1008-973X.2024.01.009
大点数FFT在"申威26010"上的并行优化
根据"神威·太湖之光"超级计算机所用国产"申威26010"处理器的架构特点和编程规范,提出针对大点数FFT的众核并行优化方案.该方案源自经典的Cooley-Tukey FFT算法,通过将一维大点数数据迭代分解为二维小规模矩阵进行并行加速.为了解决矩阵"列FFT"的读写、转置和计算问题,提出"列均分-行连续"的读写策略,通过对数据进行合理的分配、重排、交换,结合SIMD向量化、旋转因子优化、双缓冲、寄存器通信、跨步传输等优化手段,充分利用了众核处理器的计算资源和传输带宽.实验结果显示,单核组64从核并行程序较主核运行FFTW库,可以达到最高65x、平均48x以上的加速比.
神威·太湖之光、申威26010、快速傅里叶变换、Cooley-Tukey算法、众核并行
58
TP338(计算技术、计算机技术)
国家重点实验室开放基金2019A10
2023-12-21(万方平台首次上网日期,不代表论文的发表时间)
共9页
78-86