10.3969/j.issn.1007-130X.2019.07.003
快速多极子方法在申威众核处理器上的实现和优化
快速多极子方法(FMM)是一种求解N体问题的快速高效数值算法,在宇宙学和分子动力学等模拟中具有广泛的应用.申威SW26010是一款国产众核异构处理器,含260核心(4核组).基于申威SW26010的众核架构设计和实现了快速多极子方法,并对核心函数(尤其是最耗时的粒子对相互作用)系统地进行了性能优化,包括异步DMA、SIMD向量化、循环展开、内联汇编指令调整等.以粒子对相互作用为例,优化后代码的计算速度约为主核上运行的原始代码的400倍,每个核组上的浮点性能达到250 GFLOPS,即理论峰值性能的32.5%.
快速多极子方法、异构众核处理器、N体问题、性能优化
41
TP391.9;TP319(计算技术、计算机技术)
国家重点研发计划2017YFB0203303;中国科学院十三五信息化应用工程项目XXH13506-405
2019-07-24(万方平台首次上网日期,不代表论文的发表时间)
共7页
1161-1167