ARM Neon命令セットによるmemcpy最適化の深掘り:なぜ高速化しないのか

画像処理や行列演算などの分野では、ARMのNeon命令セット(SIMD)を用いた高速化が一般的です。しかし、単純なメモリコピー(memcpy)において、128ビット幅のベクトルレジスタを利用すれば、標準のmemcpyよりも高速化できるのではないかという疑問が生じます。結論から述べると、多くの場合、Neonを用いた自作の実装は標準ライブラリのmemcpyに及ばないか、同等程度のパフ ...

7月22日 19:06 投稿