深層学習におけるトレーニング高速化とメモリ最適化技術
異なる精度でのトレーニング手法
単精度トレーニング(FP32)は全てのパラメータ、活性値、勾配を32ビット浮動小数点数で表現します。
半精度トレーニング(FP16/BF16)は16ビット浮動小数点数を使用し、FP16はIEEE標準、BF16はAI計算向けに設計された形式です。
混合精度トレーニングはFP16/BF16とFP32を組み合わせ、通常は重みと勾配をFP32、活性値と中間計算をFP16/BF16 ...
8月2日 21:28 投稿