深層学習におけるトレーニング高速化とメモリ最適化技術

異なる精度でのトレーニング手法 単精度トレーニング(FP32)は全てのパラメータ、活性値、勾配を32ビット浮動小数点数で表現します。 半精度トレーニング(FP16/BF16)は16ビット浮動小数点数を使用し、FP16はIEEE標準、BF16はAI計算向けに設計された形式です。 混合精度トレーニングはFP16/BF16とFP32を組み合わせ、通常は重みと勾配をFP32、活性値と中間計算をFP16/BF16 ...

8月2日 21:28 投稿