なぜバッドケースの修正が新規データ追加より重要なのか?

強化学習による人間フィードバック(RLHF)やモデルの嗜好最適化を行う際、多くの人が直感的に考えるのが: 「モデルを強くしたい? なら、もっとデータを足せばいい。」 しかし、実際にRLHFプロジェクトを運用した経験があるエンジニアは誰もが知っている真実がある。 モデルの品質を決めるのはデータ量ではなく、「誤りをいかに早く修正できるか」というフィ ...

9月1日 04:39 投稿