かみくだきむずかしいニュースを、わかるまで噛み砕く

強化学習(RL)とは

2本の記事で説明した語です。文脈ごとに言い方が変わるので、記事ごとにそのまま並べます。

  1. 出力に点をつけ、点が高くなる方へモデルを寄せる学習法。この点を報酬と呼ぶ

    自分で採点すると学習が崩れる Co-RLは隣のモデルに採点させる

  2. 望ましい結果に報酬を与えて、モデルの振る舞いを鍛える訓練方法

    30分で誤検知と言い切れなければ止める OpenAIが訓練を2週間止めた基準

用語集へ戻る