2本の記事で説明した語です。文脈ごとに言い方が変わるので、記事ごとにそのまま並べます。
出力に点をつけ、点が高くなる方へモデルを寄せる学習法。この点を報酬と呼ぶ
自分で採点すると学習が崩れる Co-RLは隣のモデルに採点させる2026年8月22日
望ましい結果に報酬を与えて、モデルの振る舞いを鍛える訓練方法
30分で誤検知と言い切れなければ止める OpenAIが訓練を2週間止めた基準2026年8月19日
用語集へ戻る