学習の方法58語

AIがデータから何かを学ぶ方法です。教師あり学習、教師なし学習、強化学習、ファインチューニング、過学習、損失関数、勾配降下法など、「学習する」という言葉の裏にある過程をひとつずつほどきます。

難易度
DQNDeep Q-Network

Q値の表をニューラルネットワークに覚えさせる方法

応用
LoRA

本体は残し小さな付け足しだけ学ぶ方法

応用
Q学習Q-Learning

行動ごとに期待点数を書き留めて直す方法

応用
RLHF

人が選んだ好みで答えの結を仕上げる学習

言語モデル 基本
アライメントAlignment

AIの能力を人が望む方向に合わせること

倫理 基本
インストラクションチューニングInstruction Tuning

指示を受けたらそれに合わせて答える形を身につける段階

言語モデル 基本
エージェントと環境Agent & Environment

行動する側とその行動に反応する舞台

入門
エポックEpoch

学習データ全体を一回すべて見終える単位

入門
オプティマイザOptimizer

勾配を受け取り値の動かし方を決める規則

応用
クラスタリングClustering

名札のないまま似たものどうしを集める作業

基礎 基本
スケーリング法則Scaling Law

大きさとデータを増やすと性能が上がる規則

言語モデル 基本
チェックポイントCheckpoint

学習途中の状態をそのまま残した保存ファイル

入門
データリーケージData Leakage

採点用の情報が学習側へ入り込む事故

評価 基本
データ拡張Data Augmentation

持っているデータを変形して種類を増やす方法

基本
ドロップアウトDropout

学習中に一部を無作為に休ませる方法

基本
ノイズNoise

混ざり込んだ汚れであり生成の出発点

生成 入門
ハイパーパラメータHyperparameter

学習を始める前に人が決めておく値

基本
ファインチューニングFine-Tuning

学習済みモデルを新しい資料でさらに整える

基本
ミニバッチMini-Batch

データをまとまりに分け一歩ずつ処理する方式

基本
モード崩壊Mode Collapse

作る側が通りやすい一つだけ出す状態

生成 応用
モデル崩壊Model Collapse

AIが作った物を再学習し多様性が失われる現象

倫理 応用
ワールドモデルWorld Model

世界の仕組みを内に持ち前もって試す模型

生成 応用
遺伝的アルゴリズムGenetic Algorithm

複数の候補を混ぜ少し変えて選んでいく方法

基本
過学習Overfitting

練習問題の答えだけ覚えて新しい問題が解けない状態

基本
回帰Regression

続いた目盛りの上の数値一つを言い当てる仕事

基礎 基本
学習Training

例を見ながら調節値を少しずつ直していく過程

基礎 入門
学習曲線Learning Curve

回数が増えるほど点数がどう変わるか描いた線

入門
学習不足Underfitting

単純すぎて練習問題すら解けない状態

基本
学習率Learning Rate

一歩で値をどれだけ動かすか決める値

基本
機械学習Machine Learning

規則を書く代わりに例から見つけさせる方法

基礎 入門
強化学習Reinforcement Learning

やってみて受けた点数で行動を直す学習

入門
教師あり学習Supervised Learning

正解つきの例から規則を学ぶ方式

入門
教師なし学習Unsupervised Learning

正解なしに資料の構造を見つける学習

入門
局所最小値Local Minimum

もっと低い場所があるのに閉じ込められた場所

基本
検証データValidation Set

学習に使わず点検にだけ使う取り分けたデータ

入門
誤差逆伝播Backpropagation

誤差を後ろから前へたどり分け前を配る手順

基本
交差検証Cross-Validation

データを分割し順に検証して点数を平均する方法

応用
勾配Gradient

誤差を減らすにはどちらへどれだけ動くか示す信号

構造 基本
勾配降下法Gradient Descent

誤差が下がる方へ少しずつ動いていく方法

基本
勾配消失Vanishing Gradient

学べという信号が層を通るうち薄れて消える現象

構造 応用
事前学習Pretraining

使い道を決める前に基礎を身につけておく段階

言語モデル 基本
自己教師あり学習Self-Supervised Learning

資料自身が問題と答えを作って学ぶ方式

基本
収束Convergence

これ以上良くならず値が一箇所にとどまる状態

基本
正則化Regularization

値が大きくなりすぎないよう罰を科す仕組み

基本
早期終了Early Stopping

成績が悪くなり始めたら学習を止めること

入門
損失関数Loss Function

答えが正解からどれだけ外れたかを表す一つの数値

基本
対照学習Contrastive Learning

同じものを引き寄せ違うものを遠ざけて学ぶ

応用
探索と活用Exploration vs Exploitation

知っている手を使うか新しく試すかの均衡

基本
知識蒸留Knowledge Distillation

大きなモデルの判断を小さなモデルへ移す方法

応用
転移学習Transfer Learning

すでに身につけた基本を新しい仕事へ移す方式

基本
破壊的忘却Catastrophic Forgetting

新しいことを学ぶうちに前の実力を失う現象

応用
半教師あり学習Semi-Supervised Learning

少しの正解と多くの未正解で学ぶ方式

応用
汎化Generalization

初めて見るデータでも実力が保たれる力

基礎 基本
平均二乗誤差Mean Squared Error

外れた距離を二乗して平均した罰点

評価 基本
報酬Reward

行動したあとに返ってくる良し悪しの点数

入門
方策Policy

状況ごとに何をするか決めた行動方針

基本
模倣学習Imitation Learning

上手な人の行動をそのまま見て真似て学ぶ

基本
連合学習Federated Learning

資料を集めず各自の学習結果だけ集める

応用