評価・データ42語
AIの出来をどう測り、どんなデータで教えるかに関する用語です。正解率、適合率と再現率、ベンチマーク、ラベリング、バイアス、データ拡張など、性能表を読むときに必要な言葉を集めました。
二つに分けて使わせ結果を比べる試験
AIバイアスAI Bias学習データの偏りがAIの判断にそのまま残った状態
AI生成物検出AI Content DetectionAIが作ったものかどうかを見分けること
EloレーティングElo Rating対戦結果を積み重ねてつける実力の数値
F1スコアF1 Score適合率と再現率を一つにまとめた点数
LLM審査LLM-as-a-Judge言語モデルに答えの良し悪しを採点させること
ROC・AUCROC & AUC閾値を動かして測った成績を一本の曲線と数字に
クラス不均衡Class Imbalance片方の種類ばかり大量にある資料の偏り
データクリーニングData Cleaning集めた資料を使える状態に整える手入れ
データサイエンスData Scienceデータから使える答えを引き出す仕事全体
データセットDatasetAIを教えるために集めて整えた資料の束
データバイアスDataset Bias集めたデータ自体が一方に偏っている状態
データリーケージData Leakage採点用の情報が学習側へ入り込む事故
データ拡張Data Augmentation持っているデータを変形して種類を増やす方法
データ品質Data Quality学習に使う資料がどれくらい信頼できるか
パープレキシティPerplexity次の言葉を何通りで迷っているかを表す値
バウンディングボックスBounding Box物体を囲む四角とその位置
プロンプト忠実度Prompt Adherence頼んだとおりに出たかを測る物差し
ベンチマークBenchmark複数の対象を同じ条件で測る共通問題集
ラベリングLabelingデータ一つ一つに人が答えを付ける作業
ラベルLabel人が資料にあらかじめ付けておいた正解
リーダーボードLeaderboard評価点数を順に並べて見せる表
過学習Overfitting練習問題の答えだけ覚えて新しい問題が解けない状態
外れ値Outlier残りの値からぽつんと離れて浮く値
較正Calibration言った確率と実際に当たった割合を合わせること
学習曲線Learning Curve回数が増えるほど点数がどう変わるか描いた線
学習不足Underfitting単純すぎて練習問題すら解けない状態
堅牢性Robustness条件が揺らいでも通用し続ける性質
検証データValidation Set学習に使わず点検にだけ使う取り分けたデータ
交差検証Cross-Validationデータを分割し順に検証して点数を平均する方法
合成データSynthetic Data本物の代わりに作り出した練習用の資料
混同行列Confusion Matrix正解と不正解の四つの場合を枠に分けた表
信頼度スコアConfidence Scoreモデルが自分の答えに自分で付けた確信の数字
人手評価Human Evaluation人が直接見て付ける評価
正解データGround Truth学習と採点の基準になる本当の答え
正解率Accuracy全体の判定のうち正解した割合
説明可能性ExplainabilityAIがなぜそう判断したか示せる度合い
適合率と再現率Precision & Recall選んだ中の本物の割合と本物の中で見つけた割合
特徴量FeatureAIが判断するときに見る材料ひとつ
標本の偏りSampling Bias誰を選んだかで生まれる資料の偏り
評価指標Evaluation Metric何をもって良しとするか決めておく物差し
平均二乗誤差Mean Squared Error外れた距離を二乗して平均した罰点