評価指標

AI

LLM-as-a-Judgeとは?

LLM-as-a-Judgeは、大規模言語モデルにAIの回答や生成物を評価させる手法です。初心者の比喩、よくある誤解、実例と試験勉強へのつながりをやさしく解説します。
AI

再現率とは?

再現率とは、本当は「陽性」と言えるものを見逃さず、正しく見つけ出せる割合のことです。精度との違い、生活で出くわす例、G検定やデータサイエンティスト検定での出題アングルまで、初心者・受験者向けにやさしく解説します。
AI

適合率とは?

「陽性」と判定したAIのうち、本当に正しい割合が「適合率(precision)」です。混同行列と召回率の違いを、生活に即した例で分かりやすく解説します。
AI

BLEUとは?

BLEUは機械翻訳の生成文を基準文と単語の一致度で比較し、0から100で評価する指標です。初心者向けの例と、G検定で「評価方法」としてどう出題されるかをわかりやすく解説します。
AI

Top-k Accuracyとは?

Top-k Accuracyとは、AIの予測した候補のうち上位k個に正解が含まれていれば「成功」と見なす評価方法です。ランキング・検索・推薦で使われ、1位の当たりだけで切らずに「候補枠の幅」で実務性を測るのが特徴。具体例・上位1位正解率との違い・試験視点までやさしく解説します。
AI

RMSE(二乗平均平方根誤差)とは?

RMSE(二乗平均平方根誤差)は、予測のズレをひとつの数字で測る指標です。MAEとの違い、初心者向けの読み方、今週に試せる確認方法をやさしく解説します。