RAG 評価ハーネス ── AI 窓口の更新で答えが悪くなっていないか、同じ質問表で確かめる Node.js のプログラム(買い切り)
- Digital5,980 JPY






AI 窓口の更新で、答えが悪くなっていないか。 質問と期待する答えを CSV にまとめておき、更新の前と後で同じように確かめます。前回より悪くなった質問は、日本語のレポートの先頭に出ます。 AI 窓口を開発・納品する方のための、RAG の評価ツールです。 ### いつ使うか - プロンプトや答え方の設定を直したとき - 答えるモデルを替えたとき - 窓口に読ませる文書を書き足したり、書き換えたりしたとき - お客さまに納める前と、納めたあとの更新のとき ### 何を見つけられるか 前回は答えられていたのに、今回は悪くなった問いを、前回と今回の判定を並べてレポートのいちばん上に出します。あわせて、正答率・期待した出典との一致(質問表に書いた文書が答えの出典に入っているか。本文が答えを裏づけているかまでは確かめません)・検索の当たり・断りの正しさ・禁止事項の違反・1 問あたりの時間と円を数えます。 ### しくみ - 質問表は CSV です。Google スプレッドシートや Excel で 1 行 1 問ずつ書けます - 窓口に実際に答えさせ、Claude が要点ごとに「述べている・触れていない・食い違う」の印を付けます。判定は、その印からプログラムが決めます - 結果は日本語の HTML 1 枚です。日本語と英語の要約、CSV、CI 用の JSON も書き出します - GitHub Actions の例つきで、正答率が下がったら CI を失敗にできます ### つなげる窓口 AI 案内窓口キット・LINE 案内窓口キット・AI 書類読み取りキット(版 1.0.x)に、キットのコードを変えずにつなげます。任意の HTTP の窓口にもつなげます。 ### 見本 `npm run demo:diff` で、API キーなしで更新の前と後のレポートを開けます。記録した答えと採点を再生するデモです。「あと」は見本の文書の価格表 1 行をわざと書き換えて取った記録で、「キッチンの入れ替えはいくらくらいですか」が正解から誤りに変わり、先頭に出ます。お客さまの実際の窓口で取った結果ではありません。 ### 採点の確かめ `npm run judge:check` で、人が判定を付けた同梱の 30 件を採点させて一致を確かめられます(29/30 が一致)。採点は目安です。悪くなった問いは、答えを読んでお確かめください。 ### 費用 本品は買い切りです。AI の利用料は、ご自身の Anthropic のアカウントからお支払いいただきます。2026 年 10 月 3 日に見本の 20 問を記録したときの額(概算)は、AI 案内窓口キットでキット 42 円 + 採点 7 円、LINE 案内窓口キットで 37 円 + 5 円、AI 書類読み取りキットで 125 円、見本の「あと」で 46 円です。答えは claude-opus-5、採点は claude-sonnet-5 で、本品の値段の表(100 万トークンあたり opus 5 は入力 5 ドル・出力 25 ドル、sonnet 5 は入力 2 ドル・出力 10 ドル)と 1 ドル 150 円で計算しています。実際の額は文書の量や質問の数で変わります。 ### 送られるもの 採点で Anthropic へ送るのは、質問・期待する要点・答えてはいけないこと・答え・出典の題と URL だけです。文書の本文と書類そのものは送りません。発行者のもとには何も送られません。 ### できないこと 答えの自動の直し、文書からの質問表の自動生成、画面のあるサーバー、複数の利用者、Claude 以外での採点、2 往復以上の会話、xlsx の読み込みには対応していません。 ### 動作環境 Node.js 20 以上、Anthropic の API キー、測るキットのフォルダ(`npm install` 済み)か HTTP で呼べる窓口。ターミナルを使います。 ### 価格とライセンス 5,980 円(税込)の買い切りです。改変と、お客さまの環境への組み込み納品は自由です。再配布・転売・同種商品化はできません。購入後 14 日間、不具合のご連絡にメールで対応します(3 営業日以内に返信)。ダウンロード後の返金はできません。 Claude は Anthropic の商標です。本品は Anthropic の公式の製品ではなく、提携もしていません。





