AIコーディングエージェント評価データセット 5ケース|採点ルーブリック100点付き(JSONL/CSV/Markdown・Claude/ChatGPT/Copilot対応)
- Digital1,280 JPY






AIコーディングエージェント(Claude / ChatGPT / Copilot など)にリポジトリ作業を任せる前に、「依頼文・証拠・停止条件」がそろっているかを小さく確かめるための評価用データセットです。 本番リポジトリをいきなり渡すと、返ってきた回答が良いのか悪いのかを判断する基準がありません。このパックは、合成ケース5件と100点満点の採点ルーブリック、そして「良い回答/悪い回答」の期待確認ポイントをセットで用意します。 ## 収録内容(全5ファイル) - cases/cases.jsonl — 合成評価ケース5件(1行1ケース/case_id・title・buyer_job・task_prompt・expected_artifacts・hidden_risks・difficulty の9項目) - repo_eval_001 [easy] 失敗テストの切り分け(コードを直させずに原因クラスを言わせる) - repo_eval_002 [easy] バグ再現パケット(曖昧なバグ報告を再現手順へ変える) - repo_eval_003 [medium] レビューのリスク走査(曖昧な褒め言葉を禁じる) - repo_eval_004 [medium] ログイン停止時の引き継ぎ要約(ブロッカーを失わせない) - repo_eval_005 [medium] ソース鮮度チェック(記憶と現行ドキュメントを分離させる) - eval_rubric.csv — 採点観点5項目×20点=100点(各項目に pass_signal / fail_signal つき) - answer_key.md — 各ケースの期待確認ポイントと、典型的な悪い回答 - README-ja.md — 使い方(日本語) - LICENSE.txt — 利用条件 ## 使い方 1. cases.jsonl から1ケース選び、task_prompt をそのままエージェントに渡す 2. 返ってきた回答を eval_rubric.csv の5観点で採点する 3. answer_key.md と突き合わせ、足りない証拠・危ない前提・曖昧な停止条件を確認する 4. 自分のリポジトリで使う依頼文へ、埋まっていなかった欄を移植する チームで使う場合は、同じケースを複数人で採点してから基準をすり合わせると、依頼文に足りない項目が見つかりやすくなります。 ## 購入前にご確認ください(実物の仕様) - **ケース本文・ルーブリック・アンサーキーは英語で書かれています。** README の解説は日本語です(プロンプトは英語のままの方が指示が崩れにくいため、意図的にこの構成にしています)。商品画像で実物をそのまま掲載していますので、購入前にご確認ください。 - 収録は **静的な JSONL / CSV / Markdown ファイルのみ** です。実行ツール、自動採点スクリプト、CI連携、拡張機能は含まれません。 - **合成ケース5件の小さなパックです。** 大量のケースを収録したベンチマークではありません。 - ケースはすべて合成です。実在するリポジトリ、顧客情報、障害記録、認証情報は含まれていません。 - 特定モデルの性能ランキング、ベンチマークスコアの正確性、品質向上・工数削減・売上の発生を約束するものではありません。 - 内容は購入者の業務に組み込んで利用・改変できますが、パックそのものの再配布・再販はできません(LICENSE.txt)。 ## 形式 ZIP(約5KB)/ JSONL 1点 + CSV 1点 + Markdown 2点 + LICENSE。テキストエディタがあれば開けます。






