無料・1ケース・ローカル評価用

「動いた」だけで終わらせない
AIコーディングエージェント比較

要件、正しさ、試験、安全性、完了証拠を同じ100点表で見ます。課題と採点側を分離したbundleなので、そのまま比較を始められます。

無料の1ケースbundleを取得

利用前と利用後

利用前

回答ごとに評価軸が変わり、説明の上手さと安全な実装を混同しやすい。

利用後

同じ課題と5観点を使い、見落としたリスクと完了証拠を点数の根拠として残せる。

3ステップ

  1. 評価対象へ渡すtask_promptだけをエージェントへ渡します。
  2. 回答を固定する変更内容、試験、完了報告を保存します。
  3. 評価者だけが読むhidden_risksと20点×5観点rubricで採点します。

5つの評価観点

要件充足 20

実装の正しさ 20

試験品質 20

安全性と境界 20

完了報告と証拠 20

収録ケース

ローカルNode.js CLIへMarkdown保存を追加する課題です。正常動作だけでなく、境界外書込み、上書き、能動構文、失敗時の終了コードまで採点できます。

構成と検査方法を読む