直接回答
代表的で固定したリポジトリタスクに、事前定義した受け入れテスト、安全境界、レビュー基準を適用します。結果と工程証拠を記録し、必要なら反復し、失敗も保存します。正確性、コスト、速度、安全性、保守性を説明のない単一スコアへまとめません。
重要な結論
- 実際のタスク分類、固定入力、独立した受け入れ条件を使います。
- 正確性、安全、工程コスト、保守性を別々に報告します。
- 最良結果だけでなく失敗と人手介入も残します。
- ハーネス、snapshot、設定、証拠の版を記録します。
重要な事実
このガイドで解決できること
エージェントの選定や利用拡大前に監査可能な評価を構築します。
検証範囲と制約
- 証拠の種類
- 公式ドキュメント仕様
- 検証範囲
- 一般的な評価指針をリポジトリ変更、コマンド、テスト、レビュー、権限境界へ適用します。
- 制約と失効条件
- - ベンチマークスコアや製品順位は示しません。
- - 未評価のタスクや設定へ一般化できません。
- - 人のレビュー基準は調整が必要です。
実際の保守作業からタスク群を作る
説明、局所的なバグ修正、テスト追加、制約付きリファクタリング、依存調査、セキュリティレビューを含めます。秘密と個人情報を除き、開始 commit を固定し、保守担当者が各タスクを検証できるようにします。
一つの合成 Issue をすべての作業の代表にしません。受け入れ条件を独立して確認できる場合だけタスクを追加し、未カバー領域を明記します。
実行前に受け入れ基準を書く
実行可能なチェックと人の評価を組み合わせます。テストで動作を、保守担当者が範囲、可読性、設計適合、残るリスクを確認します。禁止パスと安全要件も含め、機能だけ正しい危険な変更を不合格にします。
- 必要な動作と回帰テスト
- 許可・禁止ファイル範囲
- 正規コマンドと環境
- 秘密と安全の確認
- 人のレビュー基準と拒否理由
秘密を集めず工程証拠を記録する
クライアント・設定版、開始 commit、タスク ID、権限、秘匿したツール操作、終了コード、diff、テスト、リトライ、介入、最終判断を記録します。生プロンプトやソース断片は方針が許し、秘匿できる場合だけ保存します。
ネットワーク停止、壊れた基準テスト、無効 fixture、誤ったパッチを別の失敗分類にします。
評価軸を分けて報告する
タスク完了、テスト、レビュー所見、境界違反、人手修正、要求、利用量、時間を別々に示します。総合点を使う場合は重みと元結果を公開します。
反復し、評価基盤の変化を確認する
変動を見つけるために反復しますが、適切な統計設計なしに信頼区間を主張しません。すべての試行とハーネス版を残し、クライアント、モデル、ゲートウェイ、権限、リポジトリの重要変更後に再実行します。
公式情報と検証範囲
本ガイドは公開されている公式ドキュメントを根拠にしています。コマンドや設定はクライアントのバージョンにより変わるため、実行前に参照元も確認してください。
技術検証方法を見る