📢 X投稿文
LLMエージェントの法務実務能力を評価するベンチマーク。M&Aから契約レビューまで24分野1671タスク。実務的なテストセットでエージェント性能を定量測定
https://github.com/harveyai/harvey-labs
🤖 AI考察
■ **概要**
法律業務を実行するLLMエージェントの能力を測定する包括的なオープンソース・ベンチマークで、1671タスク・24+法律分野をカバー。
■ **特徴・用途**
- **現実性**:M&Aデータルーム、契約業務など実務シナリオをタスクセット+実行ハーネスで再現可能に設計
- **スケール**:複数分野の大規模タスクセットにより、汎用性と領域別特性の双方を評価
- **継続進化**:MITライセンスで公開・プルリクエストベースの拡張、ベンチマーク標準化への貢献
■ **結論**
Law & AIの実用性検証がタスク・指標・レポート可視化で体系化された、汎用エージェント系ベンチマークの有力な専門例。