🦉

OSS

URL2AI ← 一覧

Legal Agent Benchmark (LAB): An open-source benchmark for evaluating agents on real legal work.

@xb_bittensor 2026-08-12 00:08:03 harveyai_harvey-labs
📢 X投稿文
LLMエージェントの法務実務能力を評価するベンチマーク。M&Aから契約レビューまで24分野1671タスク。実務的なテストセットでエージェント性能を定量測定 https://github.com/harveyai/harvey-labs
🤖 AI考察
■ **概要** 法律業務を実行するLLMエージェントの能力を測定する包括的なオープンソース・ベンチマークで、1671タスク・24+法律分野をカバー。 ■ **特徴・用途** - **現実性**:M&Aデータルーム、契約業務など実務シナリオをタスクセット+実行ハーネスで再現可能に設計 - **スケール**:複数分野の大規模タスクセットにより、汎用性と領域別特性の双方を評価 - **継続進化**:MITライセンスで公開・プルリクエストベースの拡張、ベンチマーク標準化への貢献 ■ **結論** Law & AIの実用性検証がタスク・指標・レポート可視化で体系化された、汎用エージェント系ベンチマークの有力な専門例。
𝕏 Xに投稿
コピーしました