Artificial Analysisの能力指数の方法論
概要
Artificial Analysisの能力指数は、法務、医療、金融といった特定の専門的なユースケースでモデルがどの程度優れた性能を発揮するかを測定します。
各構成ベンチマークを独立して実行したうえで、そのスコアを指数に統合します。ほかの評価指標と同様に、能力指数には制約があり、すべてのユースケースに直接適用できるとは限りません。それでも、特定の分野で重要な業務についてモデルを比較するうえで、有用な総合評価となります。
基礎となる各ベンチマークの実行方法と採点方法は、知能ベンチマークの方法論に記載しています。
指数の内訳
各指数は、法務、ヘルスケア・医療、財務・会計など、単一の職種や分野を対象とし、その分野の実際の業務で各能力が現れる頻度に応じて一連の能力を重み付けします。
タスクの重み付けには、O*NET形式の業務活動分類を使用しています。以下の表に、各指数の構成要素と重みを示します。
| 指数 | 重み | 能力 | 評価 | 説明 |
|---|---|---|---|---|
| 財務・会計指数 | 30% | ビジネス知識 | AA-Omniscience | 会計、企業財務、経済、投資に関する専門知識。 |
| 30% | エージェント型知識作業 | GDPval-AA v2.1, AA-Briefcase v1.1 | スプレッドシートの作成、分析の実行、ワークフローの調整など、ツール利用、計画、複数段階のタスク実行。 | |
| 20% | 推論 | HLE | 感応度分析、バリュエーション、構造化された問題解決に用いる複数段階の定量的・分析的推論。 | |
| 10% | エージェント型ツール利用 | AutomationBench-AA | ガードレールに違反せず、スプレッドシート、メール、会計ツールなどの業務アプリで財務ワークフローを完了する能力。 | |
| 5% | 長文脈 | LCR, GDP.pdf | 長い財務開示、取引文書、PDF レポートを読み、推論する能力。 | |
| 5% | 非ハルシネーション | AA-Omniscience | 架空の数値や引用を避ける能力。 | |
| 戦略・オペレーション指数 | 30% | ビジネス知識 | AA-Omniscience | 業務プロセス、会計の基礎、オペレーション概念に関する実践的知識。 |
| 35% | エージェント型知識作業 | GDPval-AA v2.1, AA-Briefcase v1.1 | ツール利用、計画、複数段階のオフィス業務を一貫して調整する能力。 | |
| 30% | エージェント型ツール利用 | AutomationBench-AA | ガードレールに違反せず、業務アプリ上でオペレーション、人事、マーケティング、営業、サポートのワークフローを完了する能力。 | |
| 5% | 長文脈 | LCR, GDP.pdf | 長いスレッド、方針、記録、PDF 文書にわたって文脈を維持する能力。 | |
| 法務指数 | 35% | 法的知識 | AA-Omniscience | 複数の法域にわたる法令、法理、手続に関する知識。 |
| 25% | エージェント型知識作業 | GDPval-AA v2.1, AA-Briefcase v1.1 | 案件管理ワークフロー、文書作成プロセス、ツールを活用した調査の実行。 | |
| 15% | 推論 | HLE | 複数段階の論証、法令解釈、相反する権威の比較衡量。 | |
| 10% | 長文脈 | LCR, GDP.pdf | 契約書、証拠開示資料、判例資料、PDF 提出書類を横断して読み、統合する能力。 | |
| 10% | 非ハルシネーション | AA-Omniscience | 架空の判例引用や法令を避ける能力。 | |
| 5% | エージェント型ツール利用 | AutomationBench-AA | ガードレールに違反せず、業務アプリで顧客サポートとオペレーションのワークフローを完了する能力。 | |
| 医療・ヘルスケア指数 | 30% | 医療・健康知識 | AA-Omniscience | 診断、薬理、ケアパスに関する臨床知識。 |
| 25% | エージェント型知識作業 | GDPval-AA v2.1, AA-Briefcase v1.1 | ツール利用、計画、電子健康記録と薬局のワークフローを一貫して調整する能力。 | |
| 15% | 長文脈推論 | MLCR-AA | 長く断片化された患者記録や請求資料から知見を統合する能力。 | |
| 10% | 非ハルシネーション | AA-Omniscience | 架空の薬物相互作用、用量、ガイドラインを避ける能力。 | |
| 10% | 推論 | HLE | 生物学と医学にわたる複数段階の臨床推論。 | |
| 10% | エージェント型ツール利用 | AutomationBench-AA | ガードレールに違反せず、業務アプリで患者サポートとオペレーションのワークフローを完了する能力。 | |
| エンジニアリング指数 | 35% | 工学知識 | AA-Omniscience | 土木、電気、機械、その他の工学分野に関する専門知識。 |
| 30% | 推論 | HLE, CritPt | 導出、寸法計算、設計上のトレードオフに必要な複数段階の定量的推論。 | |
| 20% | エージェント型知識作業 | GDPval-AA v2.1, AA-Briefcase v1.1 | 工学成果物を作成するためのツール利用、計画、複数段階の実行。 | |
| 15% | エージェント型ターミナル利用 | Terminal-Bench 4.0 | ビルド、スクリプト、システム管理、デバッグのために実際のターミナル環境を操作する能力。 | |
| 経済学指数 | 35% | 経済学知識 | AA-Omniscience | ミクロ経済学、マクロ経済学、財政学、市場に関する知識。 |
| 35% | 推論 | HLE | モデリング、推定、推論のための複数段階の定量的・分析的推論。 | |
| 25% | エージェント型知識作業 | GDPval-AA v2.1, AA-Briefcase v1.1 | 分析成果物を作成するためのツール利用、計画、複数段階の実行。 | |
| 5% | 長文脈推論 | LCR | 長いレポート、データセット、研究ノートを読み、推論する能力。 |