指数

AA-LCR v1.1AutomationBench-AATerminal-Bench 4.0SciCodeHumanity's Last ExamGDP.pdfCritPt
Updated

Artificial Analysis Intelligence Index v4.3.2

A composite benchmark aggregating ten challenging evaluations to provide a holistic measure of AI capabilities across mathematics, science, coding, and reasoning.

AA-LCR v1.1Humanity's Last ExamAutomationBench-AAGDP.pdf

財務・会計指数

ビジネス知識、エージェント型知識作業、推論、エージェント型ツール利用、長文脈分析、非ハルシネーションを含む、財務・会計分野の性能を測定します。

金融ビジネスエージェント知識労働推論ツール利用長文コンテキスト忠実性
AA-LCR v1.1AutomationBench-AAGDP.pdf

戦略・オペレーション指数

ビジネス知識、エージェント型知識作業、業務アプリでのエージェント型ツール利用、長文脈分析を含む、戦略・オペレーション分野の性能を測定します。

ビジネスエージェント知識労働ツール利用長文コンテキスト
AA-LCR v1.1Humanity's Last ExamGDP.pdfAutomationBench-AA

法務指数

法的知識、エージェント型知識作業、推論、長文脈文書分析、非ハルシネーション、エージェント型ツール利用を含む、法務分野の性能を測定します。

法律エージェント知識労働推論長文コンテキスト忠実性ツール利用
AA-Briefcase v1.1MLCR-AAHumanity's Last ExamAutomationBench-AA

医療・ヘルスケア指数

臨床知識、エージェント型知識作業、患者記録に対する長文脈推論、非ハルシネーション、臨床推論、エージェント型ツール利用を含む、医療・ヘルスケア分野の性能を測定します。

医療エージェント知識労働長文コンテキスト忠実性推論ツール利用
AA-Briefcase v1.1Humanity's Last ExamCritPtTerminal-Bench 4.0

エンジニアリング指数

工学知識、定量的推論、エージェント型実行、ターミナル利用を含む、エンジニアリング分野の性能を測定します。

科学推論エージェント知識労働コーディング
AA-LCR v1.1Humanity's Last Exam

経済学指数

経済学知識、定量的推論、エージェント型実行、長文脈分析を含む、経済学分野の性能を測定します。

ビジネス推論エージェント知識労働長文コンテキスト