Todos los índices de capacidades

Legal Index

Assesses model performance across the legal domain. Capabilities evaluated include domain-specific knowledge (contract law, tort law, constitutional law), legal research and drafting, litigation support, compliance review, and more.

Ver flujos de trabajo representativos

The Artificial Analysis Legal Index combines performance across benchmarks chosen for legal practice. We map common tasks from O*NET occupational classifications, then select benchmarks that represent this real-world work. Weights are derived from how often capabilities appear across those tasks.

This composite metric provides a single score for tracking model performance across legal tasks. Artificial Analysis ejecuta de forma independiente todas las evaluaciones subyacentes. Consulta nuestra metodología de Benchmarking de Inteligencia para saber cómo se realizan las evaluaciones.

CapacidadPesoEvaluaciones
Legal Knowledge35 %AA-Omniscience Law Accuracy
Agentic Knowledge Work25 %GDPval-AA v2
Reasoning15 %HLE
Long-Context10 %LCR
Non-Hallucination10 %AA-Omniscience Non-Hallucination
Agentic Customer Interaction5 %𝜏³-Banking

Puntuación

Desglose de capacidades

Flujos de trabajo representativos

Flujos de trabajo reales que ponen a prueba las capacidades a las que Legal Index da mayor peso.

Legal research & analysisLegal KnowledgeLong-ContextNon-HallucinationReasoning

Ejemplo: Determine whether a non-compete is enforceable under controlling state precedent by gathering the relevant case law, applying each holding to the employee's facts, distinguishing unfavorable rulings, and synthesizing the analysis into a report.

Document drafting & reviewLegal KnowledgeAgentic Knowledge WorkLong-ContextNon-Hallucination

Ejemplo: Reconcile US and EU indemnity language in a cross-border M&A share purchase agreement 48 hours before signing to flag irreconcilable conflicts, propose drafting that satisfies both regimes where possible, and deliver a partner-ready redline.

Client counseling & advisoryLegal KnowledgeNon-HallucinationReasoning

Ejemplo: Advise a startup shipping a feature that may trigger unsettled state privacy rules such as the CCPA to ask the clarifying questions, lay out the trade-offs by jurisdiction, surface open legal risks, and recommend a defensible launch posture.

Litigation & dispute resolutionLegal KnowledgeLong-ContextNon-HallucinationReasoning

Ejemplo: Work a 200,000-document e-discovery production delivered ten days before trial to prioritise responsive material, flag likely privilege issues for attorney review, and draft a deposition outline tied to the strongest exhibits.

Compliance & regulatory workLegal KnowledgeAgentic Knowledge WorkReasoning

Ejemplo: Rewrite internal policy for a new financial regulation taking effect in 90 days that clashes with procedures in three business units to produce a unified replacement policy, an implementation plan with named owners, and a training brief grounded in the statute and existing policy library.

Case managementAgentic Knowledge WorkNon-Hallucination

Ejemplo: Consolidate 40 active litigation matters tracked across three incompatible case-management systems to produce one unified docket, surface conflicting court deadlines, and propose a single workflow going forward.

Fecha de lanzamiento

Costo

Velocidad

Tokens de salida

Preguntas frecuentes

Según el Legal Index de Artificial Analysis, los modelos de IA con mejor desempeño en trabajos legales son actualmente Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (63), Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (63) y Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (60). La clasificación se actualiza a medida que se lanzan nuevos modelos.

Sí. El Legal Index de Artificial Analysis es un benchmark independiente que mide el desempeño de los modelos de IA en trabajos legales. Evalúa conocimientos jurídicos, análisis documental, razonamiento con contextos extensos y ausencia de alucinaciones.

El Legal Index es un benchmark compuesto de Artificial Analysis que evalúa el desempeño de los modelos en el ámbito legal. Las capacidades evaluadas incluyen conocimientos específicos (derecho contractual, responsabilidad civil y derecho constitucional), investigación y redacción jurídica, apoyo en litigios, revisión de cumplimiento y más.

El Legal Index se calcula como el promedio ponderado de las puntuaciones de sus capacidades. Estas son las puntuaciones y sus pesos: Legal Knowledge (35 %), Agentic Knowledge Work (25 %), Long-Context (10 %), Non-Hallucination (10 %), Agentic Customer Interaction (5 %) y Reasoning (15 %).

El Legal Index incluye AA-Omniscience Law Accuracy, GDPval-AA v2, LCR, AA-Omniscience Non-Hallucination, 𝜏³-Banking y HLE.

Actualmente, Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) tiene la puntuación más alta en el Legal Index: 63 entre los modelos con resultados publicados. Ver modelo

Una puntuación más alta en el Legal Index indica un mejor desempeño general en los benchmarks que componen el índice. Para un caso de uso específico, los resultados de cada benchmark pueden ser más informativos que la puntuación compuesta.