Todos os índices de capacidade
Índice Jurídico
Avalia o desempenho dos modelos no domínio jurídico. As capacidades avaliadas incluem conhecimento específico do domínio (direito contratual, responsabilidade civil e direito constitucional), pesquisa e redação jurídica, apoio a litígios, revisão de conformidade e muito mais.
Ver fluxos de trabalho representativosThe Artificial Analysis Legal Index combines performance across benchmarks chosen for legal practice. We map common tasks from O*NET occupational classifications, then select benchmarks that represent this real-world work. Weights are derived from how often capabilities appear across those tasks.
This composite metric provides a single score for tracking model performance across legal tasks. Todos os benchmarks subjacentes são executados de forma independente pela Artificial Analysis. Consulte nossa metodologia de benchmarking de inteligência para saber como as avaliações são realizadas.
| Capacidade | Peso | Avaliações |
|---|---|---|
| Conhecimento jurídico | 35% | AA-Omniscience: Precisão em Direito |
| Trabalho de conhecimento agêntico | 25% | GDPval-AA v2.1 e AA-Briefcase v1.1 |
| Raciocínio | 15% | HLE |
| Contexto longo | 10% | LCR e GDP.pdf |
| Não alucinação | 10% | AA-Omniscience: Não alucinação em Direito |
| Uso agêntico de ferramentas | 5% | AutomationBench-AA Suporte e Operações |
Pontuação
Artificial Analysis Índice Jurídico
Artificial Analysis Índice Jurídico: detalhamento das capacidades
Detalhamento das capacidades
Artificial Analysis Índice Jurídico: Conhecimento jurídico
Fluxos de trabalho representativos
Fluxos de trabalho reais que exercitam as capacidades às quais o Índice Jurídico atribui mais peso.
Exemplo: Determine whether a non-compete is enforceable under controlling state precedent by gathering the relevant case law, applying each holding to the employee's facts, distinguishing unfavorable rulings, and synthesizing the analysis into a report.
Exemplo: Reconcile US and EU indemnity language in a cross-border M&A share purchase agreement 48 hours before signing to flag irreconcilable conflicts, propose drafting that satisfies both regimes where possible, and deliver a partner-ready redline.
Exemplo: Advise a startup shipping a feature that may trigger unsettled state privacy rules such as the CCPA to ask the clarifying questions, lay out the trade-offs by jurisdiction, surface open legal risks, and recommend a defensible launch posture.
Exemplo: Work a 200,000-document e-discovery production delivered ten days before trial to prioritise responsive material, flag likely privilege issues for attorney review, and draft a deposition outline tied to the strongest exhibits.
Exemplo: Rewrite internal policy for a new financial regulation taking effect in 90 days that clashes with procedures in three business units to produce a unified replacement policy, an implementation plan with named owners, and a training brief grounded in the statute and existing policy library.
Exemplo: Consolidate 40 active litigation matters tracked across three incompatible case-management systems to produce one unified docket, surface conflicting court deadlines, and propose a single workflow going forward.
Custo
Artificial Analysis Índice Jurídico: custo por tarefa
Artificial Analysis Índice Jurídico vs. custo por tarefa
Velocidade
Artificial Analysis Índice Jurídico: tempo por tarefa
Tokens de saída
Artificial Analysis Índice Jurídico: tokens de saída por tarefa
Data de lançamento
Artificial Analysis Índice Jurídico vs. data de lançamento
Perguntas frequentes
Segundo o Índice Jurídico da Artificial Analysis, os modelos de IA com melhor desempenho em trabalhos jurídicos atualmente são Claude Opus 5.5 (Max, Default Fallback) (63), Claude Fable 5.1 (Xhigh, Default Fallback) (61) e Claude Opus 5.5 (Xhigh, Default Fallback) (61). O ranking é atualizado à medida que novos modelos são lançados.
Sim. O Índice Jurídico da Artificial Analysis é um benchmark independente do desempenho de modelos de IA em trabalhos jurídicos. Ele mede conhecimento jurídico, trabalho de conhecimento agêntico, raciocínio, análise de documentos longos, ausência de alucinações e uso agêntico de ferramentas.
O Índice Jurídico é um benchmark composto da Artificial Analysis que avalia o desempenho dos modelos no domínio jurídico. As capacidades avaliadas incluem conhecimento específico (direito contratual, responsabilidade civil e direito constitucional), pesquisa e redação jurídica, apoio a litígios, revisão de conformidade e muito mais.
O Índice Jurídico é calculado como a média ponderada das pontuações de suas capacidades. Estas são as pontuações e seus pesos: Conhecimento jurídico (35%), Trabalho de conhecimento agêntico (25%), Raciocínio (15%), Contexto longo (10%), Não alucinação (10%) e Uso agêntico de ferramentas (5%).
O Índice Jurídico inclui AA-Omniscience: Precisão em Direito, GDPval-AA v2.1, AA-Briefcase v1.1, HLE, LCR, GDP.pdf, AA-Omniscience: Não alucinação em Direito e AutomationBench-AA Suporte e Operações.
Atualmente, Claude Opus 5.5 (Max, Default Fallback) tem a maior pontuação no Índice Jurídico: 63 entre os modelos com resultados publicados. Ver modelo
Uma pontuação mais alta no Índice Jurídico indica melhor desempenho geral nos benchmarks que compõem o índice. Para um caso de uso específico, os resultados de cada benchmark podem ser mais informativos que a pontuação composta.