Metodologia dos índices de capacidade da Artificial Analysis
Visão geral
Os índices de capacidade da Artificial Analysis medem o desempenho dos modelos em casos de uso profissionais específicos, como direito, saúde ou finanças.
Executamos de forma independente cada benchmark que compõe um índice antes de combinar suas pontuações no índice. Como todas as métricas de avaliação, os índices de capacidade têm limitações e podem não se aplicar diretamente a todos os casos de uso, mas oferecem uma síntese útil para comparar modelos no trabalho relevante para determinado domínio.
Os benchmarks subjacentes, incluindo como cada um é executado e pontuado, estão documentados na metodologia de benchmark de inteligência.
Detalhamento dos índices
Cada índice é voltado a uma única profissão ou área, como Direito, Saúde e Medicina ou Finanças e Contabilidade, e pondera um conjunto de capacidades conforme a frequência com que cada uma aparece em tarefas reais dessa área.
Nossas ponderações de tarefas se baseiam em uma taxonomia de atividades profissionais no estilo da O*NET. A tabela abaixo mostra os componentes e os pesos de cada índice.
| Índice | Peso | Capacidade | Avaliações | Descrição |
|---|---|---|---|---|
| Índice de Finanças e Contabilidade | 30% | Conhecimento empresarial | AA-Omniscience | Conhecimento do domínio de contabilidade, finanças corporativas, economia e investimentos |
| 30% | Trabalho de conhecimento agêntico | GDPval-AA v2.1, AA-Briefcase v1.1 | Uso de ferramentas, planejamento e execução de tarefas em várias etapas, como criar planilhas, realizar uma análise ou coordenar um fluxo de trabalho | |
| 20% | Raciocínio | HLE | Raciocínio quantitativo e analítico em várias etapas, usado em análise de sensibilidade, avaliação e resolução estruturada de problemas | |
| 10% | Uso agêntico de ferramentas | AutomationBench-AA | Conclusão de fluxos financeiros em aplicativos empresariais, como planilhas, e-mail e ferramentas contábeis, sem violar as proteções | |
| 5% | Contexto longo | LCR, GDP.pdf | Leitura e raciocínio sobre extensos demonstrativos financeiros, documentos de transações e relatórios em PDF | |
| 5% | Não alucinação | AA-Omniscience | Evitar números ou citações inventadas | |
| Índice de Estratégia e Operações | 30% | Conhecimento empresarial | AA-Omniscience | Conhecimento prático de processos empresariais, fundamentos de contabilidade e conceitos operacionais |
| 35% | Trabalho de conhecimento agêntico | GDPval-AA v2.1, AA-Briefcase v1.1 | Uso de ferramentas, planejamento e coordenação integral de fluxos de escritório em várias etapas | |
| 30% | Uso agêntico de ferramentas | AutomationBench-AA | Conclusão de fluxos de operações, RH, marketing, vendas e suporte em aplicativos empresariais sem violar as proteções | |
| 5% | Contexto longo | LCR, GDP.pdf | Manutenção do contexto em conversas, políticas, registros e documentos PDF extensos | |
| Índice Jurídico | 35% | Conhecimento jurídico | AA-Omniscience | Conhecimento de leis, doutrinas e procedimentos em diferentes jurisdições |
| 25% | Trabalho de conhecimento agêntico | GDPval-AA v2.1, AA-Briefcase v1.1 | Execução de fluxos de gestão de casos, processos de redação e pesquisa assistida por ferramentas | |
| 15% | Raciocínio | HLE | Argumentação em várias etapas, interpretação de leis e ponderação de autoridades conflitantes | |
| 10% | Contexto longo | LCR, GDP.pdf | Leitura e síntese de contratos, produções de provas, compilações de jurisprudência e petições em PDF | |
| 10% | Não alucinação | AA-Omniscience | Evitar citações de casos ou leis inventadas | |
| 5% | Uso agêntico de ferramentas | AutomationBench-AA | Conclusão de fluxos de atendimento ao cliente e operações em aplicativos empresariais sem violar as proteções | |
| Índice de Saúde e Medicina | 30% | Conhecimento médico e de saúde | AA-Omniscience | Conhecimento clínico de diagnóstico, farmacologia e percursos assistenciais |
| 25% | Trabalho de conhecimento agêntico | GDPval-AA v2.1, AA-Briefcase v1.1 | Uso de ferramentas, planejamento e coordenação integral de fluxos de prontuário eletrônico e farmácia | |
| 15% | Raciocínio de contexto longo | MLCR-AA | Síntese de achados em prontuários e arquivos de sinistros longos e fragmentados | |
| 10% | Não alucinação | AA-Omniscience | Evitar interações medicamentosas, doses ou diretrizes inventadas | |
| 10% | Raciocínio | HLE | Raciocínio clínico em várias etapas em biologia e medicina | |
| 10% | Uso agêntico de ferramentas | AutomationBench-AA | Conclusão de fluxos de atendimento ao paciente e operações em aplicativos empresariais sem violar as proteções | |
| Índice de Engenharia | 35% | Conhecimento de engenharia | AA-Omniscience | Conhecimento do domínio de engenharia civil, elétrica, mecânica e outras disciplinas |
| 30% | Raciocínio | HLE, CritPt | Raciocínio quantitativo em várias etapas para derivações, cálculos de dimensionamento e decisões de projeto | |
| 20% | Trabalho de conhecimento agêntico | GDPval-AA v2.1, AA-Briefcase v1.1 | Uso de ferramentas, planejamento e execução em várias etapas de entregáveis de engenharia | |
| 15% | Uso agêntico do terminal | Terminal-Bench 4.0 | Operação de ambientes de terminal reais para compilações, scripts, administração de sistemas e depuração | |
| Índice de Economia | 35% | Conhecimento econômico | AA-Omniscience | Conhecimento de microeconomia, macroeconomia, finanças públicas e mercados |
| 35% | Raciocínio | HLE | Raciocínio quantitativo e analítico em várias etapas para modelagem, estimação e inferência | |
| 25% | Trabalho de conhecimento agêntico | GDPval-AA v2.1, AA-Briefcase v1.1 | Uso de ferramentas, planejamento e execução em várias etapas de entregáveis analíticos | |
| 5% | Raciocínio de contexto longo | LCR | Leitura e raciocínio sobre relatórios, conjuntos de dados e notas de pesquisa extensos |