Todos los índices de capacidades

Strategy & Ops Index

Assesses model performance across the strategy and operations domain. Capabilities evaluated include domain-specific knowledge (business and management, accounting, corporate and markets), strategy and planning, customer support, records management, and more.

Ver flujos de trabajo representativos

The Artificial Analysis Strategy & Ops Index combines performance across benchmarks chosen for strategy, operations, and office administration. We map common tasks from O*NET occupational classifications, then select benchmarks that represent this real-world work. Weights are derived from how often capabilities appear across those tasks.

This composite metric provides a single score for tracking model performance across operations and administrative work. Artificial Analysis ejecuta de forma independiente todas las evaluaciones subyacentes. Consulta nuestra metodología de Benchmarking de Inteligencia para saber cómo se realizan las evaluaciones.

CapacidadPesoEvaluaciones
Agentic Knowledge Work35 %GDPval-AA v2
Business Knowledge30 %AA-Omniscience Business Accuracy
Agentic Customer Interaction30 %𝜏³-Banking
Long-Context5 %LCR

Puntuación

Artificial Analysis Strategy & Ops Index

Incorporates 4 evaluations: AA-Omniscience, GDPval-AA v2, 𝜏³-Banking, AA-LCR v1.1 · Higher is better

Artificial Analysis Strategy & Ops Index: desglose de capacidades

Incorporates 4 evaluations: AA-Omniscience, GDPval-AA v2, 𝜏³-Banking, AA-LCR v1.1 · Desglosado por contribución

Desglose de capacidades

Artificial Analysis Strategy & Ops Index: Business Knowledge

Incorporates 1 evaluation: AA-Omniscience · Higher is better

Flujos de trabajo representativos

Flujos de trabajo reales que ponen a prueba las capacidades a las que Strategy & Ops Index da mayor peso.

Strategy & planningBusiness KnowledgeAgentic Knowledge WorkLong-Context

Ejemplo: Assess a mid-market SaaS company's competitive position from market-share data, analyst reports, and win/loss notes, work through a Porter's Five Forces and SWOT read, and formulate three prioritized strategic options with the trade-offs of each.

Data entry & document processing

Ejemplo: Scan 3,000 invoices of different formats before month-end and extract line-items into structured fields to add to the general ledger.

Customer service & supportAgentic Knowledge WorkAgentic Customer Interaction

Ejemplo: Absorb a 40% support surge after a product recall in a CRM ticketing queue with 20-minute hold times to triage incoming tickets by SLA, de-escalate frustrated customers in live chat, and follow the approved recall script verbatim.

Scheduling & calendar managementAgentic Knowledge Work

Ejemplo: Reconcile an executive's schedule when they're triple-booked across a full week of calendars in a scheduling tool, including external stakeholders with limited availability, to weigh free/busy windows, propose conflict resolutions ranked by stakeholder seniority, and draft rescheduling notes.

Billing, invoicing & bookkeepingBusiness KnowledgeAgentic Knowledge Work

Ejemplo: Clean up a stalled month-end close where multiple departments coded the same expenses to different GL accounts across hundreds of invoices to propose a consistent chart-of-accounts mapping, identify entries needing reclassification, and draft adjusting journal entries.

Records management & filingAgentic Knowledge WorkLong-Context

Ejemplo: Consolidate five years of training records split across paper files and two unindexed document systems for a regulatory request to build one audit-ready manifest, flag missing records with supporting evidence, and propose a retention schedule for the next cycle.

Fecha de lanzamiento

Artificial Analysis Strategy & Ops Index vs. fecha de lanzamiento

Most attractive region

Costo

Artificial Analysis Strategy & Ops Index: costo por tarea

Costo medio por tarea (USD), desglosado en tokens de entrada, aciertos y escrituras de caché, razonamiento y respuesta

Average cost per task in the index. Costs are split by input, cache hit, cache write, reasoning, and answer token pricing where canonical token counts are available.

Artificial Analysis Strategy & Ops Index: costo total

Costo total (USD) de ejecutar el índice

The cost to run the index, calculated using the model's input and output token pricing and the number of tokens used.

Velocidad

Artificial Analysis Strategy & Ops Index: tiempo por tarea

Weighted average decode time (minutes) per task; excludes TTFT and overhead time · Lower is better

The weighted average time (minutes) per index task. This is calculated by dividing output tokens per task by output speed, weighted by the relative weights of each benchmark in the index.

Tokens de salida

Artificial Analysis Strategy & Ops Index: tokens de salida por tarea

Tokens de salida utilizados para ejecutar una tarea, desglosados en tokens de razonamiento y respuesta

The average number of answer and reasoning tokens produced per benchmark task in this index.

Preguntas frecuentes

Según el Strategy & Ops Index de Artificial Analysis, los modelos de IA con mejor desempeño en trabajos de estrategia y operaciones son actualmente Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (58), Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (57) y Claude Opus 5 (Adaptive Reasoning, Max Effort) (54). La clasificación se actualiza a medida que se lanzan nuevos modelos.

Sí. El Strategy & Ops Index de Artificial Analysis es un benchmark independiente que mide el desempeño de los modelos de IA en trabajos de estrategia y operaciones. Evalúa este ámbito mediante conocimientos empresariales, flujos de trabajo agénticos e interacción con clientes.

El Strategy & Ops Index es un benchmark compuesto de Artificial Analysis que evalúa el desempeño de los modelos en estrategia y operaciones. Las capacidades evaluadas incluyen conocimientos específicos del sector (negocios y gestión, contabilidad, empresas y mercados), estrategia y planificación, atención al cliente, gestión de registros y más.

El Strategy & Ops Index se calcula como el promedio ponderado de las puntuaciones de sus capacidades. Estas son las puntuaciones y sus pesos: Business Knowledge (30 %), Agentic Knowledge Work (35 %), Agentic Customer Interaction (30 %) y Long-Context (5 %).

El Strategy & Ops Index incluye AA-Omniscience Business Accuracy, GDPval-AA v2, 𝜏³-Banking y LCR.

Actualmente, Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) tiene la puntuación más alta en el Strategy & Ops Index: 58 entre los modelos con resultados publicados. Ver modelo

Una puntuación más alta en el Strategy & Ops Index indica un mejor desempeño general en los benchmarks que componen el índice. Para un caso de uso específico, los resultados de cada benchmark pueden ser más informativos que la puntuación compuesta.