Methodik der Fähigkeitsindizes von Artificial Analysis
Überblick
Die Fähigkeitsindizes von Artificial Analysis messen, wie gut Modelle in bestimmten beruflichen Anwendungsfällen abschneiden, etwa im Rechtswesen, im Gesundheitswesen oder im Finanzbereich.
Wir führen jeden Komponenten-Benchmark unabhängig aus, bevor seine Werte im Index zusammengeführt werden. Wie alle Evaluationsmetriken haben auch Fähigkeitsindizes ihre Grenzen und lassen sich möglicherweise nicht direkt auf jeden Anwendungsfall übertragen. Sie bieten jedoch eine nützliche Zusammenfassung für den Vergleich von Modellen bei den Aufgaben, die für einen bestimmten Bereich relevant sind.
Die zugrunde liegenden Benchmarks sowie ihre jeweilige Durchführung und Bewertung sind in der Methodik für das Intelligenz-Benchmarking dokumentiert.
Aufschlüsselung der Indizes
Jeder Index ist auf einen einzelnen Beruf oder Fachbereich wie Rechtswesen, Gesundheit und Medizin oder Finanzen und Rechnungswesen ausgerichtet. Er gewichtet verschiedene Fähigkeiten danach, wie häufig diese in realen Aufgaben des jeweiligen Bereichs vorkommen.
Unsere Aufgabengewichtungen basieren auf einer an O*NET angelehnten Taxonomie von Arbeitsaktivitäten. Die folgende Tabelle zeigt die Komponenten und Gewichtungen jedes Index.
| Index | Gewichtung | Fähigkeit | Evaluationen | Beschreibung |
|---|---|---|---|---|
| Index für Finanzen und Rechnungswesen | 30% | Wirtschaftswissen | AA-Omniscience | Fachwissen in Rechnungswesen, Unternehmensfinanzierung, Volkswirtschaft und Investitionen |
| 30% | Agentische Wissensarbeit | GDPval-AA v2.1, AA-Briefcase v1.1 | Werkzeugnutzung, Planung und mehrstufige Aufgabenausführung, etwa Tabellen erstellen, Analysen durchführen oder Arbeitsabläufe koordinieren | |
| 20% | Schlussfolgern | HLE | Mehrstufiges quantitatives und analytisches Schlussfolgern für Sensitivitätsanalysen, Bewertungen und strukturierte Problemlösung | |
| 10% | Agentische Werkzeugnutzung | AutomationBench-AA | Finanzabläufe in Geschäftsanwendungen wie Tabellen, E-Mail und Buchhaltungswerkzeugen abschließen, ohne Schutzvorgaben zu verletzen | |
| 5% | Langer Kontext | LCR, GDP.pdf | Lange Finanzberichte, Transaktionsdokumente und PDF-Berichte lesen und analysieren | |
| 5% | Halluzinationsvermeidung | AA-Omniscience | Erfundene Zahlen oder Quellenangaben vermeiden | |
| Index für Strategie und Betrieb | 30% | Wirtschaftswissen | AA-Omniscience | Praxiswissen über Geschäftsprozesse, Grundlagen des Rechnungswesens und betriebliche Konzepte |
| 35% | Agentische Wissensarbeit | GDPval-AA v2.1, AA-Briefcase v1.1 | Werkzeugnutzung, Planung und durchgängige Koordination mehrstufiger Büroabläufe | |
| 30% | Agentische Werkzeugnutzung | AutomationBench-AA | Abläufe in Betrieb, Personal, Marketing, Vertrieb und Support über Geschäftsanwendungen hinweg abschließen, ohne Schutzvorgaben zu verletzen | |
| 5% | Langer Kontext | LCR, GDP.pdf | Kontext über lange Gesprächsverläufe, Richtlinien, Akten und PDF-Dokumente hinweg bewahren | |
| Rechtsindex | 35% | Rechtswissen | AA-Omniscience | Kenntnis von Gesetzen, Lehren und Verfahren in verschiedenen Rechtsordnungen |
| 25% | Agentische Wissensarbeit | GDPval-AA v2.1, AA-Briefcase v1.1 | Mandatsverwaltungsabläufe, Entwurfsprozesse und werkzeuggestützte Recherche durchführen | |
| 15% | Schlussfolgern | HLE | Mehrstufige Argumentation, Gesetzesauslegung und Abwägung widersprüchlicher Rechtsquellen | |
| 10% | Langer Kontext | LCR, GDP.pdf | Verträge, Beweisproduktionen, Rechtsprechungssammlungen und PDF-Schriftsätze lesen und zusammenführen | |
| 10% | Halluzinationsvermeidung | AA-Omniscience | Erfundene Fallzitate oder Gesetze vermeiden | |
| 5% | Agentische Werkzeugnutzung | AutomationBench-AA | Kundensupport- und Betriebsabläufe in Geschäftsanwendungen abschließen, ohne Schutzvorgaben zu verletzen | |
| Index für Gesundheit und Medizin | 30% | Medizin- und Gesundheitswissen | AA-Omniscience | Klinisches Wissen zu Diagnose, Pharmakologie und Behandlungspfaden |
| 25% | Agentische Wissensarbeit | GDPval-AA v2.1, AA-Briefcase v1.1 | Werkzeugnutzung, Planung und durchgängige Koordination von EHR- und Apothekenabläufen | |
| 15% | Langkontext-Schlussfolgern | MLCR-AA | Erkenntnisse aus langen, fragmentierten Patientenakten und Leistungsfällen zusammenführen | |
| 10% | Halluzinationsvermeidung | AA-Omniscience | Erfundene Wechselwirkungen, Dosierungen oder Leitlinien vermeiden | |
| 10% | Schlussfolgern | HLE | Mehrstufiges klinisches Schlussfolgern in Biologie und Medizin | |
| 10% | Agentische Werkzeugnutzung | AutomationBench-AA | Patientensupport- und Betriebsabläufe in Geschäftsanwendungen abschließen, ohne Schutzvorgaben zu verletzen | |
| Ingenieurwesen-Index | 35% | Ingenieurwissen | AA-Omniscience | Fachwissen in Bau-, Elektro-, Maschinenbau und weiteren Ingenieurdisziplinen |
| 30% | Schlussfolgern | HLE, CritPt | Mehrstufiges quantitatives Schlussfolgern für Herleitungen, Dimensionierungsberechnungen und Entwurfsabwägungen | |
| 20% | Agentische Wissensarbeit | GDPval-AA v2.1, AA-Briefcase v1.1 | Werkzeugnutzung, Planung und mehrstufige Erstellung technischer Arbeitsergebnisse | |
| 15% | Agentische Terminalnutzung | Terminal-Bench 4.0 | Reale Terminalumgebungen für Builds, Skripte, Systemverwaltung und Fehlerbehebung bedienen | |
| Volkswirtschaftsindex | 35% | Wirtschaftswissen | AA-Omniscience | Kenntnisse in Mikroökonomie, Makroökonomie, öffentlichen Finanzen und Märkten |
| 35% | Schlussfolgern | HLE | Mehrstufiges quantitatives und analytisches Schlussfolgern für Modellierung, Schätzung und Inferenz | |
| 25% | Agentische Wissensarbeit | GDPval-AA v2.1, AA-Briefcase v1.1 | Werkzeugnutzung, Planung und mehrstufige Erstellung analytischer Arbeitsergebnisse | |
| 5% | Langkontext-Schlussfolgern | LCR | Lange Berichte, Datensätze und Forschungsnotizen lesen und analysieren |