Index für Gesundheit und Medizin
Bewertet die Modellleistung in Gesundheitswesen und Medizin. Zu den bewerteten Fähigkeiten gehören Fachwissen (Medizin, öffentliche Gesundheit, Biomedizin), klinische Diagnose und Beurteilung, Schlussfolgern über lange Patientenakten und Leistungsfälle, Patientendokumentation, Medikamentenmanagement und mehr.
Repräsentative Workflows ansehenThe Artificial Analysis Healthcare & Medical Index combines performance across benchmarks chosen for clinical and healthcare-support work, spanning medical knowledge, clinical reasoning, long-context reasoning over patient records, agentic workflows, and non-hallucination. We map common tasks from O*NET occupational classifications, then select benchmarks that represent this real-world work. Weights are derived from how often capabilities appear across those tasks.
This composite metric provides a single score for tracking model performance across healthcare tasks. Alle zugrunde liegenden Benchmarks werden unabhängig von Artificial Analysis durchgeführt. Wie die Evaluierungen ablaufen, erläutert unsere Methodik für das Intelligenz-Benchmarking.
| Fähigkeit | Gewichtung | Evaluierungen |
|---|---|---|
| Medizin- und Gesundheitswissen | 30 % | AA-Omniscience: Genauigkeit in Gesundheit |
| Agentische Wissensarbeit | 25 % | GDPval-AA v2.1 und AA-Briefcase v1.1 |
| Langkontext-Schlussfolgern | 15 % | MLCR-AA |
| Halluzinationsvermeidung | 10 % | AA-Omniscience: Halluzinationsvermeidung in Gesundheit |
| Schlussfolgern | 10 % | HLE |
| Agentische Werkzeugnutzung | 10 % | AutomationBench-AA Support und Betrieb |
Punktzahl
Artificial Analysis Index für Gesundheit und Medizin
Artificial Analysis Index für Gesundheit und Medizin: Aufschlüsselung der Fähigkeiten
Aufschlüsselung der Fähigkeiten
Artificial Analysis Index für Gesundheit und Medizin: Medizin- und Gesundheitswissen
Repräsentative Workflows
Praxisnahe Workflows, die besonders die von Index für Gesundheit und Medizin am stärksten gewichteten Fähigkeiten prüfen.
Beispiel: Reassess a returning patient with worsening symptoms against the original EHR workup to build a differential from the new labs and imaging and surface alternative diagnoses the findings point to.
Beispiel: A surgical team that encounters unexpected anatomy mid-laparoscopic-procedure. Retrieve comparable case reports and imaging precedents and quickly output findings relevant to their immediate decision.
Beispiel: Turn a clinician's dictated notes from a follow-up visit into a structured SOAP note, pulling the patient's active problems and relevant history from the existing chart, placing each finding in the right section, and flagging the gaps the next provider would need filled.
Beispiel: Calculate a child's per-dose amount from their measurements and the prescriber's notes against the available suspension concentration, convert it to the millilitres to measure at each dose, and produce caregiver instructions that keep the total within the safe daily range.
Beispiel: Evaluate whether a dermatology team should adopt a newer procedure backed by emerging but limited long-term evidence to summarise the published trials and safety data, compare outcomes against the current standard of care, and outline the open questions the team still needs to resolve.
Beispiel: Work a several-hundred-page medical record assembled from multiple providers to reconstruct the treatment timeline, identify which encounters relate to the injury in question, and answer reviewer questions with citations to the underlying documents.
Beispiel: Turn a patient's after-visit summary into plain-language, step-by-step home-care instructions in their preferred language, anticipate the questions they are most likely to ask, and confirm the follow-up appointment and how to reach the clinic with concerns.
Kosten
Artificial Analysis Index für Gesundheit und Medizin: Kosten pro Aufgabe
Artificial Analysis Index für Gesundheit und Medizin vs. Kosten pro Aufgabe
Geschwindigkeit
Artificial Analysis Index für Gesundheit und Medizin: Zeit pro Aufgabe
Ausgabe-Token
Artificial Analysis Index für Gesundheit und Medizin: Ausgabe-Token pro Aufgabe
Veröffentlichungsdatum
Artificial Analysis Index für Gesundheit und Medizin vs. Veröffentlichungsdatum
Häufig gestellte Fragen
Laut dem Artificial Analysis Index für Gesundheit und Medizin sind Claude Opus 5.5 (Max, Default Fallback) (61), Claude Sonnet 5.5 (Max, Default Fallback) (58) und Claude Fable 5.1 (Max, Default Fallback) (58) derzeit die leistungsstärksten KI-Modelle für Aufgaben in Gesundheit und Medizin. Die Rangliste wird bei der Veröffentlichung neuer Modelle aktualisiert.
Ja. Der Index für Gesundheit und Medizin von Artificial Analysis ist ein unabhängiger Benchmark für die Leistung von KI-Modellen bei Aufgaben in Gesundheit und Medizin. Er misst klinisches Wissen, agentische Wissensarbeit, Schlussfolgern über lange Patientenakten, Halluzinationsfreiheit, klinisches Schlussfolgern und agentische Tool-Nutzung.
Der Index für Gesundheit und Medizin ist ein zusammengesetzter Benchmark von Artificial Analysis, der die Modellleistung in Gesundheit und Medizin bewertet. Geprüft werden unter anderem Fachwissen zu Medizin, öffentlicher Gesundheit und Biomedizin, klinische Diagnose und Beurteilung, Schlussfolgern über lange Patienten- und Leistungsakten, Patientendokumentation und Medikamentenmanagement.
Der Index für Gesundheit und Medizin wird als gewichteter Durchschnitt seiner Teilpunktzahlen berechnet. Die Teilpunktzahlen und ihre Gewichtungen sind: Medizin- und Gesundheitswissen (30 %), Agentische Wissensarbeit (25 %), Langkontext-Schlussfolgern (15 %), Halluzinationsvermeidung (10 %), Schlussfolgern (10 %) und Agentische Werkzeugnutzung (10 %).
Der Index für Gesundheit und Medizin enthält AA-Omniscience: Genauigkeit in Gesundheit, GDPval-AA v2.1, AA-Briefcase v1.1, MLCR-AA, AA-Omniscience: Halluzinationsvermeidung in Gesundheit, HLE und AutomationBench-AA Support und Betrieb.
Claude Opus 5.5 (Max, Default Fallback) erzielt derzeit mit 61 die höchste Punktzahl im Index für Gesundheit und Medizin unter den Modellen mit veröffentlichten Ergebnissen. Modell ansehen
Eine höhere Punktzahl im Index für Gesundheit und Medizin steht für eine insgesamt stärkere Leistung in den Benchmarks des Index. Für einen bestimmten Anwendungsfall können einzelne Benchmark-Ergebnisse aussagekräftiger sein als die zusammengesetzte Punktzahl.