Member of Technical Staff (Sprachmodell-Evaluationen)
Über Artificial Analysis
Artificial Analysis ist das führende unabhängige Unternehmen für KI-Benchmarking. Wir helfen Laboren, Ingenieuren und Unternehmen, KI-Fähigkeiten zu verstehen und wichtige Entscheidungen über ihre KI-Strategie zu treffen. Von KI-Laboren und Unternehmen bis hin zu Medien, Investoren und politischen Entscheidungsträgern sind wir die erste Anlaufstelle, um KI zu verstehen. Unsere Benchmarks messen nicht nur den neuesten Stand der KI, sondern gestalten die Frontier aktiv mit.
Hunderttausende Nutzer vertrauen unseren Benchmarks und Analysen. Sie sind die maßgebliche Referenz für führende KI-Labore wie OpenAI, Google, Meta, NVIDIA und Anthropic sowie für große Publikationen wie das Wall Street Journal, Bloomberg, die Financial Times und The Economist.
Wir sind ein Team von mehr als 40 Personen und auf Kurs, bis zum Jahresende auf das Dreifache zu wachsen. Unterstützt werden wir von Nat Friedman (Github, Meta), Daniel Gross (SSI), Andrew Ng (Google Brain, DeepLearning.ai, Amazon), Adam D'Angelo (Quora, Poe, OpenAI), Clem Delangue (Hugging Face) und weiteren Branchenführern.
Die Chance
Die Evaluation von Sprachmodellen stellt die entscheidende Frage der KI: Was können diese Systeme tatsächlich? Unsere Antworten – vom Artificial Analysis Intelligence Index bis zu AA-Omniscience, AA-Briefcase und unseren Evaluationen von Programmieragenten – sind die Referenz der Branche. Wir suchen Members of Technical Staff, die ihre nächste Generation entwickeln.
Diese Position richtet sich an Menschen, die Frontier-Benchmarks entwickeln möchten: Evaluationen konzipieren, die den Fähigkeiten von Frontier-Modellen voraus bleiben, kontaminationsresistente Datensätze erstellen und messen, wofür andere noch keine Messmethode gefunden haben. Du wendest deine Arbeit bei jeder wichtigen Modellveröffentlichung an und publizierst Ergebnisse, die die gesamte Branche liest.
Im Mittelpunkt der Position steht das Entwickeln. Analyse und Zusammenarbeit mit Laboren ergänzen die Evaluationsarbeit; unser kommerzielles Team betreut die Kundenbeziehungen im Alltag.
Deine Aufgaben
- Frontier-Evaluationen der nächsten Generation entwickeln: Evaluationen wie AA-Briefcase und AA-Omniscience für Schlussfolgern, Wissen, Programmierung, agentische Fähigkeiten und weitere Bereiche konzipieren und veröffentlichen
- Evaluationsdatensätze und Infrastruktur entwickeln: Datensätze, Harnesses und Bewertungssysteme hinter unseren Benchmarks erstellen, ausgelegt auf Kontaminationsresistenz und Wiederholbarkeit im Frontier-Maßstab
- Den künftigen Intelligence Index gestalten: Deine Evaluationen fließen in künftige Versionen des Artificial Analysis Intelligence Index und andere Plattformbereiche ein und prägen, wie die Branche Frontier-Fähigkeiten misst
- Einflussreiche Analysen publizieren: Berichte, Indizes und Datenvisualisierungen erstellen, die das Verständnis der Branche vom Fortschritt der Sprachmodelle prägen
- Mit Frontier-Laboren an unveröffentlichten Modellen arbeiten: Systeme führender Labore einschließlich noch unveröffentlichter und neu eingeführter Modelle benchmarken und direkt mit deren Forschungsteams zusammenarbeiten; unser kommerzielles Team betreut die Kundenbeziehungen im Alltag, damit deine Zeit der Wissenschaft gehört
- Jedes wichtige Modell evaluieren: Unsere Evaluationssuite auf neue Frontier-Veröffentlichungen anwenden und die Integrität der von der Branche zitierten Ergebnisse verantworten
- KI-nativ arbeiten: Einen KI-nativen Workflow nutzen und mit modernsten KI-Werkzeugen in einer sich schnell verändernden Branche mehr bewirken, damit wir unseren Wettbewerbsvorsprung im KI-Benchmarking wahren
Was wir suchen
Du hast umfassende praktische Erfahrung mit der Evaluation von Sprachmodellen und fundierte Ansichten dazu, warum die meisten Benchmarks scheitern.
Mögliche Hintergründe: Evaluations- und Benchmarking-Teams in KI-Laboren; Forschungs- oder Engineering-Positionen in evaluationsorientierten Organisationen; ML Engineers, die produktive Evaluations-Harnesses und Datensätze entwickelt haben; oder akademische Forscher in NLP und ML-Evaluation mit überzeugender Publikationsbilanz.
Voraussetzungen:
- Mehr als 3 Jahre einschlägige Berufs- oder Forschungserfahrung
- Ausgeprägte analytische Fähigkeiten und kritisches Denkvermögen
- Sehr gute Python-Kenntnisse und praktische Erfahrung mit Evaluations-Harnesses und dem Aufbau von Datensätzen
- Umfassende Kenntnis der LLM-Evaluationslandschaft: wichtige Benchmarks und ihre Fehlermodi, Kontamination, präferenzbasierte Methoden und agentische Evaluation
- Solide statistische Grundlagen: Du erkennst, wann ein Ergebnis ein Signal und wann es Rauschen ist
- Echtes, nachweisbares Interesse an und Wissen über Frontier-KI. Wir suchen Menschen mit fundierten Ansichten darüber, wohin sich KI entwickelt, und nicht nur Menschen, die KI-Werkzeuge verwenden
Warum Artificial Analysis?
- Gestalte, wie KI entwickelt wird: Führende KI-Labore verfolgen unsere Benchmarks und richten ihre Entwicklungsprioritäten daran aus. Deine Arbeit beeinflusst die Entwicklung von KI unmittelbar.
- Werde zu einem weltweit führenden KI-Experten: Du evaluierst jedes wichtige Modell über alle wesentlichen Fähigkeiten hinweg, sobald es veröffentlicht wird. Nur wenige Positionen bieten einen so breiten Einblick in Frontier-KI.
- Arbeite mit den wichtigsten Akteuren der KI-Branche: Als vertrauenswürdige, unabhängige Stimme betreust du Beziehungen zu Teams führender KI-Labore und großer Unternehmen.
- Steige in einem entscheidenden Moment ein: Wir sind mehr als 40 Personen und auf Kurs, uns bis zum Jahresende zu verdoppeln. Unterstützt werden wir von einigen der bestvernetzten Investoren der KI-Branche. Wer jetzt zu uns kommt, gestaltet beim Skalieren das Produkt, das Team und die Strategie mit.
- Wettbewerbsfähige Vergütung einschließlich Unternehmensanteilen