Forward Deployed Engineer – Sprachmodelle
Über Artificial Analysis
Artificial Analysis ist das führende unabhängige Unternehmen für KI-Benchmarking. Wir helfen Laboren, Ingenieuren und Unternehmen, KI-Fähigkeiten zu verstehen und wichtige Entscheidungen über ihre KI-Strategie zu treffen. Von KI-Laboren und Unternehmen bis hin zu Medien, Investoren und politischen Entscheidungsträgern sind wir die erste Anlaufstelle, um KI zu verstehen. Unsere Benchmarks messen nicht nur den neuesten Stand der KI, sondern gestalten die Frontier aktiv mit.
Hunderttausende Nutzer vertrauen unseren Benchmarks und Analysen. Sie sind die maßgebliche Referenz für führende KI-Labore wie OpenAI, Google, Meta, NVIDIA und Anthropic sowie für große Publikationen wie das Wall Street Journal, Bloomberg, die Financial Times und The Economist.
Wir sind ein Team von mehr als 40 Personen und auf Kurs, bis zum Jahresende auf das Dreifache zu wachsen. Unterstützt werden wir von Nat Friedman (Github, Meta), Daniel Gross (SSI), Andrew Ng (Google Brain, DeepLearning.ai, Amazon), Adam D'Angelo (Quora, Poe, OpenAI), Clem Delangue (Hugging Face) und weiteren Branchenführern.
Die Chance
Artificial Analysis betreibt eine der umfassendsten Benchmarking-Suites für Sprachmodelle der Branche. Wir evaluieren Frontier-Modelle hinsichtlich Qualität, Geschwindigkeit und Preis für die KI-Labore und Unternehmen, die sich auf unsere Daten stützen.
Wir suchen einen Forward Deployed Engineer, der den täglichen Betrieb unseres Sprachmodell-Benchmarking-Stacks verantwortet und Artificial Analysis gegenüber den wichtigsten Laboren der Branche technisch repräsentiert. Du integrierst neue Modelle in unsere Evaluationspipeline, führst Benchmarks aus und behebst Fehler und bist die wichtigste technische Kontaktperson für Kunden aus KI-Laboren: Du erklärst Ergebnisse, beantwortest Methodikfragen und löst Endpunktprobleme in Echtzeit.
Dies ist im wahrsten Sinne eine produktionsnahe Position: Du arbeitest an der Schnittstelle zwischen unserer Plattform und unseren anspruchsvollsten Kunden und trägst dafür Verantwortung, dass beide Seiten funktionieren. Es geht darum, einen komplexen Stack außergewöhnlich gut, konsistent und zuverlässig zu betreiben und zugleich der vertrauenswürdige Ingenieur zu sein, nach dem unsere Kunden persönlich fragen.
Deine Aufgaben
- Unsere Python-basierte Benchmarking-Pipeline für Sprachmodelle durchgängig betreiben und pflegen: neue Modelle integrieren, Evaluationen konfigurieren, Benchmark-Läufe ausführen und Ergebnisse validieren
- Probleme im gesamten Stack analysieren – von Zeitüberschreitungen und Fehlern an API-Endpunkten bis zu unerwarteten Benchmark-Ausgaben – und schnell beheben
- Die wichtigste technische Kontaktperson für Kunden aus KI-Laboren sein: Benchmark-Ergebnisse verständlich vermitteln, die Methodik erklären, technische Fragen beantworten und Integrationsprobleme über Slack und Videokonferenzen lösen
- Benchmark-Läufe auf Anomalien überwachen, Abweichungen untersuchen und Genauigkeit und Integrität veröffentlichter Ergebnisse sicherstellen
- Prozesse, bekannte Probleme und modellspezifische Konfigurationen dokumentieren
- Mit dem Engineering-Team Verbesserungen der Pipeline identifizieren und Prozesse weiterentwickeln
- Neue Modellveröffentlichungen, API-Änderungen und Entwicklungen im Sprachmodellökosystem laufend verfolgen
Was wir suchen
Voraussetzungen:
- Mehr als 3 Jahre Erfahrung in einer kundenorientierten technischen Position – Solutions Engineering, Support Engineering, technische Beratung oder vergleichbar (bei Unternehmen wie Stripe, Vercel, Cloudflare, Datadog, Palantir, Accenture oder ähnlichen)
- Sehr gute Python-Kenntnisse und sicherer Umgang mit komplexen Codebasen, die du nicht selbst geschrieben hast
- Praktische Erfahrung mit KI-/ML-Modell-APIs (OpenAI, Anthropic, Google, Meta usw.)
- Hervorragende Debugging-Fähigkeiten; du kannst Probleme über APIs, Datenpipelines und Code hinweg nachverfolgen
- Sehr gute schriftliche und mündliche Englischkenntnisse und die Fähigkeit, technischen Stakeholdern technische Konzepte verständlich zu erklären
- Hohe Reaktionsgeschwindigkeit und Zuverlässigkeit; du übernimmst Verantwortung für Kundenprobleme und verfolgst sie bis zur Lösung
- Freude an operativer, wiederholbarer Arbeit und daran, Abläufe außergewöhnlich gut durchzuführen
- Große Detailgenauigkeit und Ruhe unter Druck
Wünschenswert, aber nicht erforderlich:
- Erfahrung mit KI-Evaluation, Benchmarking oder Testmethodiken
- Vertrautheit mit LLM-Inferenzinfrastruktur (Tokenisierung, Latenzmessung, Durchsatzmetriken)
- Erfahrung in oder mit KI-Laboren oder Modellanbietern
- Erfahrung mit B2B-SaaS oder Entwicklerwerkzeugen
Warum Artificial Analysis?
- Gestalte, wie KI entwickelt wird: Führende KI-Labore verfolgen unsere Benchmarks und richten ihre Entwicklungsprioritäten daran aus. Deine Arbeit beeinflusst die Entwicklung von KI unmittelbar.
- Werde zu einem weltweit führenden KI-Experten: Du evaluierst jedes wichtige Modell über alle wesentlichen Fähigkeiten hinweg, sobald es veröffentlicht wird. Nur wenige Positionen bieten einen so breiten Einblick in Frontier-KI.
- Arbeite mit den wichtigsten Akteuren der KI-Branche: Als vertrauenswürdige, unabhängige Stimme betreust du Beziehungen zu Teams führender KI-Labore und großer Unternehmen.
- Steige in einem entscheidenden Moment ein: Wir sind mehr als 40 Personen und auf Kurs, uns bis zum Jahresende zu verdoppeln. Unterstützt werden wir von einigen der bestvernetzten Investoren der KI-Branche. Wer jetzt zu uns kommt, gestaltet beim Skalieren das Produkt, das Team und die Strategie mit.
- Wettbewerbsfähige Vergütung einschließlich Unternehmensanteilen