Todas as vagas abertas
Plataforma e Forward Deployed EngineeringTempo integralSan Francisco (presencial)

Forward Deployed Engineer — Modelos de linguagem

Sobre a Artificial Analysis

A Artificial Analysis é a principal empresa independente de benchmarks de IA. Ajudamos laboratórios, engenheiros e empresas a entender as capacidades da IA e tomar decisões fundamentais sobre suas estratégias de IA. Somos a autoridade de referência para compreender a IA, atendendo desde laboratórios e empresas até veículos de imprensa, investidores e formuladores de políticas públicas. Nossos benchmarks não apenas medem a fronteira da IA: eles ajudam ativamente a defini-la.

Nossos benchmarks e análises contam com a confiança de centenas de milhares de usuários e são a principal referência para laboratórios de IA como OpenAI, Google, Meta, NVIDIA e Anthropic, além de grandes publicações como The Wall Street Journal, Bloomberg, Financial Times e The Economist.

Somos uma equipe de mais de 40 pessoas, a caminho de triplicar até o fim do ano, com o apoio de Nat Friedman (Github, Meta), Daniel Gross (SSI), Andrew Ng (Google Brain, DeepLearning.ai, Amazon), Adam D'Angelo (Quora, Poe, OpenAI), Clem Delangue (Hugging Face) e outros líderes do setor.

A oportunidade

A Artificial Analysis mantém um dos conjuntos de benchmarks de modelos de linguagem mais abrangentes do setor, avaliando modelos de fronteira em qualidade, velocidade e preço para os laboratórios de IA e empresas que dependem dos nossos dados.

Estamos contratando um Forward Deployed Engineer para assumir a operação diária da nossa stack de benchmarks de modelos de linguagem e ser o representante técnico da Artificial Analysis perante os laboratórios mais importantes do setor. Você integrará novos modelos ao nosso pipeline de avaliação, executará e depurará benchmarks e atuará como principal ponto de contato técnico para clientes de laboratórios de IA: explicando resultados, respondendo a perguntas sobre metodologia e resolvendo problemas de endpoints em tempo real.

Esta é uma função forward-deployed no sentido mais genuíno: você atua na interface entre nossa plataforma e nossos clientes mais sofisticados, respondendo pelo funcionamento dos dois lados. Trata-se de operar uma stack sofisticada com excelência, consistência e confiabilidade, sendo o engenheiro de confiança que nossos clientes pedem pelo nome.

O que você fará

  • Operar e manter de ponta a ponta nosso pipeline de benchmarks de modelos de linguagem baseado em Python: integrar novos modelos, configurar avaliações, executar benchmarks e validar resultados
  • Depurar problemas em toda a stack, de timeouts e erros em endpoints de API a saídas inesperadas dos benchmarks, e resolvê-los rapidamente
  • Atuar como principal contato técnico para clientes de laboratórios de IA: comunicar claramente os resultados, explicar a metodologia, responder a perguntas técnicas e solucionar problemas de integração pelo Slack e por videoconferência
  • Monitorar execuções de benchmarks em busca de anomalias, investigar divergências e garantir a acurácia e a integridade dos resultados publicados
  • Manter a documentação de processos, problemas conhecidos e configurações específicas de modelos
  • Colaborar com a equipe de engenharia para indicar melhorias no pipeline e contribuir para o aprimoramento dos processos
  • Acompanhar novos lançamentos de modelos, mudanças em APIs e desenvolvimentos em todo o ecossistema de modelos de linguagem

O que buscamos

Requisitos:

  • Mais de 3 anos de experiência em uma função técnica com contato com clientes — engenharia de soluções, engenharia de suporte, consultoria técnica ou semelhante (em empresas como Stripe, Vercel, Cloudflare, Datadog, Palantir, Accenture ou comparáveis)
  • Sólida proficiência em Python e facilidade para trabalhar com bases de código complexas que você não escreveu
  • Experiência prática com APIs de modelos de IA/ML (OpenAI, Anthropic, Google, Meta etc.)
  • Excelentes habilidades de depuração; você consegue rastrear problemas entre APIs, pipelines de dados e código
  • Sólidas habilidades de comunicação escrita e verbal em inglês, com capacidade de explicar claramente conceitos técnicos a stakeholders técnicos
  • Alta capacidade de resposta e confiabilidade; você assume a responsabilidade pelos problemas dos clientes e acompanha tudo até a conclusão
  • Conforto com trabalho operacional e repetitivo; você encontra satisfação em executar as atividades com excelência
  • Muita atenção aos detalhes e tranquilidade sob pressão

Diferenciais (não obrigatórios):

  • Experiência com avaliação de IA, benchmarks ou metodologias de teste
  • Familiaridade com infraestrutura de inferência de LLMs (tokenização, medição de latência e métricas de vazão)
  • Experiência de trabalho em laboratórios de IA ou provedores de modelos, ou em colaboração com eles
  • Experiência em SaaS B2B ou ferramentas para desenvolvedores

Por que a Artificial Analysis?

  • Ajude a definir como a IA é construída: os principais laboratórios de IA acompanham nossos benchmarks e os usam para orientar suas prioridades de desenvolvimento. Seu trabalho influenciará diretamente os rumos da IA.
  • Torne-se uma autoridade mundial em IA: você avaliará todos os principais modelos, em todas as grandes capacidades, conforme forem lançados. Pouquíssimas funções oferecem uma exposição tão ampla à IA de fronteira.
  • Trabalhe com os participantes mais importantes da IA: você gerenciará o relacionamento com equipes dos principais laboratórios de IA e grandes empresas, atuando como uma voz independente e confiável.
  • Junte-se a nós em um momento decisivo: somos mais de 40 pessoas, a caminho de dobrar até o fim do ano, com o apoio de alguns dos investidores mais bem relacionados da IA. Quem entrar agora ajudará a definir o produto, a equipe e a estratégia durante nosso crescimento.
  • Remuneração competitiva, incluindo participação societária

Tem interesse nesta vaga?

Envie sua candidatura e entraremos em contato.